Unlimited-OCR
OCR-модель Baidu на 3B параметров для парсинга многостраничных PDF за один проход
Что это
Unlimited-OCR — открытая модель распознавания текста от Baidu на 3 миллиарда параметров, распространяется под лицензией MIT. Реализует подход "one-shot long-horizon parsing": документ, включая многостраничный PDF, обрабатывается за один инференс без пошагового взаимодействия, с постоянным KV-кешем и окном контекста до 32768 токенов. По данным разработчиков, за один проход модель способна разобрать до 40 страниц. Архитектура использует тот же визуальный стек, что и DeepSeek-OCR (SAM-ViT-B + CLIP-L DeepEncoder), и на бенчмарке OmniDocBench v1.6 показывает результат 93.92%, опережая DeepSeek-OCR по семи из девяти категорий документов.
Для участника клуба модель полезна как локальный движок распознавания в пайплайнах автоматизации: например, узел в n8n, который принимает PDF (сканы договоров, отчётов, счетов) и отдаёт размеченный markdown или структурированный текст для дальнейшей обработки другими ИИ-агентами. Запускается на одной GPU с 8+ ГБ видеопамяти, поддерживает vLLM и SGLang с OpenAI-совместимым API, что упрощает встраивание в существующие вайб-кодинг проекты без обращения к платным облачным OCR-сервисам.
Есть готовая утилита конвертации PDF в изображения с разрешением 300 DPI и функция infer_multi() для пакетной обработки нескольких страниц или файлов, включая параллельные запросы. Это снижает порог входа для тех, кто хочет собрать собственный конвейер обработки документов без написания OCR-логики с нуля.
Возможности
- 3 миллиарda параметров, веса в формате BF16, лицензия MIT
- Обработка многостраничных PDF за один проход, до 40 страниц одновременно
- Окно контекста до 32768 токенов, постоянный KV-кеш
- Функция infer_multi() для пакетной обработки нескольких страниц и файлов
- Встроенная утилита конвертации PDF в изображения с разрешением 300 DPI
- 93.92% на бенчмарке OmniDocBench v1.6, выше DeepSeek-OCR по 7 из 9 категорий
- Поддержка запуска через Transformers, vLLM, SGLang с OpenAI-совместимым API
- Работает на одной GPU с 8+ ГБ видеопамяти, есть версии для ModelScope и Baidu Cloud
Цена: Открытая модель под лицензией MIT, веса и код бесплатны для использования и модификации, локальный запуск требует собственных вычислительных ресурсов (GPU)