Unlimited-OCR

OCR-модель Baidu на 3B параметров для парсинга многостраничных PDF за один проход

huggingface.co ↗
 Публичный пост

Что это

Unlimited-OCR — открытая модель распознавания текста от Baidu на 3 миллиарда параметров, распространяется под лицензией MIT. Реализует подход "one-shot long-horizon parsing": документ, включая многостраничный PDF, обрабатывается за один инференс без пошагового взаимодействия, с постоянным KV-кешем и окном контекста до 32768 токенов. По данным разработчиков, за один проход модель способна разобрать до 40 страниц. Архитектура использует тот же визуальный стек, что и DeepSeek-OCR (SAM-ViT-B + CLIP-L DeepEncoder), и на бенчмарке OmniDocBench v1.6 показывает результат 93.92%, опережая DeepSeek-OCR по семи из девяти категорий документов.

Для участника клуба модель полезна как локальный движок распознавания в пайплайнах автоматизации: например, узел в n8n, который принимает PDF (сканы договоров, отчётов, счетов) и отдаёт размеченный markdown или структурированный текст для дальнейшей обработки другими ИИ-агентами. Запускается на одной GPU с 8+ ГБ видеопамяти, поддерживает vLLM и SGLang с OpenAI-совместимым API, что упрощает встраивание в существующие вайб-кодинг проекты без обращения к платным облачным OCR-сервисам.

Есть готовая утилита конвертации PDF в изображения с разрешением 300 DPI и функция infer_multi() для пакетной обработки нескольких страниц или файлов, включая параллельные запросы. Это снижает порог входа для тех, кто хочет собрать собственный конвейер обработки документов без написания OCR-логики с нуля.

Возможности

  • 3 миллиарda параметров, веса в формате BF16, лицензия MIT
  • Обработка многостраничных PDF за один проход, до 40 страниц одновременно
  • Окно контекста до 32768 токенов, постоянный KV-кеш
  • Функция infer_multi() для пакетной обработки нескольких страниц и файлов
  • Встроенная утилита конвертации PDF в изображения с разрешением 300 DPI
  • 93.92% на бенчмарке OmniDocBench v1.6, выше DeepSeek-OCR по 7 из 9 категорий
  • Поддержка запуска через Transformers, vLLM, SGLang с OpenAI-совместимым API
  • Работает на одной GPU с 8+ ГБ видеопамяти, есть версии для ModelScope и Baidu Cloud

Цена: Открытая модель под лицензией MIT, веса и код бесплатны для использования и модификации, локальный запуск требует собственных вычислительных ресурсов (GPU)

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб