Baidu Unlimited-OCR: революция в распознавании текста в длинных документах

Ссылка скопирована

...

Сегодня, 16:00

Искусственный интеллект

Чтение занимает время?

Вы можете слушать статьи

Прорыв Baidu в технологии распознавания текста

Компания Baidu представила новую модель Unlimited-OCR, которая значительно улучшает распознавание текста в длинных документах. Эта разработка основана на DeepSeek OCR и решает ключевую проблему управления памятью при обработке больших объемов информации.

Проблема роста памяти и точности

Традиционные OCR-системы сталкиваются с резким увеличением объема памяти из-за большого количества страниц. Unlimited-OCR применяет метод Reference Sliding Window Attention (R-SWA), который использует два типа памяти: статический префикс с визуальными токенами и системным запросом, а также скользящее окно из последних 128 выходных токенов. Такой подход фиксирует размер кеша и предотвращает рост потребления памяти.

Ключевые преимущества технологии

Документы разбиваются на небольшие квадратные участки, которые преобразуются в визуальные токены. Увеличение количества таких участков повышает точность, но увеличивает вычислительные затраты. В модели используется оптическая компрессия, позволяющая сохранить около 97% точности при десятикратном сжатии, что обеспечивает баланс между качеством и производительностью.

Открытый доступ и возможности применения

Unlimited-OCR доступен в открытом доступе на платформах Hugging Face и GitHub. Модель совместима с Transformers, vLLM и SGLang. Особенно перспективно использование vLLM в качестве API-сервера, что расширяет возможности интеграции технологии в различные системы.

Влияние на профессиональную работу с документами

Новая технология позволяет быстро и точно обрабатывать большие объемы текстов, устанавливая новые стандарты в управлении документами. Это особенно важно для юридической, медицинской и научной сфер, где автоматизация снизит трудозатраты, минимизирует ошибки и сэкономит время.

Unlimited-OCR — это новое поколение OCR-технологий, которое эффективно решает проблемы памяти и точности при работе с длинными документами, делая процесс распознавания быстрее и доступнее.

Ссылка скопирована