Baidu Unlimited-OCR: революция в распознавании текста в длинных документах
...
Искусственный интеллект
Чтение занимает время?
Вы можете слушать статьиПрорыв Baidu в технологии распознавания текста
Компания Baidu представила новую модель Unlimited-OCR, которая значительно улучшает распознавание текста в длинных документах. Эта разработка основана на DeepSeek OCR и решает ключевую проблему управления памятью при обработке больших объемов информации.
Проблема роста памяти и точности
Традиционные OCR-системы сталкиваются с резким увеличением объема памяти из-за большого количества страниц. Unlimited-OCR применяет метод Reference Sliding Window Attention (R-SWA), который использует два типа памяти: статический префикс с визуальными токенами и системным запросом, а также скользящее окно из последних 128 выходных токенов. Такой подход фиксирует размер кеша и предотвращает рост потребления памяти.
Ключевые преимущества технологии
Документы разбиваются на небольшие квадратные участки, которые преобразуются в визуальные токены. Увеличение количества таких участков повышает точность, но увеличивает вычислительные затраты. В модели используется оптическая компрессия, позволяющая сохранить около 97% точности при десятикратном сжатии, что обеспечивает баланс между качеством и производительностью.
Открытый доступ и возможности применения
Unlimited-OCR доступен в открытом доступе на платформах Hugging Face и GitHub. Модель совместима с Transformers, vLLM и SGLang. Особенно перспективно использование vLLM в качестве API-сервера, что расширяет возможности интеграции технологии в различные системы.
Влияние на профессиональную работу с документами
Новая технология позволяет быстро и точно обрабатывать большие объемы текстов, устанавливая новые стандарты в управлении документами. Это особенно важно для юридической, медицинской и научной сфер, где автоматизация снизит трудозатраты, минимизирует ошибки и сэкономит время.
Unlimited-OCR — это новое поколение OCR-технологий, которое эффективно решает проблемы памяти и точности при работе с длинными документами, делая процесс распознавания быстрее и доступнее.