Новая модель DeepSeek-OCR меняет подход к распознаванию текста
Команда исследователей из DeepSeek разработала новую модель DeepSeek-OCR, которая кардинально меняет подход к распознаванию текста. В отличие от традиционных систем, основанных на текстовых токенах, данная модель использует визуальные представления страниц. Это позволяет изменить методы хранения и анализа информации.
В классических OCR-моделях текст преобразуется в токены по символам, что требует значительных вычислительных ресурсов, особенно для длинных документов. В отличие от этого, DeepSeek предлагает уникальный способ: преобразование текста в изображение, который затем кодируется с помощью DeepEncoder в компактные визуальные токены. Это обеспечивает значительное снижение затрат при сохранении высокой точности.
В ходе испытаний модель показала удивительные результаты. Даже при сжатии в десять раз точность оставалась на уровне 97%, а при двадцатикратном — около 60%. Это позволяет эффективно хранить длинные документы, не теряя их смысл.
Архитектура DeepSeek-OCR включает три ключевых этапа: локальное внимание для захвата деталей, свёрточное сжатие в 16 раз и глобальное внимание для анализа структуры. Также внедрён механизм забывания, что позволяет старому контексту постепенно снижать разрешение, освобождая место для актуальной информации.
Попробуйте BotHub для автоматизации рутинных задач! Доступен без VPN, а для новых пользователей предусмотрены 100 000 бесплатных токенов.
