NVIDIA Nemotron OCR v2
Nemotron OCR v2 распознаёт текст на документах и фотографиях, а также возвращает координаты блоков и их порядок чтения.
Nemotron OCR v2 — модель NVIDIA для оптического распознавания текста на документах и изображениях реальных сцен. В отличие от OCR, который возвращает только строку, эта модель объединяет локализацию текстовых областей, распознавание символов и анализ связей между блоками. Поэтому результат включает распознанный текст, координаты его области и оценку уверенности.
- Три этапа внутри одной модели
- Обнаружение, распознавание и порядок чтения
- Английский и многоязычный варианты
- Размер распознавателя зависит от алфавита
- Использование в поиске и обработке документов
- OCR — отдельный этап перед анализом содержания
- Связанные модели и разработчик
- Страницы семейства NVIDIA
- Дата выпуска и официальный источник
- Первичные материалы разработчика
Три этапа внутри одной модели
Обнаружение, распознавание и порядок чтения
Первая часть находит текстовые области на странице, распознаватель преобразует их в текст, а реляционный модуль определяет связи между найденными фрагментами и их порядок. Такое устройство помогает обрабатывать многострочные блоки, несколько областей текста и изображения, где надписи встроены в окружение, например вывески или фотографии документов. На выходе формируются рамки, строки и оценки уверенности.
Английский и многоязычный варианты
Размер распознавателя зависит от алфавита
NVIDIA публикует варианты v2_english и v2_multilingual. Многоязычная версия заявлена для английского, китайского в упрощённом и традиционном написании, японского, корейского и русского. В английском варианте распознаватель компактнее; в многоязычном используется больше слоёв и расширенный набор символов. Полная версия содержит около 53,8 млн параметров для английского и 83,9 млн для многоязычного режима.
Использование в поиске и обработке документов
OCR — отдельный этап перед анализом содержания
Результаты распознавания можно передавать в системы поиска по документам, базы знаний или RAG-конвейеры. При этом модель возвращает текст и его расположение, но не проверяет истинность сведений и не интерпретирует деловой смысл документа. Для полноценного разбора типов блоков и графиков рядом применяется Nemotron Parse 2.0; для обнаружения элементов страницы — Nemotron Page Elements v3.
Связанные модели и разработчик
Страницы семейства NVIDIA
NVIDIA Nemotron Parse 2.0 · NVIDIA Nemotron Page Elements v3 · NVIDIA в Вики Futuretools
Дата выпуска и официальный источник
Первичные материалы разработчика
Модельная карточка NVIDIA указывает появление весов на Hugging Face 15.04.2026; версии Build и NGC датированы 12.06.2026. Описаны английский и многоязычный варианты, общий состав из детектора, распознавателя и реляционного модуля, а также структурированный формат результата. Первичный источник: официальная карточка модели NVIDIA.