NVIDIA Nemotron Parse 2.0
Nemotron Parse 2.0 превращает страницы документов в структурированный текст с типами блоков, координатами и порядком чтения.
Nemotron Parse 2.0 — модель NVIDIA для извлечения содержания и структуры из изображений страниц. На вход подаётся RGB-изображение и инструкция; на выходе модель возвращает текст, типы элементов, координаты их рамок и порядок чтения. Модель подходит для обработки сканов, страниц PDF и презентаций перед поиском, индексированием или передачей данных в систему работы с документами.
- Текст вместе со структурой страницы
- Таблицы, графики и обычные блоки
- Что изменилось во второй версии
- Расширенная работа с языками и графиками
- Место в конвейере обработки документов
- Извлечение, затем поиск и проверка
- Связанные модели и разработчик
- Страницы семейства NVIDIA
- Дата выпуска и официальный источник
- Первичные материалы разработчика
Текст вместе со структурой страницы
Таблицы, графики и обычные блоки
Модель распознаёт заголовки, абзацы, подписи, таблицы, графики, сноски, изображения и другие элементы страницы. Вместе с извлечённым содержимым она возвращает пространственные аннотации, поэтому последующая система может связать текст с его расположением на исходной странице и восстановить последовательность чтения. Это полезно, когда простое извлечение текста теряет границы колонок или связь ячеек таблицы.
Что изменилось во второй версии
Расширенная работа с языками и графиками
В карточке NVIDIA Parse 2.0 сравнивается с версией 1.2: заявлено расширение словаря примерно на 20 тысяч токенов, отдельный маркер для графиков и дополнительное обучение на страницах с большим количеством таблиц и диаграмм. NVIDIA также отмечает улучшения для многоязычного и рукописного текста, а также преобразование сведений с графика в структурированное описание. Результат зависит от качества исходного изображения и не заменяет проверку извлечённых данных.
Место в конвейере обработки документов
Извлечение, затем поиск и проверка
Parse 2.0 формирует слой текста и разметки, который можно использовать для последующей индексации, поиска или подготовки данных для RAG. Для распознавания символов и чтения порядка блоков на уровне OCR доступна отдельная модель Nemotron OCR v2, а обнаруживать расположение таблиц, графиков и заголовков может Nemotron Page Elements v3. Эти модели решают связанные, но не одинаковые задачи.
Связанные модели и разработчик
Страницы семейства NVIDIA
NVIDIA Nemotron OCR v2 · NVIDIA Nemotron Page Elements v3 · NVIDIA в Вики Futuretools
Дата выпуска и официальный источник
Первичные материалы разработчика
В API-карточке NVIDIA указана дата публикации весов на Hugging Face 30.06.2026 и релиза Build 11.09.2026. При этом актуальная карточка Hugging Face и запись NGC указывают для Hugging Face дату 03.08.2026; источники NVIDIA расходятся. В качестве даты страницы взята самая ранняя дата публичных весов из API-карточки; даты платформ перечислены отдельно, чтобы расхождение было видно. Первичный источник: официальная карточка модели NVIDIA.