HunyuanOCR 1.5

HunyuanOCR 1.5 — компактная зрительно-языковая модель Tencent для распознавания текста и анализа документов.

HunyuanOCR 1.5 — обновлённая специализированная модель Tencent для задач, где текст нужно извлечь из изображения или документа. Команда объявила выпуск 7 июля 2026 года и представила её как облегчённую сквозную зрительно-языковую модель для распознавания и обработки текста.

Какие задачи решает

Документы, текст на изображениях и извлечение данных

Tencent объединяет в одной модели разбор документов, поиск текста на изображении, извлечение информации и перевод текста внутри изображений. Речь идёт о задачах с визуальным текстом; HunyuanOCR не следует описывать как универсальный чат-ассистент.

Обновление версии 1.5

Ускорение вывода и варианты запуска

Разработчик перечисляет ускорение спекулятивным декодированием DFlash, новый поток подготовки данных, обновлённую схему обучения и запуск через llama.cpp на компьютере. В сравнении с HunyuanOCR 1.0 сохранена лёгкая архитектурная основа, а изменения сосредоточены на скорости и качестве.

Публикация и ограничения

Открытый код и веса

Официальный репозиторий содержит код для inference, инструкции запуска и ссылку на техническую работу. Tencent указывает собственное лицензионное соглашение Hunyuan Community License; перед коммерческим применением нужно проверить его актуальные условия.

Дата, версия и источники

Проверка по материалам Tencent

Дата публикации карточки отражает указанное событие публичного выпуска или доступности версии. Примечание по датировке: Дата выпуска 1.5 указана в официальном журнале репозитория; дата появления HunyuanOCR 1.0 — отдельное событие. Источники: официальный репозиторий HunyuanOCR; техническую работу.

Сведения о разработчике и его моделях: Tencent в Вики Futuretools.ru.