Phonon-2 — компактная модель распознавания речи

Phonon-2 — открытая модель для распознавания английской речи. Загрузка 164 МБ, локальный запуск на Mac, CPU и видеокартах NVIDIA.

Phonon-2 — открытая модель распознавания английской речи от Fermion Research. Она преобразует записи в текст и рассчитана на локальный запуск: после загрузки аудио не требуется отправлять в облачный сервис. Файл модели весит 164 МБ, а её веса распространяются по лицензии CC BY 4.0.

У модели есть важное ограничение: она распознаёт английскую речь из монофонического аудио с частотой 16 кГц и не предназначена для расшифровки русской речи. Phonon-2 представили 29 сентября 2026 года.

Как использовать Phonon-2

Расшифровка файлов и диктовка

Phonon-2 можно запускать из командной строки: пакет Fermion устанавливается из PyPI, после чего аудиофайл передаётся команде распознавания. На Mac модель также умеет принимать речь с микрофона в реальном времени. Её можно запустить как локальный сервер с совместимым с OpenAI API способом отправки запросов на транскрибацию.

Модель работает на компьютерах Apple с процессорами серии M через MLX, а также на Linux и Windows через процессорный движок. Для видеокарт NVIDIA предусмотрен отдельный вариант запуска. Это открытые веса для самостоятельного использования, а не готовый веб-сервис: скорость зависит от оборудования, а при применении CC BY 4.0 нужно соблюдать условия лицензии.

Быстрый запуск из командной строки

В документации Fermion для установки указан пакет fermion-research. После установки файл можно передать команде phonon transcribe recording.wav; на Mac для распознавания речи с микрофона используется phonon listen. Команда phonon serve --port 8010 запускает локальный сервер.

Точность: что показывают тесты

Сравнение на семи наборах данных

Fermion Research проверила модель на семи англоязычных наборах Open ASR Leaderboard. Средняя доля ошибок в словах (WER) у Phonon-2 составила 5,21%; чем меньше показатель, тем реже модель ошибается в тестовой расшифровке. В опубликованном Fermion сравнении средний WER Phonon-2 ниже, чем у Whisper large-v3-turbo, а файл модели почти в 10 раз меньше.

Модель Загрузка Средний WER
Phonon-2 164 МБ 5,21%
Whisper large-v3-turbo 1 618 МБ 6,58%
Parakeet TDT 0.6B v3 — модель-эталон 2 508 МБ 4,96%

По среднему результату Phonon-2 не превзошла полноразмерную модель-эталон Parakeet: у неё WER 4,96% против 5,21% у Phonon-2. При этом Phonon-2 показала лучший результат на тестах с записями совещаний и парламентской речью, а файл для загрузки примерно в 15 раз меньше. Все числа приведены по оценке разработчика; результаты на конкретных записях могут отличаться.

Скорость зависит от оборудования

Результаты Fermion Research

На MacBook Air с процессором M5 модель обработала один поток со скоростью 174× относительно длительности аудио: час записи превращается в текст примерно за 20 секунд. На восьми ядрах Zen 5 (16 виртуальных процессоров) разработчик получил 142,8×. Для NVIDIA H100 указаны 465× в одном потоке и до 6 680× при пакетной обработке 128 записей.

В этих замерах время загрузки модели не учитывалось. Поэтому цифры описывают скорость уже запущенного движка и не означают, что каждый компьютер будет обрабатывать аудио с такой же скоростью. Особенно высокий показатель H100 относится к пакетной обработке, а не к одной записи.

Для каких задач подойдет модель

Локальная обработка англоязычных записей

Phonon-2 может подойти для расшифровки интервью, встреч, диктовки и других англоязычных аудиозаписей, если важно запускать распознавание на своём оборудовании. Она не заменяет мультиязычные решения: если нужно распознавать русский или получать субтитры на разных языках, сравните её с WhisperTranscribe. Для длинных записей с разделением реплик и временными отметками можно посмотреть VibeVoice-ASR-7B.

Связь с приложением Detta

Диктовка с обработкой текста на устройстве

Phonon-2 используется в бесплатном приложении Detta для компьютеров Mac с Apple silicon: модель распознаёт речь в любом текстовом поле. Дополнительная модель Gluon убирает из результата слова-паразиты, повторы и незаконченные фразы. По описанию Fermion Research, распознавание и очистка текста выполняются на Mac.