Phonon-2 — компактная модель распознавания речи
Phonon-2 — открытая модель для распознавания английской речи. Загрузка 164 МБ, локальный запуск на Mac, CPU и видеокартах NVIDIA.
Phonon-2 — открытая модель распознавания английской речи от Fermion Research. Она преобразует записи в текст и рассчитана на локальный запуск: после загрузки аудио не требуется отправлять в облачный сервис. Файл модели весит 164 МБ, а её веса распространяются по лицензии CC BY 4.0.
У модели есть важное ограничение: она распознаёт английскую речь из монофонического аудио с частотой 16 кГц и не предназначена для расшифровки русской речи. Phonon-2 представили 29 сентября 2026 года.
- Как использовать Phonon-2
- Расшифровка файлов и диктовка
- Быстрый запуск из командной строки
- Точность: что показывают тесты
- Сравнение на семи наборах данных
- Скорость зависит от оборудования
- Результаты Fermion Research
- Для каких задач подойдет модель
- Локальная обработка англоязычных записей
- Связь с приложением Detta
- Диктовка с обработкой текста на устройстве
Как использовать Phonon-2
Расшифровка файлов и диктовка
Phonon-2 можно запускать из командной строки: пакет Fermion устанавливается из PyPI, после чего аудиофайл передаётся команде распознавания. На Mac модель также умеет принимать речь с микрофона в реальном времени. Её можно запустить как локальный сервер с совместимым с OpenAI API способом отправки запросов на транскрибацию.
Модель работает на компьютерах Apple с процессорами серии M через MLX, а также на Linux и Windows через процессорный движок. Для видеокарт NVIDIA предусмотрен отдельный вариант запуска. Это открытые веса для самостоятельного использования, а не готовый веб-сервис: скорость зависит от оборудования, а при применении CC BY 4.0 нужно соблюдать условия лицензии.
Быстрый запуск из командной строки
В документации Fermion для установки указан пакет fermion-research. После установки файл можно передать команде phonon transcribe recording.wav; на Mac для распознавания речи с микрофона используется phonon listen. Команда phonon serve --port 8010 запускает локальный сервер.
Точность: что показывают тесты
Сравнение на семи наборах данных
Fermion Research проверила модель на семи англоязычных наборах Open ASR Leaderboard. Средняя доля ошибок в словах (WER) у Phonon-2 составила 5,21%; чем меньше показатель, тем реже модель ошибается в тестовой расшифровке. В опубликованном Fermion сравнении средний WER Phonon-2 ниже, чем у Whisper large-v3-turbo, а файл модели почти в 10 раз меньше.
| Модель | Загрузка | Средний WER |
|---|---|---|
| Phonon-2 | 164 МБ | 5,21% |
| Whisper large-v3-turbo | 1 618 МБ | 6,58% |
| Parakeet TDT 0.6B v3 — модель-эталон | 2 508 МБ | 4,96% |
По среднему результату Phonon-2 не превзошла полноразмерную модель-эталон Parakeet: у неё WER 4,96% против 5,21% у Phonon-2. При этом Phonon-2 показала лучший результат на тестах с записями совещаний и парламентской речью, а файл для загрузки примерно в 15 раз меньше. Все числа приведены по оценке разработчика; результаты на конкретных записях могут отличаться.
Скорость зависит от оборудования
Результаты Fermion Research
На MacBook Air с процессором M5 модель обработала один поток со скоростью 174× относительно длительности аудио: час записи превращается в текст примерно за 20 секунд. На восьми ядрах Zen 5 (16 виртуальных процессоров) разработчик получил 142,8×. Для NVIDIA H100 указаны 465× в одном потоке и до 6 680× при пакетной обработке 128 записей.
В этих замерах время загрузки модели не учитывалось. Поэтому цифры описывают скорость уже запущенного движка и не означают, что каждый компьютер будет обрабатывать аудио с такой же скоростью. Особенно высокий показатель H100 относится к пакетной обработке, а не к одной записи.
Для каких задач подойдет модель
Локальная обработка англоязычных записей
Phonon-2 может подойти для расшифровки интервью, встреч, диктовки и других англоязычных аудиозаписей, если важно запускать распознавание на своём оборудовании. Она не заменяет мультиязычные решения: если нужно распознавать русский или получать субтитры на разных языках, сравните её с WhisperTranscribe. Для длинных записей с разделением реплик и временными отметками можно посмотреть VibeVoice-ASR-7B.
Связь с приложением Detta
Диктовка с обработкой текста на устройстве
Phonon-2 используется в бесплатном приложении Detta для компьютеров Mac с Apple silicon: модель распознаёт речь в любом текстовом поле. Дополнительная модель Gluon убирает из результата слова-паразиты, повторы и незаконченные фразы. По описанию Fermion Research, распознавание и очистка текста выполняются на Mac.