Edge0 — запуск больших ИИ-моделей на устройстве

Edge0 — открытый фреймворк для локального запуска разреженных ИИ-моделей. Исходный код приложений и движков опубликован для iOS, macOS, Android и Windows.

Edge0 — открытый фреймворк для запуска больших разреженных языковых моделей непосредственно на устройстве. Вместе с моделями Edge0-35B-A3B и Edge0-8B-A1B проект включает локальный движок, управление моделями и исходный код приложений для разных платформ. 30 сентября 2026 года команда открыла исходный код приложений и движков для iOS, macOS, Android и Windows.

Заявление о работе 35-миллиардной модели с 1–2,5 ГБ памяти не совпадает с текущими опубликованными замерами. В README проекта для Edge0-35B указано около 2,9 ГиБ пиковой активной памяти; около 1,0 ГиБ — результат версии Edge0-8B. Полный файл 35B-модели занимает примерно 23 ГБ на диске.

Что входит в Edge0

Код приложений и движков для четырёх платформ

В репозитории размещены отдельные компоненты для macOS, iOS, Android и Windows: приложение и командная строка для macOS, приложение для iOS, приложение и движок для Android, приложение и движок для Windows. Для каждой платформы опубликованы собственные исходники и руководство по сборке. Это набор платформенных реализаций, а не единый бинарный файл, который устанавливается одинаково на любое устройство.

Edge0 ориентирован прежде всего на разработчиков, которые хотят собирать локальных помощников, творческие приложения или функции для устройств, не отправляя запросы в облако. Код репозитория распространяется по лицензии Apache 2.0; для весов моделей действуют условия соответствующих модельных публикаций.

Как Edge0 экономит рабочую память

Веса читаются с SSD по мере необходимости

Edge0 использует разреженную архитектуру «смесь экспертов» (MoE): у модели есть набор специализированных блоков, но для обработки очередного фрагмента текста включается только часть из них. Вместо загрузки всех весов в оперативную память Edge0 хранит файл модели на SSD и подаёт нужные блоки по мере работы.

Предсказатель Prerouter заранее оценивает, какие блоки понадобятся на следующем шаге, и начинает читать их, пока модель обрабатывает текущий. Так чтение с накопителя частично идёт параллельно вычислениям. Отдельные адаптеры LoRA можно подключать к неизменённой базовой модели; сами веса основы остаются отдельными.

Модели, объём файлов и замеры

Edge0-35B-A3B

Старшая модель основана на Qwen3.6-35B-A3B и использует 4-битные веса с обученными адаптерами и предсказателем маршрутизации. Её файлы занимают около 23 ГБ. В тесте команды Edge0 пиковая активная память составила примерно 2,9 ГиБ, а скорость генерации — 14,9–17,7 токена в секунду. Замер проводился на Mac mini с M4 Pro и 24 ГБ памяти.

Edge0-8B-A1B

Компактная версия построена на Ling 3.0 и занимает около 4,2 ГБ на диске. В том же тестовом окружении для неё указано около 1,0 ГиБ пиковой активной памяти и скорость 23,9–25,3 токена в секунду.

Эти показатели опубликованы разработчиками и относятся к конкретному оборудованию и короткому контексту. Память операционной системы и служебных компонентов учитывается отдельно; при длинном контексте потребление также растёт. Поэтому объём активной памяти нельзя приравнивать к общему объёму оперативной памяти, который потребуется компьютеру.

Что доступно сейчас, а что пока в плане

Платформенные реализации уже открыты

Исходный код приложений и движков для четырёх платформ уже опубликован. При этом Python-версия фреймворка сейчас работает на macOS с Apple Silicon через MLX. Платформенные движки используют разные нативные технологии, поэтому поддержка модели и её производительность могут отличаться на телефоне, компьютере и другом устройстве.

Единый API и CUDA обозначены как планы

В дорожной карте на четвёртый квартал 2026 года команда указывает единый интерфейс запуска для iOS, macOS, Android, Windows и Python, автоматическую адаптацию к оборудованию и CUDA-бэкенд для Python. Там же перечислены поддержка новых архитектур моделей, дополнительные варианты моделей и адаптеров, а также пакетное предсказание экспертов для сокращения времени рассуждений. Это планы проекта, а не возможности, уже включённые во все опубликованные приложения.

Кому может подойти Edge0

Разработчикам локальных ИИ-приложений

Edge0 стоит рассматривать, если вы разрабатываете приложение, которому нужна языковая модель без постоянного обращения к облачному API, и готовы собирать платформенный код и загружать крупные файлы моделей. Для 35B-варианта нужно заранее предусмотреть около 23 ГБ места на накопителе; измеренные 2,9 ГиБ — это пиковая активная память самого модельного конвейера в тесте, а не рекомендация по общему объёму памяти устройства.

Если вы ищете пользовательскую программу для работы с локальными моделями, сравните Edge0 с LM Studio и Jan. Эти страницы помогут оценить другие варианты локального запуска.