Новости и статьи об искусственном интеллекте и нейросетях. Мы собираем и обрабатываем самую актуальную информацию из мира AI. О проекте

Новости

Bonsai 27B: полноценная ИИ-модель, которая помещается в iPhone

PrismML представила Bonsai 27B — открытую модель с экстремальным сжатием до 1-2 бит на вес, которая помещается на iPhone 17 Pro Max. Компания утверждает, что сжатие сохраняет до 95% качества оригинальной модели Qwen, а математика и программирование почти не страдают. Технология уже привлекла внимание Apple и может помочь ускорить локальный ИИ на устройствах.

16 июля 2026 г.
2 мин
50

PrismML уверена, что современным ИИ-приложениям всё чаще нужны мощные модели, работающие прямо на устройстве. ИИ-агент может делать сотни последовательных запросов к модели, каждый из которых несёт контекст, генерирует структурированный ответ и передаёт его на следующий шаг. В облаке затраты на обработку токенов растут, каждый вызов добавляет сетевую задержку, а промежуточные результаты, вызовы инструментов и приватные данные — вроде содержимого экрана или документов — покидают устройство.

Но перенос модели на само устройство сводит предельные затраты на эти циклы к нулю и оставляет пользовательские данные локально. В PrismML видят в этом основу для постоянно активных агентов, офлайн-ассистентов и гибридных систем. Простые и чувствительные к приватности задачи остаются на устройстве, а к облачным моделям обращаются только в самых сложных случаях.

По данным CNBC, PrismML уже ведёт переговоры с Apple о технологии сжатия, лежащей в основе Bonsai. Генеральный директор PrismML Бабак Хассиби подтвердил, что Apple и другие компании тестируют модели на скорость, энергопотребление и производительность. Переговоры находятся на «очень ранней стадии», но «дело движется хорошо».

Две версии для ноутбуков и смартфонов

Модель такого размера обычно занимает около 54 ГБ памяти. Даже со стандартным сжатием ей всё ещё требуется около 18 ГБ. PrismML предлагает два гораздо более компактных варианта. Версия с упором на качество весит примерно 5,9 ГБ и предназначена для ноутбуков, хотя реальный размер поставляемых пакетов может быть больше в зависимости от среды выполнения. В техническом документе указано около 7,2 ГБ для версии llama.cpp и 8,49 ГБ для MLX.

Более компактный вариант занимает примерно 3,9 ГБ — достаточно, чтобы уместиться в ограниченном пространстве iPhone 17 Pro Max. По заявлению PrismML, iPhone с 12 ГБ оперативной памяти выделяет отдельному приложению лишь около 6 ГБ, которые делятся между моделью и кэшем.

Вместо того чтобы хранить каждый вес нейросети как 16-битное значение, PrismML использует всего один или чуть меньше двух битов. В самом агрессивном варианте у каждого веса всего два состояния, в чуть более крупном — три. Такой подход применён ко всей языковой модели. Для иллюстрации распространённой путаницы с маркировкой PrismML указывает на сборку Qwen3.6-27B-IQ2_XXS, рассмотренную в техническом документе: несмотря на метку «2-бит», она в среднем использует 2,8 бита на вес.

Сравнение плотности интеллекта на гигабайт для моделей 27B
Версия Bonsai с 1-битным сжатием лидирует по эффективности с плотностью интеллекта 0,530 на ГБ. | Автор изображения: Prism

Сжатие почти не влияет на качество

По собственной оценке PrismML на 15 бенчмарках, более крупный вариант сохраняет 95% производительности исходной модели, а уменьшенный — 90%. Математика и программирование, по словам компании, «практически не пострадали».

Более заметные падения проявились при агрессивном сжатии, особенно в понимании изображений, следовании инструкциям и использовании инструментов агентами. Обычно сжатая модель Qwen3.6-27B размером 9,4 ГБ набирает лишь 72,7 балла, тогда как уменьшенный вариант Bonsai на 3,9 ГБ достигает 76,1.

Таблица бенчмарков сравнения Qwen 3.6-27B и сжатых версий Bonsai
Сжатые модели Bonsai сохраняют до 95% производительности оригинальной Qwen3.6-27B. У 1-битного варианта сильнее падают зрение и следование инструкциям. | Автор изображения: Prism

Согласно техническому документу, компактная версия генерирует около 11 токенов в секунду на iPhone 17 Pro Max. Тест батареи показал примерно 672 сгенерированных токена на каждый процент заряда, что экстраполируется до 67 000 токенов на полной зарядке. Чип начинал слегка троттлить чуть больше чем через пять минут.

Веса модели доступны под лицензией Apache 2.0. Bonsai 27B запускается на устройствах Apple через фреймворк MLX и на GPU NVIDIA. PrismML также предоставляет бесплатную API-версию Developer Preview и живую демонстрацию на HuggingFace.

Компания основана при поддержке Khosla Ventures, Cerberus и Google; Samsung продолжает её поддерживать. PrismML планирует применить технологию сжатия к серии моделей Google Gemma, уменьшенные версии которых уже работают на смартфонах.

Лицензированная технология сжатия важна для Apple, чьи собственные модели пока отстают в тестах. На WWDC 2026 Apple представила обновлённую Siri на базе фундаментальных моделей, разработанных совместно с Google с использованием технологий Gemini. Самая мощная локальная модель уже требует iPhone с как минимум 12 ГБ ОЗУ, а сложные запросы обрабатываются на GPU NVIDIA в облаке Apple.