PrismML уверена, что современным ИИ-приложениям всё чаще нужны мощные модели, работающие прямо на устройстве. ИИ-агент может делать сотни последовательных запросов к модели, каждый из которых несёт контекст, генерирует структурированный ответ и передаёт его на следующий шаг. В облаке затраты на обработку токенов растут, каждый вызов добавляет сетевую задержку, а промежуточные результаты, вызовы инструментов и приватные данные — вроде содержимого экрана или документов — покидают устройство.
Но перенос модели на само устройство сводит предельные затраты на эти циклы к нулю и оставляет пользовательские данные локально. В PrismML видят в этом основу для постоянно активных агентов, офлайн-ассистентов и гибридных систем. Простые и чувствительные к приватности задачи остаются на устройстве, а к облачным моделям обращаются только в самых сложных случаях.
По данным CNBC, PrismML уже ведёт переговоры с Apple о технологии сжатия, лежащей в основе Bonsai. Генеральный директор PrismML Бабак Хассиби подтвердил, что Apple и другие компании тестируют модели на скорость, энергопотребление и производительность. Переговоры находятся на «очень ранней стадии», но «дело движется хорошо».
Две версии для ноутбуков и смартфонов
Модель такого размера обычно занимает около 54 ГБ памяти. Даже со стандартным сжатием ей всё ещё требуется около 18 ГБ. PrismML предлагает два гораздо более компактных варианта. Версия с упором на качество весит примерно 5,9 ГБ и предназначена для ноутбуков, хотя реальный размер поставляемых пакетов может быть больше в зависимости от среды выполнения. В техническом документе указано около 7,2 ГБ для версии llama.cpp и 8,49 ГБ для MLX.
Более компактный вариант занимает примерно 3,9 ГБ — достаточно, чтобы уместиться в ограниченном пространстве iPhone 17 Pro Max. По заявлению PrismML, iPhone с 12 ГБ оперативной памяти выделяет отдельному приложению лишь около 6 ГБ, которые делятся между моделью и кэшем.
Вместо того чтобы хранить каждый вес нейросети как 16-битное значение, PrismML использует всего один или чуть меньше двух битов. В самом агрессивном варианте у каждого веса всего два состояния, в чуть более крупном — три. Такой подход применён ко всей языковой модели. Для иллюстрации распространённой путаницы с маркировкой PrismML указывает на сборку Qwen3.6-27B-IQ2_XXS, рассмотренную в техническом документе: несмотря на метку «2-бит», она в среднем использует 2,8 бита на вес.

Сжатие почти не влияет на качество
По собственной оценке PrismML на 15 бенчмарках, более крупный вариант сохраняет 95% производительности исходной модели, а уменьшенный — 90%. Математика и программирование, по словам компании, «практически не пострадали».
Более заметные падения проявились при агрессивном сжатии, особенно в понимании изображений, следовании инструкциям и использовании инструментов агентами. Обычно сжатая модель Qwen3.6-27B размером 9,4 ГБ набирает лишь 72,7 балла, тогда как уменьшенный вариант Bonsai на 3,9 ГБ достигает 76,1.

Согласно техническому документу, компактная версия генерирует около 11 токенов в секунду на iPhone 17 Pro Max. Тест батареи показал примерно 672 сгенерированных токена на каждый процент заряда, что экстраполируется до 67 000 токенов на полной зарядке. Чип начинал слегка троттлить чуть больше чем через пять минут.
Веса модели доступны под лицензией Apache 2.0. Bonsai 27B запускается на устройствах Apple через фреймворк MLX и на GPU NVIDIA. PrismML также предоставляет бесплатную API-версию Developer Preview и живую демонстрацию на HuggingFace.
Компания основана при поддержке Khosla Ventures, Cerberus и Google; Samsung продолжает её поддерживать. PrismML планирует применить технологию сжатия к серии моделей Google Gemma, уменьшенные версии которых уже работают на смартфонах.
Лицензированная технология сжатия важна для Apple, чьи собственные модели пока отстают в тестах. На WWDC 2026 Apple представила обновлённую Siri на базе фундаментальных моделей, разработанных совместно с Google с использованием технологий Gemini. Самая мощная локальная модель уже требует iPhone с как минимум 12 ГБ ОЗУ, а сложные запросы обрабатываются на GPU NVIDIA в облаке Apple.