Новости и статьи об искусственном интеллекте и нейросетях. Мы собираем и обрабатываем самую актуальную информацию из мира AI. О проекте
Материал рассматривает семь методов ускорения инференса больших языковых моделей: от квантования и кэширования до спекулятивного декодирования и оптимизации промтов. Эти подходы помогают снизить задержки до первых миллисекунд и улучшить пользовательский опыт.
Подробное руководство по настройке локальных моделей для Claude Code через Ollama, LM Studio и llama.cpp. Включает точные переменные окружения, конфигурационные файлы и решения типичных проблем — от ошибок соединения до медленной генерации.
Статья описывает реальные трудности локального запуска LLM: от нехватки VRAM и задержек до проблем с промптами и дообучением. Подробно разобраны обходные пути вроде квантизации, оптимизации контекста и тестирования шаблонов. Само-хостинг требует инвестиций в железо и методичный подход, но даёт полный контроль.
PrismML представила Bonsai 27B — открытую модель с экстремальным сжатием до 1-2 бит на вес, которая помещается на iPhone 17 Pro Max. Компания утверждает, что сжатие сохраняет до 95% качества оригинальной модели Qwen, а математика и программирование почти не страдают. Технология уже привлекла внимание Apple и может помочь ускорить локальный ИИ на устройствах.
Tencent опубликовала открытую модель ИИ Hy-MT1.5-1.8B-1.25bit объемом 440 МБ для оффлайн-перевода 33 языков на смартфонах. Она конкурирует с Google Translate и крупными моделями вроде Qwen3-32B благодаря сжатию до 1,25 бита на параметр без потери качества. Доступно демо-приложение для Android и 30 побед в конкурсах.
Google представил TurboQuant — алгоритм сжатия KV-кэша ИИ минимум в 6 раз без потери качества. Технология использует PolarQuant и QJL, её покажут на ICLR 2026. Интернет шутит про сходство с Pied Piper из "Кремниевой долины", но это пока лабораторный прорыв для inference.
Показаны все статьи (6)