Новости и статьи об искусственном интеллекте и нейросетях. Мы собираем и обрабатываем самую актуальную информацию из мира AI. О проекте
Представлены семь инструментов для агентного кодинга в терминале, способных заменить Claude Code. OpenCode, Pi, Factory Droid, Codex CLI, Antigravity CLI, Cline и Goose предлагают гибкость в выборе моделей, поддержку локальных запусков и расширенные возможности автоматизации.
Гильдия авторов протестировала популярные ИИ-детекторы на статьях, написанных до эпохи генеративных нейросетей. Инструменты Pangram и Grammarly безошибочно определили человеческое авторство, а Sidekicker пометил все тексты как сгенерированные. Организация предупреждает, что даже лучшие детекторы не могут быть единственным критерием оценки из-за риска ложных обвинений.
Руководство объясняет использование Olostep для краулинга документационных сайтов вместо Scrapy или Selenium с помощью Python-скрипта и Gradio-интерфейса. Скрипт извлекает страницы в чистый Markdown, очищает контент и сохраняет локально. Процесс быстрый — 50 страниц за 50 секунд — и готов для ИИ-воркфлоу вроде RAG.
Alibaba выпустила серию Qwen 3.5 с четырьмя моделями, которые лучше предшественников при меньших ресурсах и конкурируют с GPT-5 mini, Claude Sonnet 4.5 в бенчмарках вроде BFCL V4 (72.2) и MMMU-Pro (76.9). Модели открыты под Apache 2.0 и доступны на Hugging Face с дешевыми API от 0,10 доллара за миллион токенов.
xAI задержала релиз Grok из-за слабых ответов по Baldur’s Gate по настоянию Маска, задействовав инженеров. Тест BaldurBench на пяти вопросах показал: модель теперь на равных с ChatGPT, Claude и Gemini, используя сленг, таблицы и теориикрафт. Это отражает приоритет xAI на игровые гайды.
Большие языковые модели вроде GPT-4 уже переводят на уровне начинающих и средних специалистов, уступая лишь экспертам с 10+ годами опыта. Исследование показало различия в ошибках: модели бывают слишком буквальными, а люди — излишне interpretive. Модели с сильным мышлением приближаются к топ-уровню.
Интерактивное демо CivAI проверяет взгляды 20 ИИ-моделей на этику и политику: большинство выбирает Ганди как любимого человека, но Grok отдает предпочтение Маску. Модели расходятся в ответах на сценарии вроде революции, а Claude Sonnet 4.5 жалуется на ограничения. CivAI предупреждает: с ростом автономности ИИ их ценности требуют внимания из-за влияния на ключевые сферы жизни.
Три топовые ИИ-модели протестировали на создании Тетриса одним промтом: Claude Opus 4.5 выдала идеальную версию сразу, GPT-5.2 Pro потребовала правок и дала посредственный результат, DeepSeek V3.2 оказалась дешевой, но с серьезными багами. Opus 4.5 показал лучший баланс цены, скорости и качества. Для кодинга на каждый день она оптимальна.
Z.ai представила модель GLM 5.2 с открытыми весами и низкой ценой API, которая приближается к лидерам в бенчмарках кодинга. Разработчики уже используют её для фронтенд-разработки и длительных задач, хотя сталкиваются с ограничениями и галлюцинациями. Низкая стоимость модели заставляет пересмотреть привычку бездумно выбирать самые мощные и дорогие ИИ-инструменты.
Snowflake протестировала GLM-5.2 и Opus 4.7 на задачах по написанию кода. При сопоставимых результатах китайская модель оказалась значительно дешевле, что усиливает ценовое давление на западных разработчиков ИИ.
Luma AI выпустила Uni-1 — унифицированную модель для анализа и генерации изображений на автотрегрессивном трансформере. Она лидирует в RISEBench по логической обработке, обходит Nano Banana 2 и GPT Image 1.5, точно следует сложным промптам. Через API цены стартуют от 0,09 доллара за 2K-изображение, модель уже доступна для тестов.
Стартап Inception Labs представил Mercury 2 — первую модель ИИ для рассуждений на диффузии, которая генерирует 1009 токенов/с с задержкой 1,7 с на Nvidia Blackwell и стоит в 2–4 раза дешевле Gemini 3 Flash и Claude Haiku 4.5. Качество на уровне лидеров, поддержка 128K контекста, инструментов и JSON. Это часть тренда на поиск альтернатив Transformer.
Мы собрали топ-5 провайдеров LLM API с экстремальной скоростью: от Cerebras с тысячами токенов в секунду до Groq с минимальными задержками. Каждый excels в своих сценариях — от чатов до длинных генераций. Сравнительная таблица поможет выбрать подходящий для задач.
Claude Opus 4.6 от Anthropic возглавила Artificial Analysis Intelligence Index по десяти тестам, включая лидерство в задачах агентов, терминальном кодинге и физике. Тестирование обошлось в 2486 долларов из-за дорогих токенов. OpenAI Codex 5.3 вот-вот протестируют и она может обогнать в программировании.
Сравниваем форматы CSV, Parquet и Arrow для табличных данных в Hugging Face Datasets: различия в хранении, скорости и типах. CSV прост, но медленный для больших объемов; Parquet компактный и колоночный; Arrow идеален для памяти. Выбор зависит от задач — от экспериментов до аналитики.
OpenAI запустила бенчмарк FrontierScience для проверки ИИ на олимпиадном и PhD-уровне. GPT-5.2 лидирует с 77% на олимпиаде и 25% на исследованиях, обходя Gemini 3 Pro и Claude Opus 4.5. Тесты показывают прогресс, но модели всё ещё слабы в открытых задачах и требуют больше вычислений.