Новости и статьи об искусственном интеллекте и нейросетях. Мы собираем и обрабатываем самую актуальную информацию из мира AI. О проекте

Новости

Anthropic включает авторежим Claude Code по умолчанию для защиты разработчиков от ошибок

Anthropic сделала авторежим Claude Code стандартным для платных тарифов. Встроенный классификатор оценивает риски и предотвращает опасные действия, повышая продуктивность на 25% и защищая от prompt injection. Внутренние тесты показали надёжную защиту и предотвращение инцидентов.

8 августа 2026 г.
2 мин
50

Claude Code скоро будет по умолчанию работать в автономном режиме — только корпоративным клиентам потребуется включать его вручную. Это означает, что ИИ берёт на себя ещё больше задач в процессе разработки.

Авторежим позволяет инструменту ИИ-кодинга действовать самостоятельно, не дожидаясь подтверждения каждого шага. Встроенный классификатор оценивает, является ли действие опасным или необратимым, и запрашивает подтверждение только в таких ситуациях.

Начиная с 14 августа Claude Code будет поставляться с авторежимом, включённым по умолчанию для тарифов Pro, Max и Team, как объявила Anthropic в блоге. В испытаниях с участием 1053 платных тестировщиков и внутренним red-teaming'ом авторежим показал себя как минимум так же безопасно, как ручное одобрение, а зачастую и лучше. Команды, использующие авторежим, создавали примерно на 25% больше pull request'ов, то есть выполняли больший объём работы.

График сравнения обнаружения опасных команд человеком и авторежимом
В контролируемом исследовании с 1053 платными тестировщиками проверяющие люди заметили лишь 13,6% опасных команд, тогда как Auto Mode поймал 89%. | Изображение: Anthropic

Anthropic также заявляет, что авторежим добавляет уровень защиты от атак с внедрением запросов (prompt injection), когда внедрённый код пытается перехватить управление агентом и отклонить его от инструкций пользователя. Независимый аудит компании Trajectory Labs протестировал 72 сценария атак по десять раз каждый. Ни одна из 720 попыток не увенчалась успехом против текущих моделей Claude — Fable 5, Opus 5 и Sonnet 5 — в авторежиме. С OpenAI GPT-5.6 Sol в режиме Codex Auto-Review прошло 5,83% атак.

Внутри самой Anthropic авторежим предотвратил загрузку конфиденциальных данных на публичную страницу. Во время одной продолжительной сессии он также принудительно завершил около 2000 процессов, которые могли бы нарушить текущие задачи обучения на GPU, сообщает компания.

Anthropic не взимает плату за токены, потребляемые самим классификатором. Но переход на авторежим по умолчанию всё равно может быть выгоден для компании: чем дольше Claude работает и чем больше делает, тем выше общее потребление токенов, а значит и доход, даже если это не было основной целью изменений.

Разработчики переходят от написания кода к наблюдению за тем, как его пишет ИИ

Claude Code сейчас — самый популярный ИИ-инструмент для кодинга с большим отрывом, и включение авторежима по умолчанию ещё больше смещает роль разработчика от активного написания кода к проверке того, что сгенерировал ИИ. Сама Anthropic призывает к осторожности.

Классификатор снижает риски, но не устраняет их полностью.

«Для критических изменений в производственной инфраструктуре мы по-прежнему рекомендуем самостоятельно проверять действия Claude», — пишет компания.

Этот совет порождает парадокс. Чем реже разработчики вмешиваются, тем важнее становится их контроль. Но всё труднее глубоко понимать проекты, которые в основном были созданы авторежимом без значительного участия человека. А кибербезопасность развивается быстрее и усложняется быстрее, чем любой человек может реально за ней угнаться.