Новости и статьи об искусственном интеллекте и нейросетях. Мы собираем и обрабатываем самую актуальную информацию из мира AI. О проекте

Новости

ИИ сравнялся с врачами, но его архитектура устаревает

Две ИИ-системы, MIRA и AMIE, показали результаты, превосходящие врачей в точности диагностики и следовании клиническим руководствам. Однако исследователи предупреждают, что специальные архитектуры помогают только слабым моделям ИИ, а с улучшением базовых моделей их преимущество теряется. Это открытие может привести к пересмотру подходов к разработке медицинского ИИ.

22 июня 2026 г.
3 мин
45

MIRA работает как врач в симулированной больнице

Аббревиатура MIRA расшифровывается как Medical Intelligence for Reasoning and Action. Систему разработали в Дрезденском техническом университете и Гейдельбергском университете совместно с другими учреждениями. В отличие от обычных чат-инструментов, MIRA действует как автономный агент внутри изолированной виртуальной электронной медицинской карты. По данным исследования, система может выбирать из более чем 85 000 вариантов действий, используя одиннадцать инструментов. Она собирает анамнез, назначает лабораторные анализы, микробиологические тесты и визуализацию, интерпретирует результаты, формирует дифференциальный диагноз и составляет план лечения, включая рецепты, планирование операций и госпитализацию.

Команда протестировала MIRA на более чем 500 реальных случаях из отделения неотложной помощи, взятых из общедоступного набора данных MIMIC-IV. Роль пациента исполнял второй ИИ-агент, который сообщал только ту информацию, что содержалась в реальной медицинской карте.

В восьми категориях заболеваний MIRA поставила правильный диагноз в 88,9% случаев, если сравнивать с диагнозами, зафиксированными в наборе данных. Для прямого сравнения обе стороны обработали подвыборку из 311 случаев в одинаковых условиях. MIRA показала точность 87,8%, четверо опытных специалистов — 78,1%, а смешанная команда из ординаторов и специалистов — 71,1%. Лучше всего ИИ справился с аппендицитом (98,6%) и панкреатитом (92,3%). И у ИИ, и у врачей возникли трудности с пневмонией (72,4%) и инфекциями мочевыводящих путей (77,6%).

Исследователи также проверили безопасность рекомендаций. Ослеплённые рецензенты-специалисты, не знавшие, исходит ли рекомендация от MIRA или от человека, не обнаружили опасных лекарственных взаимодействий, некорректных дозировок для пациентов с нарушенной функцией почек и рискованных назначений обезболивающих. MIRA практически безупречно учитывала текущие лекарства пациента и безошибочно определяла необходимость госпитализации — она не пропустила ни одного случая, требующего стационарного лечения. Результаты оставались стабильными даже тогда, когда тестовые пациенты говорили только на немецком или французском языке или вели себя особенно тревожно. Исходный код доступен на GitHub.

AMIE объединяет двух агентов и клинические руководства

AMIE от Google применяет иной подход: ведение пациентов на протяжении нескольких визитов. Система состоит из двух частей. Разговорный агент обеспечивает быстрое и дружелюбное общение с пациентом, а второй агент работает в фоновом режиме, более тщательно обдумывая ситуацию и сверяя случай с медицинскими рекомендациями.

В строго контролируемом исследовании Google сравнила AMIE с 21 врачом первичного звена на 100 клинических сценариях, охватывающих несколько визитов. В качестве эталона использовались британские рекомендации NICE Guidance и BMJ Best Practice. Пациентов изображали актёры, общаясь через текстовый чат. Согласно исследованию, AMIE не уступала врачам в принятии решений о лечении, а по точности планов и следованию руководствам даже превзошла их. На первом визите общий план AMIE был признан адекватным в 95% случаев, тогда как для врачей этот показатель составил 72%. И рецензенты-специалисты, и актёры-пациенты чаще отдавали предпочтение AMIE, чем людям-врачам.

Для проверки знаний о лекарствах команда создала специальный тест RxQA, основанный на двух национальных фармацевтических справочниках и проверенный лицензированными фармацевтами. AMIE превзошла врачей первичного звена на более сложных вопросах. Однако тест оказался непростым для обеих сторон: даже на лёгких вопросах лучший результат не превышал 75%.

Обе команды предостерегают от поспешных выводов

Авторы чётко обозначают ограничения своих результатов. MIRA рекомендовала «помощь, отклоняющуюся от лучших практик», для «небольшой, но ненулевой» доли пациентов. Ответы симулированного пациента могли быть «более структурированными, чем реальная речь пациентов в отделениях неотложной помощи». Также нельзя полностью исключить, что общедоступный набор данных MIMIC-IV уже входил в обучающие данные использованных моделей. Если это так, измеренная производительность оказалась бы скорее верхней планкой, чем реалистичной оценкой. Кроме того, врачи, с которыми проводилось сравнение, работали в немецкой системе неотложной помощи, которая отличается от систем других стран.

Разработчики AMIE называют своё исследование «вехой», но подчёркивают, что ни подборка случаев, ни текстовые беседы не отражают реальную клиническую практику. Система демонстрирует «многообещающие возможности», но «не готова к внедрению в реальный мир». Необходима дальнейшая работа над устранением «скрытых ошибок рассуждений», которые могут проникать в невидимые шаги логического вывода системы.

Якоб Катер, чья исследовательская группа участвовала в создании MIRA, сказал в интервью Financial Times: «Мы получаем предварительный взгляд на то, как ИИ может преобразовать медицину». Он сравнил ИИ-агентов с автопилотом самолёта: «Такие системы могут поддерживать и разгружать медицинских работников, беря на себя рутинные задачи, но окончательная ответственность всегда будет лежать на врачах».

Независимые эксперты сдерживают восторг

Исследователи, не участвовавшие в этих работах, высоко оценили тщательную методологию, но указали на то, что это всего лишь симуляции. Кэтрин Поуп, профессор медицинской социологии из Оксфордского университета, отметила в интервью FT, что это «далеко от запутанного, сложного и человеческого мира повседневного здравоохранения».

Джули Джеко, профессор медицинской информатики из Эдинбургского университета, сказала, что многие заявленные преимущества сводятся к «точности и полноте планов», а не к «явным различиям в клинической корректности». По её словам, исследование «демонстрирует производительность относительно структурированного стандарта, а не полностью отражает сложность реального принятия клинических решений».

Архитектурные надстройки помогают слабым моделям, сильные в них не нуждаются

Одно из самых показательных открытий скрыто в дополнительных экспериментах AMIE. Как часто бывает в рецензируемых исследованиях, обе системы опираются на устаревшие модели ИИ. AMIE до сих пор работает на базе Google Gemini 1.5 Flash, а MIRA использует GPT-4o и o1-preview от OpenAI. Все эти модели уже превзойдены более новыми поколениями.

Исследователи из Google заменяли отдельные компоненты, чтобы выяснить, что на самом деле обеспечивает производительность: сложная архитектура из двух агентов, сопоставление с руководствами и специализированное обучение или просто лежащая в основе языковая модель.

С устаревшей Gemini 1.5 Flash специализированная конфигурация действительно дала значительный прирост производительности, описанный в исследовании. Но когда исследователи применили ту же конфигурацию к более новой Gemini 2.5 Flash, преимущество почти исчезло.

Иными словами, специализированная система компенсирует слабости старой модели, заставляя её структурировать рассуждения, ссылаться на руководства и подавлять галлюцинации. Более сильная модель способна делать всё это самостоятельно. В статье признаётся, что ценность AMIE уменьшается по мере улучшения базовой модели. Фактически, новые универсальные модели, такие как Gemini 2.5 Pro, o3 и GPT-5, уже показывают «в целом сопоставимые» результаты с полной системой AMIE в тесте RxQA.

На практике AMIE, по-видимому, опередили темпы развития ИИ. Это повторяющаяся закономерность: архитектурные надстройки вокруг языковых моделей становятся избыточными с появлением более сильных моделей, иногда потому, что сами надстройки попадают в обучающие данные для следующего поколения. Это не делает лежащие в их основе идеи бесполезными: в программировании и всё чаще в других областях такие инструменты, как Claude Code, OpenAI Codex и Claude Cowork, предоставляют моделям доступ к инструментам, контексту и памяти. И даже более сильные модели с такой поддержкой показывают лучшие результаты на сложных задачах. Но надстройки должны успевать за прогрессом моделей, иначе они превращаются в мёртвый груз.

В случае MIRA подобного анализа не проводилось. Однако часть её архитектуры связана не столько с компенсацией слабостей модели, сколько с подключением ИИ к клиническим системам больницы. Эта часть не устареет с появлением более мощных моделей.