Профессор статистики из Пенсильванского университета использовал модель GPT-5.6 от OpenAI, чтобы решить один из центральных открытых вопросов в своей области.
При массовой проверке гипотез — например, когда учёные прочёсывают геном человека в поисках генов, связанных с болезнями — возникает проблема: чем больше тестов, тем больше ложноположительных результатов просачивается в итоговые данные.
В 1995 году статистики Йоав Бенджамини и Йосеф Хохберг разработали метод, позволяющий ограничить число таких ошибочных находок. Он контролирует долю ложных отклонений (false discovery rate, FDR) — то есть долю статистически значимых результатов, которые на самом деле являются ложной тревогой.
Скоррелированные данные могут нарушить работу метода
Процедура Бенджамини-Хохберга (BH) сегодня широко используется в современной статистике и во многих научных областях. По словам Эдгара Добрибана, доцента Уортонской школы Пенсильванского университета, исходная статья получила более 130 000 цитирований.
Изначально Бенджамини и Хохберг показали, что их метод работает с независимыми данными. Однако в реальном мире данные часто взаимосвязаны. Генетические варианты могут быть скоррелированы — например, когда определённые участки генома наследуются вместе.
Многие годы эксперты предполагали, что процедура BH будет надёжно работать и с коррелированными данными, имеющими нормальное распределение, особенно при тестировании отклонений в обе стороны. Но никто так и не смог этого доказать.
Добрибан опроверг это предположение с помощью GPT-5.6 Sol Pro от OpenAI. В своём препринте он с помощью ИИ строит статистическую модель, в которой фактический уровень ложных отклонений доказуемо превышает целевой. Симуляции подтверждают результат. Добрибан также опубликовал сопутствующий код.
Пока что результат важнее для теории, чем для практики
Добрибан отмечает, что превышение над целевым уровнем «относительно небольшое (0,104 против 0,1)», поэтому на данный момент результат важен в основном для теории. Практические последствия ещё требуют дополнительных исследований, и этот вывод не означает, что процедура BH в целом непригодна.
Тем не менее результат значим для статистиков, поскольку ИИ быстро решил задачу, с которой люди не справились. Добрибан сообщает, что GPT-5.6 Sol Pro потребовалось около 90 минут. Предыдущая версия GPT-5.5 не смогла найти решение даже после примерно 20 часов работы нескольких агентов. «Так что улучшение способностей вполне реально. Захватывающее время для жизни!» — пишет он. Полный чат и промт доступны здесь.
Статистик из Беркли Уилл Фитиан назвал опровергнутую гипотезу «самой интересной открытой проблемой в моей области статистики», а сам результат — «ещё одним свидетельством прогресса ИИ, последствия которого выйдут далеко за пределы математики».
Фитиан также намекнул, насколько подобные результаты подрывают у экспертов ощущение значимости собственной работы: «Не могу не оплакивать ушедшие дни, когда ключевой результат всегда означал коллегу, с которым можно разделить радость; человеческое озарение, которым можно восхищаться; человеческое достижение, которое вдохновляет».
Модель комбинировала известные методы, а не изобретала новые
Как и в подобных случаях из математики, решение, по-видимому, сочетает существующие подходы, а не создаёт что-то принципиально новое. Добрибан отметил, что комбинация была необычной, но результат в конечном счёте «не особенно удивителен». Сложность состояла в том, чтобы найти правильный способ связать известные методы, и более новая модель справилась с этой задачей.
Открытым остаётся более широкий вопрос: могут ли модели, обученные на человеческих данных, путём рассуждений прийти к подлинно новому знанию, или они способны «лишь» перекомбинировать усвоенное в ходе обучения? Даже если всё, на что способны эти системы, — это рекомбинация, они уже доказывают свою полезность в качестве повседневных инструментов, встроенных в рабочие процессы людей. Результат Добрибана пополняет растущий список примеров.
Но более амбициозные цели, например создание самоулучшающегося ИИ, способного к обобщению, могут потребовать чего-то большего, чем простая рекомбинация. Пионер глубокого обучения Ричард Саттон — один из тех, кто так считает: он недавно основал стартап для решения именно этой проблемы.