Современные системы искусственного интеллекта могут значительно лучше справляться со сложными задачами по физике, чем показывают популярные тесты. Международная группа исследователей повторно проверила результаты ведущих ИИ-моделей и обнаружила, что значительная часть зафиксированных ошибок была связана не с рассуждениями ИИ, а с проблемами самих тестов — неверными эталонными ответами, неоднозначными условиями и ошибками автоматической проверки.
Исследователи проанализировали шесть широко используемых физических бенчмарков, предназначенных для оценки способности языковых моделей решать научные и количественные задачи. Для разных разделов физики к проверке привлекали преподавателей и аспирантов с соответствующей специализацией. Эксперты изучали не только ответы моделей, но и условия задач, эталонные решения и результаты автоматического оценивания.
Оказалось, что во многих проверенных случаях ответы, первоначально отмеченные как неправильные, на самом деле не свидетельствовали об ошибке ИИ в физическом рассуждении. Причиной могли быть ошибочные эталонные решения или задачи, допускающие несколько интерпретаций. После экспертной проверки исследователи исправили такие эталоны, а некорректные или недостаточно определённые задания отредактировали либо исключили из оценки.
После этого результаты моделей заметно выросли. Например, показатель GPT-5.6 Sol на наборе HLE-Physics увеличился с 47,3 до 78,7%, а на CMT-Benchmark — с 61,0 до 87,2%. На 54 оставшихся после проверки задачах CritPt показатель corrected pass@4 достиг 94,4%. Существенный рост после исправления тестов наблюдался также на UGPhysics, PRISM-Physics и PHYBench.
При этом результаты не означают, что ИИ уже способен заменить физиков или самостоятельно проводить полноценные научные исследования. Авторы оценивали прежде всего текстовые задачи с проверяемым конечным ответом. Реальная научная работа требует постановки новых вопросов, оценки предположений, работы с экспериментальными данными и проверки новых гипотез — это гораздо более широкий набор способностей.
Исследование указывает на другую проблему: некоторые существующие тесты могут уже плохо подходить для оценки наиболее мощных ИИ-систем. Если после экспертной корректировки модели решают подавляющую часть закрытых задач, дальнейшее сравнение систем потребует более сложных и тщательно проверенных специалистами заданий. Авторы считают, что результаты популярных бенчмарков сегодня могут существенно недооценивать способность передовых моделей решать корректно сформулированные задачи по физике.
Исследование опубликовано на сервере препринтов arXiv и пока не прошло рецензирование.
