OpenAI выпустила GeneBench-Pro: тест на научное чутьё, который не проходит ни одна модель

Большинство бенчмарков спрашивают модель о фактах или просят прогнать заранее известный алгоритм. GeneBench-Pro проверяет другое - способность принимать решения там, где правильного пути заранее нет. Это ближе к тому, чем реально занят учёный: данные приходят без инструкции, и половина работы - понять, что с ними вообще можно сделать.
Не знания, а чутьё
OpenAI вводит понятие «исследовательский вкус» - цепочку суждений, из которых складывается анализ. Какие вопросы данные вообще способны вытянуть, как ранняя диагностика должна менять модель, когда первоначальный план пора переписать. Каждая задача даёт модели реалистичный замусоренный датасет, короткое описание эксперимента и конкретную цель, привязанную к последующему решению. Чтобы ответить верно, агент должен сам исследовать данные, выбрать подход, поэкспериментировать и выдать финальный ответ.
Темы - генетика, количественная биология и трансляционная медицина (та, что переносит лабораторные находки в клинику). Бенчмарк расширяет более раннюю работу GeneBench, поднимая планку до задач уровня реального исследования.
129 задач и проверка без субъективности
В наборе 129 задач, разбитых на 10 областей и 21 поднаправление - от популяционной генетики и онкогеномики до фармакогеномики и даже судебной генетики. Главная хитрость в том, как они построены. Каждую задачу собрали синтетически: разработчики знают полную причинную структуру данных и сами симулируют процесс их порождения.
Это решает старую болезнь длинных биологических бенчмарков. На реальных исторических данных часто нет единственно верного пути: один аналитик выберет один разумный порог, другой - другой, и оценка отражает вкус автора задачи, а не силу модели. Контроль над генерацией данных позволяет проверять ответ детерминированно, прогонять ablation-тесты (убеждаться, что неверный анализ действительно проваливается) и ловить лазейки, по которым можно угадать ответ в обход анализа. 82 из 129 задач дополнительно вычитали внешние эксперты - аспиранты, постдоки, профессора и учёные из индустрии.
Лучшая модель решает меньше трети
Сильнейшая модель OpenAI, GPT-5.6 Sol, проходит 28,7% задач на максимальном уровне рассуждений и 31,5% в режиме Pro. Для сравнения: когда команда только начинала строить исходный GeneBench, лучшая на тот момент GPT-5 набирала меньше 5%. Виден и эффект масштабирования вычислений на этапе ответа - на максимальном уровне рассуждений GPT-5.6 Sol решает почти в шесть раз больше задач, чем GPT-5.2, тратя при этом около двух третей токенов.
Любопытно сравнение с открытыми моделями. Разрыв между GPT и сильными open-source-системами вроде GLM 5.2 здесь заметно больше, чем на кодинговых тестах. OpenAI читает это так: открытые модели заточены под код сильнее, чем под широкое научное рассуждение.
Где агенты спотыкаются
Картина провалов однотипная. Модели делают частичный прогресс, но не могут «замкнуть петлю вывода» - собрать наблюдения в цельный ответ. По словам одного из рецензентов, агенты недостаточно осторожны с дефектами данных: видят аномалию, но не понимают, что её нужно вычистить или скорректировать. Это поведение новичка, а не эксперта: эксперт по опыту переформулирует задачу под данные, новичок лишь фиксирует факты.
Десятки часов эксперта против нескольких долларов
Самое интересное в релизе - не процент, а экономика. По оценке рецензентов, человеку-специалисту одна задача GeneBench-Pro заняла бы 20–40 часов. При консервативных $200 в час это тысячи долларов за разбор. Прогон той же задачи через ИИ стоит несколько долларов. Агенты пока слишком ненадёжны, чтобы заменить экспертов, но разрыв в стоимости такой, что даже частичная автоматизация уже даёт ощутимую отдачу - особенно в фарме, где генетические доказательства напрямую влияют на выбор мишеней для лекарств.
Что вызывает вопросы
Здесь нужно оговориться. Бенчмарк выпустила та же лаборатория, чьи модели его и возглавляют, - и для разработки задач OpenAI использовала свои же фронтир-модели. Компания это признаёт и пишет, что проверяла набор на смещение в свою пользу: конкуренты в лучшем случае повторяли результат соответствующей GPT, чаще отставали. Поверить на слово или нет - вопрос открытый, поэтому OpenAI обещает отдать 50 задач сервису Artificial Analysis для независимой проверки и уже выложила 10 показательных задач на Hugging Face.
Вторая оговорка - про синтетику. Полный контроль над данными даёт честную автоматическую проверку, но это смоделированные данные, а не сырьё из реальной лаборатории. Разработчики уверяют, что воспроизвели реальную «грязь» биологических наборов; насколько это так, покажет независимый прогон.
OpenAI прогнозирует, что бенчмарк может быть «насыщен» уже к концу года. Если так - это и есть проверочная точка: либо модели за полгода научатся научному чутью, либо красивая кривая роста упрётся в потолок на тех самых задачах, где нужно не считать, а думать.