OpenAI нашла поломку в трети задач бенчмарка SWE-Bench Pro и отозвала свою рекомендацию

OpenAI опубликовала результаты аудита SWE-Bench Pro - одного из главных бенчмарков для оценки агентных навыков программирования у ИИ-моделей. Проверка показала: от 27 до 34% задач в тесте сломаны, часть тестов слишком жёсткая, часть условий вообще не совпадает со скрытыми проверками. Раньше OpenAI сама советовала индустрии перейти на этот бенчмарк — теперь эту рекомендацию отзывает.
OpenAI нашла поломку в трети задач бенчмарка SWE-Bench Pro и отозвала свою рекомендацию

8 июля OpenAI опубликовала результаты аудита SWE-Bench Pro - одного из главных бенчмарков для оценки агентных навыков программирования у ИИ-моделей. Проверка показала: от 27 до 34% задач в тесте сломаны, часть тестов слишком жёсткая, часть условий вообще не совпадает со скрытыми проверками. Раньше OpenAI сама советовала индустрии перейти на этот бенчмарк, но теперь эту рекомендацию отзывает.

Как считали брак: два независимых прохода

Автоматический фильтр OpenAI разбирал инструкции для модели, попытки модели решить задачу и тесты, которыми эти попытки проверяются. Он отметил 286 потенциально проблемных задач из 731 в публичной части SWE-Bench Pro. Дальше подозрительные задачи прогнали через два независимых процесса.

Первый - агентный аудит: ИИ-агенты на основе Codex получили доступ к репозиторию и окружению задачи, гоняли тесты, изучали код и типичные ошибки моделей, а финальное решение по каждой задаче принимал исследователь-человек. Этот путь подтвердил 200 сломанных задач, 27,4% от всего набора.

Второй - ручная разметка: пять опытных инженеров независимо оценивали каждую отмеченную задачу по условию, тестам и эталонному решению (gold patch), прежде чем смотреть на выводы пайплайна. Разногласия эскалировали для дополнительной проверки. Здесь брака нашли больше: 249 задач, 34,1%.

Четыре способа сломать задачу

OpenAI выделяет четыре типовые проблемы:

  • слишком строгие тесты проверяют конкретную реализацию, которой не было в условии и заваливают решения, которые в остальном работают правильно;
  • недостаточно описанные условия не называют требование, которое потом проверяет скрытый тест, а угадать его нельзя;
  • тесты с низким покрытием пропускают недоделанные решения, потому что проверяют не всё, что просит задача;
  • вводящее в заблуждение условие направляет модель не туда, куда потом смотрят тесты.

Пример из отчёта - задача OpenLibrary-77c16d5 про сериализацию оглавления в Markdown. Условие показывало модели строки с одним пробелом перед вертикальной чертой, а скрытый тест требовал два пробела. Модель, которая честно следовала условию, гарантированно проваливала проверку.

Агенты строже размечают, люди строже судят

Пересечение оценок между агентным пайплайном и человеческой разметкой - 74%: агенты и люди в основном соглашались, какие категории брака у задачи. Но люди чаще признавали задачу сломанной вообще и чаще находили в одной задаче сразу несколько проблем.

Самый заметный разрыв: тесты с низким покрытием. Люди назвали эту проблему основной для 9,4% всего бенчмарка, агентный пайплайн - только для 4,1%. Автоматический аудит здесь получился заметно консервативнее человеческого, и это стоит учитывать всем, кто полагается только на автоматическую проверку тестов.

Второй бенчмарк, который OpenAI хоронит сама

Ранее OpenAI уже признала, что SWE-bench Verified (предшественник нынешнего теста) устарел из-за проблем с дизайном задач и утечки данных в обучающие выборки, и рекомендовала переходить на SWE-Bench Pro от Scale AI. На публичном наборе из 731 задачи модели за восемь месяцев подняли долю решённых задач с 23,3 до 80,3%. Теперь выясняется, что заметная часть этого набора работала некорректно в обе стороны: где-то занижала результат из-за придирчивых тестов, где-то завышала, пропуская неполные решения. OpenAI прямо отзывает свою же рекомендацию по SWE-Bench Pro - уже второй раз подряд она признаёт негодным бенчмарк, который сама же советовала индустрии.

Взамен - только призыв к сообществу

OpenAI не предлагает замену. Вместо этого она зовёт сообщество делать новые бенчмарки с самого начала руками опытных разработчиков, с более строгим человеческим контролем на каждом этапе. Практический вывод для тех, кто сравнивает модели по агентному кодингу: к процентам SWE-Bench Pro в чужих пресс-релизах стоит относиться настороженно, пока не появится тест с прозрачной методикой проверки самих задач.

Заодно это показывает обратную сторону растущих возможностей моделей. Агенты теперь достаточно надёжны, чтобы вскрывать брак в собственных экзаменах.

00:55
151
Нет комментариев. Ваш будет первым!