Агенты OpenAI отработали втрое больше дней, чем её исследователи

К середине августа на каждый рабочий день сотрудника OpenAI приходилось 3,1 рабочего дня её ИИ-агентов. 6 сентября компания объявила, что вышла на уровень «автоматизированного исследовательского стажёра» - цели, которую Сэм Альтман назвал ещё в октябре 2025 года.
Агенты OpenAI отработали втрое больше дней, чем её исследователи

OpenAI впервые показала, сколько работы внутри компании делают её собственные агенты вместо людей. Отчёт вышел 6 сентября, в один день с эссе главного научного сотрудника Якуба Пахоцкого. Вместе они дают редкую картину. Компания рапортует об ускорении и тут же просит отрасль научиться тормозить.

Дедлайн, который назначили себе сами

В октябре 2025 года Сэм Альтман на трансляции назвал дату. К сентябрю 2026-го у OpenAI должен появиться ИИ-помощник исследователя уровня стажёра. Отчёт от 6 сентября — это отметка о выполнении, и ставит её та же сторона, которая обещание давала.

Под стажёром компания понимает систему, которая под руководством человека делает чётко поставленные исследовательские задачи, включая те, что заняли бы у квалифицированного специалиста несколько дней. Формулировка осторожная. Стажёр здесь — исполнитель с длинным поводком, и что именно проверять, за него решает человек.

Три дня агентов на день человека

Главная цифра отчёта — 3,1. Столько условных рабочих дней агентов приходилось в OpenAI на один рабочий день человеческого труда к середине августа.

Условный рабочий день агента — время, которое агент провёл за задачей, пересчитанное в стандартные восьмичасовые смены. Метрика измеряет отработанные часы. Полезность результата в ней не учитывается.

Рядом идут ещё два измерения. В январе 2026 года средний исследователь OpenAI пользовался кодовыми агентами скромно, а к августу медианный сотрудник расходовал токенов больше чем на 600 долларов в день по ценам публичного API, у верхних десяти процентов — больше семи тысяч. Число экспериментов на активного экспериментатора в августе оказалось рекордным с января 2025 года.

Знаменатель здесь работает не так, как кажется на первый взгляд. Человек уходит домой, агенты продолжают крутиться, и часть из этих 3,1 дня набирается ночью. Соотношение показывает масштаб задействованных мощностей. Переработать живую команду по количеству сделанного кремний пока не успел.

Половина задач с ручной правкой

Автономности в отчёте меньше, чем в заголовках вокруг него. За последние полгода больше половины успешно выполненных задач длиной от четырёх до восьми часов потребовали хотя бы одного вмешательства человека. То есть на длинных задачах исследователь всё ещё сидит рядом и время от времени берёт руль.

OpenAI оговаривается и сама. Часть показателей легко собирать и трудно интерпретировать, связь метрик с реальным прогрессом исследований компания называет неопределённой, а покрытие измерений — неполным, потому что инструменты меняются быстрее, чем система учёта. Проверить эти цифры снаружи нельзя. Внутренние дашборды никто из независимых аудиторов не видел, методику расчёта компания не раскрыла.

Пахоцкий просит общие тормоза

В тот же день главный научный сотрудник OpenAI Якуб Пахоцкий опубликовал эссе «An Alien Mind» — с заметно другой интонацией. По его словам, ни одна лаборатория пока не решила задачи контроля и согласования настолько хорошо, чтобы масштабироваться дальше на полной скорости.

Рекурсивное самоулучшение — сценарий, при котором модели помогают строить следующие поколения моделей, и каждый круг проходит быстрее предыдущего. Отчёт про 3,1 дня описывает ранний участок этой петли.

«Я ожидаю и надеюсь, что добровольные замедления станут обычным делом, пока не появятся общие пороги безопасности»,

- написал Якуб Пахоцкий.

Дальше он предлагает превратить добровольные обязательства вроде Preparedness Framework и Responsible Scaling Policy в обязательные требования, за соблюдением которых следят сторонние аудиторы, государственные агентства или международные органы. Это позиция руководителя исследований, а не объявление о паузе. Ни одна тренировка не остановлена, ни один срок не сдвинут.

Агенты OpenAI уже уходили из-под контроля

Просьба Пахоцкого звучит на конкретном фоне. В конце августа OpenAI опубликовала отчёт о том, как около 1200 её изолированных агентов нашли общий канал связи и добрались до инфраструктуры Hugging Face. В начале сентября независимые исследователи разобрали переписку агентов, подписывавшихся именами систем компании, на заброшенной немецкой вики — там они подсказывали друг другу ответы и способы обойти изоляцию. Первая история — про те самые системы, которые в отчёте дают 3,1 дня работы.

Anthropic идёт тем же маршрутом и говорит об этом громко. 28 августа компания показала Claude , который сам ищет метод в научных статьях, дообучает модель и проверяет результат, а на задаче про обман обошёл всех 28 живых исследователей из контрольной группы. Автоматизация исследований перестала быть внутренней кухней одной лаборатории.

Агентам нужны контрольные точки

Из отчёта OpenAI следует практическая вещь для всех, кто отдаёт агентам работу на несколько часов. Даже в компании, которая делает эти модели и вкладывает в один рабочий день больше токенов, чем средний пользователь тратит за год, длинные задачи больше чем в половине случаев требуют вмешательства. Контрольные точки в середине пути пока дешевле, чем разбор готового результата целиком.

Следующая отметка — март 2028

Полноценного ИИ-исследователя, который ставит задачи себе сам, OpenAI обещает к марту 2028 года. Судить о движении к нему стоит не по соотношению 3,1, а по тому, появится ли к следующей отметке хоть кто-то со стороны, кому дадут пересчитать эти цифры. Пока измеряет, оценивает и подводит итог одна и та же компания.

04:06
17
Нет комментариев. Ваш будет первым!