PatronusAI запускает BLUR — бенчмарк для расплывчатых воспоминаний

2 апреля компания PatronusAI анонсировала новый бенчмарк для ИИ-систем — BLUR (Browsing Lost Unformed Recollections). Цель — научить виртуальных помощников справляться с задачами, где у пользователя есть лишь смутные воспоминания.
Представьте: вы лихорадочно пытаетесь вспомнить фильм, который смотрели лет десять назад. Помните только, что там был какой-то бородатый актер и вроде бы всё происходило в лесу. Или — другая ситуация — песня вертится на языке: улавливаешь пару слов и мелодию, а название ускользает. Знакомо? Вот и PatronusAI знакомо.
Новый тест уже вызвал бурную реакцию в технологическом сообществе. Разработчики разместили лидерборд BLUR на платформе Hugging Face, где можно отслеживать, как различные ИИ-модели справляются с заданиями.
Как работает BLUR?
Бенчмарк состоит из 573 заданий. Из них 350 доступны для общего доступа — чтобы команды могли тренировать модели, а 223 остаются скрытыми: они используются для объективной оценки. Запросы разнообразны: от описаний фильмов, книг и песен до визуальных и мультиязычных задач. Например: «Это была комедия 90-х, где парень притворялся девушкой» или «Песня, в клипе которой были цветы, а пела женщина».
BLUR создан именно для тех случаев, когда точных данных нет. В отличие от традиционного поиска, где нужны ключевые слова, система должна «додумать», о чём идёт речь, на основе обрывочных подсказок.
ИИ пока сдают на троечку
Как отмечают в PatronusAI, даже самые передовые ИИ-модели (SOTA) пока далеки от человеческого уровня. Средний показатель — менее 50% верных ответов. Для сравнения: люди в аналогичных условиях дают правильный ответ в 98% случаев.
Причин несколько. ИИ не умеет интуитивно связывать образы, плохо справляется с размытыми запросами и с трудом анализирует «неконкретику». Фактически, системе приходится моделировать человеческую логику рассуждения — и это пока сложно.
Кто за этим стоит?
Компания PatronusAI уже известна в индустрии по своим другим бенчмаркам: FinanceBench — для задач в сфере финансов, и EnterprisePII — для оценки приватности. Их миссия — сделать ИИ полезнее и надёжнее в реальных сценариях.
BLUR стал логичным продолжением этой работы. По словам разработчиков, он показывает, насколько технологии пока далеки от человеческого понимания — и где именно нужно улучшение.
Что дальше?
Открытая часть BLUR уже доступна разработчикам, и PatronusAI рассчитывает, что это стимулирует прогресс в области ИИ. Инженеры смогут использовать тесты для обучения моделей, а секретная часть будет служить объективным критерием.
Сообщество встретило новинку с энтузиазмом. Один из пользователей X назвал BLUR «прорывом для тестов ИИ-агентов» и выразил надежду, что это изменит подход к работе с нечеткими запросами.
К слову, посмотреть, как ИИ-системы справляются с BLUR, можно уже сейчас — лидерборд доступен на Hugging Face. а официальная новость с подробным обзором представлена на их сайте PatronusAI.