OpenCUA: шаг к открытой автоматизации

Исследовательская команда HKU разработала OpenCUA - первый масштабируемый open source‑фреймворк для обучения агентов автоматизации компьютерных задач (Computer-Use Agents, CUA). Он включает инструменты, датасеты и «рецепты» для подготовки моделей, работающих с графическими интерфейсами Windows, macOS и Linux.
Главное преимущество - прозрачность. В отличие от решений крупных ИИ-компаний, где архитектура и методы обучения скрыты, OpenCUA предлагает полный доступ ко всем компонентам: от кода до моделей и данных. Это позволяет исследователям и компаниям не только верифицировать результаты, но и адаптировать фреймворк под собственные задачи.
Сложности создания CUA и решение от OpenCUA
Агенты CUA способны выполнять на компьютере всё: от кликов в браузере до работы в профессиональных приложениях. Однако до сих пор самые эффективные системы были закрытыми. Это мешало развитию технологии и вызывало вопросы безопасности.
«Отсутствие прозрачности ограничивает научный прогресс и создаёт риски. Нужно открытое решение, позволяющее исследовать возможности, ограничения и риски таких систем», - говорится в статье на arXiv.
OpenCUA решает ключевую проблему - масштабируемость. Инструмент AgentNet Tool позволяет записывать действия пользователя: экран, мышь, клавиатуру и структуру интерфейса (accessibility tree). Сбор данных происходит локально, и пользователь сам решает, что отправить. Затем данные проходят многоуровневую проверку на приватность - вручную и с помощью ИИ.
Так был собран датасет AgentNet - более 22 600 демонстраций задач на более чем 200 сайтах и программах. Это один из крупнейших и самых разнообразных наборов в своём роде.
«Внутренний монолог» как ключ к пониманию
Простого обучения на парах «состояние - действие» оказалось недостаточно. Поэтому исследователи добавили цепочку рассуждений - chain-of-thought (CoT). Каждое действие теперь сопровождается тремя уровнями «внутренней речи»:
- Общая оценка происходящего на экране,
- Размышления о следующем шаге,
- Финальное решение - конкретное действие.
Этот подход позволяет агенту не просто повторять увиденное, а понимать задачи. Компании могут использовать тот же механизм, чтобы обучать агентов на своих внутренних процессах без ручной разметки.
«Это открывает путь к созданию сильных, кастомизированных агентов без дополнительных затрат», - пояснил Синьюань Ван (Xinyuan Wang), аспирант HKU.
Результаты: OpenCUA‑32B вышел в лидеры
На основе OpenCUA были обучены модели от 3 до 32 миллиардов параметров, включая вариации Qwen и Kimi-VL. Самая мощная из них - OpenCUA‑32B - установила рекорд на open source‑бенчмарке OSWorld‑Verified. Она превзошла даже CUA на базе GPT‑4o и почти сравнялась с решениями от Anthropic.

Фреймворк показал высокую устойчивость при работе с разными архитектурами (в том числе mixture-of-experts) и системами. Агент успешно справляется с задачами на Windows, macOS и Ubuntu - от создания инстансов AWS до настройки параметров в Amazon MTurk.
Автоматизация по‑новому: от «что» к «как»
Исследователи предлагают два сценария взаимодействия с агентом:
- Автономный режим - агент сам завершает задачу от начала до конца,
- Совместный режим - агент работает рядом, как помощник, реагируя на указания в реальном времени.
«Люди формулируют стратегические цели, а агент берёт на себя тактическую реализацию», -
Однако перед внедрением в реальную инфраструктуру остаются вызовы - надёжность и безопасность. Агент не должен совершать критических ошибок, меняя настройки или запуская не те процессы.
Код, данные и веса моделей OpenCUA уже доступны. Открытая архитектура может стать основой для разработки корпоративных решений нового поколения. ИИ-агенты больше не будут уделом закрытых лабораторий. Теперь любой может создать собственную систему автоматизации - надёжную, масштабируемую и понятную.