o3-
o3 — это генеративная предварительно обученная трансформерная модель (GPT), разработанная OpenAI и представленная 20 декабря 2024 года. Она является преемником модели o1 и ориентирована на улучшение навыков логического рассуждения и решения сложных задач. Модель была названа "o3" для избежания конфликтов с торговой маркой мобильного оператора O2. o3 доступна в двух версиях: o3 и o3-mini.
OpenAI пригласила исследователей безопасности для раннего доступа к этим моделям до 10 января 2025 года, планируя выпустить o3-mini для широкой публики в январе 2025 года. o3-mini предлагает три уровня вычислительной нагрузки: низкий, средний и высокий.
Модель обучена с использованием методов обучения с подкреплением, что позволяет ей "размышлять" перед генерацией ответов, выполняя серию промежуточных шагов рассуждения для решения задач. Это приводит к повышенной точности в областях программирования, математики и науки.
Например, o3 достигла 87,7% на тесте GPQA Diamond, содержащем экспертные научные вопросы, и показала высокие результаты на программных и математических бенчмарках. Однако использование дополнительных вычислительных ресурсов приводит к увеличению времени отклика. OpenAI также внедрила метод "делиберативного выравнивания", повышающий устойчивость модели к манипуляциям.
Таблица характеристик o3:
| Параметр | Значение |
|---|---|
| Название модели | o3 |
| Дата релиза | 20.12.2024 |
| Компания-разработчик | OpenAI |
| Архитектура | Трансформер (точные детали не раскрыты) |
| Количество параметров | Точные данные не раскрыты |
| Контекстное окно | Точные данные не раскрыты |
| Обучающие данные | Специально подобранный набор данных для улучшения способностей к рассуждению |
| Формат ввода | Текст |
| Возможности мультимодальности | Отсутствуют |
| Метод обучения | Обучение с подкреплением, позволяющее модели "размышлять" перед генерацией ответа |
| Способы доступа | Доступ через API OpenAI; ранний доступ для исследователей безопасности |
| Специализированные версии | o3-mini |
| Эффективность в задачах | Высокая эффективность в решении сложных задач, особенно в области программирования, математики и науки |
| Скорость отклика | Медленнее по сравнению с предыдущими моделями из-за более длительного процесса рассуждения |
| Энергопотребление | Высокое из-за увеличенного времени вычислений |
| Безопасность и ограничения | Внедрен метод "делиберативного выравнивания" для повышения устойчивости к манипуляциям; возможны ограничения в доступе к цепочке рассуждений по соображениям безопасности |
| Популярность и применение | Используется в приложениях, требующих глубокого анализа и точных ответов, особенно в научных исследованиях и программировании |
| Лицензия и доступ | Проприетарная; доступ через API OpenAI и партнеров |
