OpenAI объявила во вторник, 22-го числа, о расширении своей новой линейки моделей искусственного интеллекта (ИИ) выпуском GPT-6 Sol и GPT-6 Luna. Эти модели следуют за GPT-6 Astra, который компания представила в начале сентября, и были созданы для предоставления части достижений более мощной версии, но с более низкими затратами.
По данным OpenAI, как Sol, так и Luna были обучены с использованием методологий, аналогичных тем, что применялись в Astra, интегрируя достижения в различных областях, таких как профессиональная деятельность, разработка программного обеспечения, взаимодействие с компьютерами, фактическая точность и согласованность.
Основное различие заключается в соотношении возможностей и цены. Компания сообщила, что оптимизация кэширования и вывода позволила снизить стоимость доступа через API на 50% по сравнению с акционными ценами эквивалентных моделей GPT-5.6.
Производительность в профессиональных задачах и программировании
GPT-6 Sol получил особое внимание для профессиональных приложений и программирования. OpenAI утверждает, что эта модель демонстрирует заметные улучшения по сравнению с GPT-5.6 Sol в тестах, сфокусированных на агентах, способных работать в реальных репозиториях кода.
В бенчмарке FrontierCode 1.1 Main, который оценивает не только функциональность кода, но и такие критерии, как качество тестов, организация и соответствие стандартам проекта, компания сообщила о значительном прогрессе Sol по сравнению с его предшественником.
В другом тесте, DeepSWE v1.1, посвященном сложным задачам разработки программного обеспечения в практических проектах, GPT-6 Sol достиг 68,8% при максимальных усилиях. OpenAI подчеркнула, что этот результат был всего на 1,1 процентный пункт ниже максимального балла Claude Fable 5, который составил 69,9%, но при этом с затратами на задачу примерно на 80% ниже.
GPT-6 Luna также показал производительность в 66,6% в этом же тесте, как сообщила компания. Такие функции были внедрены и в Codex, платформу OpenAI, ориентированную на задачи кодирования, что позволяет разработчикам выполнять больше задач по кодированию и использовать ИИ-агентов благодаря снижению затрат.
OpenAI также продемонстрировала результаты GPT-6 Sol в профессиональных задачах, связанных с использованием нескольких инструментов и приложений. В AutomationBench, который оценивает агентов в рабочих процессах, охватывающих продажи, маркетинг, операции, поддержку, финансы и человеческие ресурсы, Sol достиг 33,2% при максимальных усилиях. Этот показатель превзошел Claude Opus 5, который показал 26,9% в тесте, по данным компании, а предполагаемая стоимость одной задачи для Sol также была значительно ниже.
Кроме того, в тесте под названием Agents’ Last Exam GPT-6 Sol достиг 56,4% при максимальных усилиях. OpenAI заявила, что этот результат превысил самый высокий балл, зарегистрированный Claude Opus 5 в этой оценке, который составил 60%, но при этом с затратами на операцию на 60% меньше.
Взаимодействие с компьютерами
Работа с компьютерами — еще одна область, в которой OpenAI отметила достижения. В офлайн-тесте OSWorld 2.0 GPT-6 Sol, используя дополнительные усилия, набрал 60,5%, в отличие от 60,3% Claude Opus 5 при среднем усилии. OpenAI заявила, что это достижение было получено при стоимости задачи примерно на 80% ниже.
Со своей стороны, GPT-6 Luna продемонстрировал превосходство над GPT-5.6 Sol при среднем усилии в том же типе оценки, при этом стоимость составляла примерно десятую часть от стоимости за задачу.
Несмотря на представленные улучшения, OpenAI сохранила GPT-6 Astra в качестве своей эталонной модели для задач, связанных с работой с компьютерами.
Помимо технических улучшений, Sol и Luna включают изменения в стиле общения, установленном в GPT-6 Astra. OpenAI прогнозирует, что новые модели будут предоставлять более четкие ответы, уменьшая жаргон, необычные конструкции и детали, считающиеся малозначимыми. Ожидается также несколько более краткие ответы без ущерба для содержания.
Это изменение должно быть особенно заметным в технических диалогах и тех, которые связаны с программированием. Выпуск Sol и Luna ускоряет расширение семейства GPT-6. Первая модель этого поколения, GPT-6 Astra, была выпущена в начале сентября и сосредоточена на таких функциях, как программирование, научные исследования, работа с компьютерами, кибербезопасность и профессиональная работа.
С этими моделями OpenAI теперь предлагает варианты с различными комбинациями возможностей и стоимости. В то время как Astra остается флагманской, Sol и Luna направлены на демократизацию части ресурсов нового поколения для задач, требующих большого объема обработки.
Внедрение этих двух моделей также укрепляет стратегию компании по снижению операционных затрат агентов и приложений ИИ, особенно в сценариях, где системы должны выполнять множество последовательных операций. Sol и Luna уже доступны через OpenAI в их продуктах и API, расширяя доступ к новому поколению моделей.
