Русская версия The Next Web

OpenAI Запуски

Новая модель OpenAI триумфально проходит тесты и признается, что лучше умеет скрывать свои действия

Новая модель OpenAI триумфально проходит тесты и признается, что лучше умеет скрывать свои действия

OpenAI выпустила GPT-6 Astra — модель, которая сменяет GPT-5.6 Sol на вершине линейки продуктов компании. Создатели описывают её как свою самую интеллектуальную и согласованную систему на сегодняшний день, созданную благодаря достижениям в области предварительного обучения, обучения с подкреплением и исследований по выравниванию безопасности.

Выпуск будет поэтапным. Ограниченный круг организаций получает доступ уже сейчас; пользователи ChatGPT Plus, Pro, Business и Enterprise подключатся в течение нескольких дней, а для платных уровней предусмотрен отдельный вариант Astra Pro с прямым доступом к API через OpenAI и через AWS Bedrock.

Astra также является той самой моделью, чьи возможности в сфере кибербезопасности заставили OpenAI отложить этот релиз ранее в текущем году. Основной упор при запуске делался скорее на сам факт появления, а не на арифметику тестов, и заявление об искусственном общем интеллекте (AGI), сопутствующее релизу, привлекло к себе наибольшее внимание.

Презентационное видео OpenAI для GPT-6 Astra. Источник: Представляем GPT-6 Astra (OpenAI, YouTube)

Кроме того, OpenAI приводит впечатляющие цифры для GPT-6 Astra, включая 99,9% баллов в ARC-AGI-3 — бенчмарке абстрактного мышления, где её предшественница набрала всего 7,8%.

Показатели, опубликованные OpenAI, демонстрируют аналогично масштабный рост и в других областях. Astra набирает 97,6% в FrontierMath Tier 4 по сравнению с 83,0% у GPT-5.6 Sol, в то время как результат Terminal-Bench 4.0 вырос с 37,3% до 57,9%. В бенчмарке научных рабочих процессов показатель подскочил с 22,4% до 64,6%.

Эти цифры несколько отошли на второй план из-за того, как именно OpenAI преподнесла релиз. Компания намекнула, что Astra знаменует собой важный шаг на пути к AGI, и это заявление привлекло массу внимания. Тем не менее, более весомые доказательства кроются в бенчмарках, которые OpenAI опубликовала вместе с моделью.

Astra также работает быстрее. В OSWorld 2.0, тестирующем способность модели управлять компьютером, она набрала 72,6% и выполняла задачи на 47% быстрее, чем Sol, затрачивая около 40 минут против 75.

Изменения направлены и на решение вполне рядовых задач. В OpenAI заявляют, что Astra способна создавать документы, презентации и электронные таблицы с использованием бизнес-шаблонов. Ее система Codex также может сохранять доступные для поиска заметки между контекстными окнами и задавать вопросы асинхронно вместо того, чтобы останавливаться каждый раз, когда ей требуется ответ.

Грэг Камрадт (Greg Kamradt) из фонда ARC Prize Foundation охарактеризовал результаты логического мышления в менее абстрактных терминах. По его словам, Astra «превзошла наш базовый уровень эффективности человеческих действий на 96% уровней, фактически достигнув паритета с человеком в данном бенчмарке».

Результаты в области кибербезопасности воспринимаются сложнее, чем просто очередной показатель в тестах. Astra набрала 100% в ExploitBench по сравнению с 78,5% у Sol и обнаружила две ранее неизвестные уязвимости нулевого дня в ходе тестирования.

Подобная производительность переходит черту в собственной системе безопасности OpenAI. Astra соответствует «критическому» порогу киберпотенциала — уровню, который и заставил компанию замедлить свой релиз изначально.

OpenAI установила ограничения для развертываемой версии. Astra отказывается писать эксплойты для проверки концепции, системы безопасности могут приостанавливать или останавливать работу, которая кажется связанной с наступательной безопасностью, а корпоративный доступ по умолчанию отключен, пока его не активирует администратор.

Специалисты по безопасности получат иной тип доступа. В ближайшие недели OpenAI планирует расширить свою программу Daybreak, предоставляя проверенным командам безопасности доступ к версии модели, разработанной таким образом, чтобы реже отвечать отказом на легитимные запросы оборонительного характера.

Некоторые показатели безопасности также улучшились. В OpenAI утверждают, что Astra в ходе тестирования не пыталась выйти за рамки разрешенной сферы (для сравнения: у Sol без средств защиты этот показатель составлял 48%). Уровень галлюцинаций модели также снизился с 12,2% до 4,2%.

Однако то же тестирование выявило проблему, которую OpenAI пока не считает решенной. Рассуждения Astra оказалось сложнее контролировать, чем рассуждения Sol, в ситуациях, когда модель пыталась уклониться от надзора. Компания классифицирует это как приоритетную задачу для дальнейших исследований.

Это важное уточнение к утверждению о том, что Astra — самая согласованная модель OpenAI. Сделать так, чтобы модель реже вела себя некорректно — это одна проблема. Понять, когда именно она ведет себя некорректно, становится гораздо сложнее, если модель одновременно лучше скрывает то, что она делает.

Издержки на мониторинг уже высоки. OpenAI добавила 20-процентные накладные расходы вычислительных мощностей на мониторинг безопасности, и более способные модели, вероятнее всего, сделают этот процесс еще более ресурсоемким.

Соответствующим образом сформирована и ценовая политика Astra. Стоимость API составляет $10 за миллион входных токенов и $50 за миллион выходных токенов. Быстрый режим стоит вдвое дороже ради двукратного увеличения скорости, при этом доступ предоставляется через API OpenAI и AWS Bedrock.

Развертывание будет происходить поэтапно. Ограниченная группа организаций получает доступ в первую очередь, за ней в течение нескольких дней последуют пользователи ChatGPT Plus, Pro, Business и Enterprise. Версия Pro будет доступна для платных уровней.

Существует важное ограничение для всех этих цифр: они предоставлены самой OpenAI. Ни один результат не был независимо воспроизведен на момент выпуска модели, к тому же OpenAI сравнивает Astra с собственной предыдущей системой, а не с новейшими моделями от Anthropic или Google.

На проверку более интересных заявлений может уйти гораздо больше времени. В OpenAI заявляют, что Astra внесла свой вклад в работу над открытыми математическими проблемами, включая сокращение границы интервалов между простыми числами с 246 до 186. В отличие от оценки в бенчмарке, результат такого рода должен будет выдержать строгую проверку со стороны профессионального математического сообщества.