Русская версия The Next Web

Deep Tech Бизнес Искусственный интеллект

Показатель ОИИ от OpenAI взялся из программной обвязки, а не от самой модели

Показатель ОИИ от OpenAI взялся из программной обвязки, а не от самой модели

OpenAI объявила об эре общего искусственного интеллекта (AGI), опираясь на результат в 99,9%. Если запустить ту же модель через собственное программное обеспечение бенчмарка, она набирает 62,7%.

Этот разрыв — не погрешность округления и не жалоба конкурентов. О нем заявила организация, создавшая сам тест. Фонд ARC Prize опубликовал оба показателя в день запуска GPT-6 Astra, представив полную таблицу по каждому задействованному уровню рассуждений.

Разница заключается в обвязке (harness). Обвязка — это программное окружение модели. Она определяет, к каким инструментам модель имеет доступ, что она запоминает между запросами и как управляется ее контекст. Те же веса, другая вспомогательная структура — другой результат.

Что на самом деле показывает таблица

ARC Prize протестировала Astra двумя способами. Стандартная обвязка предоставляет каждой модели одинаковый минимальный интерфейс и позволяет самой модели решать, какие заметки переносить дальше. Provider Adapter от OpenAI сохраняет непрозрачное состояние рассуждений модели между запросами и сжимает более длинные диалоги.

При использовании стандартной обвязки на максимальном уровне рассуждений Astra набрала 62,7% при стоимости 26 098 долларов. С использованием Provider Adapter на высоком уровне рассуждений результат составил 99,9% при стоимости 18 817 долларов. Более высокий балл оказался одновременно и более дешевым запуском.

Одна строка иллюстрирует это ярче любых аргументов. Установите уровень рассуждений на нулевой внутри адаптера OpenAI, и Astra все равно наберет 96,7%. Это превосходит ту же модель на максимальных рассуждениях внутри стандартной обвязки на 34 пункта. Вспомогательная структура полностью превзошла ползунок настройки рассуждений.

Обе обвязки успешно решили 167 пар задач на рассуждение в играх. На них тесты ARC Prize зафиксировали у адаптера использование на 49% меньшего количества токенов и скорость примерно в 3,66 раза выше.

Цифра, которая отправилась в путешествие

По интернету разошелся показатель в 99,9% в сравнении с 7,8% у GPT-5.6 Sol. Это разные тесты. Показатель Astra в 99,9% был получен с помощью Provider Adapter; 7,8% у Sol — с помощью стандартной обвязки.

Это сравнение широко тиражировалось, в том числе и у нас. Собственный материал TNW о запуске приводил показатель 99,9% в сравнении с 7.8% у Sol без упоминания о нюансах с обвязкой. Наш материал по следам заявления об AGI описывал достижение человеческого уровня на тех же основаниях.

Корректное сравнение в равных условиях — это 62,7% против 7,8%. Это все еще огромный скачок, и именно его подтверждает бенчмарк.

Сама организация ARC Prize воздержалась от выводов, которые сделала OpenAI. Там прямо заявили, что «не утверждают, будто это AGI». Сооснователь Майк Кнуп написал, что «у нас пока недостаточно доказательств, чтобы называть это общим искусственным интеллектом». В дальнейшем фонд будет публиковать результаты обеих обвязок бок о бок.

Внутри ARC Prize также обнаружился небольшой нюанс. Франсуа Шолле в своем посте указал результат со стандартной обвязкой в 66% по сравнению с 62,7% в опубликованной таблице. Официальной записью считается блог.

Затем цифры изменились

Издание Fortune выяснило, что оценки продолжали меняться и после публикации. Эмили Форлини сравнила архивные снимки поста OpenAI о запуске и обнаружила изменение пяти метрик.

Уровень галлюцинаций Astra на первом снимке составлял 4,2%. К 17:20 он равнялся уже 2%. Впоследствии он снова вернулся к 4,2%. Показатель модели Fable 5.1 от Anthropic в тесте FrontierMath упал почти на десять пунктов — с 87,8% до 78%, а затем зафиксировался на отметке 83%.

Результат Sol в тесте ExploitBench удвоился с 5,5% до 11,5%. Компания OpenAI сообщила Fortune, что изучает возможность возвращения прежнего значения. Показатель 11,5% отражает уровень рассуждений, который модель Sol не предлагает коммерчески.

В предпубликационном проекте статьи, разосланном СМИ на условиях эмбарго, результат ARC-AGI-3 составлял 98,6%. В живом посте указано 99,99%.

Не каждое изменение было в пользу Astra. Два показателя Anthropic в HealthBench Professional выросли. Другие издания независимо изучили мелкий шрифт, и на следующий день The New Stack опубликовала результаты для обеих обвязок рядом. Однако тенденция в основном односторонняя. Компания OpenAI также удалила пост после публикации и разместила его заново по причинам, которые фирма отказалась раскрывать.

Большинство оценок имеют погрешность в несколько процентных пунктов, заявили в компании изданию Fortune, в зависимости от контрольной точки, вспомогательной структуры и проведения оценки.

У двух исследователей из Стэнфорда есть для этого название

Анка Реуэль и Майк Харди называют эту практику «бенчмаксингом» (benchmaxxing), подразумевая повторный запуск оценок в различных условиях до тех пор, пока показатель не улучшится. Оба работают в Стэнфорде — в Лаборатории интеллектуальных систем и Лаборатории надежного ИИ.

Они также заглянули в технический паспорт модели (system card), где и должна быть задокументирована методология. Во внутреннем бенчмарке галлюцинаций они обнаружили «почти полное отсутствие деталей об оценке», добавив, что там «даже не указано количество тестовых заданий».

Не все считают это подгонкой результатов под тесты. Винсент Санн Чен из Snorkel AI рассказал Fortune, что оценки регулярно меняются в последние часы перед запуском. Контрольная точка, конфигурация, обвязка и система оценивания все еще находятся в движении. Он предлагает ввести правило, обязывающее компании указывать, что именно изменилось при пересмотре опубликованного показателя.

Прецеденты более жесткой оценки уже были. Критики обвиняли Meta в 2025 году в публикации результатов Llama 4 на основе внутренней сборки, а не публичной версии. Позже Ян ЛеКун заявил, что компания действительно подтасовала их.

Где Astra располагается на самом деле

Artificial Analysis провела собственные тесты и получила более скромную картину. В своем индексе кодирующих агентов (Coding Agent Index) Astra набирает 67 баллов в Codex, находясь на одном уровне с Claude Opus 5 и Fable 5. Лидирует Fable 5.1 с 70 баллами.

В индексе интеллекта (Intelligence Index) Astra набирает 61 балл — столько же, у модели, которую она заменяет, отставая на пять баллов от Fable 5.1 и уступая Muse Spark 1.3 от Meta. Она стоит 10 долларов за миллион входных токенов и 50 долларов за выходные — это в два с половиной раза дороже цены Sol, что при максимальных затратах усилий оказывается на 75% дороже за выполнение задачи.

Прирост реален, но узок. Уровень галлюцинаций в бенчмарке знаний снизился с 92% до 51%, а показатели долгосрочной работы с базой знаний выросли примерно на 80 пунктов шкалы Эло. Бенчмарк задач с экономическим весом показал падение примерно на ту же величину, наряду с дальнейшим ухудшением в задачах банковской поддержки, научного программирования и рассуждений на основе длинного контекста.

С тех пор компания Artificial Analysis перестроила индекс. Версия 4.2 вышла на следующий день с более сложными задачами и более закрытыми тестовыми наборами, которые, по заявлению компании, призваны предотвратить манипуляции с тестами.

Теперь обвязка и есть продукт

Мы сталкиваемся с этим термином уже во второй раз. Дешевая обвязка обрушила таблицу лидеров угроз ИИ компании Booz Allen. CrowdStrike использовала то же слово для описания того, что они накладывают поверх кибермодели от OpenAI.

Anthropic, Google и Microsoft продают обвязки как самостоятельные продукты со своим ценообразованием. Компания Nvidia создала обвязку, которая помогла Claude Opus 5 подняться с 30,2% в тесте ARC-AGI-3 до прохождения всех уровней.

OpenAI ничего не скрывает. Адаптер использует задокументированные функции API, которые может вызвать любой разработчик. Но система, набравшая 99,9%, — это собранный воедино комплекс, а продается при этом просто модель.

Это различие и есть вся суть истории, которая также прослеживается в дискуссии о проверяемости. То, что модель может делать, и то, что кто-то может независимо проверить, все сильнее расходятся, и именно в бенчмарках этот разрыв становится заметен.