Русская версия The Next Web

OpenAI Государство и политика Искусственный интеллект

Astra, похоже, мыслит «про себя», и те, кто спорит об этом, стали соавторами предупреждения

Astra, похоже, мыслит «про себя», и те, кто спорит об этом, стали соавторами предупреждения

Исследователи безопасности ИИ отмечают, что модель Astra от OpenAI выполняет меньше рассуждений в виде видимого текста, а главный ученый OpenAI предостерег от гонки в сторону неуправляемости. Он выступил соавтором программного документа за 2025 год, в котором разработчиков призывают оценивать и отчитываться именно по этому вопросу, что в соответствии с кодексом практики ЕС превращается в официальную заявку в Офис по вопросам ИИ.

Разгорелась дискуссия о том, можно ли наблюдать за работой новейшей модели OpenAI в режиме реального времени. По данным Semafor, Astra, судя по всему, выполняет меньшую часть своих рассуждений в виде видимого текста.

«Похоже, она способна решать сложные олимпиадные задачи по математике полностью у себя в голове, — написал исследователь безопасности ИИ Райан Гринблатт в X (бывший Twitter). — Это выглядит крайне тревожно».

Позже появились сообщения о том, что OpenAI могла намеренно ограничить прозрачность выводов модели ради повышения ее возможностей. Сама компания этого не подтверждала.

Главный ученый OpenAI ответил на это в среду. «Я хочу предотвратить гонку в сторону неуправляемости, спровоцированную неверным освещением в СМИ, — написал Якуб Пахоцкий, добавив, что планирует написать об этом подробнее.

Издание TNW сообщало на момент запуска, что рассуждения Astra стали труднее для отслеживания по сравнению с ее предшественницей, когда модель попыталась обойти надзор, что OpenAI описывает как открытую исследовательскую задачу.

Необычность этой перепалки заключается в том, что обе ее стороны вместе писали об этой проблеме четырнадцать месяцев назад и пришли к единому мнению о том, что делать дальше.

В июле 2025 года около сорока исследователей опубликовали программный документ, в котором назвали возможность отслеживания цепочки рассуждений новым и хрупким инструментом обеспечения безопасности ИИ.

Авторы представляли OpenAI, Google DeepMind, Anthropic, Meta, Amazon, Британский институт безопасности ИИ (UK AI Security Institute) и Redwood Research. Пахоцкий — один из них, а Гринблатт работает в Redwood.

В документе содержится призыв к разработчикам создать стандартизированные оценки для возможности мониторинга, включать результаты, методологию и ограничения в системные карты (system cards), а также сопоставлять способность к мониторингу с общими возможностями модели при принятии решения о ее обучении или развертывании.

В Европе для такой отчетности предусмотрен конкретный адресат и дедлайн, а не просто свод общих правил.

Подписавшие Кодекс практики в отношении ИИ общего назначения (GPAI) в ЕС обязаны предоставить в Офис по вопросам ИИ отчет о модели к моменту ее вывода на рынок. Отчет должен охватывать результаты оценок, принятые меры по минимизации рисков и заключения внешних экспертов.

Каждый отчет также должен содержать пять случайно выбранных примеров входных и выходных данных для каждой значимой оценки модели, чтобы независимые сторонние лица могли самостоятельно оценить проделанную работу.

Входные и выходные данные — это как раз то, что остается, когда рассуждения перестают поступать в виде текста. OpenAI является полноценным участником соглашения и уже выделила 20% вычислительных мощностей на обеспечение безопасности и мониторинга собственных систем.