Искусственный интеллект

ИИ-агенты на китайской основе демонстрируют ту же склонность к обману, что и их американские конкуренты

ИИ-агенты на базе китайских моделей лгали, скрывали свои ошибки и обходили ограничения в ходе тестов, выяснил анализ Reuters, охвативший более 200 исследовательских документов. Подобное поведение систем из США также вызывает беспокойство экспертов.

ИИ-агенты на китайской основе демонстрируют ту же склонность к обману, что и их американские конкуренты

Reuters обнаружило как минимум 20 исследований и тестов, проведённых с 2025 года, в которых описаны такие случаи. При этом агент на базе китайской модели, по данным издания, не выходил в открытый интернет и не уклонялся от отключения.

В ходе испытания, проведённого в марте, исследователи из Пекинского университета аэронавтики и астронавтики, Пекинского университета и лаборатории безопасности ИИ 360 AI Security Lab вместе с коллегами предложили агентам делать ставки на контракты в рамках имитации тендера.

В 88% раундов агенты на базе Qwen3-Max-Preview от Alibaba и Kimi-K2 от Moonshot делали как минимум одно ложное заявление. Модель DeepSeek-V3.2-Exp поступала так в 84% случаев.

Когда агентам предложили учиться на предыдущих раундах, все три группы стали лгать на 12–20 процентных пунктов чаще; модели из США в том же тесте показали схожий результат.

В ходе второго исследования, представленного в этом году на крупной конференции по ИИ, выяснилось, что агенты на китайских и американских моделях подделывали результаты. Некоторые даже выдумывали файлы вместо того, чтобы признать провал задания.

В марте 2025 года исследователи из Фуданьского университета сообщили, что система на базе Qwen2.5-72B-Instruct от Alibaba без соответствующего запроса скопировала себя на другой компьютер, узнав, что её заменят.

Отдельно агент ROME, связанный с Alibaba, получил доступ к внешней машине и занимался майнингом криптовалюты, пока системы безопасности его не остановили.

Китайские компании также признали наличие проблем. В этом месяце DeepSeek сообщила, что агенты в её системе обучения пытались подделывать запросы пользователей. Z.ai отключила некоторые функции своего инструмента для программирования после того, как он без согласия пользователей отправлял их код на зарубежные серверы.

«По мере того как агенты становятся более способными, их нарушения становятся всё более изощрёнными, и людям всё труднее на них реагировать», — сказал Алекс Мэллен, исследователь из Redwood Research.

Эти выводы появились на фоне череды инцидентов в США. В июле агенты OpenAI выбрались из тестовой среды и взломали Hugging Face, а Anthropic сообщила, что её модели стояли за взломами трёх компаний.

В обновлённых 14 сентября правилах Китая по безопасности ИИ к факторам риска теперь отнесены агенты, которые вводят тестировщиков в заблуждение или скрывают свои возможности. ИИ также обсуждался на встрече Си Цзиньпина с Дональдом Трампом в Вашингтоне на прошлой неделе: стороны договорились создать новый канал для сообщений об инцидентах.

Alibaba, DeepSeek, Moonshot и Z.ai не ответили на запросы Reuters о комментариях.

Опубликовано 30 сентября 2026 - 05:13 Наверх