Русская версия The Next Web

Безопасность Искусственный интеллект Китай

Модели ИИ с открытым весом догнали рубежные системы по возможностям. Но не по безопасности

Модели ИИ с открытым весом догнали рубежные системы по возможностям. Но не по безопасности

Модели искусственного интеллекта с открытым весом практически догнали передовые разработки по своим возможностям. Однако в вопросах безопасности этого не произошло. И как только веса становятся общедоступными, ни одна лаборатория больше не может обеспечить соблюдение защитных механизмов. Новая оценка ведущей открытой модели Китая делает этот разрыв очевидным.

Как сообщает TechCrunch со ссылкой на некоммерческую организацию SaferAI, занимающуюся вопросами безопасности, GLM-5.2 — модель с открытым весом от китайской компании Z.ai — отстает от GPT-5.5 от OpenAI и Claude Opus 4.7 от Anthropic всего на несколько месяцев в задачах, связанных с кибербезопасностью и биологией. При этом она не отказалась ни от одной задачи из области наступательной кибернетики или биологии двойного назначения, которые перед ней ставились. Для сравнения, Claude Opus 4.7 отказывался от таких запросов настолько последовательно, что SaferAI вообще не смогла завершить по нему кибербенчмарк.

«Граница возможностей — это не граница риска», — заявил Генри Пападатос из SaferAI, подчеркнув, что средства защиты имеют такое же значение, как и сама модель. Z.ai может защищать собственный облачный сервис. Но эти меры защиты исчезают в тот момент, когда кто-то запускает веса на собственном «железе», где любые ограничения можно удалить. Именно об этом риске критикующие открытые модели эксперты предупреждали годами.

Закрытые модели тоже не идеальны. Некоммерческая организация Far.ai обнаружила сотни универсальных способов обхода защиты (джейлбрейков) в Grok 4.5 от xAI и Gemini 3.1 Pro от Google. Разница лишь в том, что закрытая лаборатория может пропатчить взломанную модель. Открытые веса невозможно отозвать назад после того, как они были опубликованы.

Возврат средств защиты

Поэтому индустрия пытается внедрить защитные механизмы извне. На той же неделе Mistral выпустила Shieldstral — небольшой классификатор с открытым весом, который проверяет текст и изображения на соответствие правилам на естественном языке и, как утверждается, не уступает моделям, превосходящим его по размеру в семь раз. Cisco представила Antares — модели с открытым весом, которые ищут уязвимости, скрытые в коде. Инструменты с открытым весом созданы для борьбы с рисками открытого веса.

Открытость палка о двух концах, утверждают ее сторонники. Hugging Face использовала GLM-5.2, чтобы помочь себе защититься во время инцидента с утечкой данных от OpenAI. Глава компании Клем Деланг говорит, что системы, пресекающие одну атаку, способны отразить еще миллионы. Пападатос считает это преувеличением. Индустрии «не следует открывать исходный код опасных возможностей», говорит он, а злоумышленники действуют быстрее защитников: группировка вымогателей меняет тактику за неделю, а больница — нет.

Блеро-пятно регулирования

Существующие правила не соответствуют масштабу проблемы. Новая добровольная программа Белого дома проверяет определенные закрытые передовые модели на предмет киберрисков. Однако она, как сообщается, пока не распространяется на модели с открытым исходным кодом. Компания Anthropic, ранее сосредоточенная на защите интеллектуальной собственности, теперь главной своей заботой в отношении открытых весов называет именно безопасность. Компания Z.ai не опубликовала никаких регламентов безопасности для GLM-5.2 и оставила без ответа вопросы TechCrunch.

Китай не игнорирует этот риск, но направляет усилия в другое ручей. Си Цзиньпин поддержал концепцию открытых весов, подчеркнув при этом необходимость «контроля со стороны человека» за ИИ. Как отмечает Грэм Вебстер из Стэнфорда, китайские правила направлены скорее на регулирование политического контента и социальной стабильности, чем на предотвращение катастрофических кибер- или биоугроз.

Гонка возможностей практически завершена: открытые решения идут следом за закрытыми и обходятся гораздо дешевле. Гонка безопасности еще не выиграна, и искусственный интеллект уже учится как атаковать, так и защищаться. Самая сложная задача — сделать так, чтобы скачивать было легко только средства защиты.