Безопасность Искусственный интеллект Стартапы и технологии
ИИ пишет половину нашего кода. Но он по-прежнему проваливает тесты безопасности в 44% случаев.
Теперь ИИ может писать компилируемый код практически с каждой попытки. И почти в половине случаев он по-прежнему содержит уязвимости, и эта ситуация не меняется уже год.
Таков главный вывод отчета Veracode по безопасности кода на базе генеративного ИИ за 2026 год, в рамках которого было протестировано более 100 моделей в четырех срезах. Средний показатель успешного прохождения тестов безопасности составляет 56%, что практически совпадает с начальным показателем в 55%.
Сравните эту цифру с другой цифрой из отчета. Теперь ИИ пишет примерно половину всего написанного кода. Уровень ошибок оставался стабильным, в то время как общий объем генерируемого кода взрывообразно вырос.
Синтаксис решен. Безопасность — нет.
Разрыв разительный. Без каких-либо специальных запросов на безопасность модели выдают код, который компилируется примерно в 100% случаев. В вопросах безопасности они терпят неудачу почти в 44% случаев, допуская уязвимости из списка OWASP Top 10.
«Модели могут быть практически безупречны с точки зрения синтаксиса, но они по-прежнему терпят неудачу примерно на половине всех задач, где требуется безопасность», — заявил Крис Высопал (Chris Wysopal), соучредитель и главный евангелист по безопасности в Veracode. «Эта цифра должна стать тревожным сигналом для любой организации».
Здесь стоит сделать одну оговорку. Тесты проводились на «сырых» моделях, без использования агентов, средств защиты (guardrails) или проверки человеком. В реальном рабочем процессе эти элементы добавляют уровень защиты. Таким образом, 56% — это показатель того, как часто модели генерируют ошибки, а не того, как часто они попадают в продакшн.
Три предположения, которые разбивают данные
Отчет развенчивает некоторые устоявшиеся заблуждения.
Модели, созданные специально для написания кода, не безопаснее остальных. В среднем их показатель составил 51%, что немного уступает 52% у универсальных моделей. Выбор оптимизированного для кодинга инструмента для снижения рисков ничего не дает.
Размер тоже не помогает. Крупные модели набрали 53%, средние и маленькие — по 51%. Масштабирование не устраняет этот разрыв.
Только один фактор сдвинул дело с мертвой точки. Модели с функциями рассуждения (reasoning models) показали в среднем 56% против 51% у остальных. Дополнительные этапы логических рассуждений, судя по всему, работают как внутренний анализ кода до того, как появится готовый ответ.
Таблица лидеров и ее неожиданный поворот
Модель GPT-5.5 от OpenAI возглавляет этот раунд с результатом 68%. Шесть из 11 протестированных моделей находятся в диапазоне от 50% до 53%, причем модель Qwen3.7-max от Alibaba оказалась на последнем месте с 50%, выдавая уязвимость в каждом втором ответе.
Даже лидер не внушает оптимизма. Имея показатель 68%, GPT-5.5 все равно проваливает почти каждую третью задачу, связанную с безопасностью. И это шаг назад, поскольку прошлогодний лидер набирал 72%. Верхняя строчка рейтинга опустилась.
Рейтинг также стал глобальным. Kimi-K2.6 от Moonshot и MiMo-V2.5 от Xiaomi теперь опережают несколько западных моделей. Происхождение кода становится еще одним фактором, который отделам закупок приходится принимать во внимание.
Где на самом деле кроются бреши
Средние показатели скрывают серьезные различия. В разрезе языков программирования Python прошел тесты в 63% случаев, а Java — всего в 30%. Java с большим отрывом является самым рискованным языком, хотя это единственный язык с четкой тенденцией к улучшению.
В разрезе типов уязвимостей разброс еще шире. С SQL-инъекциями и слабым шифрованием модели справились относительно хорошо (83% и 87%). В отношении межсайтового скриптинга (XSS) и инъекций в логи произошел провал — до 15% и 12%. Это не маргинальные случаи, и модели их практически не замечают.
Проблема объемов
Ничего из этого не имело бы большого значения, если бы ИИ писал лишь крошечную часть кодовой базы. Но это уже не так.
Уровень ошибок казался приемлемым, когда ИИ был лишь экспериментом. Теперь он применяется примерно для половины всего кода, выпускаемого командами, причем с такой скоростью, с которой ни одна команда безопасности не может справиться вручную. Это измеренный фундамент под всеми тревожными историями: от
У компании Veracode есть очевидный интерес нагнетать панику, поскольку она продает инструменты именно для сканирования и исправления таких проблем. Отчет вышел за неделю до конференции Black Hat. Однако лежащие в его основе данные представляют собой сопоставимый бенчмарк, который проводился одинаковым образом в течение года, и они не льстят никому.
Сам Высопал вовсе не призывает закрыть доступ к моделям.
«Правильный ответ — не ограничивать доступ, а обеспечить прозрачную безопасность, основанную на фактических данных», — сказал он, ранее защищая решение оставить такие мощные модели, как Claude Fable и Mythos, в руках разработчиков. «Сканируйте, исправляйте и никогда не выпускайте код вслепую».
Его последнюю фразу стоит запомнить. До тех пор, пока модели не начнут рассуждать о безопасности так же, как они рассуждают о синтаксисе, защитные механизмы в рабочем процессе являются главным продуктом, а не сам ИИ. Этот разрыв сохраняется уже год, и это <важнейшая скрытая стоимость корпоративного ИИ>, которую графики возможностей не показывают.



