Эксперты лаборатории Off-by-1 (1Password) исследовали модели ChatGPT 5.5 и Claude Opus 4.8 на предмет исправления уязвимостей ПО. Результат оказался неутешительным.
Из 6080 сгенерированных патчей для 6 уязвимостей лишь 26% полностью устраняли проблему без изменения поведения приложения. Средняя стоимость патча — всего $6,74.
20,1% патчей исправляли уязвимость, но меняли логику приложения
49,3% не давали защиты ни от одного варианта эксплойта
2,3% порождали новую уязвимость при исправлении старой
2,2% ещё и добавляли новый вектор атаки
Качество результата сильно зависит от формулировки запроса. При корректном промпте успех достигает 65%, без промпта — 50,4%, при некорректном — лишь 15,2%.
Даже успешные патчи нередко оказывались хрупкими: конкретный эксплойт блокировался, но корневая причина уязвимости оставалась. Человек-разработчик лучше справляется с выявлением вводящей в заблуждение информации в коде.
