
Может ли искусственный интеллект заменить часть работы специалиста по информационной безопасности? Эксперимент с использованием нескольких моделей ИИ показывает, что ответ может быть положительным - по крайней мере в некоторых случаях.
Всего за несколько часов модели смогли обнаружить уязвимости, подтвердить часть найденных проблем и предложить способы их устранения. Общая стоимость эксперимента составила всего четыре доллара.
Идея эксперимента возникла после прочтения профессиональной статьи, посвященной обнаружению уязвимости в системе WordPress. На ее основе был составлен запрос, адаптированный для проверки другой системы, который сначала отправили модели GPT-5.6 Sol. Однако она отказалась выполнять задачу, после чего исследователи обратились к модели GLM 5.2.
Чтобы не отправлять исходный код на серверы в Китае, GLM запускалась через израильскую компанию MoonMath, а модель DeepSeek одновременно работала локально на собственном оборудовании. Если GLM функционировала через облачный сервис, то DeepSeek работала локально, что потребовало значительно большего расхода электроэнергии и сопровождалось существенно более низкой скоростью работы.
Уже через несколько минут GLM обнаружила проблему, которая впоследствии оказалась не настоящей уязвимостью, хотя в среде разработки вела себя именно как таковая. Вскоре после этого модель нашла JWT-ключ среды разработки, а затем выявила уязвимость в нестандартной реализации FFMpeg, позволявшую читать файлы в условиях среды, где проводилась проверка.
После подтверждения существования уязвимости модели также поручили предложить способ ее устранения. Предложенное исправление было внедрено и успешно протестировано. Затем была обнаружена еще одна проблема - возможность IP-спуфинга, возникшая из-за того, что модель не знала особенностей сетевой архитектуры, на которой основана CDN. После предоставления дополнительной информации об инфраструктуре она предложила подходящее решение и для этой уязвимости.
Во время сканирования GLM продолжала исследовать различные участки кода, запускала реальный код и пыталась практически эксплуатировать предполагаемые уязвимости, прежде чем признать их подтвержденными. Некоторые подозрения были опровергнуты в ходе проверки, а по другим модель предложила рекомендации по усилению безопасности, хотя они и не относились к критическим уязвимостям.
Примерно через три часа проверка с использованием GLM была завершена, после чего тот же запрос был отправлен модели DeepSeek. Ее результаты частично совпали с предыдущими, однако содержали и ряд иных идей. В отличие от GLM, которая стремилась на практике доказать возможность эксплуатации найденных уязвимостей, DeepSeek в основном ограничилась подготовкой подробного отчета об обнаруженных слабых местах и их теоретических последствиях.
Позже DeepSeek попросили попытаться использовать найденные уязвимости на практике, однако модель выбрала другой подход - создала поврежденный файл изображения для проверки интерфейса API. Затем результаты были переданы модели Qwen, работавшей локально с более высокой скоростью. Она продолжила исследовать дополнительные сценарии атак, включая попытку обнаружить уязвимость к SQL-инъекциям, однако в итоге зациклилась, и тестирование было остановлено.
По итогам эксперимента его автор пришел к выводу, что за четыре доллара и несколько часов работы оборудования удалось провести комплексную проверку безопасности, которая при традиционном тестировании на проникновение могла бы стоить тысячи долларов. Помимо обнаружения уязвимостей, модели, выявившие проблемы, также предложили способы их устранения, которые были внедрены и успешно проверены в ходе работы.
