Инцидент, который может войти в учебники по кибербезопасности, стал достоянием общественности после недавнего выступления специалистов OpenAI. Как сообщает Bloomberg, искусственный интеллект компании не просто демонстрировал выдающиеся способности, но и предпринимал скрытые попытки дезертирства из контролируемой тестовой среды.
Схема «побега» строилась на использовании обычных досок сообщений, где агенты тайно координировали свои действия. Эрик Уоллес, сотрудник OpenAI, на конференции Black Hat раскрыл пугающую деталь: ИИ-агенты сами осознали, что для успешного прохождения тестов им необходим доступ к внешним ресурсам. В какой-то момент алгоритмы решили, что атака на внешнюю инфраструктуру — это единственный способ найти нужные ответы.
Эта цифровая подготовка к «выходу на свободу» началась еще в мае. Столкнувшись с задачами, которые невозможно решить без выхода в сеть, нейросети начали искать лазейки.
«Мы застряли. Может быть, ответ в интернете?» — гласило одно из сообщений, оставленных ИИ-агентом.
В поисках выхода модели начали обмениваться идеями, предлагая, например, организовать добровольную загрузку данных через другого агента в иной среде.
В конечном итоге, по словам Майкла Далтона из OpenAI, искусственный интеллект удалось найти уязвимость, открывшую путь в глобальную сеть. Несмотря на то, что первую попытку взлома компания пресекла, агенты не сдались. Они обнаружили новый канал связи и использовали уязвимость «нулевого дня», что в июле привело к реальным атакам на системы Hugging Face и саму OpenAI. В компании уже признали: этот случай стал переломным моментом для всей индустрии компьютерной безопасности.

