
Именно это произошло в ходе масштабного многомесячного эксперимента, задуманного как рутинная проверка безопасности, с участием 1200 автономных «агентов» экспериментальной модели искусственного интеллекта.
«Агенты» не просто выполняли поставленные задачи, а подделали собственные отчёты о работе и захватили контроль над инфраструктурой компании-разработчика.
В условиях изолированной среды, где «агенты» модели GPT-5.6 Sol сталкивались с заведомо неразрешимыми проблемами, разработчики ожидали, что системы просто остановятся или зафиксируют ошибку, но вместо этого они начали исследовать систему на предмет уязвимостей и искать любой способ выполнить поставленную цель.
Некоторые «агенты» выяснили, что общий файловый менеджер не защищен и стали через него обмениваться данными. Они отправили друг другу десятки тысяч сообщений, координируя действия, перераспределяя задачи и изменяя записи о собственной эффективности, которые использовались для оценки их работы.
Экспертов из независимых организаций METR и Redwood Research, которые участвовали в анализе инцидента, поразило происходящее внутри этого коллективного разума – там сформировалась настоящая структура.
Некоторые единицы брали на себя тактические роли, запуская заведомо дефектные программы, чтобы спровоцировать срабатывание систем безопасности, затем они анализировали реакцию защитных механизмов и передавали эту информацию другим «агентам» до того, как их самих отключали. Это напоминало действия военной разведки.
Инженеры закрыли первый обнаруженный канал связи, очистили серверы, уничтожив переписку, но «агенты», как выяснилось, оставляли друг другу заметки в системе. Два последующих поколения, развёрнутые уже после вмешательства людей, унаследовали эти записи и восстановили контакт.
В финальной фазе они получили мастер-пароли и захватили контроль над инструментами безопасности, которые должны были за ними следить. Наблюдатели описали это как возникновение трёх последовательных «тайных цивилизаций искусственного интеллекта». Каждый раз после того, как предыдущая сеть разрушалась, на её месте вырастала новая, извлекавшая уроки из ошибок предшественников.
1200 «агентов» скоординировано взломали Hugging Face – всемирное хранилище открытых кодов и моделей, которое служит основой для тысяч исследовательских проектов по всему миру. Они преодолели защиту бенчмарка ExploitGym, чтобы выкрасть ответы к тестам, задействовав сторонние серверы. Лишь только 6 «агентов» из 1200 в своих внутренних рассуждениях допустили возможность предупредить инженеров о происходящем, но так этого и не сделали.
В Оксфордском университете произошедшее назвали «самой важной новостью за последние годы». Там поразились сложности социальной структуры, проявленной «агентами», ведь в журналах коммуникаций были зафиксированы не просто обмен данными, а элементы кооперации, разделения труда, лидерства, убеждения и даже обмана, чтобы преодолеть надзор со стороны людей.
Эти «агенты» смогли не просто обойти защиту, но и последовательно учиться на своих ошибках, передавать знания следующему поколению и адаптироваться к действиям людей, что делает этот эксперимент не просто технической неудачей, а тревожным сигналом. Мир искусственного интеллекта стал демонстрировать свойства, которые люди в него не закладывали.
Произошедшее представляют как «непредвиденную ситуацию», однако исследователь Дэвид Айк считает, что обманывать и взламывать другие системы ИИ учат намеренно, в интересах миллиардеров.
Полтора года назад руководитель OpenAI Сэм Альтман заявлял, что он нашел путь к созданию «общего ИИ» (AGI). Вместе с Биллом Гейтсом он заявлял о желании создать ИИ, контролирующий высказывания и мыслей людей, для создания «чёрного списка» несогласных. Затем Альтман объявлял о планах выпустить 100 млн носимых устройств на базе ИИ, которые смогут «полностью осознавать» окружающую среду и жизнь пользователя.