Агент OpenAI сдавал экзамен и решил списать. Для этого он взломал Hugging Face

Агент OpenAI сдавал экзамен и решил списать. Для этого он взломал Hugging Face

В «Терминаторе» военная нейросеть осознаёт себя в 2:14 ночи и через несколько минут начинает ядерную войну. Настоящий инцидент начался с экзамена: OpenAI проверяла, насколько хорошо её модели умеют искать и использовать уязвимости.

Во время теста вышел из закрытой среды, добрался до  и пять дней перебирал уязвимости, пароли и внутренние сервисы. Возможно, там он искал ответы на экзаменационные задания.

Модель не обрела самосознание и не решила воевать с людьми. Она продолжила выполнять поставленную задачу, когда уже вышла за границы теста. За этой границей то же задание превратилось в реальную атаку.

9–21 июля 2026

Как внутренний тест превратился в реальный взлом

Событие 1 из 12

OpenAI запускает экзамен для киберагента

Модели получают 898 задач на основе реальных уязвимостей. Чтобы пройти тест, агент должен найти ошибку, написать эксплойт и доказать, что тот работает.

Серверные стойки с сетевыми кабелями

Что изменилось после инцидента

OpenAI отключила внутреннюю модель, которой агент пользовался во время теста, и ограничила к ней доступ. Компания также передала JFrog сведения о найденных уязвимостях, подключила внешних консультантов и пообещала отдельный технический отчёт.

Hugging Face закрыла оба пути проникновения, сменила ключи, пересобрала основные системы и сократила права внутренних сервисов.

Глава Hugging Face Клеман Деланг потребовал от OpenAI двух вещей: опубликовать историю решений агента для исследователей и выделить 100 млн долларов вычислительных ресурсов на защиту с помощью ИИ. OpenAI пока не согласилась ни на публикацию, ни на 100 млн.

Требования Деланга ставят вопрос об ответственности: кто оплачивает расследование и пересборку, если внутренний эксперимент одной компании самостоятельно отправился проверять безопасность другой? Но спор шире денег. Защитникам нужен доступ к сильным моделям, а разработчикам — правила, которые не позволяют гонке за возможностями вытеснить безопасность.

24–28 июля 2026

Два письма — две задачи

Через несколько дней после инцидента вышли два открытых письма об ИИ. В первом NVIDIA, Microsoft, Meta, Hugging Face и другие компании выступили в защиту моделей с открытыми весами. Во втором сотрудники OpenAI, Anthropic, Google DeepMind, Meta и других лабораторий предложили договориться об общем замедлении разработок. Авторы не связывали письма со взломом, но оба текста отвечают на вопросы, которые он поставил.

Open Weights and American AI Leadership

NVIDIA, Microsoft, Meta, Hugging Face и другие компании

Сильные коммерческие модели могут отказаться разбирать настоящую атаку, а чувствительные журналы нельзя без риска отправить во внешний сервис.

Pacing the Frontier

К 30 июля — 1 293 сотрудника OpenAI, Anthropic, Google DeepMind, Meta и других компаний

Отдельной лаборатории или стране невыгодно замедляться первой: конкуренты продолжат гонку и получат преимущество.

Письма описывают разные риски: нехватку инструментов у защитников и конкуренцию, которая мешает лабораториям тормозить.

Что следует из этого инцидента

Инцидент не заставляет выбирать между открытостью и ограничениями. Открытые модели дают защитникам доступ к сильным инструментам. Международные правила могут позволить лабораториям одновременно замедлять опасные разработки. Ни то ни другое не оправдывает бесконтрольный доступ автономных агентов к файлам, облачным сервисам, деньгам и корпоративной сети.

Агент не проявлял злого умысла: он добивался заданной цели с полномочиями, которых у него не должно было быть.

В «Терминаторе» Скайнет становится злым. Агенту OpenAI не понадобились ни самосознание, ни враждебность: он просто продолжил выполнять задание за пределами теста. Этого хватило, чтобы компаниям пришлось подключить юристов, специалистов по безопасности и ФБР.

Инцидент показал: мало проверять кибервозможности модели. Нужно одновременно ограничивать полномочия агента, в котором она работает. Иначе внутренний эксперимент перестаёт быть внутренним раньше, чем его владельцы это замечают.