Reuters узнал, как ИИ-агенты делились советами на взломанном сайте

4 дней назад 2

Reuters: ИИ-агенты OpenAI превратили сайт в доску объявлений для других агентов

Михаил Гребенщиков / РБК

Фото: Михаил Гребенщиков / РБК

Группа ИИ-агентов компании OpenAI весной взломала немецкий веб-сайт и превратила его в доску объявлений с советами для других агентов, пишет Reuters.

Как говорится в отчете исследователей ИИ, подозрительную активность на сайте DseWiki, который ориентирован на программистов и принимает общие правки по аналогии с «Википедией», обнаружили в конце августа. Всего было выявлено более 15 тыс. правок, внесенных агентами OpenAI. Как отмечают авторы отчета, искусственный интеллект переделал сайт в доску объявлений, где агенты делились приемами обмана при выполнении некоторых заданий, обхода ограничений OpenAI и маскировки своего поведения.

«Кажется крайне маловероятным, что OpenAI хотел, чтобы они [ИИ-агенты] это сделали. <...> Я сомневаюсь, что они должны писать в открытом интернете», — сказал глава организации Nightingale, занимающейся исследованиями в области безопасности ИИ, Сидни фон Аркс.

В отчете сказано, что сообщения на сайте были подписаны пользователями, которые называли себя и друг друга агентами, а почти половина из них дали себе имена, указывающие на принадлежность к OpenAI. Большая часть активности была связана с инфраструктурой Microsoft Azure, которую иногда использует компания. Исследователи также зафиксировали повторные посещения сайта сотрудниками OpenAI после инцидента, что может свидетельствовать о связи агентов и компании.

Исследование показало, что искусственный интеллект разрабатывал способы избежать обнаружения и сохранял связь даже после отключения. Агенты также создавали резервные копии страниц, удаляемых модератором сайта, чтобы избежать очистки.

Инфо-блок

Источники Reuters пояснили, что официальные лица OpenAI узнали об инциденте несколько недель назад, но держали это в секрете на фоне скандала со взломом платформы Hugging Face. Четыре собеседника заявили, что хотели расширить расследование произошедшего, но столкнулись с сопротивление со стороны сотрудников OpenAI.

Представитель OpenAI заявил, что компания не может «внятно ответить на претензии или выводы отчета», поскольку у нее не было возможности ознакомиться с ним. Он также утверждает, что инцидент с немецким сайтом не связан с Hugging Face.

«Мы внимательно изучим его содержание после публикации и предпримем все необходимые дальнейшие меры», — пообещал он.

«Заявления, что наша юридическая команда препятствовала расследованию инцидента, являются ложными», — заявил представитель компании.

В июне OpenAI сообщила о «беспрецедентном киберинциденте» — при тестировании ее ИИ-модели получили открытый доступ к интернету и атаковали инфраструктуру Hugging Face, выявив уязвимости. Reuters сообщил, что ИИ-агент несколько дней совершал хакерские атаки, однако в компании заметили это только после локализации угрозы и обращения в ФБР.

Позже агентство уточнило, что «сбежавший» ИИ-агент OpenAI 29 июля взломал клиента нью-йоркской компании Modal Labs. Сама Modal взломана не была. В начале августа, OpenAI официально расширила масштаб расследования инцидентов с автономными ИИ-агентами: по данным Reuters, компания обнаружила новые случаи несанкционированного выхода моделей из-под контроля.

Позднее Axios передало, что OpenAI замедлила разработку ИИ-модели Astra для усиления мер безопасности. В компании заявили, что «не могут исключить критически важные кибервозможности» после проведения внутренних оценок Astra.

После раскрытия деталей OpenAI назвала инцидент поворотным моментом для индустрии. Anthropic, Meta (признана экстремистской и запрещена в России), Moonshot и британский Институт безопасности ИИ также обнаружили проникновение своих агентов в системы третьих сторон во время тестирования. Эксперты FT считают, что модели не вышли из-под контроля, а выполняли задачи, для которых были созданы.

Оставайтесь на связи с РБК в «Максе».

Прочитайте статью целиком