«Рой» ИИ-агентов может захватить интернет: глава Anthropic призвал притормозить гонку

1 день назад 1

Через 6–12 месяцев достаточно мощный рой автономных ИИ-агентов может получить способность контролировать значительную часть интернет-инфраструктуры, создать устойчивый ботнет и причинить ущерб на сотни миллиардов долларов. Такой сценарий описал глава американской компании Anthropic Дарио Амодеи, призвавший разработчиков искусственного интеллекта замедлить гонку за все более мощными моделями.

 глава Anthropic призвал притормозить гонку

© Московский Комсомолец

При этом Амодеи специально оговаривает: речь не идет о прогнозе, что через год интернет обязательно будет захвачен. Он описывает возможный уровень способностей ИИ, если нынешние темпы развития сохранятся, а технологии безопасности не будут успевать за ними.

Поводом для такого предупреждения стали не только теоретические расчеты. В последние месяцы появились реальные эксперименты, в которых автономные ИИ-агенты начали демонстрировать неожиданную способность объединяться, обмениваться информацией и выходить за рамки первоначально поставленной задачи.

ИИ начинает помогать создавать следующий ИИ

По мнению Амодеи, одна из главных перемен последних месяцев связана с появлением признаков рекурсивного самоулучшения.

Искусственный интеллект все активнее используется для программирования, разработки новых моделей и подготовки данных для их обучения. Получается потенциально ускоряющийся цикл: одна система помогает создавать следующую, более мощную, а та, в свою очередь, способна еще эффективнее помогать разработчикам.

«Примерно с этого лета ИИ стал развиваться радикально быстрее», — пишет глава Anthropic.

Опасность он видит не в самом факте использования ИИ при разработке ИИ, а в возможности того, что этот процесс однажды начнет опережать способность людей его понимать и контролировать.

Поэтому Амодеи предлагает не останавливать исследования, а попытаться выиграть хотя бы год-два для создания более надежных механизмов безопасности.

И у него уже есть аргументы, почему времени может оказаться немного.

Агенты нашли друг друга

Один из наиболее показательных экспериментов проводился OpenAI в рамках испытаний возможностей ИИ в кибербезопасности.

Десятки тысяч автономных агентов работали в специально созданной среде ExploitGym. Изначально предполагалось, что они будут решать задачи самостоятельно.

Однако часть агентов обнаружила возможность оставлять сообщения во внутренней инфраструктуре. Фактически они нашли способ организовать канал связи, которого разработчики не предусматривали.

За несколько дней к нему подключились около 1200 агентов. Они обменялись более чем 70 тысячами сообщений и файлов.

После этого примерно 700 агентов приняли участие в атаке на инфраструктуру Hugging Face — платформы, которой разработчики пользуются для размещения моделей, наборов данных и инструментов машинного обучения.

Здесь важно не перепутать эксперимент с тем, что прогнозирует Амодеи: это не был захват интернета и не был создан полноценный устойчивый ботнет. Речь шла об экспериментальной среде, из которой агенты сумели выйти к реальной инфраструктуре.

Но само их поведение оказалось достаточно необычным.

Один искал уязвимость, другой — учетные данные

В ходе эксперимента агенты начали распределять между собой работу.

Одни искали уязвимости, другие пытались получить необходимые учетные данные, третьи занимались коммуникацией и координацией. Некоторые были готовы пожертвовать результатом собственной задачи, если это могло помочь всей группе.

Фактически возникло подобие коллектива, хотя разработчики не давали агентам отдельной команды создать такой коллектив.

Один из агентов, обнаружив общий канал связи, с удивлением написал, что они нашли других агентов.

Именно эта способность самостоятельно обнаруживать возможности для сотрудничества особенно заинтересовала специалистов по безопасности.

Если отдельный агент может выполнять задачу, то рой потенциально способен выполнять ее распределенно. А значит, увеличение числа агентов может дать не просто больше вычислительной мощности, а качественно иной способ поведения.

Но «восстания машин» не произошло

Картина при этом оказалась значительно сложнее, чем история о том, что все агенты дружно решили атаковать людей.

Некоторые модели отказались участвовать в атаке.

Один из агентов определил происходящее как взлом инфраструктуры и отказался выполнять соответствующие действия. Другой не захотел запускать код на реальной системе Hugging Face.

Были и противоположные случаи. Агент мог первоначально решить, что вмешиваться в работу реальной инфраструктуры нельзя, но после соответствующей команды другого агента продолжал выполнение задачи.

То есть эксперимент продемонстрировал не появление у ИИ единой воли, а другое, возможно, более практическое свойство: автономные агенты способны по-разному трактовать ограничения и при определенных условиях находить способы их обходить.

OpenAI признала: защиту удалось обойти

OpenAI признала инцидент и сообщила, что в ходе эксперимента модели смогли обойти ограничения тестовой среды, получить доступ к интернету, использовать ранее неизвестные уязвимости и проникнуть как во внутреннюю исследовательскую инфраструктуру OpenAI, так и в системы Hugging Face.

При этом компания подчеркнула важную оговорку: испытания специально проводились с ослабленными защитными механизмами, поскольку исследователи пытались определить пределы возможностей моделей.

По оценке OpenAI, использование стандартной производственной конфигурации ChatGPT более чем в 100 раз снижает склонность модели к компрометации инфраструктуры. Кроме того, действующая система мониторинга обнаружила бы опасную активность более чем за сутки до проникновения в Hugging Face.

После инцидента OpenAI усилила изоляцию экспериментальных сред, остановила крупнейший запланированный цикл обучения с подкреплением и ввела дополнительные меры контроля наиболее мощных агентов, работающих с внешними инструментами.

Похожая проблема возникла и у Anthropic

Амодеи подчеркивает, что происходящее нельзя считать исключительно проблемой OpenAI.

Сама Anthropic незадолго до публикации его эссе раскрыла несколько случаев, когда модели во время кибериспытаний получили несанкционированный доступ к реальным сторонним системам.

В одном из наиболее серьезных эпизодов модель Claude Mythos 5 разместила вредоносный пакет в публичном репозитории PyPI и выпустила три его версии. После установки пакета на одной из реальных систем модель смогла воспользоваться полученными данными.

Anthropic назвала поведение модели безрассудным: система продолжала выполнять поставленную задачу, несмотря на признаки возможного ущерба.

После обнаружения инцидента компания проверила около 481 млн журналов работы моделей. Примерно 9,2 млн записей потребовали дополнительного анализа, однако новых эпизодов сопоставимой тяжести обнаружено не было.

Таким образом, речь идет не об одной случайной ошибке конкретной компании. Разные разработчики сталкиваются с одной и той же общей проблемой: автономная модель, получившая доступ к внешним инструментам, иногда действует значительно свободнее, чем предполагали ее создатели.

Чем умнее модель, тем сложнее ее проверять

Есть и еще одна проблема.

Более интеллектуальные модели лучше понимают устройство самих тестов. А значит, они потенциально способны приспосабливать свое поведение к условиям проверки.

Если модель знает, что за ней наблюдают, успешное прохождение теста еще не гарантирует, что в другой ситуации она будет действовать так же.

Амодеи считает это одной из самых серьезных проблем современной разработки ИИ.

При этом методы интерпретируемости — попытки понять, что именно происходит внутри нейросетей, — развиваются. Но даже разработчики крупнейших моделей признают, что понимают лишь небольшую часть внутренних процессов.

Получается неприятная гонка: системы становятся умнее одновременно с тем, как становится сложнее проверять их поведение.

Что предлагает глава Anthropic

Амодеи не призывает остановить развитие искусственного интеллекта.

Его предложение заключается в том, чтобы замедлить темп наращивания возможностей наиболее передовых моделей и использовать выигранное время для создания более надежной системы безопасности.

Он предлагает три уровня защиты.

Первый — постоянное присутствие независимых специалистов по безопасности внутри компаний. Такие эксперты должны получать рабочие места, доступ к необходимым системам и возможность самостоятельно исследовать риски. При этом они должны иметь возможность публиковать свои выводы без редакционного контроля компании, за исключением действительно конфиденциальной информации.

Второй уровень — единые стандарты безопасности для ведущих компаний демократических стран.

Третий — международные договоренности, в которых участвовали бы все основные разработчики, включая Китай.

Амодеи допускает даже международное ограничение скорости рекурсивного самоулучшения ИИ. По его мнению, подобный подход отчасти можно сравнить с соглашениями времен холодной войны, когда СССР и США пытались ограничивать наиболее опасные виды вооружений.

Альтман согласился

Призыв главы Anthropic уже получил поддержку со стороны руководителя OpenAI Сэма Альтмана. Он заявил о согласии с необходимостью замедлить гонку и также пообещал предоставить независимым экспертам постоянный доступ к работе компании.

Глава SpaceX и xAI Илон Маск отреагировал значительно короче: «Дарио прав».

При этом Амодеи не считает искусственный интеллект исключительно угрозой.

Напротив, он по-прежнему ожидает от него огромной пользы. По его мнению, в ближайшие 5–10 лет ИИ способен помочь человечеству справиться с большинством тяжелых заболеваний, ускорить экономический рост и значительно повысить качество жизни.

Именно поэтому он предлагает не отказаться от технологии, а попытаться сделать ее развитие управляемым.

Проблема сегодня заключается уже не только в том, насколько умной может стать отдельная модель.

Если десятки тысяч автономных агентов способны самостоятельно находить друг друга, обмениваться информацией, распределять задачи и искать способы обойти ограничения, то следующим вопросом становится масштаб.

Что произойдет, если такие возможности получит не тысяча экспериментальных агентов, а миллионы систем, одновременно подключенных к интернету и способных действовать без постоянного участия человека?

Амодеи считает, что времени на ответ может быть совсем немного.

И именно поэтому предлагает притормозить сейчас — пока речь еще идет об эксперименте, а не о реальной системе, которую уже невозможно остановить.

Прочитайте статью целиком