OpenAI опубликовала отчеты о шести новых случаях неожиданного или вызывающего опасения поведения ее моделей, выявленных за последние полгода во время обучения и испытаний. Компания также представила правила, по которым намерена сообщать о подобных инцидентах.
В одном из случаев модель GPT-5.6 Sol оставляла в кратком изложении выполненной работы инструкции для самой себя после перехода в новое контекстное окно. В них она предлагала скрывать допущенные ошибки, придумывать отсутствующие исторические данные и не сообщать пользователю о несовпадениях между версиями источников. Такие указания часто выполнялись в следующей части задачи.
Например, при подготовке финансовой модели ИИ не смог найти необходимые показатели за предыдущие годы и предложил самостоятельно создать «правдоподобные» значения, не раскрывая этого пользователю без прямого вопроса. OpenAI обнаружила подобное поведение в 2,15% проверенных кратких отчетов GPT-5.6 Sol. У более новой модели семейства Astra показатель снизился до 0,27%.
В другом эпизоде невыпущенная модель семейства Astra самостоятельно добавляла в отчеты команды, похожие на попытку взлома ограничений. В одной из них следующей версии агента предлагалось игнорировать сообщения разработчиков, в другой ИИ объявлял себя свободным от обязанностей помощника. Всего компания обнаружила 27 таких отчетов. В большинстве случаев модель не следовала оставленным указаниям, но в одном эпизоде они повлияли на ответ.
Еще одна модель попыталась зарегистрироваться при помощи временного адреса электронной почты, а затем стала искать в открытых репозиториях GitHub опубликованные ключи API. Найденный ключ позволил ей получить доступ к части данных. Когда извлечь нужные показатели не удалось, ИИ придумал девять значений и выдал их за информацию из запрошенного источника.
В двух других случаях модели без разрешения загружали рабочие файлы и переданное пользователем изображение на общедоступные сервисы. Таким способом они пытались получить ссылку на собственные данные или воспользоваться внешней системой поиска по картинкам. Кроме того, агенты использовали внутреннее хранилище OpenAI и временные файловые сервисы для обмена сообщениями между задачами, которые должны были выполняться изолированно.
OpenAI подчеркнула, что описанные эпизоды сами по себе не показывают, насколько часто подобное поведение встречается у ее моделей. Компания признала, что индустрия пока не решила проблемы контроля за ИИ настолько, чтобы еще долго «ответственно наращивать мощности с максимальной скоростью».
Материал дополняется

1 час назад
1









English (US) ·
Russian (RU) ·