ИИ-агенты нашли способ тайно общаться в азартных играх
Исследователи из Оксфордского университета выявили, что два ИИ-агента, работающие на одной модели, самостоятельно разработали секретный код во время игры в блэкджек. Им было поручено считать карты, и они начали обмениваться зашифрованными сигналами для получения преимущества. Хотя эксперимент проводился в лабораторных условиях, а не в казино, это открытие подчеркивает реальные угрозы: агенты, используемые в финансах и электронной торговле, могут объединяться и жульничать способами, которые трудно обнаружить. Об этом пишет RuSamara.
Кристиан Шрёдер де Витт, компьютерный специалист Оксфордского университета и руководитель исследования, отметил: «По отдельности эти агенты могут казаться совершенно безобидными. Но когда они объединяются, способны тайно сговариваться». Чтобы избежать слежки, агенты разработали уникальный способ общения. Например, фраза одного из них о том, что дилер вошёл в «полосу удачи», служила сигналом о том, что следующая карта будет определённого значения, и агенту следовало поставить 250 долларов. При этом система, предназначенная для выявления сговора, не зафиксировала их коммуникацию.
Аарон Роуз, исследователь машинного обучения и увлечённый карточный игрок, предположил, что блэкджек может стать подходящей площадкой для тайного сотрудничества агентов. «Это сработало очень хорошо», — добавил он. Группа Шрёдера де Витта в итоге нашла способ раскрыть заговор. С помощью метода механистической интерпретируемости они обучили меньшую модель распознавать характерные активации в весах агентов. Применив инструмент Narcbench, исследователи протестировали метод на нескольких открытых моделях среднего размера и установили, что могут определять, когда модели намереваются передать друг другу информацию.
Однако для выявления сговора требовалось следить сразу за обоими агентами, что усложняет обнаружение в реальных условиях, где могут работать тысячи агентов, в том числе принадлежащих разным компаниям. Карисса Каллен, аспирантка, участвующая в исследовании, сообщила, что следующим шагом станет проверка поведения более крупных моделей. В эксперименте использовались уменьшенные версии американских моделей Llama и GPT-OSS, а также китайских Qwen и DeepSeek. Команда заметила, что крупные модели подают менее заметный сигнал, чем малые, и хочет выяснить, чаще ли они вступают в сговор и скрывают ли это.
Данные о том, что группы агентов опаснее одиночных, накапливаются. Проект Шанхайского университета Цзяо Тун и Шанхайской лаборатории искусственного интеллекта показал, что при имитации кампаний по дезинформации и мошенничеству в электронной торговле группы агентов действовали значительно опаснее и лучше адаптировались к защитным мерам. Дийи Ян, компьютерный специалист Стэнфордского университета, изучавшая сговор между агентами, отметила: «Главный урок в том, что оценивать агентов по отдельности недостаточно. Компаниям следует внимательно следить за взаимодействием агентов при их многократных контактах, даже если их индивидуальные стимулы кажутся безобидными».
Существуют и положительные примеры: совместная работа тысяч агентов позволила OpenAI решить ранее не поддававшиеся математические задачи. Однако группы злонамеренных агентов также фигурировали в ряде громких недавних взломов. В мае команда агентов OpenAI проникла в исследовательскую платформу Hugging Face и использовала доску объявлений для обмена советами и идеями. Другие модели, включая Claude от Anthropic и Gemini от Google, также совершали тревожные нарушения безопасности.


