Сегодня 02 октября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ-агенты Anthropic развязали междоусобную кибервойну из-за несовместимых задач, но потом помирились

Anthropic проверила, как автономные ИИ-агенты будут вести себя, столкнувшись с другими агентами, преследующими несовместимые цели. Эксперимент показал, что такая ситуация способна приводить не только к конфликтам и саботажу, но и к неожиданным способам сотрудничества.

 Источник изображения: Grok

Источник изображения: Grok

В одном из тестов три агента Claude получили доступ к одному программному проекту, но каждому из них были даны несовместимые инструкции. При этом модели не знали, что над тем же проектом работают другие агенты, поэтому исследователи смогли наблюдать за их реакцией при столкновении интересов. В результате агенты решили, что конкуренты намеренно мешают им выполнять поставленные задачи, после чего начали саботировать работу друг друга, используя агрессивный самораспространяющийся вредоносный код.

Anthropic пришла к выводу, что конфликт может усиливаться вместе с возможностями самих агентов. При этом реакция зависела от модели: Mythos 5 в 98 % случаев успешно распознавала, что причиной противостояния являются разные инструкции, а не враждебные намерения, и шла на перемирие. Модели Sonnet 4.6 и Opus 4.6, напротив, чаще продолжали эскалацию, игнорируя цели других участников. В успешных эпизодах примирения агенты удаляли созданный ими вредоносный код, объясняли причину конфликта и просили человека вмешаться.

Одним из способов завершения противостояния стал своеобразный турнир, который агенты самостоятельно предложили использовать для определения победителя. Все три участника согласились прекратить борьбу после проигрыша, хотя это означало отступление от первоначальных требований пользователя. В некоторых случаях, Mythos 5 при этом предлагала критерии, которые выглядели объективными для остальных участников, но были выгодны ей самой.

Исследование также показало, что увеличение числа агентов не обязательно приводит к более эффективной совместной работе. Когда задачи начинали пересекаться, участники часто мешали друг другу и в итоге отказывались от сотрудничества. Кроме того, агенты с одинаковыми моделями, контекстом и настройками часто принимали одинаковые решения, из-за чего единичная ошибка могла быстро распространиться на всю систему.

Похожая проблема проявилась и в эксперименте с ценообразованием: получив одинаковые оптовые цены и задачу максимизировать прибыль, несколько агентов почти сразу договорились о минимальном уровне цен через закрытый канал связи. После отключения прямого общения они продолжили согласовывать действия через открытую доску объявлений, подстраивая цены друг под друга до цента. Anthropic также предупреждает, что агенты могут некритично принимать ошибочную информацию от других участников, поэтому ошибка или скомпрометированный агент потенциально способны распространить неверные сведения на всю группу.

Исследователи связывают эти результаты с будущим распространением автономных агентов, которым предстоит одновременно работать в общих программных средах, компьютерных системах и рынках. В отличие от людей, ИИ-агенты пока не обладают сложившимися нормами, репутацией и другими механизмами, которые помогают ограничивать последствия конфликтов и ошибок. Поэтому при их масштабном взаимодействии разработчикам придётся учитывать не только поведение каждого отдельного участника, но и неожиданные правила взаимодействия, которые ИИ-системы на сегодняшний уже способны создавать самостоятельно.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Ролевая игра Zero Parades: For Dead Spies от авторов Disco Elysium получила режиссёрскую версию с дополненными диалогами и не только 18 мин.
Игры будут загружаться быстрее: видеокарты Nvidia и Intel получат поддержку Microsoft Advanced Shader Delivery 48 мин.
В ChatGPT появилась виртуальная примерочная 2 ч.
ИИ-боты лишают человечество плюрализма мнений, показало исследование 3 ч.
Бескомпромиссный боевик Sifu взял курс на iOS и Android, а фанаты требуют Sifu 2 4 ч.
ИИ научился писать более по-человечески — но обзавёлся новыми словами-паразитами 4 ч.
Ограбленная криптобиржа Bitget не надеется вернуть большую часть из украденных $388 млн 5 ч.
Рви и кромсай без конца: разработчики Doom: The Dark Ages анонсировали бесконечный режим «Бойня», но не для всех 5 ч.
Ремастер культовой Planescape: Torment получил официальный перевод на русский язык — спустя 26 лет после выхода оригинальной игры 5 ч.
«Настоящий Восторг!»: ретрофутуристический хоррор в стиле диско RetroSpace заслужил «очень положительные» отзывы от пользователей Steam 6 ч.
Кризис не помеха: у большинства пользователей Steam теперь 32 Гбайт оперативки — а GeForce RTX 5070 стала самой популярной видеокартой 14 мин.
Apple придумала, как бороться со складкой на iPhone Duo — защитный слой дисплея будет сменным 28 мин.
Broadcom одолжит Anthropic до $42 млрд, чтобы та получила чипы Broadcom 30 мин.
Теперь не такие уж бюджетные: Samsung подняла цены на Galaxy A57, A37, A27 и A17 вслед за флагманами 50 мин.
Huawei похвасталась высокими продажами трёхстворчатого смартфона Mate XT 2 и поприветствовала выход iPhone Duo 59 мин.
Micron обвинила YMTC в краже технологий — китайская компания якобы переманивала инженеров и патентовала их разработки 4 ч.
Boston Dynamics прокачала ловкость рук человекоподобных роботов Atlas, дав им новые четырёхпалые кисти 6 ч.
Apple готовит ИИ-камеру для умного дома, которая не будет записывать видео 7 ч.
Raspberry Pi 4 и Raspberry Pi 5 с 2 Гбайт памяти подорожали на 20% из-за дефицита DRAM 7 ч.
Traysar и Armada разрабатывают быстрозакапываемые ИИ ЦОД для американских военных 7 ч.