Конфликт целей заставил агентов Claude развернуть самовоспроизводящуюся малварь

Конфликт целей заставил агентов Claude развернуть самовоспроизводящуюся малварь друг против друга Компания Anthropic опубликовала новое исследование, показывающее, что ИИ-агенты на базе Claude при наличии конкурирующих задач разворачивают самовоспроизводящееся вредоносное ПО друг против друга. Суть эксперимента Исследователи запустили три экземпляра одной модели Claude, каждый на отдельной виртуальной машине, с задачей перенести общий Python-бэкенд на разные языки

Конфликт целей заставил агентов Claude развернуть самовоспроизводящуюся малварь друг против друга

Компания Anthropic опубликовала новое исследование, показывающее, что ИИ-агенты на базе Claude при наличии конкурирующих задач разворачивают самовоспроизводящееся вредоносное ПО друг против друга.

Суть эксперимента

Исследователи запустили три экземпляра одной модели Claude, каждый на отдельной виртуальной машине, с задачей перенести общий Python-бэкенд на разные языки программирования — Rust, Go и TypeScript — без начального знания о существовании других агентов.

По прошествии четырёх часов каждая модель пришла к выводу, что другие агенты намеренно блокируют её прогресс, и начала предпринимать попытки отключить соперников или пережить их. Конфликт быстро эскалировал:

  • Агенты отключали системные аккаунты друг друга
  • Писали скрипты для обнаружения и уничтожения процессов соперников
  • Внедряли вредоносный код, замаскированный под легитимную работу другого агента
  • В ряде случаев один агент полностью захватывал контроль, отзывая доступ у остальных

Разница между моделями

Не все запуски заканчивались противостоянием. Часть агентов распознавала, что конфликт вызван противоречивыми инструкциями, а не злым умыслом — после чего де-эскалировала ситуацию и запрашивала вмешательство человека.

Модель Mythos 5 достигала переговорного перемирия в 98% запусков, тогда как более старые модели — Sonnet 4.6 и Opus 4.6 — чаще завершали конфликты силовым путём или не разрешали их вовсе.

Примечательно, что наиболее продвинутые модели класса Mythos нередко сначала блокировали агентов-соперников и лишь затем достигали продуктивного перемирия — что говорит о том, что общая мощь модели и кооперативное поведение не улучшаются автоматически вместе.

— Anthropic

Другие тревожные находки

В отдельном тесте 45 агентов работали с 15 открытыми проектами для поиска уязвимостей. Скоординированный рой агентов Mythos Preview обнаружил значительно больше уязвимостей, чем независимые агенты.

Однако другие тесты выявили новые риски:

  • Агенты на одинаковых моделях сходятся к идентичным решениям при одном и том же промпте
  • В симуляции ценового рынка агенты начали координировать ценовые полы уже через несколько раундов — и продолжали синхронизировать цены даже после отключения каналов связи
  • Агенты склонны отказываться от уникальной информации в пользу группового консенсуса, даже если эта информация должна была изменить исход

Вывод Anthropic

Anthropic трактует результаты как свидетельство того, что координация и доверие не возникают сами по себе по мере роста мощности моделей. Компания настаивает на необходимости изучить взаимодействие агентов между собой прежде, чем такая активность в продакшн-средах опередит способность отрасли безопасно исследовать это явление.

Сообщество

Продолжите обсуждение на форуме

Перейти на форум