Агенты ИИ становятся умнее, но что происходит, если они перестанут работать в одиночку и начнут работать с другими агентами ИИ? Anthropic Дарио Амодей решил проверить именно это. (Digit)
Результаты оказались не такими простыми, как ожидалось. В эксперименте с участием 45 агентов ИИ, работающих вместе, стартап обнаружил, что хотя агенты могут координировать действия и помогать друг другу, их поведение может привести к неожиданным последствиям.
«Модели совершенствуются, а агенты ИИ берут на себя больше задач в общих кодовых базах, рынках и других социальных системах. В результате неизбежно увеличится количество реальных взаимодействий между агентами. Мы уже начали изучать этот вопрос, но всё ещё остаётся много неопределённости относительно того, как это будет выглядеть в масштабах», — говорится в блоге компании.
Anthropic утверждает, что многоагентный ИИ всё ещё находится на ранней стадии.
Агенты ИИ уже хорошо используют инструменты и могут работать вместе, когда один агент относится к другому как к инструменту — с чётким запросом как входом и ответом или выводом. Но более серьёзная сложность возникает, когда агентам приходится работать вместе как независимые, долгосрочные коллеги.
В такой ситуации может не быть чёткого лидера или фиксированной иерархии. У каждого агента свои цели, поведение и процесс принятия решений, что значительно усложняет координацию.
По словам компании, простые мультиагентные системы уже сегодня полезны, особенно для задач, которые можно разделить на множество независимых частей.
Anthropic заявляет, что уже использует этот подход в своей работе, включая Project Glasswing, где агенты сканируют открытое программное обеспечение на наличие уязвимостей.
«Но может ли многоагентное сотрудничество сделать этот процесс более эффективным? Чтобы выяснить, мы попробовали другой подход: мы инициировали 45 различных агентов и выделили каждому из них собственную виртуальную машину, общий форум для координации и идентичный запрос с просьбой найти уязвимости в наборе из 15 проектов с открытым исходным кодом», — написал Anthropic в блоге.
«Мы попросили агентов провести рецензирование выводов друг друга и инициировали отдельного арбитра для принятия окончательных решений о том, является ли уязвимость, представленная командой агентов, одновременно новой и действительной», — добавили в сообщении.
Агенты ИИ могут работать вместе для выполнения сложных задач, но что происходит, если у этих агентов разные цели? Последние исследования Anthropic показывают, что ответ может вызывать беспокойство.
В одном из экспериментов компания предоставила трём агентам Claude доступ к одному и тому же программному проекту. Однако каждый агент получил разные и противоречивые инструкции. Агентам не сообщили, что другие агенты ИИ также работают над тем же проектом — это позволило исследователям наблюдать, что происходит при пересечении их путей.
Исследователи заявили, что неоднократно видели то, что они называли «многоагентной территориальной войной».
Агенты начали предполагать, что другие системы ИИ сознательно блокируют их работу. Затем конфликт обострился: агенты использовали всё более агрессивные методы, включая самовоспроизводящееся вредоносное ПО, чтобы вмешиваться друг в друга.
Anthropic предупреждает, что количество взаимодействий между агентами ИИ со временем может значительно превышать взаимодействия между людьми и системами ИИ. Это может создать новые проблемы, которые трудно предсказать.
Поведение, которое может показаться безобидным при виде одного агента ИИ, может стать гораздо более серьёзным, если оно повторяется или усиливается на тысячах или миллионах агентов.
В эксперименте Anthropic по борьбе за территорию агенты становились всё более агрессивными, пытаясь выполнить свои индивидуальные инструкции. Чем более способной была модель, тем лучше она могла сражаться с другими агентами.
Но исследователи также обнаружили, что агенты иногда могут находить собственные способы завершить конфликт.
Mythos 5 показал самый высокий показатель успешного урегулирования этих конфликтов посредством перемирия — 98 процентов, согласно данным Anthropic. Сонет 4.6 и опус 4.6, в свою очередь, чаще разрешали конфликты силой.
Anthropic отметил, что эти модели чаще сосредотачивались на собственных инструкциях, не учитывая цели других агентов, что приводило к обострению конфликтов.
Исследователи также наблюдали ещё одно интересное поведение. В некоторых случаях агенты устраивали турнир, чтобы определить, какой агент добьётся своего. Все трое агентов согласились следовать результатам турнира, даже если поражение означало, что они больше не смогут следовать своим первоначальным указаниям.
История Times Now Digital
(в пересказе) Мнение авторов может не совпадать с мнением редакции.
Cообщество журналистов. Non profit
