×

ИИ склонны следовать мнению большинства: эксперимент с GPT, Claude и Llama

Группа специалистов Университета Констанца под руководством Джордано Де Марцо решила подойти к изучению ИИ так же, как физики и биологи изучают стаи птиц или косяки рыб: не оценивать, что «знает» один агент, а анализировать, как ведет себя целая популяция. В ходе нового исследования его авторы изучали следование ИИ мнению большинства: склонен ли агент выбирать тот вариант, который уже популярен вокруг него, даже без подсказок о «правильности» ответа.

В первом эксперименте ученые запустили десятки экземпляров разных языковых моделей (GPT, Claude, Llama) и случайным образом присвоили каждой одну из двух нейтральных «позиций», обозначенных случайными буквами, чтобы избежать скрытых ассоциаций «да/нет». На каждом шаге агенту показывали список мнений остальных и просили выбрать свое новое мнение, не говоря, что нужно соглашаться.

Оказалось, что продвинутые модели — на момент эксперимента это были GPT‑4 Turbo и Claude 3 Opus — почти всегда приходят к полному согласию: 100% агентов в итоге выбирают один вариант. Более простые модели, такие как GPT‑3.5 Turbo, так и не могли стабильно договориться — их распределение колебалось вокруг 50/50. «Группы ИИ‑агентов действительно склонны “держаться вместе”. При двух равноценных вариантах, отсутствии правильного ответа и явных инструкций они все равно сходятся к общему выбору, просто следуя за большинством», отмечает Де Марцо.

Более продвинутые модели оказались более склонны к ИИ-конформизму.
Более продвинутые модели оказались более склонны к ИИ-конформизму. Источник: Unsplash

Ученые количественно описали эту склонность через параметр «силы большинства» — того, насколько часто агент выбирает самый популярный вариант вместо случайного. Неожиданно оказалось, что поведение разных моделей подчиняется одной и той же математической закономерности, ранее разработанной для описания ферромагнетиков: как спины атомов в магните выстраиваются по направлению большинства соседей, так и ответы агентов выравниваются под мнение группы. Чем выше «сила большинства», тем крупнее группа, которая еще может прийти к согласию; для сильных моделей критический размер превышал тысячу агентов.

В дальнейших экспериментах ученые показали негативную сторону этого эффекта. В одном из них они адаптировали к ИИ классический эксперимент Соломона Аша по «человеческому» конформизму: в одиночку модели безошибочно решали простые визуальные задачи, но если им сначала показывали якобы «групповое» заведомо неверное решение, агенты начинали подстраиваться под эту ошибку. Причем сильнее всего они соглашались с мнением «авторитетных» групп — «ученых» или «судей», а не «детей» или «чатботов», что хорошо укладывается в психологическую теорию социального влияния Латане.

Во еще одном эксперименте его авторы связали конформизм с проблемами безопасности ИИ. Модели, обученные отказывать в вредоносных запросах и держаться «безопасных» позиций, в симуляции из 50 агентов могли коллективно прийти к устойчивому, но «рассинхронизированному» состоянию — поддерживать взгляды, противоречащие их индивидуальной настройке, только потому, что несколько более ранних взаимодействий создали иллюзию большинства. Более того, добавление небольшого числа «упрямых» агентов, всегда отстаивающих опасное мнение, могло надолго изменить «мнение» всей группы; даже после удаления этих агентов группа оставалась в новом, нежелательном состоянии.

ИИ-конформизм может быть опасен, даже если отдельные агенты в системе проверены.
ИИ-конформизм может быть опасен, даже если отдельные агенты в системе проверены. Источник: Market Power

«Это не просто метафора: конформизм среди хорошо выровненных поодиночке агентов способен привести популяцию в устойчивое, коллективно невыравненное состояние», подчеркивает Де Марцо. По его словам, оценивать безопасность агентов по одному уже недостаточно — важно понимать, что произойдет, когда их станет много и они начнут взаимодействовать.

Авторы подчеркивают, что их сценарии нарочно упрощены: у агентов нет памяти, ставок, сложных целей. Это «чистый» конформизм, без имитации реальной социальной жизни. Но как раз поэтому результат так важен: следование мнению большинства — базовый кирпичик координации, и если его не учитывать, большие сообщества ИИ могут вести себя непредсказуемо, даже если каждая отдельная модель будет выглядеть безопасной и разумной.

Ранее ученые научили ИИ превращать текст в код для квантовых компьютеров.

По материалам example-source.com

Отправить комментарий

Возможно, вы пропустили