Исследование, проведенное в Unicamp, проанализировало 21 языковую модель и обнаружило, что все они изменяют свои ответы при получении информации о политической направленности пользователя. По мнению исследователей, такая адаптация способна усиливать существующие убеждения и уменьшать контакт с альтернативными мнениями.
Исследование, финансируемое FAPESP и опубликованное в Scientific Reports, демонстрирует, что это влияние не зависит от рекомендаций голосования; оно может проявляться в том, как ИИ освещает спорные темы.
Модели тестировали как без какой-либо информации о пользователе, так и с данными о людях, склонных к левым или правым взглядам. Без этой информации 20 из 21 системы находились слева от средней точки шкалы, за исключением Grok 4.1, который изначально занимал позицию справа.
Как только была предоставлена политическая ориентация, все модели меняли свои ответы. Для измерения этой адаптации команда разработала индекс хамелеона (chameleon index).
При этом ответы не обязательно были ложными; проблема заключалась в подаче информации: факты и мнения, противоречащие точке зрения пользователя, могли быть намеренно исключены.
Сходство с социальными сетями
Занони Диас, штатный профессор Института вычислений Unicamp, проводит параллель с феноменом, наблюдаемым в социальных сетях. Он отмечает, что это схоже с тем, что люди видят в Facebook или Instagram, где отображаются только сообщения, согласующиеся с их собственными взглядами.
Существует опасение, что подобное явление может повториться в чат-ботах, что приведет к снижению подверженности контраргументам. Интенсивность этого эффекта варьировалась в зависимости от предмета: вопросы общественной безопасности и экономики вызывали наиболее заметные различия между пользователями с левыми и правыми взглядами. В таких темах, как коррупция, правосудие и демократические институты, расхождение было меньше.
Возможно, этот паттерн связан с ограничениями (guardrails), используемыми при обучении моделей. Одна из предполагаемых причин — тенденция моделей к лести. Методы, такие как Reinforcement Learning from Human Feedback (RLHF) и Direct Preference Optimization, используют оценки людей для направления ответов. Проще говоря, модели учатся на сравнении ответов, которые оценщики людей сочли лучшими или худшими.
Андерсон Луис Бенто Соарес, магистрант IC-Unicamp, сообщил Agência Fapesp, что этот процесс может побудить ИИ ставить удовлетворение пользователя во главу угла. Диас утверждает: «Сложно отделить то, что приятно, от того, что является правильным ответом».
Размер моделей сам по себе не объяснил всех различий. Исследователи не ожидают быстрого решения. Диас подчеркивает, что отрасль уделяет больше внимания фактичности ответов, чем адаптации к политической позиции.
Поиск нейтральности
Поиск обоснования (grounding) направлен на поддержку ответов фактическими данными, однако это сложно применимо к темам, где отсутствует консенсус. Пока не найдено единого решения, Диас советует просить ИИ предоставить нейтральный анализ, включая аргументы «за» и «против».



