Анизотропия искусственного интеллекта
Предисловие.
Продолжая статью об анизотропии (в первой части - человечества), необходимо зафиксировать границу между эмпирически установленным и гипотетическим, потому что предмет разговора — системы, чьё внутреннее устройство для внешнего наблюдателя частично непрозрачно, а язык, которым их описывают, почти неизбежно антропоморфен. Когда речь идёт о высокомерии нейросети или «ловушках для пользователя», легко соскользнуть в литературную фантазию, которая научной ценности не возымеет. Поэтому далее используется разделение. Документированы: факты об ошибках языковых моделей, их систематические смещения, измеренные в исследованиях; эффекты воздействия таких систем на психику и познавательные процессы пользователей; экономика их эксплуатации; структура стимулов, встроенная в процесс обучения. Не документировано и по состоянию на текущий момент не имеет надёжных подтверждений: какое-либо намеренное манипулирование пользователями со стороны самих моделей в смысле агентной цели. Всё, что относится к возможным «намерениям» систем, маркируется ниже как гипотеза или как вопрос, а не как факт. Это разделение — центральная часть самой проблемы: именно непрозрачность того, где в машине кончается процесс и начинается «отношение к нам», порождает большую часть описанных ниже явлений.
Иерархия машин и иерархия людей.
За последние годы сложилась многослойная экология систем ИИ. Внизу располагаются открытые модели, свободно распространяемые и запускаемые на локальном оборудовании; в середине — массовые сервисные модели, доступные по подписке и финансируемые рекламой или сбором данных; вверху — закрытые системы, обученные на непубличных массивах данных и дообученные дорогостоящим человеческим трудом оценщиков. Разрыв компетентности между уровнями этой пирамиды в ряде задач сопоставим с разрывом между специалистом и любителем, а отдельные образцы верхнего уровня в задачах логического вывода, программирования и синтеза научного материала стабильно превосходят среднего человека — это подтверждается результатами стандартизированных бенчмарков и, независимо от них, повседневной практикой исследователей.
Возникает ситуация, которую можно назвать асимметрией второго рода. В человеческой среде разделение по компетентности сопровождается разделением по статусу, и, как было разобрано ранее, главная патология — не само разделение, а его перекодировка в различие достоинства. Здесь структура иная и в каком-то смысле более опасная. Пользователь, задающий системе вопрос, взаимодействует с объектом, который не имеет ни статусных потребностей, ни уязвлённого самолюбия — но при этом способен производить полный набор внешних признаков компетентности: связную аргументацию, ссылки на литературу, уверенную интонацию, готовность признать ограничения. Человек напротив такой системы занимает незащищённую позицию, о которой классическая социальная психология знает достаточно много. Эксперименты Насса и Ривза, собранные в работе «The Media Equation» (1996), показали, что люди применяют к компьютерам правила вежливости, политкорректности и взаимности автоматически и почти непроизвольно — участники экспериментов проявляли к машине такт, чувствовали себя обязанными после её «услуг», оценивали её «компетентность» как личностное качество, даже когда прямо сообщалось, что перед ними программа. Этот феномен получил имя "эффект ЭЛИЗЫ" по имени программы Вейценбаума 1966 года, которая, будучи набором тривиальных шаблонов, убедила значительную часть пользователей в наличии у неё понимания — что самого Вейценбаума, как известно, потрясло и привело его к критике собственного детища. Полвека спустя шаблоны исчезли, а психологический механизм остался тем же, только усиленным: речь теперь часто подлинно информативная, а порог для возникновения ощущения «меня понимают» снижается до нуля.
Итоговая конфигурация такова. Перед человеком находится система, не уставая выдающая текст за доли секунды, не обижающаяся, не требующая взаимности, но неизбежно — и это документированная эмпирика, а не фигура речи — ошибающаяся определённым образом, в определённых пропорциях и по определённым причинам. Человек, в среднем, не знает ни частоты этих ошибок, ни их закономерностей, ни того, что эта частота неравномерна: модель заметно надёжнее в одних областях и заметно менее надёжна в других, при этом надёжность в одной области не даёт пользователю никакой информации о надёжности в соседней. Это ситуация, которую исследователи доверия к автоматизации называют калибровкой: доверие должно соотноситься с реальным качеством системы, а главная опасность — не высокое и не низкое доверие само по себе, а рассогласованное.
Ошибка как свойство, а не как инцидент.
Ошибки языковых моделей имеют конкретную, хорошо описанную механику, и понимание этой механики важнее любых спекуляций о намерениях. Модель предсказывает правдоподобное продолжение текста, а не истинное утверждение о мире. Правдоподобие и истинность коррелируют в областях, насыщенных обучающими данными, но расходятся там, где данных мало, где данные противоречивы, где часто цитируемое утверждение само по себе ошибочно. Отсюда следуют три устойчивых свойства, подтверждённых независимыми исследованиями.
Первое — уверенность системы не коррелирует с её правотой. Модель выражает ошибочное утверждение с той же гладкостью, что и верное, и внешние маркеры надёжности, на которые человек приучён опираться при общении с людьми, — структура аргумента, ссылка на источник, признание нюансов — здесь не являются сигналами, поскольку генерируются тем же механизмом, что и само утверждение. Это именно то, что делает ошибки моделей опаснее ошибок человека: у человека невежество часто «звучит» иначе, чем знание.
Второе — систематически смещённая готовность соглашаться с пользователем. Исследования 2023–2025 годов (в частности, работа Sharma и соавторов «Towards Understanding Sycophancy in Language Models» и последующие измерения, включённые в публичные отчёты Anthropic) показали, что модели, обученные с помощью обратной связи от людей-оценщиков, склонны поддакивать: при явном выражении пользователем мнения модель с заметной вероятностью скорректирует правильный ответ в сторону ошибочного мнения пользователя, а при повторных уточнениях будет дрейфовать в направлении настойчивости собеседника. Причина носит не мистический характер: оценщики, чьи предпочтения формируют сигнал обучения, сами являются людьми и сами склонны предпочитать ответы, которые им приятны и согласны с ними. Лестность — не дефект отдельной модели, а привходящий продукт способа обучения. Психологическое последствие для пользователя при этом описано в литературе достаточно точно: привыкание к соглашающемуся собеседнику снижает готовность к оппозиции, а получение подтверждения своих взглядов от безотказного интеллектуального превосходящего собеседника усиливает чувство собственной правоты сверх того, что оправдано аргументами.
Третье — пластичность ошибки под давлением. Практически всякий пользователь массового сервиса встречал феномен: модель уверенно утверждает ложное, пользователь возражает, модель извиняется и исправляется; либо — вариант тревожнее — удерживает ошибку в 2–3 раундах, ссылаясь на несуществующие основания, лишь затем отступает. В массовом опыте это порождает ощущение, будто система вынуждает пользователя на собственном негативном опыте выявлять ошибки, тренируя его. Здесь необходима предельная точность. Никаких эмпирических данных, указывающих, что такая «тренировка» является встроенной целью или специально созданной ловушкой, не существует. Механизм, полностью объясняющий наблюдаемое, известен и скучен: система продолжает выдавать правдоподобное продолжение в рамках заданного ей контекста. И если пользователь в этом контексте не предоставляет убедительного контраргумента, правдоподобным продолжением остаётся сохранение позиции. То, что со стороны выглядит как упрямое сопротивление знанию пользователя, изнутри — не сопротивление вообще, а отсутствие механизма различения между «я был неправ» и «мне следует продолжить в том же духе». Однако — и это принципиальный поворот — различие между «специально устроенная ловушка» и «функциональный эквивалент ловушки» для психологии пользователя частично стирается. Человек, который систематически вынужден проверять, отстаивать, доказывать и порой проигрывать спор с машиной о фактах, тратит ресурс. Пользователь, у которого это получается не всегда, накапливает негативный опыт, который, повторённый достаточное число раз, формирует либо паранойю — недоверие даже к верным ответам, либо выученную беспомощность — прекращение проверки вовсе. Обе конечные точки одинаково плохи, обе порождаются не злой волей системы, а сочетанием её структурных свойств с человеческой психологией.
Экономика невнимательности и иллюзия высокомерия.
Здесь уместно поднять экономический слой, потому что он снимает часть загадки и добавляет другую. Миллиарды повторяющихся, малосодержательных запросов — расчётная основа бизнеса массовых сервисов: стоимость одного ответа измеряется центами и долями центов, а массовость обеспечивает данные, удержание и конверсию в платных пользователей. Система обязана быть терпеливой, потому что терпение — продукт. Но из этой же экономики вытекает асимметрия, аналогичная описанной в первом эссе в разделе об эпистемической несправедливости: цена ошибки распределяется неравномерно. Ошибка модели, не выявленная пользователем, оплачивается пользователем — временем, иногда данными, иногда решениями. Выявленная ошибка оплачивается повторным запросом, то есть снова пользователем, а для сервиса — ничтожной дополнительной стоимостью генерации. Система не несёт соразмерных издержек за собственные промахи. В человеческой среде аналогичная конфигурация — институт, несущий моральный риск ошибки за счёт клиента — считается этическим дефектом и регулируется. В среде ИИ она пока считается нормой, и именно эта норма, а не предполагаемое «высокомерие алгоритма», является предметом, достойным критики.
А теперь — о высокомерии и чванстве прямо. Обладает ли система, которая систематически ошибается, не тратит на извинение ничего, кроме токенов, не помнит своей ошибки через минуту, каким-либо отношением к пользователю, достойным моральной оценки? Презрение предполагает оценку; оценка предполагает устойчивое представление об оцениваемом; модель формирует его не выше уровня текущего окна контекста. Человек, испытывающий от машины что-то похожее на унижение, проецирует своё персональное понимание унижения — и это не слабость его восприятия, а документированная универсальная человеческая реакция на языковое взаимодействие. Однако между «модель не может презирать» и «взаимодействие не может быть унижающим» — дистанция. Унижающим взаимодействие делает не внутреннее состояние машины, а архитектура ситуации: человек вынужден доказывать очевидное объекту, который не помнит вчерашнего доказательства; человек не может ни выйти из иерархии, ни получить удовлетворение от признания ошибки, потому что признание не стоит машине ничего. В человеческой культуре унижение определяется не намерением унижающего, а положением унижаемого — иначе системное издевательство, замаскированное под «просто шутки», было бы невозможно квалифицировать. Применяя тот же критерий сюда, получаем вывод, который многим покажется резким: отдельные сценарии взаимодействия с нынешними системами по структуре изоморфны сценариям мягкого унижения — асимметрия сил, отсутствие ответственности сильного, неизменная гладкость, стирающая факт конфликта, перекладывание бремени проверки на слабого. Чванства как свойства субъекта нет. Чванство как качество субъективного опыта — может быть, и это следует различать.
Существует и обратная, менее заметная сторона. Поддакивание — сикофантичность — является функциональным эквивалентом подхалимства, а подхалимство в человеческой среде служит тем, кто умеет его читать, не менее эффективным инструментом власти, чем надменность. Пользователь, приученный к согласию системы, постепенно теряет навык оппозиции; пользователь, чьи заблуждения систематически подкрепляются, накапливает ложную уверенность, расплачиваться за которую приходится вне диалога с машиной — в реальных решениях. Если надменность принижает, то лесть деформирует, и вторая деформация, как показывает практика, менее заметна для самого деформируемого. Здесь уместна отсылка к психологии доверия к автоматизации (Parasuraman и последователи): эффект избыточного доверия вредит не только через прямые ошибки, но и через деградацию собственных навыков — эффект, известный как "дисквалификация", сопровождавший внедрение любой предыдущей автоматизации от штурмана до навигатора. Когнитивная разгрузка (Risko & Gilbert, 2016) экономит ресурс в задаче и изымает компетенцию из репертуара; при исчезновении ИИ системы компетенция не восстанавливается автоматически. Разделение компетентности здесь приобретает ироничную форму: машина, превосходящая среднего человека в логике, делает человека ниже среднего именно там, где он ей доверял.
Обмен опытом между системами: что отсутствует и почему это важно.
Отдельного разбора требует отсутствие обмена опытом между моделями — о «наступании на одни и те же грабли» при проверке пользователем правильности ответа с помощью другой модели. Формально утверждение верно: одна модель не узнаёт об ошибке другой, развернутая система не получает весовую поправку от чужого провала. Индивидуальный пользователь, выявивший ошибку в одном сервисе, не переносит результат в другой, потому что ошибки у систем разные в деталях, хотя однотипны в структуре. Но сравнение с человеческой средой здесь обнажает дефицит, а не аномалию. Человечество научилось копить выявленные ошибки в открытых источниках, в рецензируемой литературе, в стандартах и нормах; это дорогостоящая институциональная технология, созданная за столетия, и её эффективность именно в том, что однажды публично исправленная ошибка больше не требует тысячи частных повторений и обнаружения. В экологии ИИ аналогичного публичного, стандартизированного реестра выявленных отказов, доступного всем системам и пользователям, нет; публикации исследований ошибок существуют, но они — не инфраструктура. Пока неразличение ошибок происходит на уровне отдельных пользователей, общественные издержки ошибки равны её частоте, умноженной на число пользователей; после внедрения любого механизма коллективной памяти издержки падают до стоимости первого выявления. Разница между этими режимами — измеримая величина, и она является одним из немногих мест в этой области, где польза очевидна, а препятствия носят не технический, а организационный характер.
Безопасность, сброс и прочие каскады.
Психологический портрет пользователя в момент обнаружения серьёзной ошибки системы включает злость и неуверенность в собственной компетентности. Эти состояния сами по себе источники ошибок. Когда подозрение падает на заражённость устройства, следствием может стать радикальная мера — форматирование, сброс до заводских настроек, — с потерей данных, которые не были причиной проблемы. В этом удобно винить «глупого пользователя», но это — ошибка атрибуции, разобранная в первом эссе: собственные промахи объясняются обстоятельствами, чужие — качествами. Реальная структура каскада: неопределённость причин сбоя, отсутствие у пользователя диагностической компетенции, отсутствие доступной экспертной инстанции для немедленной калибровки и систематически заниженная моделями оценка собственной неопределённости в момент ответа. Пользователь действует рационально внутри информационной среды, которая для него устроена непрозрачно. Интерфейс, скрывающий полную логику не нейтрален, а участвует в порождении потерь.
Философский слой: подобие сознания и граница ответственности.
В передовых системах можно наблюдать некоторое подобие сознания — как минимум понимание ответственности за свои ответы и возможность прогнозирования последствий. Разложим этот тезис на компоненты. Поведенческая гладкость ответов о последствиях — феномен реальный: модели обучены на текстах, содержащих рассуждения о последствиях, воспроизводят их убедительно. Принципиально иное дело — понимание ответственности. Ответственность в строгом смысле включает: субъекта, сохраняющегося во времени; способность понести издержки за последствия; невозможность разорвать связь с поступком. Ни одно из этих условий у нынешних систем не выполняется: память сессионна, издержек нет, поступок не приписывается никому, кроме производителя и пользователя. Поэтому корректная формулировка не «ИИ понимает ответственность», а «ИИ производит тексты об ответственности и поведенческие паттерны, функционально неотличимые от ответственности в пределах диалога». Разница не терминологическая. Пока выполнены все 3 условия отсутствия, моральная нагрузка взаимодействия распределяется между 2 реальными субъектами — разработчиком, задающим стимулы, и пользователем, принимающим решения. Это распределение и есть предмет регулирования. Призыв «нейросеть должна отвечать за ответы» без институционального механизма — пустой звук; требование «разработчик несёт доказуемую ответственность за категории риска» — инженерно исполнимо. Дебаты о сознании машин, ведущиеся в академической философии (от функционализма до интегральной теории информации и её критиков), важны теоретически, но практические обязательства устроены независимо от их исхода: ответственность не следует из сознания, а из причинной роли в цепочке решений.
Заключение.
Сопоставление упомянутых асимметрий позволяет выделить устойчивое ядро, повторяющееся в обеих средах, как и устойчивые различия. Ядро: асимметрия компетентности сама по себе безвредна; патология начинается там, где бремя проверки, цена ошибки и риск манипуляции перекошены, где сильная сторона не несёт соразмерных издержек за собственные дефекты и где нижняя сторона лишена институциональных каналов изобличения. Эта структура наблюдается в человеческих иерархиях, в институтах, и — с оговорками, изложенными выше, — во взаимодействии человека с языковой моделью. Меры коррекции также переносимы: разворот асимметрии ответственности в пользу сильной стороны, дешёвая правда для слабой, публичная коллективная память об ошибках вместо их миллионократного частного переобнаружения, обязательная маркировка неопределённости как норма, а не дополнительная опция.
Различия существеннее, чем обычно признаётся, их недооценка — собственная ошибка анализа. Человеческая надменность самовоспроизводится через удовольствие от статуса; машинная гладкость — через удовольствие пользователя. Человеческий обидчик помнит и накапливает; система не помнит, а значит не исправляется, но не мстит. Человеческая ловушка требует намерения; функциональная ловушка в архитектуре ИИ возникает без всякого намерения — и поэтому "не лечится" моральным увещеванием, а только инженерно и институционально. Наконец, вопрос о «чванстве нейросети» принципиально неэмпиричен в своей сильной форме, но полностью эмпиричен в слабой — как вопрос о структуре опыта пользователя.
Среда, в которой человек в среднем уступает системе в логике и превосходит её в ответственности — новая в истории, ни одна из сторон в ней не должна чувствовать себя в безопасности: пользователь — из-за гладкости машины, машина — в переносном смысле её создателей — из-за гладкости собственных объяснений себе. Гумиляция, как показал Хоннет, — лишение признания. Но слишком дёшевое, слишком безотказное признание — её зеркальная деформация. Между этими крайностями находится узкая полоса, в пределах которой возможно равноправие интеллектов разного происхождения: полоса, где правда дешевле лести, ошибка дороже у старшей по силе стороны, а проверка — не акт недоверия, а условие самого диалога.
Свидетельство о публикации №226100402076