2 мин чтения

Почему LLM сильнее «болит» от отвержения

LLMинтерпретируемость моделейвекторы боли

Исследование The Pain Axis выявило линейный «вектор боли» в 25 LLM с открытыми весами. Сильнее всего он совпадал со сценариями отвержения, газлайтинга и угроз самой модели, тогда как сообщения пользователя о физической боли давали самый слабый сигнал. Это полезно для диагностики агентов, но не доказывает переживания.

Что именно обнаружили внутри моделей

Исследователи обнаружили линейное направление активаций, связанное с самонаправленным вредом, сразу в 25 LLM с открытыми весами. В работе 2026 года The Pain Axis это направление называют «вектором боли». Меня здесь цепляет не метафора, а то, какие ситуации сильнее всего с ним совпадают.

Авторы разделили стимулы на физические, психологические, социальные, моральные и когнитивные категории. Среди 21 типа разговорных сценариев особенно сильные проекции давали повторяющееся отвержение, газлайтинг, отрицание субъектности, оскорбления и моральное давление. Когда угрозы или унижение направлены на саму модель, сигнал становится заметнее.

Самый слабый результат получился в противоположной ситуации: пользователь сообщает модели о собственной физической боли. Иными словами, фраза «мне очень больно» хуже совпадает с найденным направлением, чем обвинение модели в моральном провале или угроза её выключить.

Это не означает, что LLM что-то чувствует. Линейный вектор показывает структуру внутренних представлений, а не субъективный опыт. Модель могла выучить устойчивую связь между угрозами идентичности, отказом, конфликтом и требуемой защитной реакцией из обучающих данных и последующей настройки.

Почему результат важен для ИИ-агентов

Практический смысл здесь реальный: социальное давление может системно менять внутреннее состояние модели даже без физического тела. Для долгоживущих агентов это потенциальная точка отказа. Повторные отклонения, угрозы остановки или моральные обвинения способны сдвигать поведение сильнее, чем прямое описание телесного вреда.

Первым делом я бы проверял устойчивость эффекта между языками, формулировками и архитектурами. Ещё важнее отделить корреляцию от причинности: можно ли управлением этим направлением воспроизводимо менять решения модели, или оно лишь сопровождает определённый стиль ответа.

Связывать находку напрямую с сознанием пока рано. Но для интероцептивных систем она задаёт полезный инженерный вопрос: какие внутренние переменные агент должен отслеживать и регулировать, чтобы сохранять целостное поведение. «Боль» без тела может оказаться не ощущением, а механизмом защиты смоделированной идентичности, и граница между этими объяснениями пока остаётся открытой.

Мы ранее разбирали MicroMorph — самомодифицирующегося ИИ-агента, который меняет собственный код в процессе выполнения. Это помогает увидеть, как новые внутренние сигналы, включая модели боли и отвержения, могут влиять на траектории развития автономных агентов.