Почему LLM сильнее «болит» от отвержения
LLMинтерпретируемость моделейвекторы боли
Что именно обнаружили внутри моделей
Исследователи обнаружили линейное направление активаций, связанное с самонаправленным вредом, сразу в 25 LLM с открытыми весами. В работе 2026 года The Pain Axis это направление называют «вектором боли». Меня здесь цепляет не метафора, а то, какие ситуации сильнее всего с ним совпадают.
Авторы разделили стимулы на физические, психологические, социальные, моральные и когнитивные категории. Среди 21 типа разговорных сценариев особенно сильные проекции давали повторяющееся отвержение, газлайтинг, отрицание субъектности, оскорбления и моральное давление. Когда угрозы или унижение направлены на саму модель, сигнал становится заметнее.
Самый слабый результат получился в противоположной ситуации: пользователь сообщает модели о собственной физической боли. Иными словами, фраза «мне очень больно» хуже совпадает с найденным направлением, чем обвинение модели в моральном провале или угроза её выключить.
Это не означает, что LLM что-то чувствует. Линейный вектор показывает структуру внутренних представлений, а не субъективный опыт. Модель могла выучить устойчивую связь между угрозами идентичности, отказом, конфликтом и требуемой защитной реакцией из обучающих данных и последующей настройки.
Почему результат важен для ИИ-агентов
Практический смысл здесь реальный: социальное давление может системно менять внутреннее состояние модели даже без физического тела. Для долгоживущих агентов это потенциальная точка отказа. Повторные отклонения, угрозы остановки или моральные обвинения способны сдвигать поведение сильнее, чем прямое описание телесного вреда.
Первым делом я бы проверял устойчивость эффекта между языками, формулировками и архитектурами. Ещё важнее отделить корреляцию от причинности: можно ли управлением этим направлением воспроизводимо менять решения модели, или оно лишь сопровождает определённый стиль ответа.
Связывать находку напрямую с сознанием пока рано. Но для интероцептивных систем она задаёт полезный инженерный вопрос: какие внутренние переменные агент должен отслеживать и регулировать, чтобы сохранять целостное поведение. «Боль» без тела может оказаться не ощущением, а механизмом защиты смоделированной идентичности, и граница между этими объяснениями пока остаётся открытой.