Технический контекст
Я как раз люблю такие атаки: внешне ничего «злого» не происходит, а агент все равно уезжает не туда. В этой работе авторы показывают новый вектор против multi-hop RAG, где ломают не факты, а значимость. Для тех, кто строит AI automation и AI integration с поиском по документам, это очень неприятный класс ошибок.
Суть простая и коварная. Текст остается фактически правдивым, но в нем меняют порядок, акценты, близость фрагментов, формулировки и рамку подачи так, чтобы модель связала не те атрибуты на многошаговом рассуждении. То есть бьют не по truthfulness, а по salience, и вот тут многие пайплайны вообще слепы.
Я посмотрел на заявленную механику: у авторов шесть классов salience-редактирования и итеративный proposer-verifier pipeline с ограничениями на правдивость и скрытность. Это уже не «грязный» prompt injection, который можно ловить фильтрами по инструкциям. Здесь агент читает нормальный текст и сам ошибается в связывании сущностей.
По цифрам работа тоже неприятная. При бюджете редактирования 30% они получают 83,3% attack success rate на нескольких семействах моделей, включая GPT, Claude, Gemini, DeepSeek и Qwen, а также на ReAct, Reflexion и tool-calling агентах. Самое показательное для меня: сильнейшая базовая защита все еще оставляет 75,7% post-defense ASR.
Отдельно зацепила защита Salience Normalization. Она input-side, то есть ее можно встраивать без полной перестройки AI architecture, и в статье снижает ASR до 15,3%, а под adaptive attack до 23,6%. Если эти результаты подтвердятся в практике, это уже не академическая мелочь, а вполне прикладной слой защиты.
Что это меняет для бизнеса и автоматизации
Первое: «правдивый контекст» больше не равен «безопасный контекст». Если у вас RAG-агент собирает ответы из CRM, базы знаний, тикетов и внешних источников, то одной проверки на ложные факты и инструкции уже мало.
Второе: под ударом именно многошаговые сценарии. Чем сложнее агент связывает сущности между документами, тем выше шанс тихой ошибки, которая выглядит убедительно. Для саппорта, комплаенса, аналитики и внутренних copilots это больнее, чем обычный шум retrieval.
Я бы уже сейчас добавлял в пайплайн нормализацию представления контекста, тесты на misbinding и red-team наборы не только с injection, но и с salience-манипуляцией. Мы в Nahornyi AI Lab решаем такие вещи для клиентов на уровне AI solution development: не просто подключаем RAG, а проверяем, где агент можно увести без единой ложной строки.
Если у вас уже крутится retrieval-агент и ответы выглядят «вроде логично, но иногда странно», я бы не списывал это на случайность. Можно вместе с Vadym Nahornyi и Nahornyi AI Lab быстро разобрать ваш контекстный пайплайн и собрать защиту под реальную AI automation, пока такая тихая атака не превратилась в дорогую системную ошибку.