Skip to main content
RAGбезопасность ИИAI automation

Salienz-Induktion bricht RAG leiser als Prompt-Injektion

Ein neuer arXiv-Artikel stellt die Salienz-Induktion vor, einen Angriff auf Multi-Hop-RAG-Agenten, der die Betonung in wahrheitsgemäßem Text verschiebt, ohne Falschinformationen oder Prompt-Injektion. Dies verursacht Fehlbindungen, macht traditionelle Abwehr unzureichend und erfordert neue Schutzmaßnahmen. Ein ernstes Problem für KI-Automatisierung, das rasche Anpassungen verlangt.

Technischer Kontext

Ich mag solche Angriffe besonders: äußerlich passiert nichts „Bösartiges“, und doch gerät der Agent auf Abwege. In dieser Arbeit zeigen die Autoren einen neuen Vektor gegen Multi-Hop-RAG, bei dem nicht Fakten, sondern die Salienz gebrochen werden. Für alle, die KI-Automatisierung und KI-Integration mit Dokumentensuche aufbauen, ist das eine sehr unangenehme Fehlerklasse.

Das Prinzip ist einfach und heimtückisch. Der Text bleibt faktisch wahrheitsgemäß, aber Reihenfolge, Betonung, Nähe der Fragmente, Formulierungen und Rahmung werden so verändert, dass das Modell bei der mehrschrittigen Schlussfolgerung die falschen Attribute verknüpft. Man zielt also nicht auf Wahrhaftigkeit, sondern auf Salienz, und viele Pipelines sind dafür völlig blind.

Ich habe die angebliche Mechanik geprüft: Die Autoren schlagen sechs Klassen von Salienz-Bearbeitung und eine iterative Proposer-Verifier-Pipeline mit Einschränkungen für Wahrhaftigkeit und Heimlichkeit vor. Das ist kein „schmutziger“ Prompt-Injektionsangriff mehr, den man mit Anweisungsfiltern abfangen kann. Hier liest der Agent normalen Text und begeht eigene Fehler bei der Entitätsbindung.

Die Zahlen sind ebenfalls unangenehm. Mit einem Bearbeitungsbudget von 30 % erreichen sie eine Angriffserfolgsrate von 83,3 % über mehrere Modellfamilien hinweg, darunter GPT, Claude, Gemini, DeepSeek und Qwen, sowie bei ReAct-, Reflexion- und Tool-Calling-Agenten. Am bezeichnendsten für mich: Die stärkste Basisverteidigung hinterlässt immer noch eine Post-Defense-ASR von 75,7 %.

Besonders fasziniert hat mich die Salienz-Normalisierungsabwehr. Sie ist eingabeseitig, kann also ohne vollständige Überarbeitung der KI-Architektur integriert werden, und reduziert die ASR im Artikel auf 15,3 %, bei adaptiven Angriffen auf 23,6 %. Wenn sich diese Ergebnisse in der Praxis bestätigen, ist das keine akademische Kleinigkeit mehr, sondern eine durchaus anwendbare Verteidigungsschicht.

Was das für Unternehmen und Automatisierung bedeutet

Erstens: „Wahrhaftiger Kontext“ ist nicht länger gleichbedeutend mit „sicherem Kontext“. Wenn Ihr RAG-Agent Antworten aus CRM, Wissensdatenbanken, Tickets und externen Quellen zusammenstellt, reicht die Prüfung auf falsche Fakten und Anweisungen nicht mehr aus.

Zweitens: Besonders gefährdet sind mehrschrittige Szenarien. Je komplexer der Agent Entitäten über Dokumente hinweg verknüpft, desto höher ist die Wahrscheinlichkeit eines stillen Fehlers, der überzeugend wirkt. Für Support, Compliance, Analytik und interne Copilots schmerzt das mehr als gewöhnliches Retrieval-Rauschen.

Ich würde jetzt bereits die Normalisierung der Kontextdarstellung, Misbinding-Tests und Red-Team-Sets nicht nur für Injektion, sondern auch für Salienz-Manipulation in die Pipeline aufnehmen. Bei Nahornyi AI Lab lösen wir solche Dinge für Kunden auf Ebene der KI-Lösungsentwicklung: Wir schließen RAG nicht einfach nur an, sondern prüfen, wo ein Agent ohne eine einzige falsche Zeile in die Irre geführt werden kann.

Wenn bei Ihnen bereits ein Retrieval-Agent läuft und die Antworten manchmal „irgendwie logisch, aber gelegentlich seltsam“ erscheinen, würde ich das nicht dem Zufall zuschreiben. Gemeinsam mit Vadym Nahornyi und Nahornyi AI Lab können Sie schnell Ihre Kontextpipeline analysieren und einen Schutz für echte KI-Automatisierung aufbauen, bevor ein so leiser Angriff zu einem teuren Systemfehler wird.

Wir haben bereits untersucht, wie Unicode-Homoglyphen für Phishing und die Ausführung schädlicher Befehle über KI-Agenten genutzt werden. Dieser Angriffsvektor korrespondiert mit der Salienz-Induktion, die Multi-Hop-RAG-Ketten bricht.

Diesen Artikel teilen