
Analysiert interne Zustände von LLMs und 100+ Aufmerksamkeits-/Wahrscheinlichkeitsmerkmale, um Klassifikatoren zu trainieren, die Dokumentenvergiftungsangriffe in RAG-Systemen erkennen.
Analysiert interne Zustände von LLMs und 100+ Aufmerksamkeits-/Wahrscheinlichkeitsmerkmale, um Klassifikatoren zu trainieren, die Dokumentenvergiftungsangriffe in RAG-Systemen erkennen.
Mehr lesen…