KaliBench: Ein feingranulares Benchmark für Cybersicherheits-Tools unter Kali Linux
KaliBench ist das erste feingranulare Benchmark für die Übersetzung natürlicher Sprache in CLI-Befehle für Sicherheitswerkzeuge unter Kali Linux, mit 8.504 Abfrage-Befehl-Paaren über 1.642 Tools, 23 Fähigkeitsdimensionen und 5 Sicherheitsphasen. Es entsteht durch eine handbuchgestützte Pipeline mit deterministischer Kanonisierung und alias-bewusster Bewertung und wird über LLM-Validierung, Sandbox-Ausführung und menschliche Prüfung verifiziert. Ohne Tool-Hinweise erreicht kein offenes Modell mehr als 42% exakte Befehlsgenauigkeit, doch verifizierbare Belohnungen aus KaliBench heben ein 8B-Modell per SFT und RL auf das Niveau eines 685B-MoE-Modells.
Hintergrund und Problemstellung
Große Sprachmodelle werden zunehmend in Cybersicherheits-Workflows eingebettet, wo sie als Übersetzungsschicht zwischen der in natürlicher Sprache ausgedrückten Absicht eines Analysten und dem tatsächlich erforderlichen Tool-Aufruf fungieren. Die bisherige Bewertungslandschaft für diese Rolle blieb jedoch an zwei Extremen stecken. Auf der einen Seite stehen wissensbasierte Tests, die lediglich prüfen, ob ein Modell ein Tool oder Konzept erkennt, ohne direkten Bezug zur tatsächlichen operativen Kompetenz. Auf der anderen Seite stehen End-to-End-Agenten-Bewertungen, die den Erfolg allein daran bemessen, ob eine Flagge erfasst oder ein Ziel erreicht wurde, wodurch jeder Zwischenbefehl in einer völlig undurchsichtigen Blackbox verschwindet. Keines der beiden Extreme misst jene Fähigkeit, die tatsächlich entscheidet, ob ein LLM in einem realen Security Operations Center nützlich ist: die Fähigkeit, eine einzeilige Anfrage in natürlicher Sprache zuverlässig in eine ausführbare Befehlszeile zu übersetzen.
Diese Fähigkeit ist schwieriger, als sie erscheint, gerade weil Cybersicherheits-Werkzeuge von einer strikten CLI-Syntax leben und sterben. Ein vertauschtes Argument, ein falsch zugeordneter Wert zu einem Flag oder ein fehlplatziertes Unterkommando erzeugt nicht nur eine Warnung, sondern kann stillschweigend eine völlig andere Operation ausführen, was bei einem echten Penetrationstest oder Red-Team-Einsatz den Unterschied zwischen einem saubereren Befund und einer schädlichen Fehlhandlung ausmacht. KaliBench zielt genau auf diese vernachlässigte mittlere Schicht: Es fragt nicht, ob ein Modell das Handbuch eines Tools memoriert hat, noch ob eine gesamte Angriffskette letztlich erfolgreich ist. Es isoliert und misst die Übersetzung von natürlicher Sprache in CLI selbst, auf der Granularität einzelner Befehle.
Architektonischer Kern und technische Prinzipien
Der Datensatz umfasst 8.504 Abfrage-Befehl-Paare über 1.642 reale Kali-Linux-Tools, organisiert in 23 Fähigkeitsdimensionen und den 5 kanonischen Sicherheitsphasen von der Aufklärung bis zur Post-Exploitation. Der Aufbau folgt einer handbuchgestützten Pipeline: Statt Prompts manuell zu verfassen, verankert sich der Datensatz in der offiziellen Dokumentation jedes Tools und durchläuft dann eine deterministische Kanonisierung, die jede syntaktisch gültige Variante eines Befehls auf eine einzige normalisierte Form abbildet. Dies wird durch eine alias-bewusste Bewertung ergänzt, sodass ein Modell, das ein gleichwertiges Kurz-Flag oder ein alternatives, aber semantisch identisches Argument verwendet, korrekt bewertet wird, statt für eine bloße oberflächliche Zeichenkettenabweichung abgestraft zu werden.
Die folgenreichere Designentscheidung ist die dreistufige Verifikationspipeline. Stufe eins wendet eine LLM-basierte Validierung an, um semantische Plausibilität zu filtern. Stufe zwei führt Kandidatenbefehle tatsächlich in einem sandboxed Terminal aus und erfasst echtes Laufzeit-Feedback, um zu bestätigen, dass der Befehl nicht nur plausibel, sondern tatsächlich ausführbar ist. Stufe drei bringt eine menschliche Überprüfung ein, um Grenzfälle zu korrigieren, die die automatisierten Stufen übersehen. Zusammen verleiht dies KaliBench eine doppelte Garantie, semantische Korrektheit und praktische Ausführbarkeit, die rein LLM-bewertete Benchmarks in einer einzigen Stufe typischerweise nicht beanspruchen können.
Praktische Evaluation und Anwendungen
Die Autoren testeten 24 Modellkonfigurationen über drei Evaluationsmodi hinweg, sowohl allgemeine als auch sicherheitsspezialisierte offene Modelle umfassend. Das Hauptergebnis ist ernüchternd: In der uneingeschränkten Einstellung, ohne explizite Tool-Hinweise, überschritt kein einziges offenes Modell 42% exakte Befehlsgenauigkeit. Selbst die derzeit stärksten verfügbaren offenen Modelle bleiben weit von der Zuverlässigkeit entfernt, die eine Produktions-Sicherheitsoperation erfordern würde, wenn das LLM autonom handeln sollte.
Der zweite Beitrag von KaliBench besteht darin, dieses diagnostische Signal in ein Trainingsgut zu verwandeln. Da die Verifikationspipeline deterministische, laufzeitunabhängige Belohnungen liefert, können diese direkt für Reinforcement Learning wiederverwendet werden, ohne bei jedem Trainingsschritt eine echte Sandbox erneut auszuführen, was RL sonst in großem Maßstab unerschwinglich teuer machen würde. Die Arbeit zeigt, dass überwachtes Fine-Tuning gefolgt von Reinforcement Learning mit diesen aus KaliBench abgeleiteten verifizierbaren Belohnungen ein Modell mit 8 Milliarden Parametern auf ein Leistungsniveau hebt, das mit einem Mixture-of-Experts-Modell mit 685 Milliarden Parametern vergleichbar ist.
Branchenwirkung und Ausblick
Für Sicherheitsteams, die abwägen, ob sie ein LLM direkt Tool-Aufrufe steuern lassen sollen, ist die 42%-Obergrenze eine klare Warnung: Die autonome Befehlsgenerierung für Penetrationstest-Tools ist noch nicht zuverlässig genug, um unbeaufsichtigt zu laufen, und jede heute aufgebaute Produktionspipeline benötigt eine menschliche oder deterministische Verifikationsschicht im Kreislauf. Das Design laufzeitfreier, verifizierbarer Belohnungen ist selbst ein wiederverwendbares Muster über dieses spezifische Benchmark hinaus.
Mit Blick auf die Zukunft werden feingranulare, nach Fähigkeitsdimensionen indizierte Benchmarks wie KaliBench wahrscheinlich zum Standard für die Bewertung von Sicherheitsagenten, wodurch sich die Debatte von vagen Erzählungen wie „wurde die Box geknackt" hin zu einer präzisen Diagnose verschiebt, in welcher Fähigkeitsdimension und welcher Sicherheitsphase noch Lücken bestehen, und der Branche damit einen tatsächlich messbaren Fortschrittsindikator für den Einsatz von LLMs in realen Sicherheitsoperationen liefert.
Sources
FAQ
Wie groß ist der KaliBench-Datensatz und was deckt er ab?
KaliBench enthält 8.504 Abfrage-Befehl-Paare über 1.642 Kali-Linux-Tools, gegliedert in 23 Fähigkeitsdimensionen und 5 Sicherheitsphasen von der Aufklärung bis zur Post-Exploitation.
Welche beste exakte Befehlsgenauigkeit erreichen offene Modelle?
Über 24 Modellkonfigurationen in der uneingeschränkten Einstellung ohne Tool-Hinweise überschritt kein offenes Modell 42% exakte Befehlsgenauigkeit.
Wie ermöglicht KaliBench Training und nicht nur Evaluation?
Die dreistufige Verifikationspipeline (LLM-Validierung, Sandbox-Ausführung, menschliche Prüfung) erzeugt deterministische, laufzeitunabhängige verifizierbare Belohnungen, die direkt für SFT und RL nutzbar sind und ein 8B-Modell auf das Niveau eines 685B-MoE-Modells heben.