KaliBench:Kali Linuxのセキュリティツール操作を測る高精度ベンチマーク

Published · AI Daily — AI-assisted deep research, methodology & disclosure

KaliBenchは、Kali Linux上のセキュリティツールを対象とした初の細粒度な自然言語→CLIコマンド変換ベンチマークであり、1642種のツール、23の能力次元、5つのセキュリティフェーズにわたる8504件のクエリ・コマンド対で構成される。マニュアルに基づく構築パイプラインと決定論的正規化、別名対応評価を採用し、LLM検証・サンドボックス実行・人手レビューの三段階で正確性と実行可能性を保証する。ツールヒントなしの設定では、オープンウェイトモデルの厳密コマンド精度は42%を超えず、KaliBench由来の検証可能な報酬による教師ありファインチューニングと強化学習により、8Bモデルが685BのMoEモデルに匹敵する性能へ到達することが示された。

背景と課題の所在

大規模言語モデルはセキュリティ分析業務にますます組み込まれ、アナリストの自然言語による意図を実際のツール呼び出しへ翻訳する役割を担うようになっている。しかし、この役割を測る評価手法は長らく二極化していた。一方は知識偏重の選択式評価で、モデルがあるツールや概念を「知っているか」だけを問う。他方はエンドツーエンドのエージェント評価で、最終的にフラグを取得できたか、目的を達成できたかという結果だけを見て、途中の個々のコマンドが正しかったかどうかを完全に不透明なまま残してしまう。どちらの手法も、実運用で最も重要な中間能力、すなわち一文の意図を実行可能なコマンドラインへ安定して正確に変換できるかという点を測っていない。

この変換能力の難しさは見過ごされがちである。セキュリティツールのCLIは極めて厳格で、引数の順序の入れ替わり、フラグと値の誤った結び付け、サブコマンドの誤記一つで、コマンドはエラー終了するか、さらに悪い場合は全く別の操作として静かに実行されてしまう。実際のペネトレーションテストやレッドチーム演習では、これが誤検知や破壊的な誤操作につながりかねない。KaliBenchはまさにこの見過ごされてきた中間層を狙い撃ちしたベンチマークであり、ツールのマニュアルを記憶しているかではなく、個々のコマンド単位で自然言語からCLIへの翻訳能力そのものを測定する。

コアアーキテクチャと技術原理

データセットは1642種類の実在するKali Linuxツールにわたる8504件のクエリ・コマンド対で構成され、23の能力次元と偵察から侵入後活動までの5つのセキュリティフェーズに分類されている。構築はマニュアル駆動型パイプラインに従い、人手で問答を作文するのではなく各ツールの公式ドキュメントを基盤として、構文的に有効なあらゆる表記を一つの正規形へ写す決定論的正規化処理を経る。これに加えて別名対応評価を併用することで、モデルが等価な短縮フラグや別表現の引数を使った場合でも、文字列の表層的な不一致で不当に不正解とされることがない。

より重要な設計は三段階の検証パイプラインである。第一段階はLLMによる検証で意味的な妥当性を篩い分ける。第二段階ではサンドボックス化された実際のターミナル環境で候補コマンドを実行し、実行時フィードバックによって真に実行可能かどうかを確認する。第三段階は人間によるレビューを介し、自動化処理が見逃した境界事例を補正する。この組み合わせにより、意味的正確性と実務上の実行可能性という二つの保証を同時に持つ評価基盤が実現されている。

実用性と検証結果

研究チームは3つの評価モードと24のモデル構成にわたり、汎用モデルとセキュリティ特化型のオープンウェイトモデルを体系的に検証した。結果は厳しいものだった。ツールのヒントを与えない無制限設定では、どのオープンウェイトモデルも厳密コマンド一致精度で42%を超えなかった。現時点で最も強力なオープンモデルであっても、実際のセキュリティ運用現場で自律的にツールを呼び出すには到底信頼できる水準に達していない。

KaliBenchのもう一つの貢献は、この診断的な信号を学習資産へ転換した点にある。検証パイプラインが決定論的かつランタイムに依存しない報酬を生成するため、強化学習の各ステップでサンドボックスを再実行するコストを払わずに済む。論文では、KaliBenchから得られるこの検証可能な報酬を用いた教師ありファインチューニングと強化学習を組み合わせることで、わずか8Bパラメータのモデルが685BパラメータのMoEモデルに匹敵する性能に到達することを示している。

業界への影響と今後の展望

LLMに直接ツール呼び出しを任せるべきかどうかを検討しているセキュリティチームにとって、42%という上限は明確な警告である。ペネトレーションテストツールの自律的なコマンド生成は、まだ監督なしで運用できる信頼性には達しておらず、今日構築する本番パイプラインには人間または決定論的な検証層を組み込む必要がある。ランタイム不要の検証可能な報酬という設計は、この特定のベンチマークを超えて再利用可能なパターンでもある。

今後、KaliBenchのような能力次元ごとに細分化されたベンチマークが、セキュリティエージェント評価の標準となっていく可能性が高い。「突破できたかどうか」という曖昧な物語から、「どの能力次元、どのセキュリティフェーズでまだ不足しているのか」という精密な診断へと議論の軸を移し、実運用へのLLM導入における実測可能な進捗指標を業界に提供するだろう。

Sources

FAQ

KaliBenchデータセットの規模と対象範囲は?

KaliBenchは1642種のKali Linuxツールにわたる8504件のクエリ・コマンド対を含み、23の能力次元と偵察から侵入後活動までの5つのセキュリティフェーズに分類されている。

オープンウェイトモデルの最高精度はどの程度か?

ツールヒントなしの無制限設定における24のモデル構成のうち、厳密コマンド一致精度で42%を超えたオープンウェイトモデルは一つもなかった。

KaliBenchは評価だけでなく訓練にどう使われるのか?

LLM検証・サンドボックス実行・人手レビューの三段階検証パイプラインが決定論的かつランタイム不要の検証可能な報酬を生成し、SFTとRLに直接利用することで8Bモデルが685BのMoEモデルに匹敵する性能に達した。