KaliBench: Kali Linux 보안 도구 활용을 위한 정밀 평가 벤치마크

Published · AI Daily — AI-assisted deep research, methodology & disclosure

KaliBench는 Kali Linux 보안 도구를 대상으로 한 최초의 정밀 자연어-CLI 명령 변환 벤치마크로, 1642개 도구, 23개 역량 차원, 5개 보안 단계에 걸친 8504개의 질의-명령 쌍으로 구성된다. 매뉴얼 기반 구축 파이프라인과 결정론적 정규화, 별칭 인식 평가를 적용했으며, LLM 검증, 샌드박스 실행, 인간 검토의 3단계 파이프라인으로 정확성과 실행 가능성을 보증한다. 도구 힌트가 없는 설정에서 오픈웨이트 모델의 정확 명령 정확도는 42%를 넘지 못했지만, KaliBench 기반 검증 가능한 보상으로 지도 미세조정과 강화학습을 거친 8B 모델은 685B MoE 모델에 근접하는 성능에 도달했다.

배경과 문제 정의

대규모 언어 모델은 보안 분석 업무에 점점 더 깊이 통합되어, 분석가의 자연어 의도를 실제 도구 호출로 번역하는 역할을 맡고 있다. 그러나 이 역할을 평가하는 기존 방식은 두 극단에 머물러 있었다. 한쪽은 지식 기반 평가로, 모델이 특정 도구나 개념을 인식하는지만 묻는 선다형 시험에 가깝다. 다른 쪽은 엔드투엔드 에이전트 평가로, 최종적으로 플래그를 획득했는지 목표를 달성했는지만 보고 중간의 모든 개별 명령어는 완전히 불투명한 블랙박스로 남겨둔다. 두 극단 모두 실제 보안운영센터에서 LLM이 유용한지를 결정짓는 핵심 능력, 즉 한 줄의 자연어 요청을 실행 가능한 명령줄로 안정적이고 정확하게 변환하는 능력을 측정하지 못한다.

이 변환 능력은 보기보다 훨씬 어렵다. 보안 도구의 CLI는 극도로 엄격한 구문에 의존하기 때문이다. 인자 순서가 뒤바뀌거나, 플래그가 잘못된 값에 묶이거나, 하위 명령이 오기되면 단순히 경고가 뜨는 것이 아니라 완전히 다른 작업이 조용히 실행될 수 있으며, 실제 침투 테스트나 레드팀 훈련에서는 이것이 깨끗한 결과와 치명적인 오작동 사이의 차이를 만든다. KaliBench는 바로 이 오랫동안 간과된 중간 계층을 정확히 겨냥한다. 모델이 도구의 매뉴얼을 외웠는지, 전체 공격 체인이 결국 성공했는지를 묻지 않고, 개별 명령어 단위에서 자연어-CLI 번역 능력 자체를 분리해 측정한다.

핵심 아키텍처와 기술 원리

데이터셋은 1642개의 실제 Kali Linux 도구에 걸친 8504개의 질의-명령 쌍으로 구성되며, 23개의 역량 차원과 정찰부터 침투 후 활동까지의 5개 정형화된 보안 단계로 분류된다. 구축은 매뉴얼 기반 파이프라인을 따른다. 프롬프트를 수작업으로 작성하는 대신, 각 도구의 공식 문서에 데이터셋을 고정시킨 뒤, 구문적으로 유효한 모든 명령 변형을 하나의 정규화된 형태로 매핑하는 결정론적 정규화 과정을 거친다. 여기에 별칭 인식 평가가 더해져, 모델이 동등한 축약 플래그나 의미적으로 동일한 대체 인자를 사용해도 표면적인 문자열 불일치로 부당하게 오답 처리되지 않는다.

더 결정적인 설계는 3단계 검증 파이프라인이다. 1단계는 LLM 기반 검증으로 의미적 타당성을 걸러낸다. 2단계는 후보 명령을 실제 샌드박스 터미널 환경에서 실행하여 실제 런타임 피드백으로 명령이 그럴듯할 뿐만 아니라 실제로 실행 가능한지 확인한다. 3단계는 자동화 단계가 놓친 경계 사례를 바로잡기 위한 인간 검토를 도입한다. 이 조합을 통해 KaliBench는 의미적 정확성과 실무적 실행 가능성이라는 이중 보증을 동시에 확보하며, 단일 단계의 LLM 판정 벤치마크는 일반적으로 주장할 수 없는 신뢰성을 갖춘다.

실용성과 검증 결과

연구팀은 3가지 평가 모드와 24가지 모델 구성에 걸쳐 범용 모델과 보안 특화 오픈웨이트 모델을 체계적으로 테스트했다. 결과는 냉정했다. 도구 힌트를 제공하지 않는 무제한 설정에서, 어떤 오픈웨이트 모델도 정확 명령 일치 정확도 42%를 넘지 못했다. 현재 가장 강력한 오픈 모델조차도 LLM이 자율적으로 행동할 경우 실제 보안 운영이 요구하는 신뢰 수준에는 한참 미치지 못한다.

KaliBench의 두 번째 공헌은 이 진단적 신호를 학습 자산으로 전환한 것이다. 검증 파이프라인이 결정론적이고 런타임에 독립적인 보상을 생성하기 때문에, 매 학습 단계마다 실제 샌드박스를 재실행하지 않고도 강화학습에 직접 재사용할 수 있으며, 그렇지 않았다면 대규모 강화학습은 비용 면에서 감당하기 어려웠을 것이다. 논문은 KaliBench에서 도출된 이러한 검증 가능한 보상을 이용한 지도 미세조정과 강화학습의 결합이 80억 파라미터 모델을 6850억 파라미터 혼합전문가 모델과 비교할 만한 성능 수준으로 끌어올린다는 것을 보여준다.

산업적 영향과 전망

LLM이 직접 도구 호출을 주도하도록 할지 고민하는 보안팀에게 42%라는 상한선은 명확한 경고다. 침투 테스트 도구에 대한 자율적 명령 생성은 아직 감독 없이 운영될 만큼 신뢰할 수 없으며, 오늘날 구축되는 어떤 프로덕션 파이프라인도 인간 또는 결정론적 검증 계층을 루프에 포함해야 한다. 런타임이 필요 없는 검증 가능한 보상이라는 설계 자체는 이 특정 벤치마크를 넘어서는 재사용 가능한 패턴이기도 하다.

앞으로 KaliBench처럼 역량 차원별로 세분화된 벤치마크가 보안 에이전트 평가의 표준이 될 가능성이 높다. "뚫었는가 아닌가"라는 모호한 서사에서 벗어나, 정확히 어떤 역량 차원과 어떤 보안 단계에서 여전히 부족한지를 정밀하게 진단하는 방향으로 논의를 옮기며, 실제 보안 운영에 LLM을 배치하는 데 있어 업계에 실질적으로 측정 가능한 진행 지표를 제공할 것이다.

Sources

FAQ

KaliBench 데이터셋의 규모와 범위는 어떻게 되는가?

KaliBench는 1642개의 Kali Linux 도구에 걸친 8504개의 질의-명령 쌍을 포함하며, 23개 역량 차원과 정찰부터 침투 후 활동까지 5개 보안 단계로 구성된다.

오픈웨이트 모델이 달성한 최고 정확 명령 정확도는?

도구 힌트가 없는 무제한 설정의 24개 모델 구성 중 어떤 오픈웨이트 모델도 정확 명령 정확도 42%를 넘지 못했다.

KaliBench는 평가뿐 아니라 학습에 어떻게 활용되는가?

LLM 검증, 샌드박스 실행, 인간 검토의 3단계 검증 파이프라인이 결정론적이고 런타임 독립적인 검증 가능한 보상을 생성하여 SFT와 RL에 직접 사용되며, 8B 모델을 685B MoE 모델에 근접한 성능으로 끌어올렸다.