caveman: 동굴 말투로 코딩 에이전트의 토큰 비용 줄이기

Published · AI Daily — AI-assisted deep research, methodology & disclosure

caveman은 코딩 에이전트의 입력과 출력 토큰을 함께 줄이는 오픈소스 도구입니다. 동굴 사람 말투로 짧게 답하게 하는 skill, 로컬에서 도구 출력을 압축하되 원본을 복구할 수 있게 보관하는 proxy, 직접 만든 에이전트용 middleware로 구성됩니다. README의 65% 절감 주장은 홍보 문구입니다. JetBrains의 86개 과제 실험에서 skill만으로 출력 토큰은 8.5% 줄었고, 품질 변화는 측정되지 않았습니다.

배경과 문제 정의

코딩 에이전트는 토큰 단위로 요금을 청구합니다. 모든 토큰에 비용이 붙고, 에이전트는 두 방향으로 돈을 냅니다. 하나는 모델이 쓰는 응답이고, 다른 하나는 모델이 읽는 도구 결과입니다. 도구 결과에는 로그, 테스트 출력, JSON, diff, 검색 결과가 포함됩니다. 두 항목이 모두 청구서에 쌓입니다. caveman 프로젝트는 이 두 방향을 모두 다룹니다. GitHub의 JuliusBrussee가 2026년 4월 농담으로 시작했고, README에 따르면 Hacker News 1위에 올랐으며 현재 저장소 스타는 10만 9천 개를 넘었습니다. 다만 인기가 기법의 효과를 증명하지는 않습니다. 증명하는 것은 측정입니다. 이 글은 그 측정을 다룹니다.

문제는 단순합니다. 대부분의 에이전트는 자기소개서처럼 쓰고 소방호스처럼 읽습니다. 쓰는 쪽은 말투의 문제입니다. 서두, 반복, 형식적인 인사가 덧붙습니다. 읽는 쪽은 배관의 문제입니다. 도구 출력은 날것 그대로이고 장황하며, 현재 질문에 필요 없는 내용이 대부분입니다. README 제목은 토큰을 65% 줄인다고 주장합니다. 이 숫자는 홍보 문구에서 나왔습니다. 실제로 존재하는 측정은 범위가 더 좁고, 그중 하나는 프로젝트 자체가 수행한 것입니다. 이 글은 두 가지를 구분합니다. 섞어서 읽으면 절감 효과를 과대평가하게 됩니다.

핵심 아키텍처와 기술 원리

caveman은 세 개의 구성 요소로 이루어져 있으며, 각각 따로 설치할 수 있습니다. 첫째는 skill입니다. 에이전트에게 동굴 사람 말투로 짧게 답하라고 지시하는 규칙 파일입니다. README에 따르면 Claude Code, Codex, Gemini CLI, Cursor, Windsurf를 포함해 30종이 넘는 에이전트에서 동작합니다. 설치 명령은 `npx skills add JuliusBrussee/caveman -g`입니다. skill은 모델이 쓰는 문장만 바꾸고, 도구 출력은 건드리지 않습니다.

둘째는 proxy입니다. 사용자의 컴퓨터에서 실행되며 에이전트와 모델 제공자 사이에 위치합니다. 요청이 나가기 전에 로그, JSON, diff, 테스트 출력 같은 도구 결과를 압축합니다. 원본은 바이트 단위로 로컬 SQLite에 저장되고 복구용 식별자가 붙습니다. 모델이 전체 원문이 필요하면 `caveman_retrieve` 도구를 호출해 가져옵니다. README에 따르면 proxy는 인증 정보를 변경 없이 전달하므로, 제공자는 요청의 자격 증명을 그대로 받습니다. 셋째는 middleware입니다. 직접 에이전트를 만드는 개발자를 위한 것입니다. LangChain, Vercel AI SDK, OpenAI와 Anthropic 클라이언트의 호출 한 번을 감쌉니다. 큰 도구 결과는 모델이 보기 전에 짧은 사본으로 바뀌고, 대화 기록에는 원본 바이트가 그대로 남습니다. 세 구성 요소의 공통 원칙은 압축이 되돌릴 수 있어야 한다는 것입니다. 줄어든 텍스트는 하나의 보기일 뿐이고, 원본은 식별자를 통해 언제든 다시 열립니다. 이 점이 중요합니다. 휴리스틱이 고른 손실성 요약은 모델에게 필요한 한 줄을 조용히 지울 수 있습니다. 되돌릴 수 있으면 그 조용한 오류가 눈에 보이는 추가 도구 호출로 바뀝니다.

실용성과 검증 결과

숫자는 세 묶음이며, 각각 측정하는 대상이 다르므로 합산하면 안 됩니다. 첫째, JetBrains 실험입니다. 실제 코딩 과제 86개에 대해 Claude Code 2.1.200과 skill만 사용해 짝을 맞춘 A/B 테스트를 했습니다. proxy는 포함되지 않았습니다. 출력 토큰은 8.5% 줄었고, 비용은 약 10% 줄었습니다. 결과가 갈린 18개 과제에 대한 부호 검정 p값은 0.82입니다. 과제당 평균 점수는 기준선 0.326에서 0.311로 바뀌어, 차이는 0.015입니다. 이 데이터만 보면 품질 변화는 측정되지 않았지만, 절감 폭은 작습니다. 둘째, Adobe Research의 CAVEWOMAN 논문입니다. README가 인용합니다. 논문은 출력 측 동굴 말투가 모델에 따라 실제 비용을 1.4배에서 2.4배 줄이고, 최선의 경우 3배까지 줄인다고 보고합니다. 이 수치는 논문의 것이며, 이 글에서 재현하지는 않았습니다. 셋째, 프로젝트 자체의 벤치마크입니다. Claude Code로 54회 실행한 결과, proxy는 여섯 가지 작업군에서 입력 토큰을 33.2% 줄였습니다. 답변 검사 18개는 모두 통과했습니다. 95% 신뢰구간은 14.6%에서 48.5%입니다. 다만 README는 원본 하네스 산출물이 저장소에 없다고 밝힙니다. 따라서 공개 재현이 아니라 고정된 보고서로 읽어야 합니다. 테스트를 프로젝트 작성자가 직접 수행했다는 점도 고려해야 합니다.

추가로 두 가지를 확인하세요. 첫째는 원격 측정입니다. 명령줄 도구는 무작위 설치 ID와 IP 주소를 포함한 사용 통계를 기본으로 전송합니다. `caveman telemetry off`로 끌 수 있습니다. 데이터 규정이 있는 팀은 설치 전에 확인하세요. 둘째는 Headroom, RTK와의 비교입니다. README는 JetBrains 데이터를 인용하며, 낮은 추론 강도에서 RTK가 과제당 중앙값 비용을 7.6% 높인다고 말합니다. 이는 경쟁 도구에 대한 주장이며, 제3자 측정을 옮긴 것입니다. 도입이 맞는 곳은 응답이 일상적이고 도구 출력이 큰 대량 세션입니다. 로그 분류, 테스트 디버깅, 저장소 탐색이 해당합니다. 반면 표현이 법적, 안전적, 제품적으로 무게를 가질 때는 맞지 않습니다. README도 이를 인정합니다. 보안 경고와 확인 질문은 완전한 문장으로 돌아옵니다. 짧은 답이 더 안전하다고 가정하면 안 됩니다. 실무 방법은 도입 전에 측정하는 것입니다. `caveman trial` 명령은 caveman을 켠 세션과 끈 세션을 실행해 차이를 보여 줍니다. 다른 코드베이스에서 얻은 백분율은 여러분의 작업에 대해 거의 말해 주지 않습니다.

업계 영향과 전망

caveman이 바꾼 것은 기법보다 대화의 초점입니다. 청구 구조의 사실을 눈에 보이게 만들었습니다. 팀은 읽는 텍스트이기 때문에 출력 토큰을 주로 봅니다. 이 프로젝트는 읽기 쪽이 보통 청구서의 더 큰 부분이며, proxy가 바로 그 부분을 겨냥한다는 점을 상기시킵니다. 농담이 진지한 공학 아이디어를 담을 수 있다는 사례이기도 합니다. 말투는 장난스럽지만, 그 아래 메커니즘은 모델과 도구 사이의 되돌릴 수 있는 압축 계층입니다. 이 계층은 caveman만의 것이 아니며, Headroom이나 RTK 같은 프로젝트도 비슷한 방향을 탐색합니다.

실무자에게 세 가지 교훈이 있습니다. 첫째, 백분율을 믿기 전에 자신의 작업량을 측정하십시오. 둘째, 압축을 되돌릴 수 있게 유지하십시오. 되돌릴 수 없는 손실 절단은 모델의 판단을 영구적인 손실로 바꿉니다. 셋째, 비용과 함께 품질을 추적하십시오. 답변을 나쁘게 만드는 절감은 절감이 아닙니다. 남은 질문은 읽기 쪽 압축이 더 긴 세션, 더 많은 도구, 더 큰 코드베이스에서도 유지되느냐는 것입니다. 현재 공개된 자료는 짧은 코딩 과제와 프로젝트 자체의 벤치마크에 한정됩니다. 이 질문에는 아직 답하지 못합니다. proxy 결과에 대한 독립적인 재현이 가장 유용한 다음 단계입니다. 3.0.0 버전부터 저장소 전체에 적용되는 Apache-2.0 라이선스 덕분에 재현은 법적으로도 쉽습니다.

Sources

FAQ

JetBrains 실험에서 품질은 어떻게 나왔나요?

측정 가능한 품질 저하는 없었습니다. 결과가 갈린 18개 과제의 부호 검정 p값은 0.82이고, 평균 점수는 0.326에서 0.311로 바뀌었습니다.

README의 33.2% 절감은 독립적으로 재현됐나요?

아닙니다. README는 원본 하네스 산출물이 저장소에 없다고 밝히며, 이를 공개 재현이 아닌 고정된 보고서로 규정합니다.