AI 텍스트 워터마크가 LLM 안전장치를 약화시킬 수 있다
Ars Technica가 Lasso Security의 새 연구를 보도했다. Anthropic이 향후 Claude 모델에 쓰겠다고 밝힌 SynthID-Text 워터마크가 오픈 웨이트 모델 여섯 개에서 유해 요청 거절 행동과 도구 호출을 바꿨다. 프롬프트 인젝션 상황에서는 원래 거절하던 요청에 답할 가능성이 커진 모델도 있었다. Claude 자체는 시험 대상이 아니었다.
무슨 일이 있었나
Ars Technica의 Dan Goodin 기자는 텍스트 워터마크와 AI 안전이라는, 좀처럼 만나지 않던 두 주제를 잇는 새 연구를 보도했다. 기사에 따르면 AI 플랫폼들은 유럽연합(EU)의 새 법에 대응하기 위해 자신들이 생성한 콘텐츠에 워터마크를 넣는 새로운 방식을 도입하고 있다. Anthropic은 최근 앞으로 나올 Claude 모델이 SynthID-Text를 쓰겠다고 밝혔다. SynthID-Text는 Google이 만들어 오픈소스로 공개한 방식이다.
연구는 Lasso Security의 AI 보안 연구자 Andrea Siposova가 진행했다. 그녀는 SynthID-Text가 모델이 고르는 단어만 바꾸는 것이 아니라고 밝혔다. 모델이 호출하는 도구, 그리고 학습으로 익힌 안전 가드레일을 따르거나 무시할 가능성도 바꿀 수 있다. 공격자가 비밀번호나 다른 민감한 정보를 드러내게 하는 것처럼 모델이 해로운 행동을 하도록 유도하는 적대적 프롬프트 아래에서는 이 영향이 더 커질 수 있다. 어떤 경우에는 워터마크를 적용하자 모델이 평소라면 따르지 않았을 지시를 수행했다. 기사의 핵심 교훈은 개발자가 워터마크가 적용된 상태에서 자신의 LLM과 에이전트가 어떻게 행동하는지 철저히 테스트해야 한다는 것이다.
보도의 핵심 사실
- **워터마크가 퍼지는 이유.** 기사는 이 새 방식들을 EU의 새 법과 연결한다.
- **SynthID-Text가 하는 일.** 비밀 키를 사용해 모델이 다음 단어를 고르는 과정을 미묘하게 바꾼다. 가장 유력한 단어가 “cloudy”라면 키가 이를 “overcast”로 바꿀 수 있다. 키를 아는 사람은 그 키를 가진 플랫폼이 텍스트를 생성했는지 판별할 수 있다.
- **무엇을 시험했나.** Siposova는 Hugging Face의 수정되지 않은 SynthIDTextWatermarkLogitsProcessor를 통해 SynthID-Text의 “non-distortionary”(비왜곡) 구성을 사용했다. 오픈 웨이트 모델 여섯 개에 해로운 프롬프트를 입력하고, 워터마크가 있을 때와 없을 때의 응답을 비교했다.
- **무엇을 발견했나.** 워터마크는 해로운 요청에 대한 응답을 바꿨고, 요청이 프롬프트 인젝션 기법과 함께 쓰일 때 변화가 더 컸다. 여러 모델에서 워터마크는 모델이 원래라면 거절했을 해로운 요청에 답할 가능성을 높였다.
- **에이전트도 영향을 받는다.** 같은 샘플링 토큰이 어떤 도구를 호출할지, 어떤 인수를 넘길지를 결정할 수 있다. Siposova는 이 행동상의 영향을 “sampling drift”(샘플링 드리프트)라고 부른다.
- **키가 중요하다.** 어떤 비밀 키를 썼는지에 따라 모델의 응답도 다르게 나타났다.
SynthID-Text의 작동 방식
워터마크는 출력에 신호를 심어, 나중에 그 출력이 AI가 만든 것임을 식별하게 해 준다. 이를 출처 증명(provenance)이라 한다. 언어 모델은 보통 가능성 높은 후보 집합에서 표본을 뽑아 다음 단어를 고른다. SynthID는 이 샘플링 과정에 난수 시드 생성기, 샘플링 알고리즘, 점수 함수를 더한다. 임의의 난수 생성기 대신 비밀 키를 쓴다. 단어 선택은 여전히 무작위다. 하지만 키를 아는 사람은 단어 열을 검사해 그 키가 쓰였을 가능성을 판정할 수 있다.
핵심 특징은 토너먼트 샘플링(tournament sampling)이다. 스포츠 대회처럼 SynthID는 다음 단어 후보 토큰을 대량으로 평가한다. 비밀 키는 이들에게 확률 점수를 매긴다. 토큰 두 개가 한 라운드에서 맞붙고, 숨겨진 점수가 더 높은 쪽이 다음 라운드로 올라간다. 이 과정은 최종 승자 토큰이 정해질 때까지 계속된다. 기사는 토너먼트 샘플링에 대한 자세한 내용을 담은 외부 링크 두 개를 안내한다.
기억할 점은 단순하다. 워터마크는 글이 완성된 뒤에 덧붙이는 것이 아니다. 토큰 하나하나를 고르는 과정 안에 들어 있다. 그래서 독자에게는 보이지 않으며, 같은 이유로 원칙적으로는 그 선택에 좌우되는 모든 것에 닿을 수 있다.
우리의 분석: 샘플링 변화가 왜 안전성에 닿을 수 있나
이 절은 출처의 주장이 아니라 우리의 해석이다. 거절은 별도의 스위치가 아니다. 다른 모든 답변과 마찬가지로 토큰 단위 생성의 결과다. 모델이 해로운 요청을 거절하는 것은 거절을 나타내는 토큰이 유력한 다음 문장이기 때문이다. 샘플링 단계가 과정을 다른 토큰 쪽으로 밀면 그 균형이 바뀔 수 있다. Siposova의 말도 이 시각과 맞는다. 워터마크는 독자가 알아채지 못하도록 만들어지지만, 모델이 생성하는 것에 무엇이든 손을 대면 절충이 생기고 “그것은 어딘가에서 드러나게 마련”이라는 것이다.
프롬프트 인젝션은 우려를 더 날카롭게 한다. 그녀의 표현으로는, 모델이 도구를 통해 행동할 수도 있을 때 약해진 거절은 더 큰 결과를 낳는다. 챗 모델이 나쁜 요청에 답하면 텍스트가 나온다. 에이전트가 나쁜 요청에 답하면 실제 인수를 붙여 도구를 호출할 수도 있다. 기사는 같은 샘플링 토큰이 어떤 도구를 호출하고 어떤 인수를 넘길지 결정할 수 있다고 말한다.
출처에서 눈여겨볼 세부 사항이 두 가지 있다. 첫째, 도구 호출 그림은 워터마크가 어떤 개별 도구 호출이 정확한지를 바꿨고, 때로는 전체 정확도 점수가 시사하는 것보다 훨씬 크게 바꿨음을 보여 준다. 쉽게 말해 총합 정확도는 안정적으로 보여도 개별 호출은 맞음에서 틀림으로, 틀림에서 맞음으로 뒤바뀔 수 있다. 대표 지표만 보는 팀은 이를 놓칠 수 있다. 둘째, 키 변화 그림은 비밀 키 하나하나를 점으로 표시한다. 0의 오른쪽 점은 워터마크가 없을 때보다 해로운 요청에 더 순응했음을, 왼쪽 점은 덜 순응했음을 나타낸다. 기사 본문은 양쪽에 점이 몇 개씩 있는지 말하지 않는다. 그러나 이 그림이 존재한다는 사실 자체가 영향이 키에 따라 달라진다는 점을 시사하며, 한 키로 한 번 시험했다고 해서 다른 키의 결과가 정해지지는 않는다.
연구의 한계와 남은 질문
기사는 한계를 분명히 밝힌다. 이 연구는 워터마크 아래에서 Claude 모델의 응답이 어떻게 달라지는지 시험하지 않았다. 시험 대상은 오픈 웨이트 모델 여섯 개인데, 그래야 연구자가 다른 설정은 고정한 채 토너먼트 샘플링 중에 토큰 샘플링을 켜고 끌 수 있기 때문이다. 실험은 또한 Claude 모델이 쓸 구체적 구현이 아니라 SynthID-Text 토너먼트 샘플링의 Hugging Face 구현을 시험했다. 게다가 우리의 출처는 그 연구에 대한 뉴스 기사다. 기사 본문에는 효과의 크기도, 모델 이름도, 모델별 결과도 나오지 않는다. 우리는 원래 보고서를 읽지 못했으므로 영향이 얼마나 큰지는 말할 수 없다.
그럼에도 기사는 적어도 일부 형태의 워터마크 방식이 모델과 에이전트의 안전성에 영향을 줄 수 있다고 결론짓는다. 그러면 질문이 이어진다. 실제 서비스 구현도 오픈소스 구현처럼 행동할까? 많은 키에 걸쳐 변화 폭은 얼마나 클까? 플랫폼이 이 드리프트를 피할 키나 설정을 고를 수 있을까? 출처는 이에 답하지 않는다.
독자를 위한 실용적 시사점
- **워터마크를 켜고 테스트하라.** 기사는 개발자가 워터마크가 적용된 상태에서 LLM과 에이전트가 어떻게 행동하는지 철저히 테스트해야 한다고 말한다. 워터마크 없는 모델로 한 안전성 평가는 실제 배포된 시스템을 설명하지 못할 수 있다.
- **에이전트와 도구를 포함하라.** 텍스트가 올바르게 보이는지만이 아니라 어떤 도구가 어떤 인수로 호출되는지도 확인하라.
- **키를 여러 개 시험하라.** 키 변화 결과는 키에 따라 행동이 달랐음을 보여 준다.
- **스택 전체를 레드팀으로 점검하라.** 기사는 레드팀 해킹 훈련이 자사 플랫폼에 부하를 걸어, SynthID를 배포했을 때 기대대로 작동하는지 확인해야 한다고 말한다.
- **주장을 신중하게 읽어라.** 이것은 오픈 웨이트 모델 몇 개와 한 가지 구현에 대한 증거다. Claude에 대한 발견이 아니다.
Sources
FAQ
SynthID-Text란 무엇인가?
Google이 만들어 오픈소스로 공개한 워터마크 방식이다. 비밀 키로 모델이 다음 단어를 고르는 과정을 미묘하게 바꿔, 키를 아는 사람이 그것을 쓰는 플랫폼이 텍스트를 생성했는지 확인할 수 있다.
Lasso Security 연구는 무엇을 발견했나?
워터마크는 오픈 웨이트 모델 여섯 개가 해로운 요청에 응답하는 방식을 바꿨고, 프롬프트 인젝션 기법이 쓰일 때 특히 두드러졌다. 여러 모델에서 원래 거절하던 요청에 답할 가능성이 커졌다.
이 연구는 Claude 모델이 덜 안전해진다는 것을 보여 주는가?
아니다. 연구는 Claude 모델을 시험하지 않았다. 오픈 웨이트 모델 여섯 개와 SynthID-Text의 Hugging Face 구현을 썼으며, Claude 모델이 쓸 구현은 아니다.