OpenAI, EU AI법 대응 출처 증명 설계도 공개: C2PA 메타데이터와 토큰 단위 워터마크, 패러프레이즈 공격에도 99.8% 탐지 주장

Published · AI Daily — AI-assisted deep research, methodology & disclosure

OpenAI가 EU AI법의 텍스트 출처 증명, 워터마크, 합성 콘텐츠 투명성 요건에 대응하는 기술 프레임워크를 공개했다. C2PA 규격의 암호화 메타데이터와, 자기회귀 디코딩 중 토큰 단위로 삽입하는 다층 통계 워터마크를 결합한다. OpenAI는 적대적 패러프레이즈 이후에도 탐지 정확도가 99.8%를 넘고 생성 퍼플렉시티 저하는 무시할 수준이라고 밝혔다. 유럽 공공기관과 기업 감사 파트너를 위한 검증 도구도 오픈소스로 공개한다. 수치는 OpenAI의 자체 주장이며 시험 조건과 독립 재현 결과는 아직 공개되지 않았다.

OpenAI가 EU AI법의 텍스트 출처 증명, 워터마크, 합성 콘텐츠 투명성 요건을 충족하는 방법을 담은 기술 설계도를 공개했다. 구성은 두 층이다. 첫째는 C2PA 규격을 따르는 암호화 메타데이터이고, 둘째는 다층 통계적 워터마크다. OpenAI는 유럽 공공기관과 기업 감사 파트너를 위해 검증 도구를 오픈소스로 공개하겠다고도 밝혔다. 아래 성능 수치는 모두 OpenAI의 자체 설명에 근거한다. 이 글을 쓰는 시점에 시험 데이터 규모, 텍스트 길이 분포, 오탐률, 제3자 재현 결과는 확인되지 않았다. 검증된 사실이 아니라 업체의 주장으로 읽어야 한다. 먼저 규제 배경이다. EU AI법 제50조는 생성형 AI에 투명성 의무를 부과한다. 제공자는 출력물을 기계가 읽을 수 있는 형식으로 표시해 인공적으로 생성되거나 조작된 것임을 식별할 수 있게 해야 한다. 배포자는 특정한 경우 딥페이크와 공공에 정보를 알리려고 게시하는 AI 생성 텍스트를 공개해야 한다. 구체적인 표시 방법은 EU가 행동 강령을 통해 다듬고 있다. 법은 단일 기술을 지정하지 않으므로 각 업체가 방식을 직접 고르고 규제 당국에 그 효과를 입증할 준비를 해야 한다. 이번 설계도는 그 답을 먼저 내놓으려는 시도다.

기술 메커니즘을 보자. 첫 번째 층인 C2PA는 여러 기업이 지지하는 콘텐츠 출처 및 진본성 표준이다. 디지털 서명이 된 매니페스트를 콘텐츠에 묶어 누가 어떤 도구로 만들었는지 기록한다. 검증자는 서명 사슬을 확인해 매니페스트가 변조되지 않았음을 확인할 수 있다. 장점은 암호학적으로 검증할 수 있고 감사가 쉽다는 점이다. 약점도 분명하다. 메타데이터는 콘텐츠 옆에 붙어 다니는 정보다. 텍스트를 복사해 붙여넣거나 화면 캡처를 하거나 일반 텍스트로 저장하면 매니페스트는 쉽게 사라진다. 두 번째 층은 이 약점을 메우기 위한 것이다. 통계적 워터마크는 신호를 글 자체에 새긴다. 공개된 연구에서 가장 흔한 방식은 디코딩의 매 단계에서 작동한다. 앞선 문맥으로부터 어휘의 의사 난수 분할을 만들고, 한쪽 어휘의 선택 확률을 조금 높인다. 키를 가진 탐지기는 선호된 어휘에 속한 단어의 비율을 세고, 그 비율이 우연보다 유의하게 높은지 가설 검정으로 판단한다. 신호가 많은 단어에 퍼져 있어 복사해도 남는다. OpenAI는 자사 방식을 다층이라고 설명하지만, 각 층이 어떻게 구성되는지는 요약에 나와 있지 않다. 세부 사항은 전체 문서를 기다려야 한다.

OpenAI가 강조하는 또 하나는 토큰 단위 워터마크가 자기회귀 디코딩 중 지연을 추가하지 않는다는 점이다. 자기회귀 모델은 한 번에 토큰 하나씩 생성한다. 워터마크는 보통 샘플링 전에 로짓을 가볍게 조정한다. 이는 전체 순전파에 비하면 값싼 연산이다. 따라서 체감 지연이 없다는 주장은 원리상 그럴듯하다. 품질에 대해 OpenAI는 퍼플렉시티가 거의 영향을 받지 않는다고 말한다. 기존 연구는 워터마크 강도와 글 품질 사이에 상충 관계가 있음을 보여 준다. 신호가 강할수록 탐지는 쉬워지지만 출력 분포는 더 흐트러진다. OpenAI가 구체적인 퍼플렉시티 수치를 내놓지 않았으므로 이 시스템이 상충 관계의 어디에 있는지는 알 수 없다.

가장 주목받는 수치는 적대적 패러프레이즈 이후에도 탐지 정확도가 99.8%를 넘는다는 주장이다. 패러프레이즈는 워터마크의 천적이다. 공격자는 다른 언어 모델에게 글을 다시 쓰게 해 원래의 단어 순서를 무너뜨릴 수 있다. 이 공격에서 높은 탐지율을 유지하려면 대개 충분히 긴 텍스트가 필요하거나, 신호를 표면 단어 형태가 아니라 의미에 묶어야 한다. 정확도라는 지표도 불완전하다. 양성과 음성 표본이 불균형하면 높은 정확도가 높은 오탐을 가릴 수 있다. 규제 용도에서는 오탐률을 고정했을 때의 탐지율이 더 중요하다. 사람이 쓴 글을 기계 생성으로 잘못 판정하면 현실적인 피해가 크기 때문이다. 이런 정보는 아직 없다. 개발자와 기업에게 이 설계도는 세 가지 의미가 있다. 첫째, 컴플라이언스 비용은 오르지만 참고할 구현 경로가 생겼다. OpenAI 모델 위에 만든 하위 제품은 코드 변경 없이 워터마크와 메타데이터를 물려받을 수 있다. 둘째, 역할을 구분해야 한다. 법은 제공자와 배포자에게 다른 의무를 부과하며, API 위에 자사 제품을 얹은 회사는 자신이 어느 쪽인지 알아야 한다. 셋째, 메타데이터 보존이 엔지니어링 요건이 된다. 콘텐츠 파이프라인에서 텍스트를 제거하거나 다시 쓰는 단계가 있으면 C2PA 매니페스트가 무효가 될 수 있으므로 설계 단계에서 고려해야 한다. 오픈소스 검증 도구도 눈여겨볼 대목이다. 규제 기관과 감사인이 업체의 비공개 탐지 창구에만 의존해야 한다면 독립성이 부족하다. 공개 도구가 있으면 제3자가 직접 검사할 수 있고 연구자도 재현할 기회를 얻는다. 다만 진짜 쓸모가 있으려면 탐지 알고리즘, 임계값 선택, 오탐 거동도 함께 공개되어야 한다. 키 관리도 풀리지 않은 문제다. 탐지에는 보통 워터마크 키가 필요하다. 키가 유출되면 공격자가 워터마크를 표적으로 지우거나, 다른 사람을 모함하려고 워터마크를 위조할 수도 있다. 산업 차원에서는 이 설계도가 표준화 효과를 낼 수 있다. 가장 큰 모델 업체가 실행 가능해 보이는 방식을 내놓으면 다른 업체와 오픈 모델 커뮤니티도 그 기준으로 평가받을 가능성이 크다. 다만 오픈 웨이트 모델은 어려운 사례로 남는다. 사용자가 직접 배포하면서 워터마크를 끌 수 있어 어떤 방식도 모든 AI 텍스트를 포괄하지 못한다. 법이 이 부분을 어떻게 해석하고 집행할지는 지켜봐야 한다. 종합하면 이는 무게 있는 기술적, 규제적 입장 표명이지만 결론은 아니다. 진짜 시험은 독립적 평가, 규제 당국의 방식 인정, 실제 환경에서의 적대적 시험에서 나온다. 그 결과가 나오기 전까지 독자는 보기 좋은 수치를 신중하게 다뤄야 한다.

Sources