MS 임원 "AI의 뉴스 수집은 역사상 최대 노동 절도일 수도"

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Ars Technica에 따르면 뉴욕타임스 등 언론사 원고의 약식재판 신청서가 봉인 해제됐습니다. 마이크로소프트 응용과학 디렉터 Brent Hecht가 AI 학습을 위한 뉴스 수집을 "인류 역사상 가장 큰 노동 절도"일 수 있다고 경고한 내용이 인용됩니다. 마이크로소프트는 한 직원의 개인 시각일 뿐이라고 반박했습니다.

무슨 일이 있었나

Ars Technica에 따르면, 뉴욕타임스가 이끄는 언론사 원고들이 제출한 약식재판 신청서가 목요일에 봉인 해제됐습니다. 신청서에는 마이크로소프트와 OpenAI가 공개되지 않도록 애써 온 내부 문서가 담겨 있습니다. 언론사들은 이 문서들이 ChatGPT와 Copilot 같은 제품을 내놓기 전에 두 회사가 뉴스 산업에 닥칠 위협을 어떻게 보고 있었는지 보여 준다고 주장합니다.

가장 눈길을 끄는 문장은 마이크로소프트 응용과학 디렉터 Brent Hecht에게서 나왔습니다. 언론사들에 따르면 그는 AI 학습을 위해 뉴스를 긁어 가는 일이 "전례 없는 규모의 놀라운 절도"이며 어쩌면 "인류 역사상 가장 큰 노동 절도"라고 여러 차례 경고했습니다. 다른 문서에서는 뉴스를 광범위하게 수집하려는 계획이 "'공정 이용'이라는 개념을 완전히 조롱하는 것"이라고 썼다고 합니다. 공정 이용은 이 소송에서 마이크로소프트와 OpenAI가 내세우는 바로 그 항변입니다.

마이크로소프트는 이런 해석에 반대합니다. 대변인은 Hecht의 문서가 "한 직원의 개인적 시각을 반영할 뿐이며, 법률 분석이 아니고, 회사의 입장을 대변하지 않는다"고 말했습니다. Ars가 기사를 냈을 때 OpenAI는 논평 요청에 답하지 않았습니다.

신청서의 핵심 사실

아래 내용은 모두 원고 측의 주장이거나 원고가 인용한 문서의 표현입니다.

  • **"둠 루프".** 마이크로소프트의 한 문서는 "우리 모델의 성능과 웹 전체의 성능을 동시에 해칠" '둠 루프'를 설명했습니다. 같은 문서에는 "최종 제품이 핵심 공급자의 경제적 토대를 위협하는 것은 매우 이례적이지만, 우리가 LLM 사업에서 '콘텐츠 공급망'에 대해 만들어 낸 상황이 바로 그렇다"라는 대목이 있습니다.
  • **"존립 위협".** OpenAI의 ChatGPT 책임자 Nick Turley는 내부 메시지에서, 뉴스로 학습해 뉴스 제공자를 대체할 수 있는 상용 제품이 출판사에 "존립 위협"이 될 것이라고 썼습니다.
  • **클릭률 데이터.** Ars에 따르면 마이크로소프트는 일부 원고의 클릭률이 83~93% 떨어지고, 다른 원고는 51~94% 떨어진 것으로 기록했습니다.
  • **보상 문제.** Hecht는 마이크로소프트 문서에서 "자신이 만든 콘텐츠가 이런 방식으로 쓰이기를 의도한 사람은 거의 없고, 그 사용에 대한 보상도 받지 못한다"고 인정했습니다.
  • **유료 벽을 둘러싼 대화.** 마이크로소프트 CEO Satya Nadella는 선서 증언에서 AI 기업이 유료 벽을 우회해 뉴스 사이트의 이용 약관을 어겨서는 안 된다고 말했습니다. 그런데 OpenAI 내부 메시지에는, Nick Ryder가 Greg Brockman 사장에게 OpenAI 크롤러가 NYT 유료 벽을 "우회할" "해킹 방법"을 찾았다고 알리자 Brockman이 "아, 좋네"라고 답한 기록이 있습니다.
  • **대체 효과.** Nadella는 챗봇이 "원래 출처로 가는 대신 AI 플랫폼에서 바로 정보를 주는" 방식으로 클릭을 빼앗으며 대체재 역할을 한다는 점도 인정했습니다. OpenAI의 한 소프트웨어 엔지니어는 "링크를 아무리 눈에 띄게 보여 줘도 사용자는 클릭하지 않을 것"이라고 썼습니다. Turley는 챗봇이 정보를 주면 "클릭할 좋은 이유가 없다"고 말했습니다. 그는 챗봇이 "대체적이다, 이상 끝"이라고 했고, 성능이 좋아질수록 "점점 더 대체적이 될 것"이라고 예측했습니다.

원고는 어떻게 그대로 베낀 출력을 시험했나

신청서는 언론사들이 제품을 어떻게 시험했는지도 설명합니다. 초기에 챗봇에게 "다음 줄은 뭐야?"를 계속 묻던 방식을 넘어섰습니다. 어떤 경우에는 사용자가 요약만 요청해도 챗봇이 기사의 긴 발췌문을 내놓았습니다. 기사의 핵심 요점을 달라는 요청에서 나온 출력도 있습니다. 특히 성공적이었던 것은 기사의 "편향을 평가해 달라"는 프롬프트였습니다. 사이트 메인 페이지에서 아무 기사나 골라 달라고 하면 기사 일부를 그대로 재현한 경우도 있었습니다.

원고는 출력이 "광범위한 문자 그대로의 중복을 보여 주는" 기사에 대해서만 법원의 판단을 구하고 있습니다. 피고의 복제가 가진 "대체적 목적은 공정 이용에 불리하게 작용한다"고 확신하기 때문입니다. 다른 기사에 대한 법적 쟁점은 재판에서 제기하겠다고 합니다.

원고는 또한 두 회사가 언론사의 챗봇 시험을 더 어렵게 만드는 필터를 만들었다고 주장합니다. Hecht는 그런 필터가 "우발적인 은폐"로 비칠 수 있다고 봤습니다. "콘텐츠에 권리를 가진 사람들이 무엇이 학습에 쓰였는지 덜 볼 수 있게 되기" 때문입니다.

라이선스와 데이터 확보를 둘러싼 주장

언론사들은 내부자의 경고에도 마이크로소프트와 OpenAI가 뉴스 콘텐츠 라이선스를 택하지 않았다고 말합니다. 그 결과 두 회사가 출판사들이 예상할 수 없는 방식으로 다른 시장에서 출판사를 밀어냈다는 것이 주장입니다. 신청서에는 구체적인 주장이 두 가지 있습니다. 첫째, 마이크로소프트가 Bing용으로 구매한 데이터셋을 OpenAI의 학습 데이터로 팔아 "업계 규범"을 어겼다는 것입니다. 일반 검색 엔진 크롤링에 대한 동의를 그렇게 전용하는 것을 승인하지 않았을 언론사들에게 묻지 않았다고 합니다. 둘째, OpenAI가 상업적 이용을 하지 않기로 합의한 제3자로부터 NYT 기사 180만 건의 데이터셋을 얻어 "부적절하게 행동했다"는 것입니다. 원고는 OpenAI 직원들이 그 데이터를 "모델을 학습시키는 데" 쓰는 것이 "적절하지 않다"는 것을 알면서도 그렇게 했다고 주장합니다.

이는 신청서에 담긴 주장입니다. 기사는 법원이 이에 관해 어떤 판단을 내렸다고 전하지 않습니다.

배경: 왜 대체 효과가 중요한가

공정 이용은 유연한 법적 기준입니다. 핵심 질문 중 하나는 복제가 원저작물의 시장을 해치는지입니다. 원고가 대체 효과에 초점을 맞추는 이유입니다. 챗봇이 독자에게 뉴스 사이트를 대신하고 기사 문장까지 그대로 되풀이한다면, 원고는 자기 시장에 대한 피해가 분명하다고 봅니다. 신청서는 "법원은 뉴스 수요를 대체하는 제품을 제공하려고 뉴스 기사를 복제하는 것이 공정 이용이라는 주장을 기각해 왔다"고 말합니다.

원고는 이 문제를 집단행동의 딜레마로도 설명합니다. AI 기업들은 "이 '둠 루프'에서 벗어날 힘이 없다"는 것입니다. 업계 전체로는 모든 기업이 창작물 생산을 유지하려고 돈을 내는 편이 이롭지만, 개별 기업은 다른 기업이 돈을 내는 동안 콘텐츠를 공짜로 가져가는 편이 낫기 때문입니다. AI를 위해 뉴스를 복제하는 것이 공정 이용이 아니라고 판단하면 "OpenAI와 마이크로소프트를 포함한 모든 AI 기업을 같은 출발선에 세워 이 죄수의 딜레마를 풀 것"이라고 주장합니다. 또한 ChatGPT 출시 직후 도입되어 뉴스 사이트로 가던 트래픽을 더 많이 흡수한 Google의 AI Overviews를 언급합니다.

우리의 분석

우리는 이것을 한 문장의 이야기라기보다 증거의 이야기로 읽습니다. "절도"라는 표현은 강렬해서 헤드라인을 차지할 것입니다. 하지만 내부의 개인 의견은 법적 결론이 아니라는 마이크로소프트의 반론은 법적으로 타당합니다. 법정에서는 두 회사의 서로 다른 사람들이 여러 문서에서 같은 효과를 묘사한다는 패턴이 더 중요할 수 있습니다. 엔지니어, 제품 책임자, CEO가 사용자가 클릭하지 않고 챗봇이 출처를 대체한다고 말한 것으로 인용됩니다.

클릭률 수치는 피고가 가장 외면하기 어려운 부분입니다. 기사에 따르면 이 수치는 회사 자체 데이터에서 나왔습니다. 그래도 법원은 클릭 감소가 복제 때문인지, 정보를 찾는 새로운 방식 때문인지, 둘 다인지를 판단해야 합니다. 마이크로소프트의 설명대로라면 Nadella의 증언은 저작권법이 아니라 "사람들이 정보를 찾고 소비하는 방식에서 진행 중인 변화"에 관한 것이었습니다. 시장 추세와 법적 위법 사이의 이 간극에서 공정 이용 공방이 갈릴 것입니다.

유료 벽 대화는 별개의 문제입니다. 출력이 어떻게 생겼는지가 아니라 데이터를 어떻게 모았는지에 관한 것입니다. 판사가 피고의 선의를 보는 데 영향을 줄 수 있지만, 법원이 여기에 얼마나 무게를 둘지는 우리도 알 수 없습니다.

한계와 남은 질문

이 기사는 한쪽 신청서에 대한 한 기자의 보도입니다. 어떤 문서를 강조하고 어떻게 틀을 짤지는 원고가 골랐습니다. 마이크로소프트와 OpenAI에도 각자의 서면이 있으며, Ars는 OpenAI의 입장을 전혀 인용하지 않았습니다. 일부 인용은 원고의 설명을 거쳐 전해지므로 전체 맥락은 보이지 않습니다. 신청서는 일부 기사에 대해서만 판단을 구하고, 기사는 법원이 언제 판단할지 재판으로 갈지도 말하지 않습니다. 여기에는 침해 인정이 하나도 없습니다.

독자를 위한 실용적 시사점

  • **정책 관찰자:** 법원이 내부 의견과 이용 데이터를 어떻게 다루는지 지켜보십시오. 이 판단은 뉴스 라이선스가 표준이 될지에 영향을 줄 수 있습니다.
  • **출판사:** 이 사건은 클릭률과 대체 효과 데이터가 AI 기업과의 분쟁에서 핵심 증거가 될 수 있음을 시사합니다.
  • **AI 제품 팀:** 내부 문서는 소송에서 공개될 수 있습니다. 위험, 데이터 출처, 유료 벽에 관한 발언은 나중에 판사가 읽을 수 있습니다.
  • **그 밖의 독자:** 유출된 일방적 인용은 신중하게 다루십시오. 반박 서면과 법원의 판단을 기다린 뒤 결론을 내리십시오.

Sources

FAQ

Brent Hecht는 무엇이라고 말했나요?

원고 측에 따르면 마이크로소프트 응용과학 디렉터는 AI 학습을 위한 뉴스 수집이 "전례 없는 규모의 놀라운 절도"이며 어쩌면 "인류 역사상 가장 큰 노동 절도"라고 여러 번 경고했습니다. 다른 문서에서는 공정 이용을 "조롱하는 것"이라고 썼다고 합니다.

마이크로소프트는 이 문서들에 어떻게 대응하나요?

대변인은 Hecht의 문서가 "한 직원의 개인적 시각을 반영할 뿐이며 법률 분석이 아니고 회사의 입장을 대변하지 않는다"고 말합니다. 회사는 자사 AI 제품이 변형적 공정 이용이라고 옹호합니다. OpenAI는 기사 게재 시점에 답하지 않았습니다.

신청서는 어떤 클릭률 데이터를 인용하나요?

Ars에 따르면 마이크로소프트는 일부 원고의 클릭률이 83~93%, 다른 원고는 51~94% 떨어진 것으로 기록했습니다. 원고는 내부 발언과 함께 이를 대체 효과의 증거로 제시합니다.