영국·아일랜드 중고서점, AI 기업들의 '이상한' 대량 주문 의심

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Anthropic이 데이터 수집을 위해 수백만 달러를 들여 책을 스캔한 사실이 보도된 후, 영국과 아일랜드의 중고서점에서는 신비로운 구매자의 대량 주문이 급증하고 있다. AI 기업들이 학습 데이터를 위해 책을 사들이고 있다는 추측이 나오고 있다.

배경

영국과 아일랜드의 중고서적 시장은 최근 몇 달간 정체불명의 구매자로부터 쏟아지는 대량 주문으로 인해 큰 혼란을 겪고 있습니다. 올해 상반기부터 독립 서점과 도서관 재고 처리 부서들은 수백 권에서 수천 권에 달하는 책을 한꺼번에 사들이는 익명 고객들의 요청을 빈번하게 받고 있습니다. 기존 수집가나 기관과 달리, 이들은 책의 물리적 상태에 거의 신경 쓰지 않으며, 페이지가 누렇게 변색되었거나 책등이 손상되어 있어도 텍스트 내용이 온전하기만 하면 구매를 진행합니다. 이러한 태도는 책이라는 물리적 대상보다 디지털 텍스트 자체에 더 큰 가치를 두는 현재 트렌드의 특징을 잘 보여줍니다.

이러한 불투명한 구매 행태는 업계 내 광범위한 추측을 불러일으켰습니다. 구매자들은 소속 기관이나 구체적인 구매 목적을 밝히기를 거부하고, '개인 연구'나 '기록 보존'이라는 모호한 이유만을 제시하는 경우가 많습니다. 이는 Anthropic이 대규모 언어 모델의 학습 데이터를 확보하기 위해 수백만 달러를 들여 책을 스캔했다는 보도가 나온 시기와 정확히 일치합니다. 주요 AI 연구소들의 신모델 출시나 데이터 전략 업데이트 시점과도 겹치는 이 대량 구매 현상은, 빅테크 기업들이 자사 코퍼스를 은밀하게 확장하려는 조율된 노력의 일환이라는 강한 의심을 사고 있습니다.

장기적으로 희소 재고에 의존해 생존해 온 중고서점들에게 이 갑작스러운 자본 유입은 기존 운영 리듬을 무너뜨렸습니다. 단기적으로는 현금 흐름이 개선되었지만, 희귀 도서가 빠르게 소진되면서 일반 독자와 수집가들이 원하는 책을 구하기가 점점 어려워지고 있습니다. 이는 AI 데이터 수집 전략이 디지털 스크레이핑을 넘어 전통적인 출판 공급망의 물리적 시장까지 침투했음을 의미하는 중대한 전환점입니다.

심층 분석

이 현상의 근본적인 동력은 AI 산업이 고품질 롱테일 텍스트 데이터에 대해 느끼는 갈증입니다. 현재 데이터 환경에서 공개 인터넷 텍스트는 주요 AI 기업들에 의해 광범위하게 정제되고 중복 제거되어 그 한계에 다다랐으며, 한계 효과가 감소하고 있습니다. 성능 병목을 돌파하기 위해 기업들은 다양성, 전문성, 깊이가 더 있는 데이터 소스를 모색하고 있습니다. 중고서적 시장은 이 공백을 효과적으로 메워줍니다. 웹 텍스트와 달리 책은 편집 검수를 거쳤으며, 역사적 기록, 지방지, 전문 학술지, 절판 문학 작품 등 널리 디지털화되거나 크롤링되지 않은 전문 지식을 담고 있습니다.

전략적 관점에서 보면, 물리적 책을 구매하여 OCR(광학 문자 인식)으로 스캔하는 것은 복잡한 저작권 라이선스 협상보다 비용 효율적인 대안이 됩니다. 이 방식은 긴 법적 절차와 높은 라이선스 비용을 우회하여, 중고시장의 가격 차이를 활용하여 정식 인가 비용의 극히 일부로 방대한 텍스트를 확보할 수 있게 합니다. 이러한 '데이터 아비트라주'는 정보 비대칭과 시장 분절을 활용하여 사적 데이터 해자를 빠르게 구축하는 것입니다. 그러나 이 방법에는 기술적 장벽도 존재합니다. 인쇄 선명도, 종이 재질, 제본 방식에 따라 스캔 품질이 제한되며, 텍스트 정제, 노이즈 제거, 구조화에는 상당한 엔지니어링 자원이 필요합니다. OCR 오류로 인한 노이즈를 방지하고 정확성을 확보하는 것은 여전히 중요한 기술적 과제입니다.

그럼에도 불구하고 직접 구매 방식이 가진 법적 및 시간적 이점은 매력적입니다. 많은 관할권에서 물리적 책의 구매와 그 내용 스캔은 '공정 이용'이나 '최초 판매 원칙'에 대한 법적 모호성 덕분에 저작권 침해로 직접 간주되지 않습니다. 이 법적 회색 지대는 AI 기업들이 출판사와 라이선스를 협상하는 것보다 법적 리스크를 낮추고 운영할 수 있게 합니다. 결과적으로 책의 가치 제안은 문학적 또는 학술적 가치만이 아니라, 텍스트 데이터의 희소성과 완전성에 의해 점점 더 결정되고 있습니다.

산업 영향

AI 기업들이 주요 구매자로 등장하면서 책의 시장 가격 메커니즘이 왜곡되고 있습니다. 특정 타이틀의 비용이 문화적 가치보다는 학습 데이터로서의 유용성에 따라 인위적으로 상승하는 '데이터 프리미엄'이 형성되고 있습니다. 이러한 가격 왜곡은 일반 독자와 수집가에게 장벽을 만들어, 특정 작품의 비용이 높아지거나 아예 구할 수 없게 되는 상황을 초래합니다. 문화적 소비를 위한 공급과 수요의 균형을 맞췄던 중고시장의 전통적 균형은 데이터 추출에 주된 관심을 가진 새로운 산업적 구매자들에 의해 깨지고 있습니다.

이러한 추세는 출판 업계의 불안감을 고조시켰습니다. 전통적인 출판사는 저작권 라이선스와 로열티 수입에 의존하여 운영을 유지합니다. AI 기업들이 인가 절차를 우회하기 위해 중고책을 구매하는 것은 사실상 저작권 체계를 회피하는 행위입니다. 법적 근거가 있는 맥락이 있더라도, 이 관행은 상당한 윤리적 및 상업적 우려를 제기합니다. 출판 업계는 이 접근 방식이 데이터 사용에서 저자와 출판사의 정당한 수익 배분을 박탈하여, 장기적으로 창작 동기를 약화시키고 문화 생태계의 다양성을 훼손할 수 있다고 주장합니다.

중개자 역할을 하는 중고서점들은 복잡한 정체성 위기에 직면해 있습니다. 역사적으로 문화 유산과 지식 공유의 수호자로 위치해 왔던 그들은 이제 AI 데이터 공급망의 일부로 통합되고 있습니다. 이러한 변화는 그들의 사회적 평판에 영향을 미치고 비즈니스 모델에 대한 재평가를 강제합니다. 일부 서점가는 업계 윤리를 유지하기 위해 의심스러운 AI 구매자에게 민감하거나 고가 책의 판매를 거부하며 주문을 능동적으로 선별하기 시작했습니다. 그러나 이러한 저항은 특히 소규모 독립 서점의 경우, 대량 주문 거부가 생존을 위한 재정적 위기를 초래할 수 있어 취약합니다. 판매에 대한 경제적 압력이 윤리적 고려를 종종 상회하여, 업계 내 대응이 단편화되고 있습니다.

전망

AI 데이터 수집 전쟁은 '공개 데이터 크롤링'에서 '사적 데이터 구매'로 전환되고 있습니다. 이는 데이터 장벽이 점점 더 높아질 것을 의미하며, 더 많은 고품질 사적 데이터를 보유한 기업이 모델 개발에서 경쟁 우위를 점하게 됩니다. 자금력이 부족한 중소 AI 스타트업은 이 대규모 데이터 구매 경쟁에 참여하지 못할 수 있으며, 이는 산업의 추가적인 집중화와 헤드 효과의 강화로 이어질 수 있습니다. 이러한 역학은 출판업과 AI 산업이 새로운 협력 모델을 모색하도록 촉발하고 있습니다. 일부 출판사는 AI 기업과 직접적인 데이터 사용 라이선스를 협상하여 투명한 수익 공유 메커니즘을 구축하려 하고 있습니다. 이 모델이 보편화되면 출판업의 수익 구조를 판매 의존에서 데이터 서비스 의존으로 전환시켜 재편할 수 있습니다.

그러나 협상의 복잡성과 수익 분배의 공정성은 여전히 상당한 장애물입니다. 앞으로 이 추세는 더 엄격한 규제 개입을 촉발할 수 있습니다. 각국 정부는 AI 데이터 수집의 합법성을 검토하기 시작하여, 대규모 텍스트 스캔과 데이터 사용에 대한 특별 규정을 제정할 수 있습니다. 이러한 규정은 AI 기업에게 데이터 출처를 공개하도록 요구하거나, 특정 유형의 데이터 사용에 대한 보상 기준을 설정하는 것을 포함할 수 있습니다. 업계는 AI 기업들이 데이터 구매 관행을 공개적으로 인정할지, 출판계가 통일된 대응이나 집단 소송을 형성할지, 그리고 중고서적 시장이 AI 데이터 수요를 위한 전문 거래 채널을 개발할지 등 주요 신호를 주시하고 있습니다.

책이 지식 매개체로서 가지는 역할은 재정의되고 있습니다. 그것들은 더 이상 읽기 위한 대상일 뿐만 아니라 알고리즘 훈련의 연료가 되었습니다. 이 전환은 기술, 문화, 윤리, 경제 구조의 깊은 조정을 수반합니다. AI와 출판업계의 관계는 이러한 다가오는 발전들에 의해 결정될 것이며, 두 부문이 대립으로 나아갈지 공생으로 나아갈지를 가를 것입니다. 지속되는 긴장은 이러한 변화의 함의에 대한 사회의 지속적인 관심과 성찰이 필요함을 강조합니다.

Sources

FAQ

영국과 아일랜드의 중고서점에서 어떤 일이 벌어지고 있나요?

올해 초부터 익명 구매자들이 수백~수천 권 단위의 대량 주문을 반복하고, 책 상태는 중요하지 않고 글자가 온전하기만 하면 된다고 주장하며 목적도 밝히지 않고 있다.

왜 이 대량 구매가 출판 업계에 중요한가요?

특정 분야 도서 가격을 끌어올려 '데이터 프리미엄'을 만들고 가격 메커니즘을 왜곡한다. 저작권 허락을 우회해 실물을 스캔하기 때문에 윤리와 지속가능성 논란도 커지고 있다.

앞으로 어떤 동향에 주목해야 하나요?

AI 기업이 구매를 인정할지, 출판계가 집단 대응이나 소송에 나설지, 중고시장에 AI 데이터 전용 거래 채널이 생길지 주목해야 하며, 각국 규제 동향도 살펴야 한다.