'그저 사물이 아니다': 호주 중고서상들 AI 학습용 희귀서적 파손 경보

호주 중고서상들이 자신들의 희귀 도서들을 AI 데이터 회사에 의해 무단으로 스캔된 후 폐기되었음을 발견했다. 멜버른의 서점 소유주 티민트 와이트는 책의 가치가 텍스트를 넘어선다고 강조한다. 낡은 표지, 이전 소유자의 주석 등은 그 자체로 역사적 정보를 담고 있다. 이 사건은 물리적 문화재를 원료로 소비하는 AI 훈련 관행에 대한 윤리 논쟁을 촉발했다.

배경

호주 멜버른의 중고서점 주인인 팀 화이트는 최근 인공지능 데이터 공급망의 어두운 이면을 폭로하며 충격을 던졌다. 그는 자신의 재고 중 일부 귀중하고 절판된 도서들이 자신의 동의 없이 AI 데이터 수집 업체에 의해 일괄 스캔되었음을 발견했다. 더욱 충격적인 사실은, 디지털 스캔 작업이 완료된 후 해당 물리적 책들이 소유자에게 반환되거나 아카이브에 보관되지 않고 오히려 폐기되었다는 점이다. 이는 단순한 저작권 분쟁을 넘어, AI 산업이 방대한 학습 데이터를 확보하기 위해 문화적 유산을 일회성 원료로 소비하는 착취적 행태를 드러낸 사례다. 화이트는 이러한 책들이 단순한 상품이 아니라 역사의 증인이라고 강조하며, 무단 스캔과 파괴가物权과 문화적 가치에 대한 이중의 침해라고 지적했다.

이 사건은 디지털 추출 과정이 항상 선량한 과정이라고 가정해 왔던 시각에 균열을 일으켰다. AI 데이터 벤더에게 이 책들은 대형 언어 모델을 훈련시키는 데 필요한 고품질 저잡음 텍스트의 원천에 불과했지만, 수집가들과 역사가들에게는 책의 물리적 상태 자체가 역사적 내러티브를 담고 있었다. 표지의 마모, 종이의 산화, 특정 제본 방식은 책이 시간을 거쳐 온 여proof의 증거다. 이러한 물리적 사본들을 파괴함으로써 데이터 회사는 특정 판본의 유일한 존재를 지우는 문화적 소멸 행위를 저질렀다. 투명성 결여와 동의 없는 데이터 수집은 디지털 시대의 지적 재산권과 물리적 소유권의 교차점에 대한 새로운 법적, 윤리적 질문을 제기한다.

심층 분석

"스캔 후 폐기" 모델의 비즈니스 로직은 AI 기업들의 데이터 확보 우선순위에서 구조적 결함을 드러낸다. 대형 언어 모델은 성능 최적화를 위해 방대한 양의 고품질 텍스트가 필요하며, 희귀하고 절판된 도서들은 현대 웹 스크래핑 데이터로는 복제하기 어려운 독특한 언어 스타일과 역사적 맥락을 제공한다. 그러나 이러한 텍스트에 대한 권리 확보는 종종 비용이 많이 들고 법적 절차가 복잡하다. 이에 따라 일부 데이터 공급업체는 물리적 책을 획득해 텍스트를 스캔한 후 물리적 사본을 폐기하는 저비용 전략을 채택했다. 이는 책을 일회성 상품으로 취급하여 데이터 수확량은 극대화하면서 저장 및 라이선스 비용은 최소화하는 방식이다.

기술적 및 아카이브 관점에서 이 관행은 중요한 메타데이터의 상실을 초래한다. 도서관학 및 문화유산 보존 분야에서 책의 물리적 특성은 1차 데이터로 간주된다. 이전 소유자들이 남긴 주석은 독서 습관과 지적 역사를 보여주는 단서를 제공하며, 서장이나 헌사는 작품의 계보를 추적할 수 있게 한다. 디지털 스캔은 텍스트만 포착하여 이러한 맥락의 층위를 제거한다. 물리적 객체의 파괴는 이러한 풍부하고 비텍스트적 정보가 영구적으로 손실됨을 의미한다. 이는 문화유산의 복잡성을 단순한 텍스트 문자열로 평평하게 만드는 정보 환원주의적 접근으로, 객체에 진정한 가치를 부여하는 물질적 역사를 무시한다.

또한 이 관행은 가치의 디지털 영역과 물리적 영역 사이의 단절을 강조한다. 텍스트는 디지털 형태로 무한히 복제될 수 있지만, 물리적 유물은 유일하고 대체 불가능하다. 원본을 파괴함으로써 데이터 회사는 정보를 복제하는 것을 넘어 원천을 제거했다. 이는 문화 기록에서 회복 불가능한 적자를 생성한다. 희귀 도서의 경우 물리적 상태는 종종 역사적 중요도와 상관관계가 있다. 특정 손상이나 주석이 있는 책은 깨끗한 사본보다 역사가들에게 더 가치 있을 수 있다. "스캔 후 폐기" 모델은 이러한 미묘한 차이를 인식하지 못하고 모든 사본을 고유한 역사적 표지와 무관하게 상호 교환 가능한 텍스트 원천으로 취급한다.

산업 영향

이 사건의 함의는 여러 부문에 걸쳐 확산되며 AI 산업과 문화 기관 간의 관계를 근본적으로 변화시킨다. 도서관, 아카이브, 중고서점에게 위협은 저작권 침해에서 물리적 자산 파괴로 전환되었다. 전통적으로 주요 우려는 콘텐츠의 무단 디지털 복제였으나, 이제 물리적 객체 자체가 소비될 위험에 처했다. 이는 디지털 시대의 재산권에 관한 긴급한 법적 질문을 제기한다. AI 회사가 디지털 파생물을 생성하기 위해 물리적 객체를 사용할 때, 원래 소유자는 데이터에 대한 청구권이나 보상을 유지하는가? 현재의 재산법はこの 상황을 명확히 규정하지 않아 문화 기관이 이러한 관행에 취약하게 만든다.

AI 산업에게 이 스캔들은 상당한 평판 리스크를 안겨준다. 이는 "기술을 위한 AI"라는 서사를 훼손하고 기술 거대기업의 동기에 대한 대중의 회의감을 고취시킨다. AI 개발이 문화유산의 파괴에 의존한다는 인상은 학계와 예술 커뮤니티를 포함한 사용자들로부터 역풍을 불러일으킬 수 있다. 연구자들과 수집가들은 훈련에 사용된 데이터의 윤적 계보에 의문을 제기하며 AI 모델을 의심하기 시작할 수 있다. 만약 기초 데이터가 비윤리적 수단을 통해 획득되었다면, 결과 모델의 정당성도 의문에 부쳐진다. 이는 특정 부문이 논쟁의 여지가 있는 데이터로 훈련된 모델과의 참여를 거부하는 AI 생태계의 단편화로 이어질 수 있다.

이 사건은 규제 감독을 가속화할 수도 있다. 정부들은 AI 회사의 데이터 수집 관행을 더 면밀히 검토하고 디지털 착취로부터 문화유산을 보호하기 위한 새로운 법안을 도입할 가능성이 있다. 데이터 소싱의 필수 투명성 요구사항이나, AI 회사가 보호된 문화유산 데이터를 사용할 때 문화 보존을 위해 수수료를 지불하는 "문화 데이터세"와 같은 보상 메커니즘이 요구될 수 있다. 이는 데이터 확보 비용을 문화 부문에서 기술 산업으로 이전하여 유산 보존을 혜택자로부터 자금 지원받게 한다.

전망

앞으로 이 사건은 AI 윤리와 규제에서 전환점이 될 것으로 예상된다. 데이터 공급업체들에게 투명한 소싱 관행을 구현하도록 하는 압력이 증가할 것이며, 업계는 각 데이터 포인트의 기원을 추적하고 검증하는 "데이터 계보" 시스템을 구축하는 방향으로 나아갈 수 있다. 이는 불법적으로 획득되었거나 윤리적 결함이 있는 데이터의 사용을 방지하는 데 도움이 될 것이다. 또한 법원은 AI 회사가 데이터 수집 중 물리적 재산 파괴에 대해 어떤 책임을 지는지 정의하는 새로운 판례가 나올 수 있다. 추출된 데이터가 공공의 이익에 사용되더라도 물리적 책의 파괴가 재산권 침해에 해당하는지 법원이 판결할 필요가 있다.

AI 산업은 데이터 확보를 위한 지속 가능한 대안을 모색해야 한다. 이는 파괴가 아닌 보존을 명시적인 목표로 삼아 도서관 및 아카이브와의 공식적인 파트너십을 포함할 수 있다. 비침습적 스캔 기술을 사용하여 물리적 항목을 손상시키지 않고 디지털 사본을 생성할 수 있다. 또한 희귀하고 민감한 자료의 사용에 대한 윤리적 가이드라인이 개발되어 문화유산이 존중되고 보호되도록 해야 한다. 이러한 조치는 기술 산업과 문화 부문 간의 신뢰를 재건하고 착취적 관계보다는 협력적 환경을 조성하는 데 도움이 될 것이다.

마지막으로 AI 데이터 공급망의 글로벌 성격을 고려할 때, 이 문제는 호주를 넘어 공명할 가능성이 크다. 다른 국가들이 유사한 관행을 목격한다면 데이터 소싱을 규제하기 위한 국제적 협력이 이루어질 수 있다. 국경 간 협정을 통해 문화유산을 디지털 착취로부터 보호할 수 있다. 핵심 과제는 대규모 데이터의 필요성과 인간 역사의 보존이라는 당위성 사이의 균형을 맞추는 것이다. 산업은 데이터가 무한한 자원이 아니며, 물리적 세계에서 유래하며 그 추출이 현실 세계의 결과를 가진다는 점을 인식해야 한다. 윤리적이고 지속 가능한 데이터 관행으로의 전환은 도덕적 의무일 뿐만 아니라 AI 산업의 장기적 생존을 위한 필수 조건이다.

Sources