[지디넷코리아]
중국 인공지능(AI) 기업들이 고품질 학습 데이터 확보에 비상이 걸렸다. 온라인에서 활용할 수 있는 중국어 데이터가 제한적인 데다 공개 데이터 고갈 우려까지 커지면서 차세대 대규모언어모델(LLM) 개발을 위한 데이터 확보 부담도 높아지고 있다.
8일 사우스차이나모닝포스트(SCMP)가 인용한 인터넷 통계업체 W3테크스(Techs) 자료에 따르면 이달 기준 전 세계 웹 콘텐츠에서 중국어가 차지하는 비중은 1.3% 수준이다. 영어는 전체의 절반에 가까운 비중을 차지했으며 스페인어와 독일어는 각각 6%, 일본어는 5%로 집계됐다.
AI 업계 전반에선 모델 학습에 투입할 고품질 인간 생성 데이터가 빠르게 줄고 있다는 우려가 커지고 있다. 미국 연구기관 에포크AI는 공개적으로 이용할 수 있는 고품질 인간 생성 텍스트가 향후 6년 안에 사실상 소진될 수 있다고 전망했다. 오픈AI 공동창업자 안드레이 카파시도 2030년 전후 신뢰할 수 있는 신규 데이터를 충분히 공급하지 못하면 모델 성능 향상이 정체되는 ‘데이터 벽’에 부딪힐 수 있다고 경고했다.

이에 미국 AI 기업들은 웹 밖으로 데이터 확보 범위를 넓히고 있다. 워싱턴포스트가 법원 문서를 토대로 보도한 내용에 따르면 앤트로픽은 내부 프로젝트인 ‘프로젝트 파나마’를 통해 수천만 달러를 투입해 수백만 권의 실물 도서를 확보했다. 책의 제본을 제거한 뒤 모든 페이지를 스캔해 디지털화하는 방식으로 학습 데이터를 마련했다.
중국은 온라인에서 활용할 수 있는 자국어 콘텐츠 풀이 영어권보다 작아 데이터 고갈에 더 취약할 수 있다. 기존 웹 크롤링만으로 모델 규모와 성능을 계속 끌어올리기 어려워지면 도서와 전문 문헌, 산업 데이터, 음성·영상 등 아직 충분히 활용하지 못한 데이터 확보가 필요해질 것으로 보인다.
이 탓에 중국 정부는 고품질 데이터를 AI 경쟁력의 핵심 자원으로 보고 공급 체계 구축에 나섰다. 중국 국가데이터국은 지난 6월 AI 학습 데이터의 공급·유통·상용화를 확대하는 전국 단위 계획을 발표했다. 2028년까지 제조·에너지·의료·금융·농업을 비롯해 피지컬 AI, 자율주행, 저고도 항공 분야에서 활용할 수 있는 검증된 데이터셋 생태계를 구축한다는 목표다.
학계에선 중국어 코퍼스(언어 데이터) 자체를 넓혀야 한다는 요구도 커지고 있다. 디지털 도서뿐 아니라 역사 기록물과 지방지, 고문서, 과학 문헌 등 오프라인 자료를 체계적으로 디지털화하고 사전과 음성·영상 콘텐츠, 지역 방언까지 학습 자원으로 활용해야 한다는 주장도 나오고 있다.
이 같은 상황 속에 대안으로 합성 데이터와 시뮬레이션이 거론되고 있다. 알리바바그룹 산하 싱크탱크 알리리서치는 2024년 발표한 백서에서 알고리즘과 컴퓨팅 파워, 데이터를 AI 모델 개발의 3대 축으로 제시하고 생성형 AI 성능 향상을 위해 더 풍부하고 품질 높은 데이터가 필요하다고 밝혔다. 잡지와 프로그래밍 코드 등도 추가 데이터원으로 활용할 수 있다고 제안했다.
하지만 데이터 확보 범위가 출판물과 오프라인 자료로 확대되면서 저작권 갈등이 커질 가능성도 높아지고 있다. 중국 화샤출판사가 최근 출간한 고대 도교 경전 번역본에는 책 내용을 AI 학습에 사용하는 것을 금지하고 위반 시 법적 책임을 묻겠다는 문구가 실렸다. 출판사 측은 해외 저작권자 요청으로 해당 조항을 넣었다고 설명했지만, AI 학습 과정에서 실제 침해 여부를 적발하고 권리를 행사하기는 쉽지 않다고 강조했다.
업계에선 중국이 웹 중심의 데이터 확보 방식에서 벗어나려면 오프라인 지식의 디지털화와 산업별 데이터 구축, 저작권 처리 체계를 함께 마련해야 할 필요가 있다고 지적했다. 모델과 컴퓨팅 파워를 확보하더라도 학습에 투입할 고품질 중국어 데이터가 충분하지 않으면 AI 성능 경쟁을 지속하기 어렵기 때문이다.
쑨마오쑹 칭화대 교수는 “코퍼스는 대규모언어모델 발전에서 핵심적인 역할을 하며 AI 역량 고도화를 뒷받침하는 핵심 요소로 자리 잡았다”며 “과장해서 말하는 게 아니라 코퍼스가 없으면 언어모델도 없다”고 강조했다.
