[지디넷코리아]
미국과 중국의 기술 패권 경쟁이 심화하는 가운데 정부가 인공지능(AI) 국가 경쟁력과 기술 주권 확보에 나섰다. AI 모델 경쟁력을 높이려면 이를 학습시킬 양질의 데이터가 뒷받침돼야 한다는 인식이 확산하면서 분야별 데이터 인프라를 구축하려는 움직임도 빨라지고 있다.
16일 업계에 따르면 정부는 지난 6월 반도체, 로봇·피지컬 AI, AI 데이터 센터를 3대 축으로 삼는 ‘대한민국 대도약 3대 메가 프로젝트’를 발표했다.
이 중 로봇·피지컬 AI 분야의 핵심 축인 맥스(M.AX, 제조업 AI 대전환) 경우 오는 2030년까지 민관 합동으로 20조 원을 투자하고 100조 원 이상 경제적 부가가치를 창출하겠다는 목표다. 가장 먼저 핵심이 되는 제조 데이터 확보에 착수해 기업별로 흩어진 데이터를 수집하고 ‘제조 AI전환(AX) 데이터 라이브러리’에 구축할 계획이다.

데이터 인프라 확보는 제조업을 넘어 제약·특허·나노 등 다른 기술 산업에서도 주목받고 있다. 원활한 AX를 구현하기 위해 AI 학습에 적합한 도메인 데이터가 필수적이기 때문이다.
제약 분야 역시 활발한 AX가 일어나는 대표적인 산업군이다. 하지만 개인정보 유출 우려와 고품질 데이터의 확보·통합 분석 장벽으로 AI 도입이 까다로운 영역으로 꼽혀왔다.
과학기술정보통신부와 한국지능정보사회진흥원(NIA)이 추진하는 ‘의료 데이터 스페이스 실증사업’은 의료기관 간 데이터를 안전하게 연결하려는 사례 중 하나다. 이 사업 수행기관으로 선정된 카카오헬스케어 컨소시엄은 27개 의료기관이 각 데이터를 보유한 상태에서 안전하게 공유·활용할 수 있는 분산형 연합 데이터 체계를 구축한다.
한미약품은 보건복지부가 주관하는 371억 원 규모 ‘K-AI 신약개발 전임상·임상 모델개발 사업’의 공동 연구기관으로서 데이터 인프라 강화에 나섰다. 전임상과 임상 데이터를 통합 분석할 수 있는 AI 소프트웨어 개발이 목표로, 항암·대사질환 분야 데이터를 활용한다.
특허는 기업의 미래 기술 전략을 가늠할 수 있는 주요 기술 지표다. 다만 법률·기술적 맥락이 복잡하다는 특성상 특허 데이터를 AI가 학습할 수 있는 형태로 가공하는 작업이 까다롭다.
워트인텔리전스는 106개국 3억 건의 특허 데이터를 AI 학습이 가능한 형태로 구축하고 특허 특화 거대언어모델(LLM) ‘플루토LM’을 개발했다. 이 데이터와 모델은 지식재산처의 ‘특허 AI 에이전트’ 사업과 한국전자통신연구원(ETRI)의 특허 검색 솔루션 사업에 활용됐다. LG AI연구원과 LG전자 등 민간 분야에서도 특허 AX 협력을 확대하고 있다.
나노소재 기업들의 데이터는 장비, 과제 등 부서별로 분산돼 있고 표준화된 기준이 부재해 AI 학습에 활용하기 어려웠다. 한국나노융합산업협회는 산업통상자원부와 한국산업기술진흥원(KIAT)이 지원하는 ‘2026년 산업AI 솔루션 실증·확산 지원사업’의 주관기관으로 선정돼 이 문제 해결에 나섰다.
협회는 참여 기업들의 실험·공정·품질 데이터를 진단하고 AI 학습이 가능한 형태로 정제·구조화할 예정이다. 이후 실제 AI 모델에 적용해 업계가 공동 활용 가능한 AI 데이터 기준과 서비스 모델을 마련할 계획이다.
업계 관계자는 “산업별 데이터 표준화가 뒷받침되지 않으면 AX는 구호에 그칠 수밖에 없다”며 “정부와 민간이 함께 데이터 인프라를 쌓는 지금 단계가 향후 AX 경쟁력을 좌우할 것”이라고 말했다.
