이러한 장벽을 해소하는 것은 데이터 자원을 활용하고, 2030년까지의 인공지능 국가전략 목표 실현과 2045년까지의 비전을 달성하는 데 필수적이다.
인공지능 국가전략은 2026년 8월 28일자 총리 결정 제1671/QD-TTg호로 승인됐다. 단순한 AI 연구·개발·적용을 넘어 AI 연구 및 개발이 주도하는 국가적 전환을 지향하는 변화를 예고한다. 이 새로운 접근법에서는 인적 자원, 인프라, 데이터가 기반 요소로 규정된다. 특히 데이터 및 AI 모델 분야에서는 AI 연구, 개발, 교육, 테스트, 평가, 배포를 지원하기 위한 데이터, 데이터 인프라, 모델의 개발을 강조하고 있다.
이러한 요구는 국가 데이터베이스(DB), 전문DB, 공유DB, 대규모 고품질 데이터셋의 개발·개방·공유, 데이터·제품·서비스 공유를 위한 인프라 및 플랫폼, 데이터 시장의 구축, 데이터 개방·공유·유통·안전한 접근·상호운용성 확보를 위한 제도 완비 등 일련의 과업으로 구체화된다. 특히, 데이터에 대한 재산권, 지적재산권, AI를 위한 합법적 콘텐츠 이용에 관한 규정 정비 과제가 전략에 명시되어 있다.
이러한 과제들은 베트남어 AI 모델 개발 목표와 직접적으로 연관된다. 전략은 2030년까지 엣지 디바이스 및 특수 목적의 소형 모델부터 국가적 기반 문제 해결 및 지역·국제 경쟁을 위한 초대형 모델에 이르기까지 최소 8개의 다양한 규모의 베트남어 AI 모델을 개발하는 것을 목표로 한다.
이러한 모델 구축에는 컴퓨팅 역량과 전문가 집단뿐만 아니라 방대한 양의 고품질·다양한 데이터가 필수적이다. 그러나 실제로 인터넷에서의 자동 데이터 수집 및 모델 학습 과정에서는 저작권 보호를 받는 도서, 신문, 이미지, 동영상, 소프트웨어 소스코드 등이 복제되는 경우가 많다. 따라서 데이터 개방 및 활용 요구와 더불어, AI 모델 학습을 위한 보호 콘텐츠의 합법적 이용 범위를 명확히 규정할 필요가 있다.
국회 법률사법위원회의 호앙 민 히에우 상임위원에 따르면, 현행 법률에는 학습 데이터에 대한 정보 공개 의무가 없다. 인공지능법은 데이터, 개인정보 보호, 지적재산권, 사이버보안 관련 법률을 위반하여 AI 시스템 개발·학습·테스트·운영을 위한 데이터 수집·처리·이용을 금지하며, 기록 보관 및 요청 시 정보 제공을 요구한다. 이러한 규정은 점검 및 집행의 근거를 제공하지만, 권리자가 자신의 저작물이 학습 데이터셋에 사용되었는지 알 수 있는 메커니즘은 마련되어 있지 않다.
실제 개발 경험을 바탕으로, 과학기술부는 법률 AI 플랫폼을 법령 검토 우선 대상으로 권고하고 있다. 베트남법률미디어주식회사 대표 쩐반찌는 AI 개발을 위한 데이터 이용 범위, 특히 공개 접근 가능한 데이터와 합법적으로 복제·저장·학습에 사용할 수 있는 데이터의 구분이 명확해야 한다고 지적했다. 이 경계가 불분명할 경우, 저작권 및 관련 권리 보유자의 권리 행사와 학습 데이터 사용에 따른 사용자의 로열티 지급 의무 이행이 어려워진다.
찌 대표는 법률 AI 플랫폼의 입력 데이터 소스가 저작권 보호 범위에 해당하지 않는 법규 및 행정문서임을 예로 들었다. 그러나 이는 법률문서로부터 생성된 모든 산출물이 자유롭게 복제될 수 있음을 의미하지 않는다. 소프트웨어, 분류체계, 법적 효력 관련 링크, 개정 이력, 조항 주석, 편집 콘텐츠 등에는 지적재산권이 존재할 수 있기 때문이다.
이는 데이터의 출처, 법적 지위, 활용 허용 범위의 사전 확인이 AI 학습 데이터 편입 전 필수적임을 시사한다. 따라서 학습 데이터의 투명성 확보 의무를 법제화하고, AI 모델 개발자는 데이터 소스, 이용 근거 및 범위에 관한 정보를 보관하며, 권리자의 정당한 요청을 접수·처리할 수 있는 메커니즘을 마련해야 한다.
투명성 메커니즘이 부재할 경우, AI를 위한 데이터 시장 발전이 저해된다. 연구·기술개발 명목으로 데이터를 무상 활용할 수 있다면, AI 개발자들은 사용권 협상에 나설 유인이 줄어들기 때문이다. 동시에, 베트남의 디지털 아카이브, 언론, 문학, 음악 등이 해외에서 호스팅되는 모델 학습에 자동 수집되어 저작자나 국가에 아무런 수익도 발생시키지 못할 위험도 있다.
전문가들은 학습 데이터 준수 의무를 AI 제품·서비스의 베트남 시장 제공과 연계하는 규정 보완이 필요하다고 본다. 이러한 방향의 규정 정비는 국내 기업의 경쟁력 저하를 방지하고, 국가 데이터 자원 보호 수단을 제공할 것이다.
AI 학습 데이터 투명성에 관한 구체적 규정이 없는 상황에서, 브로스앤파트너스지적재산권회사 대표 레꽝빈 변호사는 기업들이 입력 데이터 소스 관리에 선제적으로 나설 것을 조언했다. 즉, 데이터 수집 경로를 명확히 하고, 활용 과정을 기록·보관하여 분쟁 발생 시 증거로 활용해야 한다는 것이다.
호앙 민 히에우 위원은 법적 프레임워크 개선과 더불어, 국회가 정책 및 법률 이행에 대한 감독을 지속적으로 강화해야 한다고 강조했다. 정부는 일정 기간 시행 후 영향평가 결과를 국회에 보고해야 하며, 문서 및 입력 데이터 활용 관련 분쟁 발생 건수, 저작권 및 관련 권리 유보 신고 건수, 학습 데이터 라이선스 거래 건수, 국내 AI 기업의 평균 준수 비용 등 구체적 정량 지표를 활용해야 한다고 제안했다.
데이터 활용 장벽 해소는 인공지능 국가전략 목표 실현의 핵심이다. 모든 당사자의 권리와 의무가 명확히 규정될 때, 데이터는 안전하고 합법적으로 공유·활용될 수 있으며, 이는 베트남 AI 모델 연구·교육·개발을 위한 자원으로 이어질 것이다.