제65회 ALAI Korea 월례연구회(2026년 9월 16일)
[주제1] “검색 강화 생성(RAG)과 저작권법적 쟁점” 발제자 : 김병일 (한양대학교 법학전문대학원 교수); [주제2] “AI 학습에서 ”변형적 이용“과 ”잠재적 시장“의 의미에 대한 검토” 발제자 : 김현경 (서울과학기술대학교 IT정책전문대학원 교수)
[주제1] “검색 강화 생성(RAG)과 저작권법적 쟁점”
발제자 : 김병일 (한양대학교 법학전문대학원 교수)
최근 생성형 AI 모델의 학습(training) 단계에서 이루어지는 저작물 이용에 관한 논의가 활발하게 이루어지고 있으나, 광범위하게 활용되는 검색강화생성(RAG) 기술과 관련된 저작물 이용 문제는 상대적으로 학술적 관심을 충분히 받지 못하였다. RAG는 언어모델 출력물의 신뢰성과 최신성을 제고하기 위하여 외부 데이터베이스·문서저장소에서 관련 정보를 검색한 후 이를 생성 과정에 반영하는 기술로서, 외부 데이터의 수집·정제·분할 및 벡터화가 이루어지는 데이터 준비 단계와 이용자의 질의를 분석하여 관련 정보를 검색하고 최종 답변을 생성하는 실시간 처리 단계로 구분된다. 본 연구는 전통적인 법적 포섭 방법론에 따라 RAG의 작동 과정에서 이루어지는 저작물의 이용과 그에 따른 저작권법적 쟁점을 현행 저작권법 체계 내에서 검토하고, 향후 판단을 위한 기초적 분석틀을 제시한다.
RAG의 처리과정은 데이터베이스 저장 단계, 접근·식별·통합 단계, 출력물 생성 단계로 구분된다. 내부 데이터베이스에 원문 또는 청크가 유형물에 그대로 고정되는 경우 복제 해당성이 명확하며, RAG의 내부 데이터베이스 구축은 통상 기업·기관이 업무수행 또는 서비스 제공을 위해 조직적으로 이루어져 사적이용의 범위를 벗어난다고 볼 여지가 크다. 한국 저작권법에는 TDM 활동을 포괄적으로 수용하는 명시적 제한규정이 부재하여, 현행법 체계 내에서 RAG의 데이터 저장 단계를 포괄적으로 정당화할 수 있는 명시적 근거는 현재로서는 찾기 어렵다. 접근·식별·프롬프트통합 단계에서는 소스데이터 저장과 임베딩 저장을 구분할 필요가 있다. 소스데이터는 향후 다수 질의에 대비해 사전 구축·유지되는 지식저장소로서 제35조의2에 의한 면책 가능성은 낮으며, 임베딩 생성 과정의 중간적·일시적 복제와 재구성 불가능한 순수 통계적 임베딩에는 제한적 적법성을 인정할 여지가 있다.
출력물 생성 단계에서는 암기화로 인해 저작물이 정확하게 또는 거의 동일하게 출력될 가능성과 인용의 자유 적용 가능성을 검토하였다. 인용된 저작물이 자신의 주장을 뒷받침·설명하는 근거로 기능하고, 목적 달성에 필요한 범위와 출처명시 등의 요건을 충족하는 경우 제28조에 따른 면책 가능성이 있다. 또한 미국의 공정이용 4요소, 일본의 비향유목적·경미이용 법리는 한국 저작권법상 공정이용 일반조항의 해석·적용에 유의미한 참고자료를 제공한다. 구체적 적법성은 데이터 수집방식, 저장범위, 출력의 재현정도, 출처연결방식 및 라이선스시장과의 관계 등 개별 사실관계에 따라 판단될 가능성이 크며, 향후 내부DB 접근형과 웹 접근형 RAG의 구분에 따른 세분화된 법리 구성과 TDM에 관한 명시적 제한규정의 도입 논의가 필요하다.
[주제2] “AI 학습에서 ”변형적 이용“과 ”잠재적 시장“의 의미에 대한 검토”
발제자 : 김현경 (서울과학기술대학교 IT정책전문대학원 교수)
인공지능 학습 행위에 대한 공정이용 논의는 최근 미국의 주요 판례와 저작권청 보고서를 기점으로 본격화되었으나, 이를 판단하기 위한 법적 기준은 여전히 명확하지 않다. 특히 공정이용의 핵심 요소인 변형적 이용과 잠재적 시장 영향성은 AI 기술의 유형, 데이터 이용 방식, 시장 구조에 따라 상이하게 해석되고 있어 법적 예측 가능성과 규범적 일관성이 낮은 상황이다. 이러한 두 요소의 법리적 구조와 정책적 함의를 분석하여 AI 학습행위에 적용 가능한 공정이용 판단의 합리적 기준을 제시하고자 한다.
변형성과 관련하여 AI 학습의 목적은 기존 저작물의 표현을 재현하거나 감상하기 위한 것이 아니라, 언어적 패턴 분석과 정보 추출을 통해 새로운 기능을 창출하는 데 있다는 점에서 변형적 이용으로 평가될 수 있다. 다만 비표현적 이용 여부가 공정이용 판단의 하위 요소인지, 혹은 저작권 보호 대상성 판단의 전제로 기능하는지에 대해서는 법리적 정립이 필요하다. 또한 생성형과 비생성형이라는 이분법보다는 각 AI 기술의 목적, 구조, 출력 메커니즘에 따라 사안별로 판단해야 하며, 기술적 안전장치는 학습 자체의 제한 근거가 아니라 출력 단계의 침해 가능성을 조절하는 수단으로 이해할 필요가 있다. 공표 저작물에 대한 ‘적법한 접근’ 요건 역시 공정이용의 본질과 조화되는지에 대한 추가적인 검토가 요구된다.
잠재적 시장 영향성과 관련해서는 AI 출력물이 원저작물의 기존 시장을 대체하는지 여부뿐 아니라, 학습데이터 라이선스 시장이 저작권자의 정당한 통제 범위에 포함될 수 있는지, 그리고 그 보호가 기술혁신과 창작 인센티브에 어떠한 균형적 결과를 초래하는지에 대한 정책적 분석이 필요하다. AI 학습데이터 무단 이용이 시장 형성을 저해할 수 있다는 우려가 제기되지만, AI 기술의 수요자가 일반 소비자가 아닌 기술 개발자라는 점 학습데이터 시장의 구조적 한계 및 순환성 그리고 AI 생성물의 공익적 활용 가능성을 고려할 때 잠재적 시장 개념을 과도하게 확대하는 것은 저작권법의 본래 목적을 벗어날 우려가 있다.