Ed Newton-Rex, AI 학습용 '파생 데이터'의 창작자 피해와 규제 필요성 지적
핵심 내용
Ed Newton-Rex는 AI가 창작물을 재작성해 학습하는 파생 데이터가 탐지를 어렵게 하고 옵트아웃을 우회한다며 학습 데이터 공개 의무화를 촉구했다.
자세히 보기
Ed Newton-Rex는 AI 학습 과정에서 발생하는 파생 데이터(derived data) 문제를 지적하며, 이에 대한 사회적 관심과 규제가 시급하다고 주장했다. 기존에는 해적판이나 웹 스크래핑 데이터에 대한 소송이 100건 이상 제기되는 등 불법 수집 데이터에 초점이 맞춰졌으나, AI가 창작물을 먼저 재작성한 후 이를 학습에 사용하는 방식은 탐지가 어려워 창작자에게 동일한 피해를 입힌다.
파생 데이터의 작동 방식과 위험성
파생 데이터는 원본 창작물을 AI 모델이 직접 학습하는 대신, AI를 통해 문장 등을 재작성한 결과를 학습에 사용하는 것을 의미한다. 이 방식은 모델이 원본을 그대로 출력할 가능성이 낮아져 탐지가 어렵지만, 결과적으로는 허락 없이 창작물을 경쟁 제품 개발에 이용하는 것과 같다. AI 모델 성능이 향상될수록 이러한 파생 데이터 생성이 쉬워지고 빈번해져, 창작자가 자신의 작품이 악용되는 것을 인지하고 대응하기가 더욱 힘들어진다.
옵트아웃 우회와 규제 필요성
이 문제는 AI 기업들이 옵트아웃(opt-out) 조치를 우회하는 수단으로도 악용될 수 있다. 플랫폼이 특정 데이터를 학습하지 않기로 약속했더라도, 해당 데이터를 AI로 재작성한 파생 데이터까지 학습 대상에서 제외하지 않으면 기업은 법적 책임을 피할 수 있다. Newton-Rex는 이러한 문제를 해결하기 위한 유일한 방법은 학습 데이터 공개 의무화라고 강조하며, AI 기업이 학습 데이터를 투명하게 공개하도록 하는 법적 규제가 필요하다고 촉구했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.