Authors Guild 소송서 OpenAI 경영진 해적판 데이터 인지 및 증거 삭제 지시 드러나
핵심 내용
Authors Guild 소송 자료에서 OpenAI 경영진이 해적판 데이터 사용을 인지하고 증거 삭제를 지시한 정황이 드러났다.
자세히 보기
Authors Guild v. OpenAI 소송에서 공개된 서면 자료에 따르면, OpenAI와 Microsoft 경영진이 학습 데이터에 해적판 도서가 포함되었음을 인지하고 부정적 여론을 우려했던 것으로 드러났다.
해적판 데이터 사용 인지
2026년 9월 제출된 문서에 따르면 Sam Altman과 Dario Amodei는 2019년 4월경 Bill Gates와 Microsoft CTO Kevin Scott에게 LibGen 사용 사실을 보고했다. 내부 채팅에서 연구원 Sam McCandlish는 Hacker News에 "openai uses copyrighted data from sketchy russian website"이라는 내용이 올라오는 것이 "유감스럽다"고 우려했으며, Amodei는 해당 데이터셋을 "a bit sketchier"라고 표현했다.
증거 삭제와 'Project Clear'
소송 자료는 OpenAI가 2022년 여름 시스템에서 LibGen 파일을 제거하기 위해 **'Project Clear'**라는 코드명의 정리 작업을 시작했다고 주장한다. 연구 부사장 Bob McGrew는 회사의 높은 미디어 노출도를 이유로 "excise Libgen from our systems and storage"라고 지시했다.
일자리 대체에 대한 경영진 발언
서면 자료에는 Jack Clark OpenAI 정책 디렉터의 발언도 포함됐다. Clark은 2020년 GPT 모델이 장르 소설 작가의 노동을 "substitute for the labor"할 것이라 언급하며, 회사가 작가들의 우려를 "ignore their concerns and release anyway"할 가능성이 높다고 인정했다. 또한 연구원 Tarun Gogineni는 작가들의 데이터 절도 불만을 "acceptable economic disruption"라고 묘사했으며, GPT-5가 George R.R. Martin의 미완결 시리즈를 "autocomplete"할 수 있다고 언급했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.