실제 데이터를 넘어: 정규화 관점에서 본 합성 데이터
핵심 내용
합성 데이터는 많을수록 좋지 않으며, 실제 데이터와의 비율에 최적점이 있다.
자세히 보기
합성 데이터는 실제 데이터가 부족할 때 일반화 성능을 끌어올릴 수 있지만, 비율이 과해지면 실제 분포와의 차이 때문에 오히려 성능이 떨어질 수 있다. 여기서는 이 균형을 정규화(regularization) 관점의 학습이론으로 정량화해, 합성 데이터와 실제 데이터의 최적 비율을 설명한다.
핵심은 algorithmic stability를 이용해 일반화 오차 경계를 유도하고, 실제 분포와 합성 분포 사이의 Wasserstein distance에 따라 기대 테스트 오차를 최소화하는 synthetic-to-real ratio를 제시한 점이다. 이 이론은 혼합 데이터를 다루는 kernel ridge regression 설정에서 직관과 수학적 분석을 함께 제공한다.
이 프레임워크는 테스트 오차가 합성 데이터 비중에 따라 U-shaped로 변한다는 예측도 낳는다. 즉, 합성 데이터를 조금만 쓰거나 너무 많이 쓰는 경우보다, 두 데이터를 적절히 섞는 구간에서 성능이 가장 좋아진다.
실험적으로는 CIFAR-10과 임상 brain MRI 데이터셋에서 이 예측을 검증했다. 또한 이 이론은 domain adaptation으로 확장되며, 제한적인 소스 데이터와 합성 타깃 데이터를 잘 섞으면 도메인 시프트를 줄이고 일반화 성능을 높일 수 있음을 보여준다.
정리하면:
- 합성 데이터는 대체재가 아니라 비율 조절이 중요한 자원이다.
- 실제-합성 분포 차이가 클수록 최적 비율은 달라진다.
- 도메인 내부 학습뿐 아니라 out-of-domain 전이에도 같은 원리가 적용된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.