Google, TEE 기반 연합 학습으로 Gboard 모델 학습 시 외부 검증 가능한 차등 프라이버시 적용
Google의 TEE 기반 연합 학습(FL) 외부에서 검증 가능한 차등 프라이버시로 Gboard 모델 학습 사례 공유
·2026.10.11 13:30
핵심 내용
Gboard 학습 기간을 2개월에서 3주로 단축하고 프라이버시 예산을 3배 개선
1 / 5
자세히 보기
Google Research가 신뢰 실행 환경(TEE) 기반 연합 학습(FL) 시스템을 발표하며, Gboard 영어 및 일본어 다음 단어 예측 모델 학습에 차등 프라이버시(DP)를 적용한 사례를 공개했다. 이 시스템은 기기 데이터를 서버 TEE 내에서만 복호화하여 학습에 사용하며, 외부 제3자가 DP 노이즈 적용 여부를 코드로 검증할 수 있는 '외부에서 검증 가능한 중앙 DP 보장'을 제공한다.
핵심 메커니즘 및 구조
- 신뢰 사슬: 기기에서 KMS(Key Management System), 루트 TEE, 워커 TEE로 이어지는 신뢰 사슬을 구성한다. 기기는 접근 정책이 공개 투명성 로그(Rekor)에 등록된 경우에만 데이터를 암호화하여 업로드한다.
- 워크로드 실행: 루트 TEE가 Python 프로그램(trusted_program)을 실행하며, 하위 작업은 워커 TEE 클러스터에 분산된다. 루트와 워커 간에는 Noise 프로토콜로 종단 간 암호화 채널을 구성한다.
- 검증: KMS 및 데이터 처리 바이너리는 오픈소스 코드에서 재현 가능하게 빌드(Reproducible Build)할 수 있어 투명성을 확보한다.
Gboard 실험 결과 및 개선점
- 학습 효율성: 기존 시스템은 참여 기기 가용성에 의존하여 학습에 1~2개월이 소요되었으나, 신규 시스템은 업로드 데이터를 먼저 수집한 후 서버에서 최적화하여 학습 기간을 3주로 단축했다.
- 프라이버시 예산: A/B 테스트 결과, TEE 실험군의 zCDP(차등 프라이버시 예산 지표)는 0.215로, 기존 운영 모델의 0.641보다 약 3배 작아 더 강력한 프라이버시 보호를 제공한다.
- 사용성: Words Per Minute, Words Modified Ratio 등 핵심 사용성 지표에서는 기존 모델과 차이가 없는 중립(neutral)한 결과를 보였다.
한계 및 향후 과제
- TEE 부채널: 현세대 TEE는 부채널 분석에 취약할 수 있으며, 이는 현재 위협 모델 밖으로 간주되어 개발자의 몫으로 남겨진다.
- 모델 규모: 현재까지 학습된 모델은 10M 파라미터 이하로 제한되며, 더 큰 모델을 위해서는 GPU 사용 및 통신 병목 해결이 필요하다.
- 검증 범위: 공개되는 것은 Python 프로그램과 바이너리이며, 사이드로딩된 비공개 로직이나 파라미터는 검증 대상에서 제외된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.