AI Briefing

GPT-4o 시스템 카드

·2024.08.08 09:00

OpenAI가 GPT-4o의 멀티모달 기능과 오디오 관련 안전성 평가를 담은 시스템 카드를 공개했다.

GPT-4o는 텍스트, 오디오, 이미지, 비디오를 입력받아 텍스트, 오디오, 이미지를 출력하는 오토레그레시브 옴니(autoregressive omni) 모델이다. 모든 입출력을 동일한 신경망에서 처리하며, 평균 320ms의 응답 속도를 통해 인간과 유사한 대화 수준의 실시간 상호작용을 지원한다.

이번 시스템 카드는 특히 새롭게 도입된 오디오 기능이 초래할 수 있는 새로운 위험 요소들을 중점적으로 다룬다. 주요 평가 및 완화 대상은 다음과 같다:

  • 화자 식별 및 무단 음성 생성
  • 저작권 콘텐츠 생성 가능성
  • 근거 없는 추론(ungrounded inference) 및 허용되지 않은 콘텐츠 생성

평가 결과, GPT-4o의 음성 모달리티가 Preparedness(준비성) 위험을 유의미하게 증가시키지는 않는 것으로 나타났다. 4가지 Preparedness 프레임워크 카테고리 중 3개가 '낮음'을 기록했으며, 설득(persuasion) 항목이 '중간(medium)' 경계에 머물렀다.

모델 학습에는 2023년 10월까지의 데이터를 사용했다. 데이터셋은 다음과 같이 구성된다:

  • 웹 데이터: 다양한 관점과 주제를 학습하기 위한 공개 웹 페이지 데이터
  • 코드 및 수학: 논리적 추론 능력 향상을 위한 구조화된 데이터
  • 멀티모달 데이터: 이미지, 오디오, 비디오를 통한 비텍스트 입출력 학습 데이터

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.