OpenAI o1 시스템 카드
·2024.12.05 19:00
OpenAI가 o1 모델의 추론 능력과 안전성 평가 결과를 담은 시스템 카드를 공개했다.
OpenAI o1 모델 시리즈는 대규모 Reinforcement Learning을 통해 Chain-of-Thought를 활용한 추론을 수행한다. 이러한 고급 추론 능력은 모델이 안전 정책을 맥락에 따라 이해하고 준수하는 '심사숙고형 정렬(deliberative alignment)'을 가능하게 하여, 부적절한 콘텐츠 생성이나 탈옥(jailbreak) 시도에 대한 저항력을 높인다.
다만, 높아진 지능은 새로운 위험을 초래할 수 있다. OpenAI는 Preparedness Framework를 통해 다음과 같은 위험 항목을 평가했다:
- Cybersecurity: Low
- CBRN (화학·생물학적 위협): Medium
- Persuasion (설득): Medium
- Model Autonomy: Low
o1 및 o1-mini 모델은 공개 데이터, 파트너십을 통한 독점 데이터, 자체 개발 데이터셋을 활용해 사전 학습되었다. 데이터 처리 과정에서는 Moderation API와 안전 분류기를 사용하여 개인정보를 제거하고 유해 콘텐츠를 필터링하는 엄격한 과정을 거친다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.