AI Briefing

이미지로 사고하기

·2025.04.16 19:00

OpenAI가 이미지 내에서 직접 크롭, 확대, 회전하며 시각적 추론을 수행하는 o3 및 o4-mini를 공개했다.

OpenAI의 최신 o-series 모델인 o3o4-mini는 단순한 이미지 인식을 넘어, chain-of-thought(사고의 사슬) 과정에서 이미지를 직접 활용하는 시각적 추론 능력을 선보였다.

이 모델들은 별도의 전문 모델 없이도 이미지 처리 도구를 활용해 이미지를 크롭(crop), 확대(zoom), **회전(rotate)**할 수 있다. 이를 통해 텍스트와 시각적 추론을 결합한 새로운 test-time compute scaling 축을 형성하며, 멀티모달 벤치마크에서 뛰어난 성능을 기록했다.

주요 특징은 다음과 같다:

  • 강화된 시각 지능: 불완전한 사진에서도 정보를 정확히 추출하기 위해 이미지를 자동으로 조작하여 분석한다.
  • 멀티모달 에이전트: Python 데이터 분석, 웹 검색, 이미지 생성 기능과 결합하여 복잡한 문제를 해결하는 에이전트 경험을 제공한다.
  • 유연한 상호작용: 글씨가 뒤집힌 노트의 내용을 읽기 위해 이미지를 회전하거나, 미로의 경로를 찾아 시각화하는 등의 고차원적 작업이 가능하다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.