AI Briefing

fine-tuning API에 vision 기능 도입

·2024.10.01 19:04

OpenAI가 이미지와 텍스트를 함께 사용하여 GPT-4o를 학습시킬 수 있는 vision fine-tuning 기능을 출시했다.

GPT-4ovision fine-tuning 기능이 도입되어, 이제 개발자는 텍스트뿐만 아니라 이미지를 포함한 데이터셋으로 모델을 맞춤형 학습시킬 수 있다. 이를 통해 시각적 검색, 자율주행 객체 탐지, 의료 영상 분석 등 시각적 이해가 필수적인 분야의 성능을 극대화할 수 있다.

학습 방식은 기존 텍스트 fine-tuning과 유사하며, 적절한 형식의 이미지 데이터셋을 업로드하는 방식으로 진행된다. 단 100장의 이미지만으로도 성능 향상이 가능하며, 데이터 양이 많아질수록 더욱 정교한 결과물을 얻을 수 있다.

주요 활용 사례는 다음과 같다:

  • Grab: 도로 이미지를 학습시켜 차선 수 정확도를 20%, 속도 제한 표지판 위치 탐지 정확도를 13% 개선했다.
  • Automat: 스크린샷 데이터를 활용해 UI 요소를 인식하는 RPA 에이전트의 성공률을 16.60%에서 61.67%로 높였다.
  • Coframe: 이미지와 코드를 함께 학습시켜 웹사이트 생성 시 시각적 스타일과 레이아웃 일치도를 26% 향상시켰다.

OpenAI는 fine-tuning 모델에 대해 지속적인 자동화 안전 평가를 수행하며, Enterprise privacy 약속을 통해 데이터 보안을 보장한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.