AI Briefing

smolagents, VLM 지원으로 시각 기능 추가

We now support VLMs in smolagents!

·2025.01.24 09:00

HuggingFace의 smolagents가 VLM 지원을 통해 시각적 정보를 처리할 수 있는 기능을 업데이트했다.

HuggingFace의 smolagents 라이브러리에 시각(Vision) 기능이 추가되어, 에이전트 파이프라인에서 **VLM(Vision Language Models)**을 네이티브하게 사용할 수 있게 되었다.

이미지를 전달하는 방식은 크게 두 가지로 구현된다:

  • 초기 이미지 전달: agent.run 메서드 호출 시 images 인자를 통해 여러 이미지를 한 번에 전달할 수 있다. 이는 긴 PDF 문서 내의 시각적 요소를 분석하는 작업에 유용하다.
  • 단계별 동적 전달: step_callbacks를 활용해 에이전트의 각 단계마다 이미지를 동적으로 추가할 수 있다. 이를 통해 웹 브라우징 에이전트가 행동 후 변화된 화면을 실시간으로 확인하며 작업을 수행할 수 있다.

이번 업데이트를 통해 에이전트는 텍스트 추출만으로는 파악하기 어려운 웹 페이지의 레이아웃, 아이콘, 색상 정보 등을 직접 인식하며 더욱 정교한 자율 웹 브라우징이 가능해졌다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.