AI Briefing

FlowEval: 생성된 사용자 인터페이스(UI)의 참조 기반 평가

·2026.07.07 09:00

LLM이 생성한 UI가 실제 웹사이트처럼 자연스러운 상호작용 흐름을 지원하는지 측정하는 FlowEval 프레임워크를 제안한다.

LLM과 코딩 에이전트가 UI 개발에 널리 활용되고 있지만, 이들이 생성한 인터페이스의 시각적 및 상호작용 디자인 역량을 신뢰성 있게 평가하는 것은 여전히 어려운 과제다.

기존 평가 방식은 두 가지 한계가 있다.

  • 인간 전문가 평가: 정확한 사용성 측정이 가능하지만 비용이 많이 들고 속도가 느림
  • 자동화된 평가(Automated Judges): 확장성은 높지만 정확도가 떨어지고 평가 과정이 불투명함

FlowEval은 이러한 문제를 해결하기 위해 제안된 참조 기반(Reference-based) 프레임워크다. 이 프레임워크는 실제 웹사이트의 내비게이션 경로(Navigation traces)를 기준으로, 생성된 UI가 현실적인 상호작용 흐름을 지원하는지 비교하여 측정한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.