신뢰할 수 있는 AI 에이전트를 만드는 보이지 않는 일
핵심 내용
AI 에이전트의 핵심은 화려한 기능보다 스크롤·클릭의 신뢰성이다.
자세히 보기
AI 에이전트가 여행 예약을 대신해주는 모습은 매력적이지만, 실제로는 스크롤, 클릭, 탭, 팝업 뒤 날짜 선택, 폼 복구 같은 아주 작은 동작들이 먼저 완벽해야 한다. 아마존 내부에서는 이런 기본기를 normcore agents라 부르며, 현실 소프트웨어를 다루는 데 필요한 가장 평범하지만 가장 중요한 상호작용을 극도로 잘하게 만드는 데 집중한다.
이를 위해 Amazon AGI Lab은 고충실도 reinforcement learning(RL) ‘gym’들을 만들고 있다. 각 gym은 하나의 기술을 분리해 반복 훈련하고, 조건을 바꾸고, 실패를 유도하고, 결과를 계측해 에이전트가 웹 인터페이스의 난잡함과 레거시 시스템의 예측 불가능성을 견디도록 설계된다. 이 환경은 여행 예약만이 아니라 주소 입력, 드롭다운 선택, 다단계 업무 흐름처럼 실제 업무를 구성하는 원자적 행동을 학습시키는 기반이 된다.
신뢰성은 이 접근의 중심이다. 에이전트는 단순히 출력을 내는 모델이 아니라 실제 시스템 상태를 바꾸는 행위자이기 때문에, 행동 이후 시스템이 올바르게 반응했는지 스스로 판단할 수 있어야 한다. 이를 위해 환경은 DOM 구조, UI 타이밍, 네트워크 동작, 백엔드 상태 변화 같은 정답 신호를 제공하고, 각 task는 성공 조건과 허용되는 변경, 절대 일어나면 안 되는 변경을 명시한 formal verifier로 평가된다.
예를 들어 “e-mail 보내기” task는 버튼 클릭처럼 보이는지로 끝나지 않는다. 정확히 1개의 새 e-mail 레코드만 생성되고, 다른 레코드가 수정·삭제되지 않았을 때에만 성공으로 인정된다. 이렇게 검증 가능한 보상 신호를 수천 번 반복해 주는 과정이, 일회성 성공을 실제 운영에 쓸 수 있는 안정적인 능력으로 바꾼다.
아마존은 이미 수십 개 도메인과 수천 개 task에 걸친 gym에서 에이전트를 훈련하고 있다. 예시는 다음과 같다.
- calendar stability test: UI 요소가 확대·재렌더링·레이어 겹침으로 흔들려도 날짜를 정확히 한 번만 선택하고 백엔드 상태까지 검증
- dropdown discipline drill: 화면상 변경과 실제 시스템 반영이 어긋날 수 있음을 학습하고, UI가 아니라 시스템 상태를 신뢰
- async endurance run: 검색, 필터링, 검증, 새로고침이 얽힌 긴 비동기 흐름에서 타이밍 오류와 간헐적 실패를 견디며 일관성 유지
핵심 메시지는 분명하다. 사람에게는 사소해 보이는 조작을 에이전트가 안정적으로 수행할 수 있어야만, 그 위에 여행 예약이나 업무 자동화 같은 큰 기능이 쌓인다. 결국 신뢰할 수 있는 AI 에이전트는 ‘똑똑함’보다 먼저, 작은 일을 끝까지 정확하게 해내는 훈련에서 만들어진다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.