AI Briefing

Show HN: Forge – 가드레일로 8B 모델의 에이전트 태스크 성능을 53%에서 99%로 향상

·2026.05.19 21:23

핵심 내용

로컬 LLM의 도구 호출 신뢰성을 높이는 가드레일 프레임워크 Forge가 공개됐다.

자세히 보기

Forge는 자체 호스팅 LLM의 도구 호출(tool-calling) 신뢰성을 개선하는 Python 라이브러리다. 가드레일(rescue parsing, retry nudges, step enforcement)과 컨텍스트 관리(VRAM 기반 예산, 계층적 압축)를 통해 8B 로컬 모델을 멀티스텝 에이전트 워크플로우에서 최상위 수준으로 끌어올린다.

핵심 성능: Ministral-3 8B Instruct Q8 + llama-server 조합이 26개 시나리오 평가에서 86.5%, 최고난이도 태스크에서 76% 달성.

세 가지 사용 방식

  • WorkflowRunner: 도구 정의부터 에이전트 루프까지 전체 생명주기 관리
  • 가드레일 미들웨어: 기존 오케스트레이션 루프에 신뢰성 스택만 삽입
  • 프록시 서버: OpenAI 호환 프록시로 모든 클라이언트에 투명하게 가드레일 적용 (python -m forge.proxy)

Ollama, llama-server(llama.cpp), Llamafile, Anthropic 백엔드 지원. 프록시는 자동으로 respond 도구를 주입해 소형 모델이 텍스트와 도구 호출을 올바르게 선택하도록 유도한다.

검증 체계: 865개 단위 테스트와 26개 시나리오 평가 하네스 포함. PyPI 배포 및 ACM 학술지 게재 논문 공개.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.