AI Briefing

Promptimus: 이미 좋은 LLM 프롬프트를 자동으로 최적화

·2026.05.14 22:47

Promptimus가 수작업 없이 이미 좋은 LLM 프롬프트를 자동 개선한다.

Promptimus는 이미 잘 만든 LLM 프롬프트를 수작업 없이 더 끌어올리는 자동 최적화 방법이다. 적은 샘플로도 소스 모델에서 다듬은 프롬프트를 타깃 모델에 맞게 다시 최적화하며, 사용자 정의 성능 지표를 기준으로 반복 개선한다.

입력은 타깃 LLM, 초기 프롬프트 템플릿, 20~50샘플 규모의 JSONL 데이터셋, 그리고 사용자 정의 Python 메트릭 함수다. 샘플에 정답이 없어도 되며, 개발셋과 홀드아웃 테스트셋으로 나눠 최적화와 검증을 분리한다.

작동은 4단계 루프로 진행된다.

  • 평가: 개발셋으로 기준 성능을 측정하고, metric-analyzer가 체크포인트 함수를 생성해 실패 지점을 세분화한다.
  • 피드백 생성: 병목 체크포인트와 성공·실패 사례를 함께 분석해 원인과 수정 방향을 찾는다.
  • 전략 및 수정 생성: standard mode는 전체 재작성, edit mode는 find-and-replace 기반의 국소 수정을 만든다.
  • 후보 평가: 후보를 실행해 점수를 비교하고, 가장 좋은 안을 다음 반복의 출발점으로 삼는다.

edit modeAPI 스키마, 규정, 도메인 분류 체계처럼 구조가 중요한 긴 프롬프트에 특히 잘 맞는다. 5만~10만 토큰급 프롬프트에서도 보통 3~5개, 총 500~1,000토큰 수준만 고치며, 프로그램식 매칭은 exact, whitespace-normalized fuzzy, similarity의 3단계로 처리해 LLM 호출 없이 97.3% 성공률을 냈다.

실험에서는 동일한 optimizer model과 평가 예산을 쓰고 Claude Sonnet 4.6을 타깃 모델로 맞춘 뒤, 5개 random seed 평균으로 비교했다. 20개 공개 벤치마크16개에서 최고 성능을 기록했고, 1개는 동률이었으며, 평균 점수는 0.792로 기존 최선 조합의 0.765를 앞섰다. 특히 멀티모달 과제에서는 edit mode가 기존 프롬프트 구조를 보존하면서 성능을 끌어올렸다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.