Promptimus: 이미 좋은 LLM 프롬프트를 자동으로 최적화
Promptimus가 수작업 없이 이미 좋은 LLM 프롬프트를 자동 개선한다.
Promptimus는 이미 잘 만든 LLM 프롬프트를 수작업 없이 더 끌어올리는 자동 최적화 방법이다. 적은 샘플로도 소스 모델에서 다듬은 프롬프트를 타깃 모델에 맞게 다시 최적화하며, 사용자 정의 성능 지표를 기준으로 반복 개선한다.
입력은 타깃 LLM, 초기 프롬프트 템플릿, 20~50샘플 규모의 JSONL 데이터셋, 그리고 사용자 정의 Python 메트릭 함수다. 샘플에 정답이 없어도 되며, 개발셋과 홀드아웃 테스트셋으로 나눠 최적화와 검증을 분리한다.
작동은 4단계 루프로 진행된다.
- 평가: 개발셋으로 기준 성능을 측정하고, metric-analyzer가 체크포인트 함수를 생성해 실패 지점을 세분화한다.
- 피드백 생성: 병목 체크포인트와 성공·실패 사례를 함께 분석해 원인과 수정 방향을 찾는다.
- 전략 및 수정 생성: standard mode는 전체 재작성, edit mode는 find-and-replace 기반의 국소 수정을 만든다.
- 후보 평가: 후보를 실행해 점수를 비교하고, 가장 좋은 안을 다음 반복의 출발점으로 삼는다.
edit mode는 API 스키마, 규정, 도메인 분류 체계처럼 구조가 중요한 긴 프롬프트에 특히 잘 맞는다. 5만~10만 토큰급 프롬프트에서도 보통 3~5개, 총 500~1,000토큰 수준만 고치며, 프로그램식 매칭은 exact, whitespace-normalized fuzzy, similarity의 3단계로 처리해 LLM 호출 없이 97.3% 성공률을 냈다.
실험에서는 동일한 optimizer model과 평가 예산을 쓰고 Claude Sonnet 4.6을 타깃 모델로 맞춘 뒤, 5개 random seed 평균으로 비교했다. 20개 공개 벤치마크 중 16개에서 최고 성능을 기록했고, 1개는 동률이었으며, 평균 점수는 0.792로 기존 최선 조합의 0.765를 앞섰다. 특히 멀티모달 과제에서는 edit mode가 기존 프롬프트 구조를 보존하면서 성능을 끌어올렸다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.