AI Briefing

Launch HN: Tokenless (YC S26) – 비용 절감을 위한 자동 모델 스위칭

·2026.07.30 00:55

여러 모델을 동시에 실행하여 최적의 모델을 빠르게 선택함으로써 추론 비용을 절감하는 라우터 서비스가 출시되었습니다.

Tokenless는 API 호출 시 비용을 절감하기 위한 드롭인 교체형(drop-in replacement) 모델 라우터입니다.

작동 원리는 다음과 같습니다:

  • 요청이 들어오면 여러 모델에 동시에 요청을 보냅니다(Fan-out).
  • 각 모델의 추론 과정을 모니터링하다가, 특정 모델이 정답에 근접했다고 판단되면 즉시 해당 모델을 선택하고 나머지 모델의 실행을 중단합니다.
  • 이를 통해 사용자는 필요한 토큰만큼만 비용을 지불하며, 고성능 모델(Frontier model)을 무조건 사용하지 않고도 품질을 유지할 수 있습니다.

주요 특징:

  • OpenAI 및 Anthropic 호환 엔드포인트를 제공하여 기존 코드 변경을 최소화합니다.
  • 성능 지표로 단순 마케팅 문구가 아닌, 공개된 Agentic Benchmark를 기준으로 해결률(Solve rate)과 태스크당 비용을 측정하여 제공합니다.
  • 사용자의 월간 LLM 지출 규모에 따른 예상 절감액을 시뮬레이션할 수 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.