Interfaze: 대규모 환경에서 높은 정확도를 내는 새로운 모델 아키텍처
·2026.05.12 01:22
Interfaze가 OCR·STT·구조화 출력용 새 모델 아키텍처와 API를 공개했다.
Interfaze는 DNN/CNN + transformer decoder를 결합한 하이브리드 아키텍처를 내세우며, OCR·객체/GUI 탐지·web extraction/search·STT·translation 같은 결정적 작업에 맞췄다고 설명한다.
- 스펙: context window 1M tokens, max output 32k tokens, 입력은 text/image/audio/file, reasoning은 기본 비활성화.
- 자체 벤치마크: OCRBench V2, olmOCR, RefCOCO, VoxPopuli-Cleaned-AA, Spider 2.0-Lite, GPQA Diamond, MMMLU, MMMU-Pro, SOB에서 Gemini-3-Flash, Claude-Sonnet-4.6, GPT-5.4-Mini, Grok-4.3와 비교한 결과를 공개했다.
- 가격: input $1.50 / 100만 토큰, output $3.50 / 100만 토큰으로 책정했다.
- OCR: 복잡한 PDF와 이미지에서 텍스트와 그래픽 객체의 픽셀 좌표를 함께 반환하고, raw OCR precontext와 confidence까지 노출한다고 설명한다.
- STT: VoxPopuli-Cleaned-AA에서 **WER 2.4%**를 제시했고, 초당 209초 오디오를 처리한다고 밝혔다.
- 연동: OpenAI Chat Completions 호환 API를
https://api.interfaze.ai/v1에 붙여 사용할 수 있다.
SOB는 정답이 이미 컨텍스트에 주어진 상태에서 모델이 JSON 구조로 정확히 값을 채워 넣는 능력을 재는 벤치마크라고 설명한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.