0.34.11주 전
v0.34.1
핵심 내용
MLX 모델 생성의 실험 단계 종료 및 Apple Silicon 메모리 처리 개선, 대규모 모델 라이브러리에서 API 응답 속도 대폭 향상
자세히 보기
주요 변경 사항
성능 개선
/api/tags엔드포인트의 응답 속도가 대규모 모델 라이브러리 환경에서 대폭 향상되었습니다. 테스트 기준 콜드 스타트 시 약 3.1초에서 294ms로 개선되었으며, 모델 기능(capabilities) 보고가 일관되게 처리됩니다.- Apple Silicon 환경에서 MLX의 메모리 처리 방식이 개선되었습니다.
기능 변경 및 Breaking Changes
- MLX safetensors를 이용한
ollama create명령어가 더 이상 실험적 기능이 아닙니다. - GGUF 모델 생성 시 safetensor 변환 및 양자화(quantization)를 위해 반드시 llama.cpp 도구를 사용해야 합니다.
폐기 및 제거
typical_p파라미터가 폐기되었습니다. 새로운 모델 생성 시 설정할 수 없으며, 기존 GGUF 모델에 대해서만 지원이 유지됩니다.
버그 수정 및 기타
- 반복 토큰 runaway 감지 로직이 수정되어, 오탐지(false positives, 예: OCR 작업 중)를 줄이기 위해 반복 토큰 수 기준이 100개로 상향 조정되었습니다.
- MLX 및 llama.cpp 라이브러리가 업데이트되었습니다.