Gemma4 전사
Gemma 4 audio with MLX
·2026.04.13 08:57
핵심 내용
macOS에서 MLX와 mlx-vlm으로 Gemma 4 E2B 오디오를 전사하는 예시다.
자세히 보기
10.28GB의 Gemma 4 E2B 모델을 macOS에서 MLX와 mlx-vlm으로 돌려 오디오 파일을 전사하는 uv run 예제가 소개됐다.
실행 예시는 uv run --python 3.13 --with mlx_vlm --with torchvision --with gradio mlx_vlm.generate 형태로, google/gemma-4-e2b-it 모델에 file.wav를 넣고 프롬프트로 Transcribe this audio를 준다. --max-tokens 500, --temperature 1.0 같은 옵션도 함께 사용한다.
14초짜리 WAV 데모에서는 모델이 짧은 음성 메모를 꽤 그럴듯하게 전사했지만, 일부 표현은 잘못 들었다. 원문이 "This right here..."와 "... how well that works"였던 부분이 각각 다른 단어로 해석된 점도 함께 언급된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.