AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#inference-optimization
#inference-optimization와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#inference-optimization 5페이지 | AI Briefing
BeeLlama v0.2.0: DFlash로 추론 속도 향상
Reddit
·
1
·
2026.05.23 02시
llama.cpp, MTP 모델 VRAM 누수 수정
Reddit
·
2026.05.22 07시
llama.cpp, MTP 성능 개선
Reddit
·
2026.05.21 02시
Show HN: Forge – 가드레일로 8B 모델의 에이전트 태스크 성능을 53%에서 99%로 향상
Hacker News
·
2026.05.19 21시
AI 에이전트용 UI API 'M1' 출시
Product Hunt
·
2026.05.18 13시
DeepSeek-V4-Flash로 LLM 조향(Steering)이 다시 흥미로워졌다
GeekNews
·
2026.05.17 08시
cyankiwi, AWQ 양자화 방식 개선
Reddit
·
2026.05.15 03시
continuous batching의 비동기화
TLDR AI
·
2026.05.15 00시
llama.cpp, MTP와 멀티모달 통합 지원 준비
Reddit
·
2026.05.12 07시
BeeLlama.cpp: llama.cpp 최적화
Reddit
·
2026.05.10 01시
Gemma 4용 DFlash 공개
Reddit
·
2026.05.08 23시
Meta의 추천 시스템 추론 최적화
TLDR AI
·
2026.05.08 09시
Qwen3.6 MTP 레이어 결합 및 추론 최적화
Reddit
·
2026.05.08 05시
vLLM 기반 encoder 서빙 도구 공개
Reddit
·
2026.05.06 20시
Qwen 3.6, MTP 지원으로 추론 속도 2.5배 향상
Reddit
·
2026.05.06 18시
Gemma 4 MTP 은폐 후 커뮤니티가 파헤치고, Google이 뒤늦게 우회 지원
GeekNews
·
2026.05.06 13시
카카오, Kanana-O 음성 AI 서빙 최적화 기술 공개… OpenAI API 호환·프로세스 격리 적용
카카오
·
2026.05.06 00시
vLLM 대비 메모리 8배 절감, FastDMS 공개
Reddit
·
2026.05.05 06시
APEX MoE 양자화 모델 30종 이상 확대
Reddit
·
2026.05.05 01시
RL 학습을 위한 Speculative Decoding
TLDR AI
·
2026.05.01 09시
RTX 5090서 100 tps
Reddit
·
2026.04.26 17시
Mixture of Experts 모델, Speculative Decoding의 효과가 더 크다
Cohere
·
2026.04.21 09시
자율주행을 위한 Flash 비전-언어-행동 추론: FlashDrive
TLDR AI
·
2026.04.21 09시
KV-cache 압축 기술 오픈소스 재현
Reddit
·
2026.04.21 01시
이전
3
4
5
6
7
다음
이전
1
2
3
4
5
6
7
다음