AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-inference
#llm-inference와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#llm-inference 6페이지 | AI Briefing
DeepLearning.AI, vLLM 공식 강의 출시
Reddit
·
2026.06.05 02시
Speculative KV coding: KV cache를 최대 ~4배까지 무손실 압축하기
Hacker News
·
2026.06.05 00시
OCTOPUS: 최적 제곱 오차 양자화와 팔면체 매개변수화를 이용한 트랜스포머 KV Cache 최적화
Stability AI Research
·
2026.06.04 01시
llama.cpp, 추론 수준 조절 기능 추가
Reddit
·
1
·
2026.06.02 22시
llama.cpp, Step3.7-Flash 지원 추가
Reddit
·
2026.06.02 18시
llama.cpp, VRAM 사용량 최적화 PR 제안
Reddit
·
2026.06.02 00시
llama.cpp, EXAONE 4.5 지원
Reddit
·
2026.06.01 18시
llama.cpp 통합 바이너리 및 웹사이트
Reddit
·
2026.05.30 01시
Standard GPU에서의 실시간 LLM 추론: 요청당 3,000 tokens/s
Hacker News
·
2026.05.29 18시
AMD MI300X LLM 추론 최적화 기술
Reddit
·
2026.05.29 17시
llama.cpp, Flash Attention VRAM 최적화
Reddit
·
2026.05.29 16시
llama.cpp, AMD/ROCm 업데이트
Reddit
·
1
·
2026.05.29 10시
Zai, GLM-5.1 추론 네트워크 최적화
Reddit
·
1
·
2026.05.28 22시
ZCube 도입으로 GLM-5.1 추론 최적화
Reddit
·
2026.05.28 22시
유휴 Inference GPU Pool을 이용한 GPU Job 스케줄링
GeekNews
·
1
·
2026.05.27 08시
TogetherAI, OSCAR KV 양자화 공개
Reddit
·
2026.05.26 21시
2비트 KV 캐시 양자화 기술 'OSCAR' 공개
Reddit
·
2026.05.25 20시
llama.cpp, 컨텍스트 재처리 최적화
Reddit
·
1
·
2026.05.25 15시
AMD RDNA3 최적화 추론 엔진 hipEngine
Reddit
·
2026.05.25 07시
llama.cpp 비대칭 KV 캐시 양자화 이슈 및 최적화 논의
Reddit
·
3
·
2026.05.22 22시
Mix-Quant: 프리필은 양자화, 디코딩은 고정밀 유지
Reddit
·
2026.05.22 04시
오픈소스 GPU 관측 도구 l9gpu 공개
Reddit
·
2026.05.21 10시
AWS, M3 Ultra Mac Studio 제공
Reddit
·
2026.05.20 23시
llama.cpp, MTP 프롬프트 처리 속도 개선
Reddit
·
2026.05.18 00시
이전
4
5
6
7
8
다음
이전
1
2
3
4
5
6
7
8
9
다음