AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-benchmark
#llm-benchmark와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
Taste-Bench, 프런티어 LLM의 장기 작업 의사결정 정확도 59.7% 기록
TLDR AI
·
2026.09.25 09시
NVIDIA, LLM 추론 벤치마크 도구 AIPerf 공개
PyTorchKR 읽을거리
·
2026.09.22 18시
DeepSeek V4.1 Flash, AI 해킹 벤치마크에서 취약점 11개 모두 공략 성공
Hacker News
·
2026.09.16 20시
추천
Toss, 공개 리더보드와 실제 업무 성능 괴리 해소 위한 'Toss Benchmark' 구축
토스
·
1
·
2026.09.16 14시
Real-SWE 벤치마크, AI 코딩 에이전트의 불명확한 요구사항 처리 한계 드러나
TLDR AI
·
2026.09.14 09시
GPT-5.6 Luna, GPT-6 Astra 대비 비용 3.6%로 검증 버그 75% 발견…정밀도는 낮아
GeekNews
·
2026.09.14 09시
Artificial Analysis, Intelligence Index v4.3 공개
Reddit
·
2026.09.08 03시
AI 보안 패치 성공률 25%
Reddit
·
1
·
2026.09.06 07시
LLM 게임 내비게이션 벤치마크 공개
Reddit
·
2026.09.04 00시
AI2, 벤치마크 분석법 공개
HuggingFace Blog
·
1
·
2026.09.02 06시
구글, WikiSkill 논문 공개
Reddit
·
2026.08.31 22시
Artificial Analysis, 모바일 기기용 소형 LLM 추론 성능 벤치마크 공개
Hacker News
·
2026.08.28 04시
Qwen3.8 27B, Artificial Analysis에서 52점 기록
Hacker News
·
2026.08.18 02시
Qwen3.8-27B 성능 및 아키텍처 분석
Reddit
·
2026.08.15 06시
Qwen3.8 Max, Agentic Index 종합 1위
GeekNews
·
2026.08.07 07시
Open-Weight LLM, 정확도에서 따라잡다
TLDR AI
·
2026.07.31 09시
celeris-1 소개 (2분 분량)
TLDR AI
·
2
·
2026.07.27 09시
IMO 수학 문제로 본 LLM 성능 및 에이전트 효과
Reddit
·
2026.07.26 16시
독일 AI 컨소시엄이 벤치마크에서 최고 성능을 보이는 오픈소스 30B 모델 Soofi S 공개
Hacker News
·
2
·
2026.07.17 02시
LLM 정치적 중립성 벤치마크 공개
Reddit
·
2026.07.12 08시
CursorBench 3.1
Hacker News
·
2026.07.02 16시
Semgrep: GLM 5.2가 자사 Cyber Benchmarks에서 Claude를 능가함
Hacker News
·
2026.06.29 02시
AI 에이전트의 인용 오류: 15.9%가 부적절한 출처
Reddit
·
2026.06.26 19시
GLM-5.2, Artificial Analysis 오픈 가중치 모델 1위 등극
GeekNews
·
2026.06.18 09시
이전
1
2
다음
이전
1
2
다음
#llm-benchmark | AI Briefing