AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-benchmark
피드
트렌딩
주간
태그
설정
Open-Weight LLM, 정확도에서 따라잡다
TLDR AI
·
2026.07.31 09시
celeris-1 소개 (2분 분량)
TLDR AI
·
2026.07.27 09시
IMO 수학 문제로 본 LLM 성능 및 에이전트 효과
Reddit
·
2026.07.26 16시
LLM 정치적 중립성 벤치마크 공개
Reddit
·
2026.07.12 08시
Semgrep: GLM 5.2가 자사 Cyber Benchmarks에서 Claude를 능가함
Hacker News
·
2026.06.29 02시
AI 에이전트의 인용 오류: 15.9%가 부적절한 출처
Reddit
·
2026.06.26 19시
GLM-5.2, Artificial Analysis 오픈 가중치 모델 1위 등극
GeekNews
·
2026.06.18 09시
BenchBench 소개
TLDR AI
·
2026.05.26 09시
Antigravity 2.0, OpenSCAD 아키텍처 3D LLM 벤치마크 1위 차지
Hacker News
·
2026.05.22 19시
에이전트 실행 세금 개념 도입
Reddit
·
2026.05.22 00시
AI 안전성 벤치마크 DystopiaBench 공개
Reddit
·
2026.05.18 22시
GPT 5.5, ProgramBench 첫 해결
Reddit
·
2026.05.13 02시
Kimi K2.6가 코딩 챌린지에서 Claude, GPT-5.5, Gemini를 이김
GeekNews
·
2026.05.04 09시
NeurIPS 2025 E2LM 경진대회 개최
HuggingFace Blog
·
2025.07.04 21시