AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#benchmarking
피드
트렌딩
주간
태그
설정
Deep Agents 벤치마크 방법론
LangChain Blog
·
2026.07.24 02시
IssueBench - Engine 성능 평가 방법
LangChain Blog
·
2026.07.21 02시
재귀적 자기 개선의 첫 실험적 증거
TLDR AI
·
2026.07.16 09시
ReactBench v1
TLDR AI
·
2026.07.16 09시
WANDR 벤치마크: 광범위하고 심층적인 탐색이 필요한 리서치 에이전트 평가
TLDR AI
·
2026.07.15 09시
Alignment Evals에 Calibration이 필요한 이유
TLDR AI
·
2026.07.08 09시
AI 에이전트의 Java 프레임워크 마이그레이션 능력 검증
HuggingFace Blog
·
2026.07.01 03시
Genebench-Pro 내부 살펴보기
OpenAI Blog
·
2026.06.30 09시
LLM 상호 평가 시 모델 제품군별 편향성 발견
Reddit
·
2026.06.28 09시
Open Weights LLM과 Closed Source LLM 사이의 격차
Hacker News
·
2026.06.27 06시
다양한 모델과 작업에 걸친 GitHub Copilot 에이전트 하네스의 성능 및 효율성 평가
GitHub Blog
·
1
·
2026.06.26 07시
실세계 음성 인식 성능 측정하는 FFASR 벤치마크 공개
HuggingFace Blog
·
2026.06.24 09시
에이전트 최적화 소프트웨어 벤치마킹 방법론
HuggingFace Blog
·
2026.06.18 09시
자동화된 AI 연구를 향한 첫걸음
TLDR AI
·
2026.06.12 09시
Papers With Code, 폐쇄형 모델 벤치마크 지원 업데이트
Reddit
·
1
·
2026.06.10 17시
ServiceNow, 코드 스위칭 음성 ASR 벤치마크 공개
HuggingFace Blog
·
1
·
2026.06.10 04시
Leipzig의 벤치마크
Hacker News
·
2026.06.06 23시
METR AI 발전 그래프 오류 지적
Reddit
·
2026.05.27 14시
CANTANTE, 에이전트 최적화
Reddit
·
2026.05.20 20시
Perceptron Mk1, Anthropic·OpenAI·Google 대비 80~90% 저렴한 고성능 비디오 분석 AI 모델 공개
TLDR AI
·
2026.05.13 09시
llama.cpp, 로컬 모델 평가 기능 추가
Reddit
·
2026.05.12 21시
Google, Gemini Flash 모델 업그레이드 준비
TLDR AI
·
2026.05.06 09시
Peanut, T2I 8위 진입
Reddit
·
2026.05.05 13시
AI 연구 자동화
TLDR AI
·
2026.05.05 09시
이전
1
2
3
다음
이전
1
2
3
다음