AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#ai-evaluation
피드
트렌딩
주간
태그
설정
AI 모델에 인간의 감각을 더하다
TLDR AI
·
2026.08.04 09시
VLM 벤치마크의 임상용어 지우기
Reddit
·
2026.08.01 18시
Eval-driven development: 대규모 GenAI 평가를 통한 교훈
Airbnb Tech
·
2026.07.29 02시
ARC-AGI 리더보드
Hacker News
·
2026.07.25 15시
Perplexity, WANDR 벤치마크 공개
PyTorchKR 읽을거리
·
2026.07.24 08시
AI 연구소들이 펠리컨 벤치마크를 과적합하고 있을까?
TLDR AI
·
2026.07.23 09시
Schema
TLDR AI
·
1
·
2026.07.17 09시
LLM이 컴퓨터 아키텍처 논문에 대해 심층적인 기술적 이해를 수행할 수 있는가?
Hacker News
·
2026.07.16 11시
LMArena, 사실성(Factuality) 지표 도입 및 순위 발표
Reddit
·
2026.07.16 01시
장기적 터미널 작업 수행 능력을 테스트하는 에이전트 벤치마크 (GitHub Repo)
TLDR AI
·
2026.07.14 09시
Hugging Face, AI 모델 평가 결과 통합 표준화
HuggingFace Blog
·
2026.06.30 09시
도구 사용 능력을 갖춘 LLM 에이전트의 취약점 측정
TLDR AI
·
2026.06.26 09시
보이스 에이전트 평가 프레임워크의 6가지 핵심 요소
ElevenLabs
·
2026.06.20 01시
Ground truth는 데이터셋이 아닌 프로세스다
Amazon Science
·
2026.06.04 00시
신뢰할 수 있는 제3자 평가를 위한 공동 플레이북
TLDR AI
·
2026.05.30 02시
AI 책임성 확보를 위한 경로 구축
Anthropic News
·
2026.05.29 12시
Cohere와 Mila, AI의 퀘벡 프랑스어 언어 및 문화적 맥락 강화를 위한 파트너십 체결
Cohere
·
2026.05.28 01시
BenchBench 소개
TLDR AI
·
2026.05.26 09시
METR AI 타임 호라이즌 그래프의 심각한 오류 지적
Reddit
·
2026.05.26 03시
대규모 Multi-Agent 시스템 평가하기
TLDR AI
·
2026.05.25 09시
AI 에이전트 평가 도구, Polarity
Product Hunt
·
2026.05.18 12시
AI 실패율 두 자릿수
Reddit
·
2026.04.24 06시
Mimo V2 Flash HSS
Xiaomi MiMo
·
2025.12.19 09시
Chain-of-thought 모니터링 가능성 평가
OpenAI Blog
·
2025.12.18 21시
이전
1
2
다음
이전
1
2
다음