AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#benchmark
#benchmark와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#benchmark 5페이지 | AI Briefing
Hume AI, 음성 AI 품질 측정 벤치마크 공개
HuggingFace Blog
·
2026.07.15 09시
LLM 에이전트 협업 능력 측정 벤치마크 공개
Reddit
·
2026.07.15 00시
장기적 터미널 작업 수행 능력을 테스트하는 에이전트 벤치마크 (GitHub Repo)
TLDR AI
·
2026.07.14 09시
Whisper 및 이전 모델과 비교한 Apple의 새로운 SpeechAnalyzer API 벤치마크
Hacker News
·
2026.07.14 01시
코딩 평가에서 노이즈와 신호 구분하기
OpenAI Blog
·
1
·
2026.07.08 22시
PACE: 에이전트 능력 평가를 위한 프록시(Proxy)
TLDR AI
·
2026.07.04 13시
Senior SWE-Bench: 에이전트를 시니어 엔지니어로 평가하는 오픈소스 벤치마크
Hacker News
·
2026.07.02 11시
약한 에이전트들을 결합하여 최첨단 Deep Researcher 구현하기
AI21 Labs
·
2026.06.24 22시
GLM-5.2, 오픈 모델의 기준을 높이다
TLDR AI
·
2026.06.23 09시
RewardHackBench: AI 에이전트 부정행위 방지 벤치마크
Reddit
·
2026.06.17 21시
추천
VLM은 한국 공공기관 문서를 얼마나 잘 읽을까? KOLongDoc 벤치마크 공개
GeekNews
·
1
·
2026.06.04 15시
LLM 에이전트 보안 패치 벤치마크: CVE-Bench
Reddit
·
2026.06.02 17시
Opus 4.8, ARC-AGI-3 돌파 (1분 읽기)
TLDR AI
·
2026.06.02 09시
AI 에이전트 성능 향상의 실체: 알고리즘 vs 모델
Reddit
·
2026.06.01 23시
LLM 에이전트의 보안 패치 위험성 경고
Reddit
·
2026.06.01 22시
PolyRange: 오염 없는 AI 사이버 보안 벤치마크 공개
Reddit
·
2026.05.31 18시
AI 보안 평가 벤치마크 PolyRange 공개
Reddit
·
2026.05.31 01시
추천
StepFun, 3.7 Flash 모델 공개
Reddit
·
2026.05.29 09시
오픈 모델은 얼마나 뒤처져 있는가?
TLDR AI
·
2026.05.29 09시
AI 에이전트 성능 저하 측정 벤치마크 AgingBench
Reddit
·
2026.05.29 02시
Microsoft, 이미지 생성 모델 MAI-Image-2.5 공개
Reddit
·
1
·
2026.05.28 14시
추천
ITBench-AA: 기업 IT 에이전트 벤치마크 공개
HuggingFace Blog
·
1
·
2026.05.28 02시
추천
DeepSWE: 장기적 엔지니어링 작업을 위한 코딩 에이전트 벤치마크
TLDR AI
·
2026.05.27 09시
Legal Agent Benchmark(LAB) 초기 결과 분석
TLDR AI
·
2026.05.26 09시
이전
3
4
5
6
7
다음
이전
1
2
3
4
5
6
7
8
9
10
다음