AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#benchmark
피드
트렌딩
주간
태그
설정
AI가 혼자 완수할 수 있는 가장 큰 소프트웨어 프로젝트는 무엇인가?
Hacker News
·
2026.08.04 01시
APEX-Accounting: 회계 업무를 위한 AI 생산성 벤치마크
TLDR AI
·
2026.08.03 09시
HANDBOOK.md: 긴 정책 문서만으로는 에이전트를 안정적으로 통제할 수 없음
GeekNews
·
2026.07.31 02시
AI 모델 보안 강건성 리더보드 공개
Reddit
·
2026.07.30 07시
Handbook.md: 긴 문맥의 Agentic Instruction Following을 위한 벤치마크
Hacker News
·
2026.07.29 22시
SWE-rebench 다국어 벤치마크 업데이트
Reddit
·
2026.07.29 01시
ARC-AGI 리더보드
Hacker News
·
2026.07.25 15시
Perplexity, WANDR 벤치마크 공개
PyTorchKR 읽을거리
·
2026.07.24 08시
GPT-5.5, 시각 벤치마크서 10.6% 그쳐
Reddit
·
3
·
2026.07.24 04시
AI 연구소들이 펠리컨 벤치마크를 과적합하고 있을까?
TLDR AI
·
2026.07.23 09시
GLM 5.2, ProgramBench 3위
Reddit
·
2026.07.23 02시
추천
35B 모델로 1T급 성능 달성한 Agents-A1 공개
PyTorchKR 읽을거리
·
2026.07.22 14시
Claude, 타 모델 대비 '강압적 행동' 낮게 나타나
Reddit
·
2026.07.22 06시
LVSum: 타임스탬프 인지형 긴 영상 요약을 위한 벤치마크
Apple ML
·
2026.07.20 09시
VLM용 ASCII 다이어그램 벤치마크 공개
Reddit
·
2026.07.19 18시
Schema
TLDR AI
·
1
·
2026.07.17 09시
추천
Nemotron 3 Embed, RTEB 1위 임베딩 모델
HuggingFace Blog
·
2026.07.17 01시
LG AI Research 337
LG AI Research
·
2026.07.16 09시
간단한 Self-Distillation으로 LLM 코드 생성 성능 향상
Apple ML
·
2026.07.16 09시
LG AI Research: 비정형 데이터셋에서의 신경 상호 정보량 추정 평가를 위한 벤치마크 스위트
LG AI Research
·
2026.07.16 09시
LG AI Research: 과학 논문 대상의 고도화된 질의응답(QASA) 접근법 및 벤치마크 제안
LG AI Research
·
2026.07.16 09시
OpenAI의 Sol, 드디어 디자인 감각을 배우다
TLDR AI
·
2026.07.16 09시
[ACL 2024] LLM 신뢰성 평가 방법론과 효율성 연구 트렌드
LG AI Research
·
2026.07.16 09시
[NAACL 2025 최우수 논문상] BiGGen Bench: 언어 모델의 세밀한 평가를 위한 원칙적 벤치마크 - LG AI Research 블로그
LG AI Research
·
2026.07.16 09시
이전
1
2
더 많은 페이지
7
다음
이전
1
2
3
4
5
6
7
다음