AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#evaluation
#evaluation와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
NVIDIA, AI 에이전트 평가 지표 재정의
PyTorchKR 읽을거리
·
2026.09.23 17시
아마존, 생성형 AI 및 에이전트 워크로드용 관측 솔루션 'CloudWatch Omni' GA 출시
AWS Blog
·
2026.09.23 07시
GoBench 공개, LLM 추론 능력 평가 지표로 주목
Reddit
·
2026.09.17 03시
UiPath, Claude Code 스킬 활성화율 측정 및 개선 사례 공개
Reddit
·
2026.09.11 00시
에이전트 행동 표준 공개
PyTorchKR 읽을거리
·
2026.09.03 18시
스마트폰에서 GUI 에이전트 실행에 관한 문헌 리뷰: AndroidWorld
Reddit
·
2026.09.02 16시
52개 T2I 모델 벤치마크 공개
Reddit
·
2026.08.27 06시
LLM 판정판이 동의할 때, 우리는 믿을 수 있는가?
Amazon Science
·
2026.08.27 02시
오토-이밸류에이터 활용 기회
LangChain Blog
·
2026.08.26 23시
프로덕션 배포 전 LLM 평가 방법
GitHub Blog
·
1
·
2026.08.26 06시
웰빙 연구 보조금
Anthropic News
·
2026.08.26 01시
에이전트 환경 및 태스크 구축 방법
LangChain Blog
·
2026.08.25 23시
신약 예측 벤치마크 LEADBOARD 공개
PyTorchKR 읽을거리
·
2026.08.22 19시
ASR 모델, 벤치마크 답 외우기
HuggingFace Blog
·
1
·
2026.08.21 09시
Google, 에이전트 CLI 공개
PyTorchKR 읽을거리
·
1
·
2026.08.02 15시
LangSmith: 제품 홈페이지 개편 및 리소스 관리를 위한 태그 기능 도입
LangChain Blog
·
2026.06.17 03시
LLM-as-a-Judge를 인간의 선호도에 맞게 정렬하기
LangChain Blog
·
2026.06.16 01시
DeepSWE, 코딩 모델 리더보드 오류 지적
Reddit
·
2026.06.02 12시
Agent Judge: 프로덕션 에이전트의 롱 컨텍스트 평가 문제 해결
TLDR AI
·
2026.05.29 09시
LangSmith Engine 소개
LangChain Blog
·
2026.05.29 07시
오픈 에이전트 리더보드 공개
HuggingFace Blog
·
2026.05.18 23시
LangChain Labs 출범
LangChain Blog
·
2026.05.15 02시
에이전틱 LLM 파이프라인의 캐싱
AI21 Labs
·
1
·
2026.05.14 05시
Harvey의 Legal Agent Benchmark 공개
TLDR AI
·
2026.05.07 09시
이전
1
2
3
다음
이전
1
2
3
다음
#evaluation | AI Briefing