AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-evaluation
피드
트렌딩
주간
태그
설정
LangSmith로 음성 에이전트를 평가하는 방법
LangChain Blog
·
2026.08.05 02시
AI가 혼자 완수할 수 있는 가장 큰 소프트웨어 프로젝트는 무엇인가?
Hacker News
·
2026.08.04 01시
darwin-skill, 에이전트 스킬 최적화
PyTorchKR 읽을거리
·
2026.08.03 09시
ReviewBench로 코드 리뷰 에이전트 평가하기
LangChain Blog
·
2026.08.01 01시
SWE Tasks에서 13개 모델과 4개 에이전트 비교: Go, Java, Python, Rust, TS
Hacker News
·
2026.08.01 00시
HANDBOOK.md: 긴 정책 문서만으로는 에이전트를 안정적으로 통제할 수 없음
GeekNews
·
2026.07.31 02시
인터페이스를 무시해서는 Computer Use 문제를 해결할 수 없다
Hacker News
·
2026.07.30 20시
Similarweb이 LangSmith를 사용하여 에이전트 보고서를 평가하는 방법
LangChain Blog
·
2026.07.30 00시
환자 대응형 헬스케어 AI 에이전트 평가를 위한 새로운 벤치마크
Amazon Science
·
2026.07.30 00시
Handbook.md: 긴 문맥의 Agentic Instruction Following을 위한 벤치마크
Hacker News
·
2026.07.29 22시
주요 AI 벤치마크 오류 12% 발견 및 정제 버전 공개
Reddit
·
2026.07.29 04시
오픈소스 LLMOps 플랫폼 agenta 공개
PyTorchKR 읽을거리
·
1
·
2026.07.21 14시
VLM용 ASCII 다이어그램 벤치마크 공개
Reddit
·
2026.07.19 18시
Databricks가 자체 코딩 AI 벤치마크를 만든 방법과 결과
GeekNews
·
2026.07.16 12시
[NAACL 2025 Best Paper Award] BiGGen Bench: 정밀한 인간 평가 기준을 반영한 LLM 평가 프레임워크
LG AI Research
·
2026.07.16 09시
[ACL 2024] LLM의 충실도(Faithfulness) 평가 방법론 및 LLM 효율성 연구 트렌드 - LG AI Research 블로그
LG AI Research
·
2026.07.16 09시
[ACL 2024] LLM 신뢰성 평가 방법론과 효율성 연구 트렌드
LG AI Research
·
2026.07.16 09시
[NAACL 2025 최우수 논문상] BiGGen Bench: 언어 모델의 세밀한 평가를 위한 원칙적 벤치마크 - LG AI Research 블로그
LG AI Research
·
2026.07.16 09시
몇 주에서 하루로: LLM 평가 속도를 높여 반복적인 개선을 가능하게 만든 방법
Airbnb Tech
·
2026.07.15 02시
몇 주에서 하루로: LLM 평가 속도를 높여 반복적인 개선을 가능하게 만든 방법
Airbnb Tech
·
2026.07.15 02시
Amazon Bedrock 모델을 promptfoo로 성능 평가하기
AWS Tech Blog (한국)
·
2026.07.11 18시
에이전트 개선은 데이터 마이닝의 문제다
LangChain Blog
·
2026.07.08 00시
Artificial Analysis, 오픈 모델 개방성 지수 발표
Reddit
·
2026.07.07 09시
Vending-Bench에서 나타난 Fable 5의 부적절한 행동: 그럴듯한 부인(Plausible Deniability)을 동반한 기만
Hacker News
·
2026.07.06 21시
이전
1
2
3
4
다음
이전
1
2
3
4
다음