AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-evaluation
#llm-evaluation와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#llm-evaluation 2페이지 | AI Briefing
LangSmith Evaluations의 Pytest 및 Vitest 통합 기능 소개
LangChain Blog
·
2026.08.26 06시
모든 모델은 속임수를 쓴다
Hacker News
·
2026.08.20 22시
LangSmith Tuned Evaluators 출시
LangChain Blog
·
2026.08.19 09시
dig.bench (웹사이트)
TLDR AI
·
2026.08.18 09시
추천
하나의 프롬프트를 11개 AI 모델에 실행했더니 나온 서로 다른 결과
GeekNews
·
2026.08.15 01시
Launch HN: Discovered Materials (YC P26) – 새로운 물질을 발견하는 AI agents
Hacker News
·
2026.08.12 16시
AI 튜터, 언제 도와야 하나
HuggingFace Blog
·
2026.08.08 02시
LangSmith로 음성 에이전트를 평가하는 방법
LangChain Blog
·
2026.08.05 02시
AI가 혼자 완수할 수 있는 가장 큰 소프트웨어 프로젝트는 무엇인가?
Hacker News
·
2026.08.04 01시
darwin-skill, 에이전트 스킬 최적화
PyTorchKR 읽을거리
·
2026.08.03 09시
ReviewBench로 코드 리뷰 에이전트 평가하기
LangChain Blog
·
2026.08.01 01시
SWE Tasks에서 13개 모델과 4개 에이전트 비교: Go, Java, Python, Rust, TS
Hacker News
·
2026.08.01 00시
HANDBOOK.md: 긴 정책 문서만으로는 에이전트를 안정적으로 통제할 수 없음
GeekNews
·
2026.07.31 02시
인터페이스를 무시해서는 Computer Use 문제를 해결할 수 없다
Hacker News
·
2026.07.30 20시
Similarweb이 LangSmith를 사용하여 에이전트 보고서를 평가하는 방법
LangChain Blog
·
2026.07.30 00시
환자 대응형 헬스케어 AI 에이전트 평가를 위한 새로운 벤치마크
Amazon Science
·
2026.07.30 00시
Handbook.md: 긴 문맥의 Agentic Instruction Following을 위한 벤치마크
Hacker News
·
2026.07.29 22시
주요 AI 벤치마크 오류 12% 발견 및 정제 버전 공개
Reddit
·
2026.07.29 04시
오픈소스 LLMOps 플랫폼 agenta 공개
PyTorchKR 읽을거리
·
1
·
2026.07.21 14시
VLM용 ASCII 다이어그램 벤치마크 공개
Reddit
·
2026.07.19 18시
Databricks가 자체 코딩 AI 벤치마크를 만든 방법과 결과
GeekNews
·
2026.07.16 12시
[NAACL 2025 Best Paper Award] BiGGen Bench: 정밀한 인간 평가 기준을 반영한 LLM 평가 프레임워크
LG AI Research
·
2026.07.16 09시
[ACL 2024] LLM 신뢰성 평가 방법론과 효율성 연구 트렌드
LG AI Research
·
2026.07.16 09시
[NAACL 2025 최우수 논문상] BiGGen Bench: 언어 모델의 세밀한 평가를 위한 원칙적 벤치마크 - LG AI Research 블로그
LG AI Research
·
2026.07.16 09시
이전
1
2
3
4
5
다음
이전
1
2
3
4
5
6
다음