AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-as-a-judge
#llm-as-a-judge와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
LangSmith, Jev 평가 모델 추가… LLM 대비 최대 450배 저렴·200배 빠른 에이전트 평가
LangChain Blog
·
2026.09.22 01시
LLM 판정판이 동의할 때, 우리는 믿을 수 있는가?
Amazon Science
·
2026.08.27 02시
AI Agent를 위한 OpenSearch 검색 품질 평가하기 (Part 1)
AWS Tech Blog (한국)
·
2026.08.17 15시
LangSmith로 음성 에이전트를 평가하는 방법
LangChain Blog
·
2026.08.05 02시
[ACL 2024] LLM 연구의 최신 트렌드와 주요 인사이트 - LG AI Research BLOG
LG AI Research
·
2026.07.16 09시
9명의 판사, 실제로는 2명분: 상관관계가 있는 오류가 LLM 평가 패널을 저해한다
Apple ML
·
2026.06.23 09시
Align Evals 소개: LLM 애플리케이션 평가 프로세스 간소화
LangChain Blog
·
1
·
2026.06.16 02시
LLM-as-a-Judge를 인간의 선호도에 맞게 정렬하기
LangChain Blog
·
2026.06.16 01시
Agentic AI 기반 플랫폼 - Part 3: AgentCore Policy, Evaluation, Observability로 기업 운영 체계 구축하기
AWS Tech Blog (한국)
·
2026.05.15 15시
Amazon Bedrock, 고급 프롬프트 최적화·모델 전환 도구 공개
AWS Blog
·
2026.05.15 07시
LLM 행동 모니터링: 드리프트, 재시도, 거부 패턴
TLDR AI
·
2026.04.27 09시
1부: 데이터도 정답도 없다: 하이퍼커넥트가 LLM을 길들이는 법
하이퍼커넥트
·
2026.04.22 09시
2부: 정책을 따르는 평가자, LLM-as-a-Judge
하이퍼커넥트
·
2026.04.22 09시
CrabTrap: 프로덕션 환경의 에이전트를 보호하기 위한 LLM-as-a-judge HTTP 프록시
Hacker News
·
2026.04.22 00시
3대 맥미니 GRPO
Reddit
·
2026.04.16 19시
GRPO로 요약모델 강화
Reddit
·
2026.04.15 18시
LLM-as-a-Judge로 Netflix 쇼 시놉시스 평가하기
Netflix Tech
·
2026.04.11 01시
에이전트 개선 루프에 필요한 인간의 판단
LangChain Blog
·
2026.04.10 00시
DSPy로 Dash의 관련성 판정기를 최적화한 방법
Dropbox Tech
·
2026.03.18 02시
개발자가 하지 않는 테스트를 쓰는 Rails 테스트 자동화 에이전트 구축
Mistral AI
·
2026.03.11 09시
OOM 없이 vLLM 확장하기
AI21 Labs
·
2026.02.05 23시
Josh Clemm이 말하는 Dash의 knowledge graph, MCP, DSPy 활용법
Dropbox Tech
·
2026.01.29 03시
LLM as a Judge를 활용한 RAG 평가
Mistral AI
·
2025.04.09 09시
카카오, CodeBuddy 성능 평가에 LLM as a Judge 도입…편향 완화 방안 제시
카카오
·
2025.03.07 00시
이전
1
2
다음
이전
1
2
다음
#llm-as-a-judge | AI Briefing