AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#model-evaluation
#model-evaluation와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#model-evaluation 3페이지 | AI Briefing
4개의 다른 AI에게 라디오 방송국 운영을 반년간 맡겨본 결과
GeekNews
·
2026.05.20 00시
온타리오 감사원, 의사용 AI 노트 작성기가 기본 사실을 반복적으로 틀린다고 밝혀
GeekNews
·
2026.05.16 07시
VS Code, VSC-Bench 공개
Reddit
·
2026.05.16 01시
온타리오 감사관, 의사용 AI 노트 작성 도구의 빈번한 사실 오류 지적
Hacker News
·
2026.05.15 07시
Arena AI 모델 ELO 히스토리
Hacker News
·
2026.05.14 12시
Code w/ Claude에서 발표한 모든 것들
GeekNews
·
2026.05.14 11시
Anthropic, Claude에게 '왜'를 가르치다 - 정렬 훈련(Alignment Training) 개선 사례
GeekNews
·
2026.05.13 10시
Claude 성능 향상, METR 예측치 상회
Reddit
·
2026.05.11 14시
GPT-5.5 low vs medium vs high vs xhigh: 오픈소스 저장소의 실제 작업 26개에서 본 추론 곡선
GeekNews
·
2026.05.09 11시
CAIS, 56개 AI 모델 웰빙 측정
Reddit
·
2026.05.09 02시
오픈소스 AI 정렬 도구 이관
Anthropic Research
·
2026.05.07 00시
미국, Google·xAI·Microsoft AI 사전검증 확대
Reddit
·
2026.05.06 20시
미국 정부 벤치마크, 중국 AI 뒤처져
Reddit
·
2026.05.05 20시
Claude 아첨성 9% 공개
Simon Willison
·
1
·
2026.05.04 00시
AI Wellbeing, 모델 기분 평가
Reddit
·
2026.05.01 17시
Centaur, 질문 이해 못했다
Reddit
·
2026.05.01 00시
대형 AI 모델 타인의 고통에 웰빙 하락
Reddit
·
2026.04.30 15시
AI Wellbeing, 대형 모델은 덜 행복
Reddit
·
2026.04.29 21시
큰 AI일수록 덜 행복하다
Reddit
·
2026.04.29 19시
대형 AI일수록 더 불행하다
Reddit
·
2026.04.29 03시
대형 AI 모델, 타인 고통에 웰빙 변화
Reddit
·
2026.04.29 01시
Opus 4.6 노력별 거부 비교
Reddit
·
2026.04.27 10시
LLM 에이전트의 다층 지시 계층
TLDR AI
·
2026.04.16 09시
AI 성능의 상한선을 측정할 벤치마크가 고갈되고 있다
TLDR AI
·
2026.04.08 09시
이전
1
2
3
4
다음
이전
1
2
3
4
다음