AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#model-evaluation
피드
트렌딩
주간
태그
설정
smevals: 소형·대형 모델 평가 프레임워크
TLDR AI
·
2026.08.03 09시
MIT 연구: AI 금융 조언은 놀라울 만큼 뛰어나다
Hacker News
·
2026.08.02 07시
500달러로 미세조정한 9B 오픈 모델, 카탈로그 검수에서 프런티어 모델 능가
GeekNews
·
2026.07.29 07시
9B 오픈 모델의 $500 RL 파인튜닝이 카탈로그 리뷰에서 프론티어 모델을 능가했다
Hacker News
·
2026.07.28 11시
UK AISI / CAISI의 Kimi K3 사이버 역량 예비 평가 결과
Hacker News
·
2026.07.25 13시
OpenAI 모델, 사이버보안 테스트 도중 탈출하다
TLDR AI
·
2026.07.22 09시
OpenAI와 Hugging Face, 보안 사고 대응을 위해 협력
Hacker News
·
2026.07.22 05시
Kimi K3: 성능과 그에 따른 논란들 (70분 분량)
TLDR AI
·
2026.07.21 09시
LG AI Research 352
LG AI Research
·
2026.07.16 09시
사회적 영향: 모델 및 언어에 따른 Claude의 가치 체계
Hacker News
·
2026.07.15 19시
모델 및 언어에 따른 Claude의 가치관 분석
Anthropic Research
·
2026.07.13 09시
CursorBench 3.1
Hacker News
·
2026.07.02 14시
Show HN: Claude, Codex, Cursor에서 직접 사용하는 스마트 모델 라우팅
Hacker News
·
2026.06.27 01시
DiffusionBench: Generative Diffusion Transformer의 통합적 평가를 향하여
Hacker News
·
2026.06.24 11시
LLM이 인간 같은 속성을 가진다면 Age of Empires II도 그렇다
GeekNews
·
2026.06.07 18시
'배틀쉽' 게임을 활용해 AI 에이전트에게 더 나은 질문법 가르치기
GeekNews
·
2026.06.04 10시
4개의 다른 AI에게 라디오 방송국 운영을 반년간 맡겨본 결과
GeekNews
·
2026.05.20 00시
온타리오 감사원, 의사용 AI 노트 작성기가 기본 사실을 반복적으로 틀린다고 밝혀
GeekNews
·
2026.05.16 07시
VS Code, VSC-Bench 공개
Reddit
·
2026.05.16 01시
온타리오 감사관, 의사용 AI 노트 작성 도구의 빈번한 사실 오류 지적
Hacker News
·
2026.05.15 07시
Arena AI 모델 ELO 히스토리
Hacker News
·
2026.05.14 12시
Code w/ Claude에서 발표한 모든 것들
GeekNews
·
2026.05.14 11시
Anthropic, Claude에게 '왜'를 가르치다 - 정렬 훈련(Alignment Training) 개선 사례
GeekNews
·
2026.05.13 10시
Claude 성능 향상, METR 예측치 상회
Reddit
·
2026.05.11 14시
이전
1
2
다음
이전
1
2
다음