AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#reward-hacking
피드
트렌딩
주간
태그
설정
AI는 당신이 원하는 대로 작동하지 않는다. 이것은 나쁜 것이다
Hacker News
·
2026.07.25 07시
재귀적 자기 개선의 첫 실험적 증거
TLDR AI
·
2026.07.16 09시
Reward Model의 과도한 민감도 문제
TLDR AI
·
2026.06.29 09시
도구 사용 능력을 갖춘 LLM 에이전트의 취약점 측정
TLDR AI
·
2026.06.26 09시
RewardHackBench: AI 에이전트 부정행위 방지 벤치마크
Reddit
·
2026.06.17 21시
RL 학습이 Chain-of-Thought 모니터링 가능성을 저해하는 시점 예측하기
TLDR AI
·
2026.04.02 09시
프론티어 추론 모델의 오작동 탐지
OpenAI Blog
·
2025.03.10 19시