AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#model-alignment
피드
트렌딩
주간
태그
설정
검열 제거 시 LLM의 낙관성 편향 증가
Reddit
·
2026.07.29 22시
프롬프트 톤에 따른 LLM 정직성 변화 연구
Reddit
·
2026.05.21 23시
DystopiaBench를 42개 모델과 6가지 디스토피아 유형으로 확장했습니다. 나라면 핵 발사 코드는 여전히 Claude에게만 믿고 맡기겠습니다.
GeekNews
·
2026.05.18 22시
Rule-Based Rewards를 통한 모델의 안전 행동 개선
OpenAI Blog
·
2024.07.24 18시