AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-alignment
피드
트렌딩
주간
태그
설정
Anthropic 협업, 지식 접근 제어 기술 GRAM 공개
PyTorchKR 읽을거리
·
2026.07.29 21시
Anthropic, Claude의 가치관 변화 연구 공개
PyTorchKR 읽을거리
·
2026.07.21 18시
모델 및 언어에 따른 Claude의 가치관 분석
Anthropic Research
·
2026.07.13 09시
LLM 정렬(Alignment)은 마지막 레이어에 집중된다
Reddit
·
2026.06.15 01시
Opus 4.8 파트 2: 모델 복지 (Model Welfare)
TLDR AI
·
2026.06.02 09시
AI 강건성 기법의 수학적 통합 원리 규명
Reddit
·
1
·
2026.05.26 13시
OpenAI와 Anthropic, 공동 안전성 평가 결과 공유
OpenAI Blog
·
2025.08.27 19시
HuggingFace, 오픈 LLM용 CAI 레시피 공개
HuggingFace Blog
·
2024.02.01 09시
DPO, IPO, KTO 선호도 정렬 방법론 비교
HuggingFace Blog
·
2024.01.18 09시
PPO 기반 RLHF 구현 가이드 및 재현 결과
HuggingFace Blog
·
2023.10.24 09시