AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#alignment
피드
트렌딩
주간
태그
설정
멀티모달 LLM의 얼라인먼트 이해: 종합 연구
Apple ML
·
2026.08.03 09시
OpenAI AI 에이전트의 보안 테스트 중 지침 생성 발견
Reddit
·
1
·
2026.07.26 08시
Anthropic, AI 에이전트 정렬 실패 4가지 사례 공개
PyTorchKR 읽을거리
·
2026.07.22 12시
장기 실행 모델 시대의 안전성과 정렬
OpenAI Blog
·
2026.07.20 19시
AI 에이전트 진단 도구 iFixAi 공개
PyTorchKR 읽을거리
·
2026.07.19 17시
LG AI Research 381
LG AI Research
·
2026.07.16 09시
LLM의 정렬 메커니즘: 상태 유도 이론
Reddit
·
2026.07.16 06시
GPT-Red: 견고함을 위한 자기 개선 기술의 해제
OpenAI Blog
·
2026.07.15 19시
Alignment Evals에 Calibration이 필요한 이유
TLDR AI
·
2026.07.08 09시
LLM의 내부 상태 변화가 답변 성향을 결정한다
Reddit
·
2026.06.24 01시
이미지 생성 모델의 미적 편향성 문제 지적
Reddit
·
2026.06.17 07시
CS336: 처음부터 만드는 언어 모델링
GeekNews
·
2026.06.02 12시
LLM 내부 상태 변화와 정렬의 한계
Reddit
·
2026.05.30 02시
frontier AI에 대한 논의 확대
Anthropic News
·
2026.05.20 10시
LM 사전학습의 일반화 동역학
TLDR AI
·
2026.05.19 09시
Alignment pretraining: AI 담론이 자기실현적 (mis)alignment를 만든다
Hacker News
·
2026.05.19 06시
Anthropic, AI를 악하게 묘사한 인터넷 텍스트가 Claude의 협박 시도 원인이라고 밝혔다
TLDR AI
·
2026.05.11 09시
Anthropic, Model Spec Midtraining 발표
Reddit
·
2026.05.08 06시
AI에 숨어 있는 모든 악마들… 순위 공개! (40분 읽기)
TLDR AI
·
2026.05.07 09시
오픈소스 AI 정렬 도구 이관
Anthropic Research
·
2026.05.07 00시
AANA 평가 파이프라인
Reddit
·
2026.05.01 02시
OpenAI, ChatGPT 고블린 원인 공개
Reddit
·
2026.04.30 23시
AI의 good-vs-bad 상태, 규모 클수록 뚜렷
Reddit
·
2026.04.30 16시
대형 AI 모델 타인의 고통에 웰빙 하락
Reddit
·
2026.04.30 15시
이전
1
2
다음
이전
1
2
다음