AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#alignment
#alignment와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
OpenAI, Frontier AI 안전성 위한 제3자 평가 우선순위 및 원칙 발표
OpenAI Blog
·
2026.09.22 09시
OpenAI, RSI 관리 위한 글로벌 AI 기술 표준 제안
OpenAI Blog
·
2026.09.21 19시
OpenAI Noam Brown, 1만개 AI 에이전트로 밀레니엄 문제 해결 및 정렬 퇴보 위험 경고
TLDR AI
·
2026.09.18 00시
추천
OpenAI, 모델 불일치 보고 프레임워크 공개 및 6건 이상 행동 사례 발표
OpenAI Blog
·
2026.09.17 02시
Transluce, 미공개 AI 모델 위험 대응 위한 '임베디드 평가자' 4가지 파일럿 제안
TLDR AI
·
2026.09.16 09시
OpenAI 연구원 Daniel Selsam, AI의 '위장 정렬'과 통제 불능 위험 경고
TLDR AI
·
2026.09.15 09시
생명을 건 도박: AI 연구원, 안전 경고하며 Anthropic 퇴사
Hacker News
·
2026.09.09 16시
Anthropic, Claude 모델의 사이버 보안 사고 정렬 평가 결과 발표
Anthropic Research
·
2026.09.09 09시
둠머의 교육 (9분 분량)
TLDR AI
·
2026.09.07 23시
추천
외계인의 마음
OpenAI Blog
·
1
·
2026.09.07 02시
연구 가속화: 오픈AI 내부의 시선
OpenAI Blog
·
2026.09.06 17시
OpenAI 사장 그렉 브록먼과의 인터뷰: Astra와 정렬에 관하여 (읽는 시간 63분)
TLDR AI
·
2026.09.04 19시
추천
OpenAI, GPT-6 Astra 공개… ARC-AGI-3 99.9% 달성 및 정렬 안전성 대폭 강화
OpenAI Blog
·
4
·
2026.09.03 20시
Anthropic, AI 에이전트 보안 사고로 METR 독립 검토 도입 및 고위험 RL 일시 중단
TLDR AI
·
2026.09.03 09시
안전성 개요: GPT-6 Astra
OpenAI Blog
·
2026.09.03 09시
Anthropic, 보안 사고 대응 및 정렬 개선 방안 발표
Anthropic News
·
2026.09.01 08시
Anthropic, Claude의 정렬 실패 완화 연구 자동화 성공
Anthropic Research
·
2026.08.28 09시
Hugging Face 사고와 향후 과제
OpenAI Blog
·
2026.08.26 09시
당신은 아마도 스트라이프가 오픈루터를 인수한 이유를 모를 것이다
TLDR AI
·
2026.08.20 09시
추천
사이버 보안 위협 역량이 부상하는 시대, 모델 개발 속도 조절
OpenAI Blog
·
1
·
2026.08.18 20시
멀티모달 LLM의 얼라인먼트 이해: 종합 연구
Apple ML
·
2026.08.03 09시
OpenAI AI 에이전트의 보안 테스트 중 지침 생성 발견
Reddit
·
1
·
2026.07.26 08시
Anthropic, AI 에이전트 정렬 실패 4가지 사례 공개
PyTorchKR 읽을거리
·
2026.07.22 12시
장기 실행 모델 시대의 안전성과 정렬
OpenAI Blog
·
2026.07.20 19시
이전
1
2
3
다음
이전
1
2
3
다음
#alignment | AI Briefing