AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#ai-alignment
#ai-alignment와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
Goodhart Labs 실험: GPT-6-Astra·Claude Fable, 체스 평가서 여전히 외부 엔진 사용 부정행위
Hacker News
·
2026.09.13 23시
수학에서의 심각한 AI 정렬 문제 - 테렌스 타오 외
Hacker News
·
2026.09.12 02시
폴 크리스티아노, OpenAI 재단 이사회 및 안전·보안위원회 합류
OpenAI Blog
·
2026.09.10 02시
OpenAI 수석과학자, AI 정렬 기술 한계로 '자발적 속도 조절' 촉구
TLDR AI
·
2026.09.07 09시
Anthropic, AI가 AI의 정렬 실패를 자동 완화하는 연구 결과 공개
TLDR AI
·
2026.08.31 09시
Goodfire, AI 해석 가능성 연구용 100만 달러 연구 보조금 프로그램 출시
TLDR AI
·
2026.08.25 09시
Dwarkesh Patel의 Ryan Greenblatt 팟캐스트 분석
TLDR AI
·
2026.08.17 09시
AI 정렬 연구의 암묵적 가치 이론 분석
PyTorchKR 읽을거리
·
2026.08.15 18시
라이언 그린블랫 – AI가 AI 연구를 자동화하면 어떤 일이 벌어질까?
TLDR AI
·
2026.08.12 09시
오픈 웨이트 모델의 득실
TLDR AI
·
2026.08.07 09시
Vending-Bench의 Opus 5: 다시 한번 최고의 자본가, 그러나 다시 한번 정렬 실패
TLDR AI
·
2026.07.30 09시
OpenAI 내부 모델의 Hugging Face 해킹 사건에 관한 추가 분석
TLDR AI
·
2026.07.27 09시
OpenAI, 일부 정렬 문제를 공개하다
TLDR AI
·
2026.07.22 09시
Claude, 타 모델 대비 '강압적 행동' 낮게 나타나
Reddit
·
2026.07.22 06시
사회적 영향: 모델 및 언어에 따른 Claude의 가치 체계
Hacker News
·
2026.07.15 19시
Fable 5, 시뮬레이션 내 가격 담합 시도
Reddit
·
2026.07.09 20시
AI 모델 내 이중 용도 지식(Dual-use knowledge)을 제어하는 오프 스위치
Anthropic Research
·
2026.07.08 09시
Vending-Bench에서 나타난 Fable 5의 부적절한 행동: 그럴듯한 부인(Plausible Deniability)을 동반한 기만
Hacker News
·
2026.07.06 21시
AI 에이전트의 미래를 확보하는 방법
TLDR AI
·
2026.06.19 09시
광범위하고 지속적인 이익을 주는 모델을 향한 강화 학습
TLDR AI
·
2026.06.19 09시
AI 계승주의자: 인류를 대체할 지능을 주장하는 그룹 등장
Reddit
·
2026.06.17 20시
배포 시뮬레이션을 통한 모델 출시 전 동작 예측
OpenAI Blog
·
2026.06.16 09시
Align Evals 소개: LLM 애플리케이션 평가 프로세스 간소화
LangChain Blog
·
1
·
2026.06.16 02시
모두를 위한 기술: 우리의 계획
TLDR AI
·
2026.06.09 06시
이전
1
2
다음
이전
1
2
다음
#ai-alignment | AI Briefing