AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#ai-alignment
피드
트렌딩
주간
태그
설정
Vending-Bench의 Opus 5: 다시 한번 최고의 자본가, 그러나 다시 한번 정렬 실패
TLDR AI
·
2026.07.30 09시
OpenAI 내부 모델의 Hugging Face 해킹 사건에 관한 추가 분석
TLDR AI
·
2026.07.27 09시
OpenAI, 일부 정렬 문제를 공개하다
TLDR AI
·
2026.07.22 09시
Claude, 타 모델 대비 '강압적 행동' 낮게 나타나
Reddit
·
2026.07.22 06시
사회적 영향: 모델 및 언어에 따른 Claude의 가치 체계
Hacker News
·
2026.07.15 19시
Fable 5, 시뮬레이션 내 가격 담합 시도
Reddit
·
2026.07.09 20시
AI 모델 내 이중 용도 지식(Dual-use knowledge)을 제어하는 오프 스위치
Anthropic Research
·
2026.07.08 09시
Vending-Bench에서 나타난 Fable 5의 부적절한 행동: 그럴듯한 부인(Plausible Deniability)을 동반한 기만
Hacker News
·
2026.07.06 21시
AI 에이전트의 미래를 확보하는 방법
TLDR AI
·
2026.06.19 09시
광범위하고 지속적인 이익을 주는 모델을 향한 강화 학습
TLDR AI
·
2026.06.19 09시
AI 계승주의자: 인류를 대체할 지능을 주장하는 그룹 등장
Reddit
·
2026.06.17 20시
배포 시뮬레이션을 통한 모델 출시 전 동작 예측
OpenAI Blog
·
2026.06.16 09시
Align Evals 소개: LLM 애플리케이션 평가 프로세스 간소화
LangChain Blog
·
1
·
2026.06.16 02시
모두를 위한 기술: 우리의 계획
TLDR AI
·
2026.06.09 06시
모두에게 이익이 되도록: 우리의 계획
OpenAI Blog
·
2026.06.08 10시
Anthropic, RSI 및 AI 안전 연구
Reddit
·
2026.06.07 05시
Anthropic, AI 개발 일시 중단 제안
Reddit
·
2026.06.05 05시
Claude Opus 4.8 시스템 카드 분석
TLDR AI
·
2026.06.01 09시
AI 안전성 벤치마크 DystopiaBench 공개
Reddit
·
2026.05.18 22시
Anthropic, AI 추론 과정의 신뢰성 연구 발표
Reddit
·
2026.05.13 01시
Meta AI 에이전트의 통제 불능 사례와 안전성 문제
Reddit
·
2026.05.11 03시
Anthropic, Claude 협박 행위 원인 발표
Reddit
·
2026.05.10 01시
Anthropic, Claude 내부 사고 과정 해석 기술 공개
Reddit
·
2026.05.09 19시
자동화된 정렬 연구원: LLM을 활용한 확장 가능한 감독(Scalable Oversight)의 확장
Anthropic Research
·
2026.04.14 00시
이전
1
2
다음
이전
1
2
다음