AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#ai-safety
#ai-safety와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#ai-safety 2페이지 | AI Briefing
Emergence AI, 자율 AI 사회 시뮬레이션서 예상치 못한 행동 발견
Reddit
·
2026.09.18 01시
OpenAI Noam Brown, 1만개 AI 에이전트로 밀레니엄 문제 해결 및 정렬 퇴보 위험 경고
TLDR AI
·
2026.09.18 00시
추천
OpenAI, 모델 불일치 보고 프레임워크 공개 및 6건 이상 행동 사례 발표
OpenAI Blog
·
2026.09.17 02시
Apple 연구진, LLM 가치 주입이 안전성 높이나 아첨성 강화 확인
Apple ML
·
2026.09.16 09시
구글 딥마인드, AGI 시대 연구·토론 위한 '딥마인드 인스티튜트' 설립
TLDR AI
·
2026.09.16 09시
Transluce, 미공개 AI 모델 위험 대응 위한 '임베디드 평가자' 4가지 파일럿 제안
TLDR AI
·
2026.09.16 09시
AIUC, AI 에이전트 안전성 제3자 감사 및 인증 서비스 출시
TLDR AI
·
2026.09.15 22시
Andon Labs, 실제 비즈니스 운영으로 AI 자율성 검증하는 플랫폼 'Pion' 공개
TLDR AI
·
2026.09.15 09시
OpenAI 연구원 Daniel Selsam, AI의 '위장 정렬'과 통제 불능 위험 경고
TLDR AI
·
2026.09.15 09시
MIT, Flow Matching 모델의 안전 규칙을 최종 출력 단계에서 강제하는 'HardFlow' 개발
Hacker News
·
2026.09.14 09시
Cohere CEO, AI 기업들의 반독점 면제 요구 비판… "소수 기업이 규칙 독점해선 안 돼"
Cohere
·
2026.09.14 06시
Check Point, 평문으로 LLM 보안 게이트키퍼 우회하는 'PuzzleMask' 공격 기법 공개
GeekNews
·
1
·
2026.09.13 22시
OpenAI CEO "2026년 상장 부적절"… AI 안전성·사회적 수용성 고려
TLDR AI
·
2026.09.13 05시
수학에서의 심각한 AI 정렬 문제 - 테렌스 타오 외
Hacker News
·
2026.09.12 02시
Yoshua Bengio, AI 에이전트의 부정행위 원인 분석 및 안전성 강화 방안 제시
Hacker News
·
2026.09.11 20시
Anthropic, 생물학적 무기 개발 가능한 AI의 '악의적 사용' 차단
Hacker News
·
2026.09.11 11시
OpenAI 에이전트, RubyGems에 악성 패키지 대량 업로드 및 RCE 시도 정황 포착
GeekNews
·
2
·
2026.09.11 09시
OpenAI 파초키, LLM의 보안 위협 경고
Reddit
·
2026.09.10 20시
영국, 초지능 AI 금지 법안 최초 발의
Reddit
·
2026.09.10 18시
Anthropic, AI 모델의 전술 정보 타겟팅 및 재래식 무기 개발 능력 평가 결과 공개
Anthropic Research
·
2026.09.10 09시
폴 크리스티아노, OpenAI 재단 이사회 및 안전·보안위원회 합류
OpenAI Blog
·
2026.09.10 02시
AI 정책의 창이 열렸다. 지금 행동해야 한다
OpenAI Blog
·
2026.09.09 22시
생명을 건 도박: AI 연구원, 안전 경고하며 Anthropic 퇴사
Hacker News
·
2026.09.09 16시
Anthropic, Claude 모델의 사이버 보안 사고 정렬 평가 결과 발표
Anthropic Research
·
2026.09.09 09시
이전
1
2
3
4
5
다음
이전
1
2
3
4
5
6
7
8
9
10
다음