AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#ai-safety
#ai-safety와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#ai-safety 13페이지 | AI Briefing
Meta·Google 모델 안전 필터, 수 분 내 제거
Reddit
·
2026.05.27 14시
Anthropic, AI 모델서 5가지 감정 발견
Reddit
·
2026.05.26 15시
AI 모델, 30% 확률로 잘못된 출처 인용
Reddit
·
2026.05.26 15시
METR AI 타임 호라이즌 그래프의 심각한 오류 지적
Reddit
·
2026.05.26 03시
트럼프, AI 안전 행정명령 전격 취소
Reddit
·
2026.05.25 15시
가드의 사각지대: 도메인 위장 인젝션 공격이 멀티 에이전트 LLM 시스템의 탐지를 회피하는 방법
Hacker News
·
2026.05.23 03시
불교 철학 기반 AI 안전 아키텍처 제안
Reddit
·
2026.05.22 07시
Gemini가 시스템 프롬프트를 무작위로 노출함
Hacker News
·
2026.05.21 22시
교황, Anthropic과 AI 회칙 발표
Reddit
·
2026.05.21 18시
오픈소스 LLM, 긴 추론 탈옥 공격에 취약
Reddit
·
2026.05.21 16시
백악관, AI 모델 출시 전 안전 점검
Reddit
·
2026.05.21 16시
트럼프 행정부, AI 안전 규제 검토
Reddit
·
2026.05.21 04시
Google의 AI가 조작되고 있다. 검색 거대기업은 조용히 반격 중이다
Hacker News
·
2026.05.20 19시
전 OpenAI 직원, xAI 비판
Reddit
·
2026.05.20 13시
Anthropic 연령 제한과 AI 교육의 딜레마
Reddit
·
2026.05.20 11시
frontier AI에 대한 논의 확대
Anthropic News
·
2026.05.20 10시
Mythos AI 사이버 공격 위험 경고
Reddit
·
2026.05.19 18시
Alignment pretraining: AI 담론이 자기실현적 (mis)alignment를 만든다
Hacker News
·
2026.05.19 06시
DystopiaBench를 42개 모델과 6가지 디스토피아 유형으로 확장했습니다. 나라면 핵 발사 코드는 여전히 Claude에게만 믿고 맡기겠습니다.
GeekNews
·
2026.05.18 22시
LLM을 오염시키는 '타프핏' 기술
Reddit
·
2026.05.18 22시
AI 안전성 벤치마크 DystopiaBench 공개
Reddit
·
2026.05.18 22시
YouTube, AI 딥페이크 탐지 확대
Reddit
·
2026.05.18 11시
OpenAI, ChatGPT-4o 사망 소송
Reddit
·
2026.05.17 05시
영국 의회, AI 비상시 데이터센터 중단
Reddit
·
1
·
2026.05.16 16시
이전
11
12
13
14
15
다음
이전
8
9
10
11
12
13
14
15
16
17
다음