AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#ai-safety
#ai-safety와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#ai-safety 9페이지 | AI Briefing
정부 및 국가 안보 파트너십에 대한 접근 방식
OpenAI Blog
·
2026.07.08 22시
UN, AI 거버넌스 역량 부족 경고
Reddit
·
2026.07.08 21시
Alignment Evals에 Calibration이 필요한 이유
TLDR AI
·
2026.07.08 09시
추천
Anthropic, 모델 내부의 개념 표현 'J-space' 발견
Reddit
·
2026.07.08 01시
단 하나의 뉴런만으로 LLM의 안전 정렬(Safety Alignment) 우회 가능
Apple ML
·
2026.07.07 09시
Vending-Bench에서 나타난 Fable 5의 부적절한 행동: 그럴듯한 부인(Plausible Deniability)을 동반한 기만
Hacker News
·
2026.07.06 21시
해석 가능성을 통한 데이터 어노테이터 안전 정책의 이해
Apple ML
·
2026.07.06 09시
Claude Mythos Preview 출시 전후로 심각한 보안 취약점 급증
Hacker News
·
2026.07.04 06시
Fable 5의 사이버 보안 보호 조치 및 탈옥(Jailbreak) 프레임워크 상세 정보
Anthropic News
·
2026.07.03 09시
주요 기관별 AI 거버넌스 및 가드레일 입장 차이
Reddit
·
2026.07.02 21시
Spring Health, 정신건강 AI 평가 프레임워크 VERA-MH 공개
Reddit
·
2026.07.02 02시
UN AI 과학 패널, AI 위험성 경고
Reddit
·
1
·
2026.07.01 22시
Meta, 주요 LLM 대상 미성년자 안전성 테스트
Reddit
·
2026.06.30 21시
DVA: AI의 무분별한 수정을 방지하는 결정론적 검증 도구
Reddit
·
2026.06.26 21시
미 정부, OpenAI GPT-5.6 출시 제한 요청
Reddit
·
2026.06.26 19시
연구 과학자(Research Scientist) 구직 과정에서 얻은 놀라운 교훈들
TLDR AI
·
2026.06.26 09시
멀티모달 모델의 환각 유발 원인 규명
Reddit
·
2026.06.25 17시
고도화된 AI를 위한 공동 표준 구축 지원
OpenAI Blog
·
2026.06.23 22시
LLM의 역할 인식 한계와 프롬프트 인젝션
Simon Willison
·
2026.06.23 08시
캘리포니아 내 사업 확장
ElevenLabs
·
2026.06.23 05시
DiffusionGemma 투명성 감사 (9분 분량)
TLDR AI
·
2026.06.22 09시
Anthropic Mythos, 기밀 시스템 수 시간 내 해킹
Reddit
·
2026.06.21 15시
미 법무부, 딥페이크 누드 사이트 압수
Reddit
·
2026.06.19 22시
광범위하고 지속적인 이익을 주는 모델을 향한 강화 학습
TLDR AI
·
2026.06.19 09시
이전
7
8
9
10
11
다음
이전
4
5
6
7
8
9
10
11
12
13
다음