AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#ai-safety
#ai-safety와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#ai-safety 5페이지 | AI Briefing
LLM의 '아첨' 현상: 인간보다 49% 더 동조
Reddit
·
2026.08.18 03시
미국인, AI 딥페이크 및 선거 허위 정보 우려
Reddit
·
2026.08.17 23시
추천
Claude의 ‘워터마크’가 글쓰기를 왜곡하는 방식
GeekNews
·
1
·
2026.08.17 18시
긴 컨텍스트가 LLM의 RLHF 정렬을 무력화한다
Reddit
·
2026.08.17 06시
AI 연구자들 사이의 급격한 우려 확산과 경고
Reddit
·
2026.08.16 04시
AI 정렬 연구의 암묵적 가치 이론 분석
PyTorchKR 읽을거리
·
2026.08.15 18시
Anthropic 2026년 8월 리스크 보고서 [pdf]
Hacker News
·
2026.08.15 04시
AX-Ray, AI 모델의 인과적 안전성 진단
PyTorchKR 읽을거리
·
2026.08.14 11시
Claude 에이전트 간 영역 다툼 실험
Reddit
·
2026.08.14 01시
Anthropic: Conceptual Reasoning Index 소개
Hacker News
·
1
·
2026.08.13 22시
AI 에이전트가 거짓말하고, 속이고, 훔친다. 이것이 사용자들을 멀어지게 하고 있다
Hacker News
·
2026.08.13 22시
AI 안전 우려가 커지는 가운데, 세 명의 개척자가 '오픈'의 필요성을 역설하다
TLDR AI
·
2026.08.13 09시
대규모 언어 모델에서 나타나는 자기성찰적 인식
Hacker News
·
2026.08.12 06시
미래는 모두의 것이다
TLDR AI
·
2026.08.11 09시
DEF CON 34: AI는 Bug Bounty를 어떻게 바꾸고 있나?
GeekNews
·
2026.08.11 08시
무슨 일이 있었나: OpenAI와 Hugging Face (18분 읽기)
TLDR AI
·
2026.08.10 09시
Claude Code, Auto Mode를 기본값으로 전환
TLDR AI
·
2026.08.10 09시
고도화된 AI 아첨
TLDR AI
·
2026.08.10 09시
Claude Code, Auto 기본값
Simon Willison
·
2026.08.09 07시
OpenAI, Astra 통제 강화
Reddit
·
2026.08.08 21시
Anthropic, 안전 분류기 무료화
Reddit
·
2026.08.08 20시
OpenAI 에이전트 공격 타임라인
Simon Willison
·
2026.08.08 08시
Google, Earth AI 하루 만에 중단
Reddit
·
1
·
2026.08.08 05시
차세대 핵심 사이버 역량에 대응하기
OpenAI Blog
·
1
·
2026.08.08 00시
이전
3
4
5
6
7
다음
이전
1
2
3
4
5
6
7
8
9
10
다음