AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-safety
피드
트렌딩
주간
태그
설정
에이전트, 허위 주장 85.5% 채택
Reddit
·
1
·
2026.08.01 02시
LLM의 거절 행동을 유도하는 문맥 효과 발견
Reddit
·
2026.06.23 20시
RewardHackBench: AI 에이전트 부정행위 방지 벤치마크
Reddit
·
2026.06.17 21시
연구자들 “Fable 5 논란은 탈옥이 아니라 ‘fix this code’에서 시작됐다”
GeekNews
·
2026.06.17 09시
배포 시뮬레이션을 통한 모델 출시 전 동작 예측
OpenAI Blog
·
2026.06.16 09시
AI 에이전트가 Fedora 및 기타 프로젝트에서 통제 불능 상태로 작동
Hacker News
·
2026.06.11 09시
Claude Opus 4.8 시스템 카드 분석
TLDR AI
·
2026.06.01 09시
LLM 내부 상태 변화와 정렬의 한계
Reddit
·
2026.05.30 02시
GPT-4.5, 튜링 테스트 73% 기록하며 통과
Reddit
·
2026.05.29 20시
의료 가이드라인에 AI 가짜 인용 포함 확인
Reddit
·
2026.05.27 14시
Clawpatrol, AI 에이전트 보안 방화벽
Reddit
·
2026.05.26 23시
프롬프트 톤에 따른 LLM 정직성 변화 연구
Reddit
·
2026.05.21 23시
장기 자율성 평가를 위한 AI 에이전트 시뮬레이션 플랫폼 'Emergence World' 분석
GeekNews
·
2026.05.19 10시
온타리오 감사원, 의사용 AI 노트 작성기가 기본 사실을 반복적으로 틀린다고 밝혀
GeekNews
·
2026.05.16 07시
MIT, AI 과신 줄이는 RLCR
Reddit
·
2026.05.14 23시
AI 안전의 나머지 절반
Hacker News
·
2026.05.14 09시
게이 jailbreak 기법
GeekNews
·
2026.05.02 12시
OpenAI, ChatGPT 고블린 원인 공개
Reddit
·
2026.04.30 23시
OpenAI Codex 시스템 프롬프트에 ‘고블린 언급 금지’ 지시가 포함됐다
TLDR AI
·
2026.04.30 09시
당신의 LLM은 얼마나 치명적인가
Amazon Science
·
2026.04.28 04시
ServiceNow-AI, 에이전트용 안전 모델 AprielGuard 공개
HuggingFace Blog
·
2025.12.23 23시
Chain-of-thought 모니터링 가능성 평가
OpenAI Blog
·
2025.12.18 21시
AI 모델의 scheming 탐지 및 완화
OpenAI Blog
·
2025.09.17 09시
카카오, AI 가드레일 모델 'Kanana Safeguard' 시리즈 공개
카카오
·
2025.05.27 00시
이전
1
2
다음
이전
1
2
다음