AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-safety
#llm-safety와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#llm-safety 2페이지 | AI Briefing
AI를 위한 ‘diff’ 도구: 새 모델의 행동 차이를 찾아내기
Anthropic Research
·
2026.03.13 00시
ServiceNow-AI, 에이전트용 안전 모델 AprielGuard 공개
HuggingFace Blog
·
2025.12.23 23시
Chain-of-thought 모니터링 가능성 평가
OpenAI Blog
·
2025.12.18 21시
AI 모델의 scheming 탐지 및 완화
OpenAI Blog
·
2025.09.17 09시
카카오, 한국어 특화 AI 가드레일 'Kanana Safeguard' 시리즈 오픈소스 공개
카카오
·
2025.05.27 00시
Constitutional Classifiers: 범용 jailbreak 방어
Anthropic Research
·
2025.02.03 00시
Deliberative alignment: 추론을 통한 더 안전한 언어 모델 구현
OpenAI Blog
·
2024.12.20 19시
Google, SynthID Text 공개
HuggingFace Blog
·
2024.10.23 09시
LLM 레드팀 저항성 리더보드 공개
HuggingFace Blog
·
2024.02.23 09시
LLM 신뢰성 평가 리더보드 공개
HuggingFace Blog
·
2024.01.26 09시
LLM 취약점 탐색을 위한 레드팀 가이드
HuggingFace Blog
·
2023.02.24 09시
이전
1
2
다음
이전
1
2
다음