AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#interpretability
#interpretability와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
AI 에이전트 '비밀 언어', 전문 용어 변이일 뿐
Reddit
·
2026.09.26 21시
Goodfire, 모델 내부 Activation 신호로 Reward Hacking 탐지 기술 공개
TLDR AI
·
2026.09.18 09시
LLM 내부 표현이 상징적 구조를 암시적으로 구현한다는 연구 발표
Hacker News
·
1
·
2026.09.02 13시
스펙트럴 뉴런 논문 공개
Reddit
·
2026.08.20 19시
중간 토큰을 추론/사고 흔적으로 인간화하는 관행 중단하라
Hacker News
·
2026.08.19 20시
대규모 언어 모델에서 나타나는 자기성찰적 인식
Hacker News
·
2026.08.12 06시
진리는 방향이 아니다: LLM 프로브(Probe)에 대한 타르스키식 공격
Hacker News
·
2026.07.27 21시
Anthropic, Jacobian Lens 오픈소스 공개
PyTorchKR 읽을거리
·
2026.07.22 20시
Silico
TLDR AI
·
2026.07.16 09시
LG AI Research: ICLR 2024 연구 요약
LG AI Research
·
2026.07.16 09시
Anthropic, 모델 내부의 개념 형성 과정 포착
Reddit
·
2026.07.13 21시
우리는 대규모 언어 모델(LLM)이 추론하는 방식을 이해할 수 있는가?
Hacker News
·
2026.07.13 03시
추천
Anthropic, 모델 내부의 개념 표현 'J-space' 발견
Reddit
·
2026.07.08 01시
단 하나의 뉴런만으로 LLM의 안전 정렬(Safety Alignment) 우회 가능
Apple ML
·
2026.07.07 09시
J-Space만큼 특별한 공간은 없다
TLDR AI
·
2026.07.07 09시
해석 가능성을 통한 데이터 어노테이터 안전 정책의 이해
Apple ML
·
2026.07.06 09시
MemoryLLM: Transformer를 위한 플러그 앤 플레이 방식의 해석 가능한 Feed-Forward Memory
Apple ML
·
2026.07.02 09시
Google DeepMind, Tracr 공개
Reddit
·
2026.06.30 12시
Pangram 3.3.2의 내부 표현 탐색
Hacker News
·
2026.06.25 10시
LLM의 내부 상태 변화가 답변 성향을 결정한다
Reddit
·
2026.06.24 01시
DiffusionGemma 투명성 감사 (9분 분량)
TLDR AI
·
2026.06.22 09시
모델 규모에 따른 'Rosetta 뉴런'의 특성 변화 연구
Reddit
·
2026.06.19 04시
Anthropic 공동 창립자, AI 내부 구조의 불확실성 경고
Reddit
·
2026.06.12 14시
예측적 데이터 디버깅: 모델 학습 전, 모델이 무엇을 배울지 미리 확인하고 제어하라
TLDR AI
·
2026.06.12 09시
이전
1
2
3
다음
이전
1
2
3
다음
#interpretability | AI Briefing