PyTorchKR, 에이전트 하네스 최적화 등 주요 AI 논문 모음 공개
[2026/09/21 ~ 27] 이번 주에 살펴볼 만한 AI/ML 논문 모음
핵심 내용
에이전트 하네스 증류로 작업 성공률 23.3%에서 44.3%로 향상시키는 등 7편의 최신 AI 연구 결과를 소개했다.
자세히 보기
PyTorchKR 커뮤니티가 2026년 9월 21일부터 27일까지의 주요 AI/ML 논문 7편을 모았다. 이번 주 연구 흐름은 에이전트 하네스 최적화, 지식 증류를 통한 시스템 경량화, 복잡한 추론을 위한 기억 구조에 집중되어 있다.
에이전트 하네스 최적화 및 자기개선
Harness-Zero는 외부 하네스 의존성을 제거하기 위해 최적화된 하네스를 가이드로 사용하는 증류 기법을 제안했다. 이를 통해 기본 모델의 매크로 평균 작업 성공률이 23.3%에서 44.3%로 향상되었으며, 하네스 유도 행동 회복률은 평균 **82.3%**를 기록했다. SoL-Pi는 재귀적 자기개선(RSI) 스케일링 시 토큰 효율을 높이는 자동 연구 루프를 적용했다. EdgeBench 51개 태스크에서 기록된 토큰 트래픽을 44.7–49.0% 감소시키고 API 비용을 약 1/3 절감했다. RRSI는 에이전트 하네스 편집 과정에서 발생하는 과적합을 방지하기 위해 정규화 원리를 도입했다. 8개 벤치마크에서 최대 14.1점, 5개 OOD 벤치마크에서 최대 4.7점 향상되었으며, 정책 토큰 사용량은 30% 감소했다.
기억 구조 및 효율성 향상
Jev-Mem은 System-One/System-Two 인지 이론을 기반으로 한 기억 구조를 제안했다. LoCoMo 벤치마크에서 LLM-as-a-Judge 점수 0.777로 최강 기준선 대비 11.0% 상대 개선을 달성했으며, 기억 구축 시간은 158초로 경쟁 시스템 대비 6.6배 빨라졌다. **WFM(Wiki Foundation Model)**은 밀집 문서 맥락과 다층적 토폴로지 링크를 결합하여 복잡한 에이전트 추론을 지원한다. 분산 클러스터에서 10.5배 훈련 가속을 달성하며 5개 장기 에이전트 기억 벤치마크에서 뛰어난 성능을 보였다.
모델 경량화 및 옴니모달 임베딩
세계 모델 표현 증류 연구는 무거운 세계 모델의 물리적 이해를 작은 정책 모델로 증류하여 로봇 응답 시간을 밀리초 단위로 단축했다. Consumer RTX5090에서 32ms 응답과 1.86GB 메모리 사용을 기록했으며, LIBERO 벤치마크에서 97.9% 성공률을 달성했다. Ovis-Embedding은 텍스트, 이미지, 비디오, 오디오를 단일 옴니모달 백본으로 통합한 범용 임베딩 모델이다. 약 5,000만 쌍의 고품질 코퍼스로 학습하여 MMEB-v3 등 주요 벤치마크에서 최신(state-of-the-art)급 성능을 입증했다. SlopShape는 AI 생성 콘텐츠의 구조적 특징을 분석하여 탐지하는 방법론으로, 재작성 우회 공격에 강건하며 macro-F1 98.0의 정확도를 보였다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.