AI Briefing

NeurIPS 반려 기준과 Pangram 데이터 팩트 체크

NeurIPS decisions are out. I fact-checked my own Pangram post, and Pangram's own report changes the story [N]

·2026.09.26 21:25

핵심 내용

NeurIPS 2026 반려 기준과 Pangram 오탐지율에 대한 팩트 체크 결과가 발표됐다.

자세히 보기

Pangram 성능과 오탐지

NeurIPS에서 사용된 Pangram v3.3.2의 내부 보고서에 따르면, AI로 다듬어진 인간 작성 피어 리뷰의 **14.9%**를 'AI 작성'으로 잘못 분류했다. 난이도가 높은 서브셋에서는 오탐지율이 **4.5%**였다. 이는 v3.0과 v4보다 낮은 성능이다. 해당 트랙 정책은 AI를 통한 문장 다듬기를 명시적으로 허용했다. ICML 2026 논문은 창 단위 오탐지율을 전체 논문으로 확장 해석해서는 안 된다고 지적했다.

반려 기준과 편향 주장에 대한 정정

팩트 체크는 다음과 같은 오해를 바로잡았다.

  • 반려 등급: 79편 그룹은 AI 탐지 점수 0.8에 더해 복수의 단독 저자 제출물 또는 다른 반려 이력이 있어야 했다. 22편 그룹은 AI 사용 신고를 공란으로 둔 저자들도 포함했다.
  • ESL 편향 주장: 비영어권 화자(ESL)의 61% 오탐지율은 2023년 다른 탐지 도구 7종을 대상으로 한 연구 결과다. Pangram v3.3.2는 같은 TOEFL 에세이 89편에서 오탐지가 0건이라고 주장하지만, 이는 벤더 자체 데이터이며 독립적으로 검증되지 않았다.
  • 독립 연구자: '독립 연구자'는 Sergey Berezin 한 사람을 지칭하며, 그는 의장 논문 작성 방식에 대해 어떠한 주장도 하지 않았다.

현재 상태

초기 반려 이후 조건부 통과된 논문 총수는 공개되지 않았다. 전체 분석은 저자 블로그에서 확인할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.