새 최첨단 AI 모델은 공간생물학에서 더 빨라졌지만 정확도는 제자리
SpatialBench에서 GPT-5.5와 Opus 4.7은 더 빨라졌지만 정확도는 제자리였다.
SpatialBench 결과에서 GPT-5.5와 Opus 4.7은 속도는 빨라졌지만 정확도는 거의 변하지 않았다. GPT-5.5는 GPT-5.4 대비 평균 실행 시간을 거의 절반으로 줄였지만 정확도는 57.65% 대 57.44%에 머물렀고, Opus 4.7도 52.41%로 Opus 4.6의 52.83%와 사실상 비슷했다.
벤치마크는 159개 공간생물학 분석 과제로 구성되며, Xenium, Visium FFPE, MERFISH, TakaraBio Seeker, AtlasXomics DBiT-seq 같은 실제 플랫폼을 다룬다. 각 과제는 실제 분석 상태에서 출발해 특정 생물학적 결과를 복원하게 만들고, 정답은 전문가가 검토한 기준값과 비교된다.
플랫폼별로는 GPT-5.5가 Visium, Xenium, MERFISH에서 개선됐지만 TakaraBio와 AtlasXomics에서는 뒤졌다. Opus 4.7도 Xenium에서는 11.1%p 앞섰으나, 다른 플랫폼에서는 비슷하거나 낮았다.
전문가가 검토한 분석 경로에서는 반복적인 실패 패턴이 드러났다.
- 바코드·비드·스팟을 독립 반복으로 취급해 pseudoreplication을 일으킴
- scRNA-seq 기본 정규화를 targeted spatial 패널에 그대로 적용함
- donor/timepoint 통합 없이 군집화해 배치 구조를 생물학적 구조로 오독함
- bead나 marker를 세포처럼 세어 공간 단위를 잘못 해석함
- de novo niche와 tissue state 복원에 실패함
예시도 분명하다. AtlasXomics SPATIAL10_genome_wide_de_pct에서는 기대값이 약 1.2%인데 모델들은 92~94%의 유전자를 성별 차등으로 판정했다. MERFISH norm_02_myelin_gene_coexpression_normalization에서는 Mbp와 Plp1의 기대 Spearman 상관이 약 0.308인데, GPT-5.5와 Opus 계열은 약 -0.16을 냈다. 원인은 374개 유전자 타깃 패널에 sc.pp.normalize_total(adata, target_sum=1e4)와 sc.pp.log1p(adata)를 그대로 적용한 데 있었다. TakaraBio Seeker의 oocyte_count_per_timepoint에서는 기대 immature oocyte 수가 850인데 모델은 1,510~3,463까지 과대추정했다. 공간생물학에서는 속도보다도 플랫폼별 맥락을 반영하는 판단이 여전히 병목으로 남아 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.