MOOSE-Star 7B 공개
MOOSE-Star (ICML 2026): 7B model + 108K-paper dataset for scientific hypothesis discovery
·2026.05.15 02:33
MOOSE-Star가 108,717편 NCBI 논문 기반 7B 모델·데이터를 공개했다.
Hugging Face에 MOOSE-Star 컬렉션이 공개됐다. 과학 가설 발견용으로 후학습한 7B 모델과 그 기반 데이터셋이 함께 제공되며, 논문은 ICML 2026에 채택됐다.
- 모델은 MS-IR-7B(inspiration retrieval), MS-HC-7B(hypothesis composition), MS-7B(joint IR+HC)로 구성된다.
- 모두 DeepSeek-R1-Distill-Qwen-7B를 기반으로 하며, 추론·검색·가설 구성 작업에 맞춰 나뉜다.
TOMATO-Star는 108,717편의 NCBI 논문을 background / hypothesis / inspirations로 분해한 데이터셋이다.
- 각 inspiration은 실제 논문 인용에 연결돼 있어 추적 가능성을 높였다.
- 적용 분야는 biology, chemistry, medicine, medical imaging, psychology, cognitive science를 포함한다.
- 데이터 구축 전처리에는 약 38,400 A800 GPU-hours가 사용됐다.
평가는 train ≤ 2025년 9월, test = 2025년 10월로 나눈 엄격한 시계열 분리에서 진행됐다.
- Inspiration retrieval accuracy는 MS-IR-7B 54.37%, **MS-7B 54.34%**로 보고됐다.
- 비교값은 Random 6.70%, base 28.42%, Claude Sonnet 4.6 45.02%, DeepSeek-R1 45.11%, Gemini-3 Flash 51.44%, GPT-5.4 51.50%, Gemini-3 Pro **54.89%**였다.
실행 측면에서는 DeepSeek-R1-Distill-Qwen-7B가 돌아가는 환경이면 그대로 사용할 수 있고, llama.cpp / vLLM / SGLang도 지원한다.
- 메모리 요구량은 fp16 기준 약 14GB 수준이다.
- 24GB 단일 GPU 환경에서도 구동 가능한 범위다.
- 코드 라이선스는 Apache-2.0, 데이터는 CC-BY-4.0다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.