AI Briefing

오픈 모델에 과학 연구를 가르치기

·2026.07.31 09:00

오픈 모델을 RL로 학습해 과학적 도구 사용과 생물학 추론 성능을 높였다.

Loka, AWS, Arcee AI, Prime Intellect는 오픈 모델이 도구를 활용해 과학적 질문을 조사하고, 불완전한 증거를 바탕으로 추론하며, 검증 가능한 결과를 내놓도록 강화학습 환경을 구축했다. 하나는 생의학 도구를 사용해 증거를 찾는 작업을, 다른 하나는 단백질 증거에서 Gene Ontology 주석을 추론하고 엄격한 JSON으로 반환하는 작업을 다룬다.

21개의 통제된 post-training 실험을 진행한 결과, Run 120 체크포인트가 두 작업 모두에서 우수해 최종 설정으로 선정됐다.

  • Drug Tool 평가 점수가 **70.8%에서 81.2%**로 상승했으며, 모든 평가 시점에서 개선됐다.
  • BioReason의 종합 점수는 0.863으로, GO term F1·GO 트리 유사도·측면 커버리지·JSON 유효성을 포함한다.
  • 강화학습 전 GEPA prompt search를 한 차례 적용했을 때 BioReason 검증 성능은 약 84%, Drug Tool은 7.7% 개선됐다. 이는 post-training 전 검증 결과로 최종 성능과는 별도다.

Drug Tool 환경은 800개 학습 프롬프트와 200개 보류 프롬프트로 구성되며, 17개 워크플로 카테고리와 총 5,049개의 구조화된 도구 호출을 포함한다. 모델은 PubMed, GEO, KEGG, UniProt, STRING 등 7개 검색 도구를 선택하고 인자를 설정하며, 검색 실패를 복구한 뒤 간결한 종합 결과를 제출해야 한다.

보상 설계는 최종 답변뿐 아니라 도구 선택, 인자, 검색된 사실, 작업 완료 여부, 효율성, 간결성까지 평가하도록 구성됐다. BioReason은 생물학적 내용, 출력 구조, JSON 유효성을 함께 측정한다.

이 접근법은 과학적 정확성뿐 아니라 운영 측면에서도 의미가 있다. 소형 모델과 LoRA adapter를 조직의 cloud boundary 안에서 실행하고, 특정 정책 버전에 고정하며, 자체 데이터와 기준에 맞춰 업데이트할 수 있기 때문이다. 팀은 데이터 경로, 보상 함수, 평가 방식, serving 비용, incident response를 직접 통제할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.