오픈 모델에 과학 추론 학습
- •Arcee, Loka, AWS, Prime Intellect가 감사 가능한 과학 워크플로용 Trinity Large Thinking을 훈련했다
- •BioReason RL은 8,630개 레코드를, Drug Tool 데이터셋은 800개 훈련 프롬프트와 5,049개 도구 호출을 담았다
- •GEPA 프롬프트 최적화는 BioReason 검증을 약 84%, Drug Tool 검증을 7.7% 끌어올렸다
Arcee, Loka, AWS, Prime Intellect는 2026년 7월 30일 도구 사용, 생물학적 추론, 감사 가능한 과학 워크플로를 위한 오픈 모델 프로젝트 Trinity Large Thinking 사례 연구를 공개했다. 이번 협업은 Trinity Mini의 기존 생의학 초록 과제에서 더 나아갔다. 당시 Trinity-Mini-DrugProt-Think 어댑터는 증거 항목 1개, 명명된 개체 2개, 가능한 관계 13개를 바탕으로 약물-단백질 관계를 분류했다. 새 작업은 같은 오픈 모델이 과학적 질문을 조사하고, 여러 출처를 넘나들며 추론하며, 증거가 불완전할 때 복구하고, 다른 과학자가 확인할 수 있는 결론을 낼 수 있는지를 묻는다.
사례 연구는 과학 AI가 질의응답에서 연구 워크플로로 이동하고 있다고 설명했다. 근거로 129개 계산생물학 문제를 담은 OpenAI의 GeneBench-Pro, 생명과학 추론용 GPT-Rosalind, Anthropic의 Claude Science 워크벤치, 구조 예측·분자 생성·도킹·서열 분석·유전체학을 위한 NVIDIA BioNeMo Agent Toolkit을 들었다. 저자들은 목표가 설득력 있는 과학 문장보다 증거 수집, 전문 도구 사용, 분석, 수정, 검증 가능한 작업에 더 가깝다고 주장했다.
오픈 스택은 Arcee의 Trinity Mini 오픈 웨이트 정책, Prime Intellect의 오픈소스 prime-rl 강화 학습 시스템, Loka의 생의학 데이터셋과 에이전트형 하니스, 그리고 가속 훈련·내구성 있는 산출물·보안·모델 서빙·애플리케이션 서비스·관측성을 위한 AWS 인프라를 결합했다. 보고서는 워크플로가 특화된 오픈 모델 훈련과 증거 중심 반복 21라운드를 거쳤다고 밝혔다. 제시된 이유는 운영 통제다. 조직은 보상을 검사하고, 평가를 조정하며, 정책 버전을 고정하고, 배포를 승인된 클라우드 경계 안에 유지하며, 실패를 다음 훈련 실행의 입력으로 쓸 수 있다.
훈련 과제에는 공개된 데이터셋 2개가 쓰였다. BioReason RL은 훈련 및 보류 분할 전반에 걸쳐 큐레이션된 레코드 8,630개를 포함하며, 단백질 메타데이터와 서열을 InterPro, 상호작용, 세포내 위치 증거, 노이즈가 있는 GO-GPT 후보 용어와 결합한다. 모델은 이 증거에서 기능 요약과 함께 Molecular Function, Biological Process, Cellular Component 유전자 온톨로지 ID 목록을 추론해야 한다. Loka Drug Tool SFT 데이터셋은 17개 워크플로 범주에 걸쳐 훈련 프롬프트 800개와 보류 프롬프트 200개를 담았고, 질병-경로 증거, 문헌 기반 표적 선별, 모순 확인, GEO 바이오마커 스크리닝, KEGG 해석, 단백질 레코드, 상호작용 네트워크, 분자 생성, 단백질 접힘, 도킹 계획을 포괄하는 구조화된 도구 호출 5,049개를 포함했다.
검증기는 이 데이터셋들을 훈련 신호로 바꿨다. Drug Tool RL은 근거가 있는 핵심 사실, 도구 결과, 도구 선택, 도구 인수, 완료도, 효율성, 간결성을 채점했다. BioReason은 GO F1, GO 트리 유사도, 측면 존재 여부, 엄격한 JSON 유효성을 평가했다. 최종 프로토콜은 지정된 환경과 검증기 아래에서 훈련 20스텝마다 Drug Tool 예제 200개와 BioReason 예제 512개를 평가했으며, 이는 임상적 유효성, 습식 실험 성능, 전체 신약 프로그램 성공에 대한 주장으로 제시되지 않았다.
GRPO 후훈련 전에 연구팀은 두 환경 전반에서 GEPA 프롬프트 최적화 1회를 수행했다. Trinity Mini가 기본 모델 롤아웃을 만들었고, Claude Sonnet 5는 롤아웃과 검증기 피드백을 사용해 더 강한 과제 지시문을 제안했다. 이 과정은 기본 모델 검증을 BioReason에서 약 84%, Drug Tool에서 7.7% 개선해 공유 검증 지수를 BioReason은 100에서 184로, Drug Tool은 107.7로 높였다. 저자들은 이 수치가 강화 학습에 더 강한 출발점을 주기 위해 사용된 프롬프트 탐색 검증 상승분이며, 최종 후훈련 결과는 아니라고 설명했다.