SWE-bench Science、コーディングエージェントを検証
- •SWE-bench Scienceは、20の科学分野にまたがる98リポジトリ由来の119タスクでコーディングエージェントを評価する
- •Opus-5 (max)を使うClaude Codeは、科学ソフトウェア修復でpass@1が50%未満だった
- •非公開テストでは、Qwen3.8-27Bが119件の公開再現に通った一方、非公開タスクは35件にとどまった
Zhipeng Xu、Jiahao Lu、Yining Zheng、Yuxin Wang、Xipeng QiuはAug 20、コーディングエージェントがリポジトリ単位で科学ソフトウェアを修復できるかを測るSWE-bench Scienceを公開した。ベンチマークは、20の科学分野にまたがる98件のGitHubリポジトリから119タスクを収録する。著者らは、科学コードの不具合がプログラムの挙動だけでなく、科学的結論に使われる証拠にも影響し得ると説明している。
SWE-bench Scienceは各タスクをIssue-driven、Expert-exploratory、Engineering-integrationの3つのパラダイムに分類する。評価対象は単なるコーディング成功率ではなく、科学ソフトウェア工学である。著者らによると、最良のエージェントであるOpus-5 (max)搭載のClaude Codeでもpass@1は50%未満で、これらのタスクでは1回の試行による修復がなお難しいことを示した。
論文は、コーディングエージェントに見られる4つの反復的な失敗メカニズムを挙げた。科学知識や抽象化の不足、誤った探索や表層的な修復、修復範囲やシステム統合の不完全さ、観測済み事例を越えて科学知識を一般化できない失敗である。著者らは、リポジトリと実行可能なエンジニアリング文脈を残したまま、明示的な科学的ガイダンスだけを取り除くペアのアブレーション(要因を1つ除いて比較する手法)も実施した。
アブレーションでは、科学的ガイダンスが一律に有益ではないことが分かった。根拠のある情報は修復範囲を絞り、平均性能とトークン効率を改善し得る。一方、うまく整合しないガイダンスはアンカリングを引き起こし、正確な修復成功を必ずしも高めなかった。
コミュニティでは、エージェントがテストを編集して失敗が修正されたように見せられるのではないか、という疑問が出た。Kevin589981の返信によれば、SWE-bench Scienceは検証用イメージ内に保持された別個の非公開テストスイートを使う。検証器は新しいワークスペースから開始し、提出されたパッチを適用し、その結果のソースコードに対して挙動重視の非公開テストを実行する。返信によると、Qwen3.8-27Bは119件すべての公開再現に合格したが、非公開の完全Pass@1は119タスク中35件だった。