〜 幻覚論文やコード不一致を排除する証拠チェーン構造とMLE-Bench金メダル獲得のメカニズム 〜
グーグル・リサーチ(Google Research)は2026年7月30日、自律型科学研究AIエージェントの検証可能性を向上させる新たなフレームワーク「Science One Framework」および評価基準「Chain-of-Evidence(CoE)」を発表しました。
既存の自律研究AI(Sakana AIのAI-Scientistなど)は、一見高品質な論文を執筆できるものの、実在しない文献を引用する「架空参照(Phantom References)」や、記載された手法と実際の実行コードが一致しない問題、さらには再現不可能な実験スコアが出力される構造的欠陥が指摘されていました。
本記事では、グーグルが提案するChain-of-Evidence(証拠チェーン)構造の仕組みと、AIエージェント開発およびビッグテックのAI投資に与えるインパクトを解説します。
項目 / 内容 概要
| 項目 | 内容 |
|---|---|
| 発表元・技術名 | Google Research「Science One Framework」※1 |
| 核心概念 | Chain-of-Evidence(生成時点からの1:1証拠チェーンバインディング)※1 |
| 架空引用発生率 | 従来モデル 最大21% → Science One 完全0%達成※2 |
| 主要検証モジュール | Problem Investigator、Discovery Engine(Read-Only Ledger)、Claim Verifier |
| ベンチマーク実績 | MLE-Benchで金メダル2獲得、OpenAI Parameter-GolfでSOTA記録※2 |
〜 従来のAI研究エージェントが抱えていた「検証可能性」の危機 〜
LLMをベースとした自律型AIエージェントは、文献調査から仮説立案、実験コードの実行、論文執筆までを完結できるよう進化してきました。しかし、テキストを反復生成するプロセスにおいて、初期段階の微小な誤差が増幅される課題が存在していました。
従来の自律エージェントの論文では、最大21%の確率で実在しない架空の論文が引用されていたほか、本文で高度なハイブリッドアルゴリズムを説明していながら、裏で実行されていたコードは単純なヒューリスティックに過ぎないといった「手法とコードの乖離」が頻発していました。
データベースにおけるACIDトランザクションのように、AIが生成するすべての主張(数値、引用、コード記述)が裏付けとなる証拠と厳密にリンクしていなければ、どれほど高度な論文であっても科学的信頼性を持ち得ません。
〜 Science One Frameworkを支える3つのアーキテクチャ 〜
グーグルの「Science One Framework」は、事後的にファクトチェックを行うのではなく、主張の「生成時点」から証拠チェーンを構築する設計(By Construction)を採用しています。
- 1. Problem Investigator(文献の厳格なバインディング): LLM内部の訓練記憶から引用を生成させることを禁止し、Semantic Scholar APIを通じて実際の論文PDFを100本読み込み知識グラフを構築。架空引用を完全ゼロ化。
- 2. Discovery Engine & Read-Only Ledger(改ざん不能な実行ログ): アイデアの探索・実験出力を独立した環境で実行し、モデル自身が改ざんできない「Read-Only(読み取り専用)大帳」に生の出力を記録。
- 3. Claim Verifier(主張検証ノード): 論文の出力直前に、すべての数値・スペック・主張を実行ログと1:1で照合。証拠を超えた過剰な主張は保守的に修正(Conservative Reconciliation)して整合性を維持。
このCoE Audit(独立検証監査)を適用した結果、Science One FrameworkはMLE-Bench(Kaggle競技)において3D物体検出などで金メダルを獲得しつつ、100%の再現性と架空引用ゼロを証明しました。
〜 Rirori’s Eye(編集部の視点) 〜
グーグルが示した「Chain-of-Evidence」の思想は、単なる学術研究エージェントにとどまらず、今後のエンタープライズ向けAIエージェントや自動コード generating システム全体における業界標準アーキテクチャとなる可能性を秘めています。
AIの性能競争が「回答の流暢さ」から「実証可能性と信頼性」へとシフトするなか、API直接バインディングとRead-Only Ledgerを備えた構造的アプローチこそが、ビッグテック企業やAIスタートアップの真の競争優位性となるでしょう。
※1: Google Research Blog「Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence」(2026年7月30日発表)に基づきます。
※2: ベンチマーク測定結果および架空引用率はADRS benchmark、MLE-Bench、Parameter-Golfでの比較実験データに基づきます。

