見出し画像

「AIが科学を知っている」から「AIが研究をする」へ。Claude Fable 5.1とTerminal-Bench-Scienceが示した変化


2026年9月、Anthropicは新モデルClaude Fable 5.1とClaude Mythos 5.1を発表した。

Anthropicは今回のモデルを、コーディングや知識労働だけでなく、科学研究そのものを進める能力が大きく向上したモデルとして紹介している。(Anthropic)

その中でも特に目を引く数字がある。

Terminal-Bench-Science 0.1
Fable 5:24.7%
Fable 5.1:52.6%

わずか0.1のアップデートに見えるが、スコアはほぼ倍になっている。(Anthropic)

ただし、この数字の意味を理解するには、まずTerminal-Bench-Scienceとは何なのかを知る必要がある。

これは普通のAIベンチマークとはかなり違う。

端的に言えば、

「AIは科学について答えられるか」ではなく、「AIに実際の研究作業を任せたら、最後までやり切れるか」を測るテスト

なのである。


まず結論:今回重要なのは「AIの知識量」ではない

Claude Fable 5.1で最も重要なのは、

AIが難しい問題に答えられるようになった

ということだけではない。

むしろ、

AIが何時間、何十時間とかかる仕事を自分で進められるようになりつつある

ことの方が重要だ。

これまでの生成AIは、人間から見ると非常に頭がいい一方で、仕事を丸ごと任せるのは難しかった。

たとえば、

「このデータを分析して」

と頼むと、分析方法を説明することはできる。

しかし現実の研究では、

  • データ形式を確認する

  • 必要なライブラリを探す

  • コードを書く

  • 実行する

  • エラーが出る

  • 原因を調べる

  • 修正する

  • 別の方法を試す

  • 結果を検証する

  • 最終データを保存する

といった工程が延々と続く。

本当に研究者の役に立つAIには、これらを途中で投げ出さずに最後まで処理する能力が必要になる。

Terminal-Bench-Scienceは、まさにそこを測っている。


Terminal-Bench-Scienceとは何か

Terminal-Bench-Science、略してTB-Scienceは、2026年に公開された科学研究向けAIエージェントのベンチマークだ。

Stanford大学の研究者を中心に、Terminal-BenchやHarborのチーム、世界各地の研究者が参加して作られている。(TERMINAL-BENCH-SCIENCE)

初版のTerminal-Bench-Science 0.1には、

70個の研究タスク

が収録されている。

対象分野は大きく5つ。

分野内容Life Sciences生物学・医学などPhysical Sciences物理・化学・材料科学などEarth Sciences地球・環境・気候関連Mathematical Sciences数学・統計・最適化Engineering Sciences工学・信号処理・制御など

実際のタスクには、

  • 科学データ解析

  • 統計推論

  • シミュレーション

  • 最適化

  • 定理証明

  • 医用画像解析

  • 画像再構成

  • 信号処理

  • センサー較正

  • モデルフィッティング

  • 機械学習

  • 逆問題

などが含まれる。(TERMINAL-BENCH-SCIENCE)

ここで重要なのは、

「科学についてのクイズ」ではない

ということだ。


Humanity's Last Examなどとは何が違うのか

AIモデルの能力を比較するとき、よく使われるのがMMLUやHumanity's Last Examなどのベンチマークだ。

ただし、これらは基本的には「問題を読んで答える」試験である。

一方Terminal-Bench-Scienceは違う。

ベンチマーク主に測っているものMMLU幅広い知識Humanity's Last Exam超難問への推論能力SWE-benchソフトウェアのバグ修正Terminal-BenchPC上での長い作業Terminal-Bench-Science実際の科学研究ワークフロー

たとえば大学院生に、

このテーマについて説明してください

と質問するのが従来型ベンチマークだとする。

Terminal-Bench-Scienceは、

この研究データを渡すので、解析して成果物を完成させてください

に近い。

試験から仕事へ

評価対象が変わっている。


なぜ「Terminal」という名前なのか

Terminal-Bench-ScienceのAIは、チャット画面だけで問題を解くわけではない。

実際にLinuxのターミナル環境を使う。

イメージとしてはこうなる。

研究課題を読む

↓
ファイルを確認

↓
データ構造を理解

↓
Pythonなどでコードを書く

↓
実行

↓
エラー発生

↓
原因を分析

↓
修正

↓
再実行

↓
解析結果を検証

↓
指定形式で成果物を保存

人間の研究者がPCで行っている作業にかなり近い。

そのためTB-Scienceは単純な「LLMの頭の良さ」だけではなく、

モデル+AIエージェント

を評価している。

たとえば、

  • Claude + Claude Code

  • GPT + Codex

という組み合わせで競争する。

公開された0.1のランキングでは、

モデルAgentResolution RateClaude Opus 5Claude Code30.0%GPT-5.6 SolCodex22.4%Claude Fable 5Claude Code21.4%Claude Opus 4.8Claude Code10.5%

という結果だった。(TERMINAL-BENCH-SCIENCE)

世界最高峰のAIでも、ほとんどの課題を完遂できない。

それほど難しい。


実際にどんな問題を解くのか

具体例を見るとTB-Scienceの性格がよく分かる。

公開されているタスク名には、

  • MRI画像解析

  • 細胞系譜の再構成

  • DNAストレージ

  • EEG信号解析

  • タンパク質解析

  • 天体軌道推定

  • X線回折解析

  • センサー較正

  • 数理最適化

  • Leanによる数学証明

  • 湖の氷結データ解析

  • 地形データ生成

などが並んでいる。(GitHub)

「AI向けに作ったパズル」というより、

研究室のPCで実際に行われている計算作業

に近い。


例:電子顕微鏡画像から3D構造を復元する

特に分かりやすいのがCryo-ET、つまりクライオ電子線トモグラフィーの例だ。

これは生物試料などをさまざまな角度から電子顕微鏡で撮影し、

複数の2次元画像から3次元構造を復元する

技術である。

TB-Scienceに提案された課題では、

41枚の投影画像などをAIに渡し、AIが3Dデータを復元する。(GitHub)

単に、

「Cryo-ETとは何ですか?」

と聞くわけではない。

AI自身が、

  1. データを読み込む

  2. 画像形式を理解する

  3. 適切な再構成法を考える

  4. ソフトウェアを設定する

  5. 計算を実行する

  6. うまくいかなければ修正する

  7. 3Dデータを生成する

必要がある。

最終的には、隠された正解データと比較して、十分な精度に到達したかが判定される。

ここが非常に重要である。


「文章がそれっぽい」だけでは合格できない

従来の生成AI評価には難しい問題がある。

AIが非常に説得力のある文章を書いても、

実際には間違っている

ことがある。

科学研究ではこれは致命的だ。

そこでTerminal-Bench-Scienceでは可能な限り、

最終成果物を機械的に検証する

設計になっている。

たとえば、

  • 数値

  • ファイル

  • シミュレーション結果

  • 統計モデル

  • 画像

  • 証明

  • データセット

などを提出させる。

そして正しい成果物になっているかをテストする。

TB-Scienceの設計方針でも、単なる自由記述ではなく、具体的で検証可能な科学成果物を重視している。(GitHub)

つまり、

AIが「できました」と言った

では駄目で、

本当にできているか

を見る。


さらに面白いのは、問題を科学者自身が作っていること

Terminal-Bench-Scienceにはもう一つ重要な特徴がある。

AI企業が一方的に問題を作っているわけではない。

実際の研究者が、

「これは私たちの研究室で実際にやる作業です」

というタスクを提案する。

初版では920件のタスク案が提出された。

そこから、

  • 科学的に意味があるか

  • 本当に研究現場の仕事か

  • AIにとって十分難しいか

  • 正解を客観的に判定できるか

などを審査。

920案のうち464件が実装候補となり、最終的に0.1へ入ったのはわずか70件だった。(TERMINAL-BENCH-SCIENCE)

かなり厳しく選別されている。


そこでFable 5.1の「52.6%」が重要になる

ここでClaude Fable 5.1の話に戻ろう。

Anthropicが発表した評価では、

モデルTB-ScienceGPT-5.6 Sol22.4%Claude Fable 524.7%Claude Opus 529.0%Claude Fable 5.152.6%

となった。(Anthropic)

かなり大きなジャンプである。

ただし注意点もある。

公開されているTB-Science公式ランキングでは、

Fable 5=21.4%

となっている。

Anthropic側の再実験では24.7%。

Anthropicによれば、この程度の差は試行ごとのばらつきの範囲で、標準誤差はモデルあたり約±3.5〜4.5ポイントとしている。(Anthropic)

また、現時点でFable 5.1の52.6%はAnthropic側の評価結果である。

したがって、

独立した第三者によって52.6%が完全に再現された

という意味ではない。

ここは分けて考える必要がある。


それでも「倍」はかなり大きい

多少の測定誤差があったとしても、

24.7%から52.6%

という伸びは非常に大きい。

単純化すると、

Fable 5では4つ研究タスクを渡して1つ程度しか完遂できなかったものが、

Fable 5.1では約2つ完遂できる水準に近づいたことになる。

もちろん実際の難易度はタスクごとに違うので、完全にこの比率で考えることはできない。

それでも、

「研究エージェントとして成功する確率」が明らかに変わってきた

と見ることはできる。


なぜFable 5.1はこれほど伸びたのか

今回のAnthropicの説明を読むと、一つの方向性が見えてくる。

Fable 5.1は、

長時間作業の継続能力

に力を入れている。

AnthropicはFable 5.1について、

  • ショートカットを避ける

  • 根本原因まで調べる

  • 自分の作業を検証する

  • 長い複数工程を維持する

能力が改善したとしている。(Anthropic)

実際、早期利用企業からも「数時間放置して作業させた」「38時間の連続作業を行わせた」といった事例が紹介されている。(Anthropic)

つまり今回の進化は、

IQが少し上がった

というより、

優秀な人が途中で仕事を投げ出さなくなった

と考える方が近い。


AIエージェントにとって「継続力」は非常に重要

人間の仕事でも同じだ。

100点満点の知識を持っていても、

  • 途中で指示を忘れる

  • 最初の方針に固執する

  • エラーを直せない

  • 検証せず終了する

人には大きな仕事を任せにくい。

逆に、

  • 80点の知識

  • 問題が起きたら調査

  • 仮説を立て直す

  • 自分で検証

  • 最後まで完成

できる人は実務では非常に強い。

AIにも同じことが起きている。

だから現在のAI競争は、

「最も賢いチャットボットはどれか」

から、

「最も長く、正確に、自律して働けるAIはどれか」

へ移りつつある。


Fable 5.1とMythos 5.1の違い

今回Anthropicはもう一つ、Claude Mythos 5.1というモデルも発表した。

やや分かりにくいが、

Fable 5.1とMythos 5.1の基礎モデルは同じ

である。(Anthropic)

違うのは主に安全制限だ。

Fable 5.1Mythos 5.1基礎モデル同じ同じ一般利用○×セキュリティ制限強い一部緩和生命科学制限あり審査済み研究者向けサイバー研究制限あり専門家向け

Mythosは、

  • サイバーセキュリティ

  • 生命科学

など、デュアルユース性が高い分野の専門家向けモデルとなっている。

誰でも利用できるわけではなく、AnthropicのTrusted Accessプログラムを通じて提供される。(Anthropic)


Anthropicはすでに「AIが科学を進める」実験を始めている

今回の発表が興味深いのは、ベンチマークだけではない。

AnthropicはFable 5.1 / Mythos 5.1を実際の研究課題にも使っている。

たとえばFable 5.1はNASAのMagellan探査機の古いレーダーデータを使い、

金星表面の高解像度標高マップ

を生成したという。

従来10〜20km程度だった解像度から、2〜3km程度の地形まで読み取れるデータを作成したとしている。(Anthropic)

またMythos 5.1では、タンパク質設計にも取り組んでいる。

Anthropicによれば、一部の標的では既存コンペの最良設計より10倍高い結合親和性を持つ設計が得られ、12標的全体で約50%のhit rateを記録したとしている。(Anthropic)

さらに生命科学用の機械学習モデルについて、

GPU処理を最大2.5倍高速化

するコードも作成したという。(Anthropic)

もちろん、これらはAnthropic自身による発表なので、今後第三者による検証を見る必要はある。

しかし方向性は明確だ。


科学者はAIに置き換えられるのか

ここで、

では研究者はいらなくなるのか?

という疑問が出てくる。

少なくともTerminal-Bench-Scienceの考え方はそうではない。

むしろ想定されているのは、

AIが研究助手になる

世界だ。

研究には、

AIに任せやすい部分

  • データ整理

  • コーディング

  • シミュレーション

  • パラメータ探索

  • 画像処理

  • 定型解析

  • 実験結果の再計算

と、

人間の判断が重要な部分

  • 何を研究するか

  • 仮説をどう立てるか

  • 結果に意味があるか

  • 実験設計は妥当か

  • 研究倫理

  • 他の研究との関係

  • 最終的な科学的判断

がある。

TB-Science自身も、AIが時間のかかる技術作業を担い、人間の研究者が「研究課題の設定・仮説形成・結果の解釈・検証」などに集中することを目標としている。(TERMINAL-BENCH-SCIENCE)

つまり理想像は、

科学者 vs AI

ではなく、

科学者 × AIエージェント

である。


これは研究だけの話ではない

Terminal-Bench-Scienceは科学用ベンチマークだが、実はこの変化は多くの仕事に当てはまる。

たとえば、

エンジニア

「コードを書いて」

から、

リポジトリを調査し、原因を見つけ、修正して、テストまで通して

へ。

コンサル

「市場について教えて」

から、

市場データを集め、競合を分類し、分析し、資料を完成させて

へ。

研究者

「この論文を要約して」

から、

データを解析し、モデルを比較し、再現実験して

へ。

事務

「Excel関数を教えて」

から、

ファイルを読んで、間違いを直し、集計表を完成させて

へ。

AIの価値の中心が、

回答

から、

完了

へ移っている。


価格改定も「長時間エージェント」を意識している

Fable 5.1では価格にも面白い変更がある。

基本価格はFable 5と同じで、

  • 入力:100万トークンあたり10ドル

  • 出力:100万トークンあたり50ドル

となっている。

一方、過去に処理した情報を再利用するcache readは、

100万トークンあたり0.25ドル

へ75%値下げされた。(Anthropic)

Anthropicによれば、

  • 一般的な利用:約25%削減

  • 高度なAgent利用:最大約45%削減

になるという。(Anthropic)

なぜキャッシュを安くするのか。

AIエージェントは、

同じ巨大なコードベースや資料を何度も参照する

からである。

つまり価格設計まで、

「チャットAI」

ではなく、

長時間働くAI

を前提に変わりつつある。


ただし「もうAIが研究者になった」は早い

ここは冷静に見る必要がある。

TB-Scienceで52.6%という数字は非常に印象的だが、

逆に言えば、

約半分はまだ失敗する

ということでもある。

さらに、

  • Fable 5.1の52.6%はAnthropicによる評価

  • 全科学分野を代表するわけではない

  • 70タスクという規模

  • 計算機上で完結する研究が中心

  • 実験室での物理的作業は別問題

という限界もある。

したがって現時点で、

「AIが科学研究を自律的にできるようになった」

と言い切るのは早い。

より正確には、

「一部の計算科学研究では、AIに研究工程そのものを任せられる可能性が急速に現実化している」

という段階だろう。


それでも今回の変化はかなり大きい

ChatGPTが登場した2022年頃、生成AIの驚きは、

人間のような文章を書ける

ことだった。

その後、

難しい質問に答えられる

ようになった。

さらに、

コードを書ける

ようになった。

そして現在は、

PCを使って仕事を進められる

段階へ入っている。

Terminal-Bench-Scienceのようなベンチマークが重要なのは、

この次の段階を測っているからだ。

文章を書くAI
        ↓
質問に答えるAI
        ↓
推論するAI
        ↓
ツールを使うAI
        ↓
仕事を完遂するAI
        ↓
研究を進めるAI

Fable 5.1の52.6%という数字が本当に重要なのは、

「ClaudeがGPTより何ポイント上だった」

というモデル同士の順位ではない。

AIが研究工程を最後まで完遂できる確率そのものが、急速に上昇していること

にある。


おわりに

AIの能力を見るとき、これまでは、

  • IQ的な推論力

  • 知識量

  • 数学

  • コーディング

といった指標が注目されてきた。

しかしこれから重要になるのは、

「どれだけ難しい仕事を、どれだけ長時間、自律して、正しく完了できるか」

だろう。

Terminal-Bench-Scienceは、その変化を非常に分かりやすく測るベンチマークだ。

そしてClaude Fable 5.1がそこで示した52.6%という結果は、少なくともAnthropicの評価上では、

AIが「答える道具」から「実際に研究を進める道具」へ近づいている

ことを示している。

本当に注目すべきなのは、52.6という数字そのものより、

今後この数字が70%、80%、90%になったとき、研究現場がどう変わるのか

なのかもしれない。


主な参考資料


いいなと思ったら応援しよう!