
Gemini 2.5 Deep Think の概要
以下の記事が面白かったので、簡単にまとめました。
1. Deep Think
本日、「Ultraプラン」のユーザーは「Geminiアプリ」で 「Deep Think」を利用できるようになりました。I/O で最初に発表されたものから大幅に改善されています。これは、今年の国際数学オリンピック (IMO) で金メダルを獲得したモデルのバリエーションです。以前のモデルでは複雑な数学の問題を推論するのに数時間を要していましたが、より高速で日常的に使いやすくなり、社内評価では2025年のIMOベンチマークで銅メダルレベルの性能を達成しています。
2. Deep Thinkのしくみ
人間が複雑な問題に取り組む際に、様々な角度から検討し、潜在的な解決策を比較検討し、最終的な答えを洗練させるのと同じように、「Deep Think」は並列思考技術を用いて思考能力の限界を押し広げます。このアプローチにより、「Gemini」は一度に多くのアイデアを生み出し、それらを同時に検討し、最適な答えに到達するまで、時間の経過とともに異なるアイデアを修正または組み合わせることさえ可能です。
さらに「推論時間」、つまり「思考時間」を拡張することで、「Gemini」はより多くの時間をかけて様々な仮説を探索し、複雑な問題に対する創造的な解決策を導き出すことができます。
また、モデルがこれらの拡張された推論パスを活用するように促す、新たな強化学習技術も開発しました。これにより、「Deep Think」は時間の経過とともに、より優れた直感的な問題解決者へと進化していきます。
3. Deep Thinkの優位性
「Deep Think」は、創造性、戦略的計画、そして段階的な改善を必要とする以下のような問題に取り組むのに役立ちます。
・反復的な開発と設計
複雑なものを段階的に構築する必要があるタスクにおいて、「Deep Think」の性能には驚かされました。例えば、「Deep Think」はWeb開発タスクの見た目と機能性の両方を向上させることができることが分かりました。

・科学的および数学的発見
「Deep Think」は高度に複雑な問題を推論できるため、研究者にとって強力なツールとなり得ます。数学的仮説の定式化と探求、あるいは複雑な科学文献の推論を支援し、発見への道を加速させる可能性を秘めています。
・アルゴリズム開発とコーディング
「Deep Think」は、問題の定式化とトレードオフや時間計算量の慎重な考慮が極めて重要となる、難解なコーディング問題に特に優れています。
「Deep Think」の性能は、コーディング、科学、知識、推論能力を測定する高難易度のベンチマークにも反映されています。例えば、ツールを使用しない他のモデルと比較して、「Gemini 2.5 Deep Think」は、競争力のあるコード性能を測定する「LiveCodeBench V6」と、科学や数学を含む様々な分野の専門知識を測定する高難易度のベンチマークである「Humanity’s Last Exam」において、最先端の性能を達成しています。

4. Gemini を責任ある形で進化させる方法
学習と導入のライフサイクル全体を通して、「Gemini」に安全性と責任を継続的に組み込んでいます。テストでは、「Gemini 2.5 Deep Think」は「Gemini 2.5 Pro」と比較してコンテンツの安全性と客観性が向上しましたが、無害なリクエストを拒否する傾向が高まりました。
「Gemini」の問題解決能力が向上するにつれ、複雑性の増大に伴うリスクについて、最先端の安全性評価や重要な機能レベルに対する計画的な緩和策の実施など、より深く検討しています。
「Gemini 2.5 Deep Think」の安全性に関する成果の詳細は、モデルカードを参照してください。
5. Geminiアプリで Deep Think を今すぐ使う方法
「Ultraプラン」のユーザーは、モデルのドロップダウンで「2.5 Pro」を選択し、プロンプトバーで「Deep Think」をオンにすることで、「Geminiアプリ」で「Deep Think」を今すぐ利用できます。1日に一定数のプロンプトが表示されます。「Deep Think」は、コード実行や Google 検索などのツールと自動的に連携し、より長い応答を生成できます。
また、開発者や企業のユースケースにおける「Deep Think」の有用性をより深く理解するため、今後数週間以内に、信頼できるテスターの皆様に、ツールの有無にかかわらず、「Gemini API」経由で」「Deep Think」をリリースする予定です。