
巨大AIは不要か?私たちの脳と「共鳴」するAIのサイズが判明:最新NeuroAI研究が明かす3つの真実
現代のAI開発は、あたかも「規模こそが知能の正体である」と言わんばかりの、凄まじいスケーリング則の競争に明け暮れています。1000億を超えるパラメータを持つ巨大な言語モデル(LLM)が次々と誕生し、その計算資源の消費量はとどまる所を知りません。しかし、ここで一つの根本的な、そして極めて「人間的」な疑問が浮かび上がります。
私たちの脳はどうでしょうか。人間の脳は、驚くほどコンパクトで、わずかな電力消費で複雑な言語や感情を処理しています。AIが人間の知能を真に理解し、模倣するために、本当にこれほどまでの巨大な計算資源が必要なのでしょうか?
最新のNeuroAI研究(Linguistic properties and model scale in brain encoding: from small to compressed language models)は、この問いに対して、スケーリング則の盲点を突く衝撃的な事実を突きつけました。最先端のモデルファミリーであるLLaMA-3.2、Qwen-2.5、そしてDeepSeek-R1を用いた詳細な分析により、AIが脳活動と「共鳴」するために必要な最小容量が明らかになったのです。

1. 驚きの発見:脳との同期は「30億パラメータ」で飽和する
本研究の最も核心を突く発見は、AIモデルの規模と脳活動の予測精度の関係にあります。研究チームが1B(10億)から14B(140億)パラメータまでのモデルを比較したところ、驚くべきことに3B(30億)規模の小規模言語モデル(SLM)が、その数倍のサイズを持つ巨大モデルと同等の、あるいはそれ以上の精度で脳活動を予測できることが判明しました。
この現象は「早期飽和(Early Saturation)」と呼ばれます。データが示すのは、知能の「線形な拡大」ではありません。1Bクラスのモデルでは、特に意味処理を司る脳領域での予測精度が著しく低いものの、3Bに達した瞬間にその精度は急激に上昇し、それ以上の規模(7Bや14B)になっても有意な向上が見られなくなるのです。
さらに興味深いのは、モデルサイズと脳アライメント(整合性)が単純な比例関係にない「U字型の逆説」が見られた点です。特定の条件下では、3Bモデルが7Bモデルの予測精度を上回るケースすら確認されました。これは、脳の言語処理を模倣する上では、単にパラメータを増やせば良いというわけではなく、3Bというサイズがある種の「認知的スイートスポット」であることを示唆しています。
「3B SLMs achieve brain predictivity indistinguishable from larger LLMs, whereas 1B models degrade substantially, particularly in semantic language regions.」 (3Bの小規模言語モデルは、より大きなLLMと区別がつかないほどの脳予測精度を達成する一方で、1Bモデルは特に意味処理領域において大幅に精度が低下する。)

3. モデルの「圧縮」は脳への似姿を壊さない
次に、研究チームは「モデルの軽量化」が脳とのアライメントに与える影響を検証しました。量子化(Quantization)や剪定(Pruning)といった、実用化に不可欠な圧縮技術を用いた際、AIの「脳らしさ」は損なわれてしまうのでしょうか。
実験結果は、AIの頑健性(Robustness)を証明するものでした。INT8やINT4への量子化(AWQやSmoothQuantなど)を施しても、脳との同期精度は驚くほど高い水準で維持されました。また、剪定においても、10〜25%程度の「中程度の疎性」であれば精度は揺るぎません(ただし、50%を超えると急激に脳の似姿から乖離していきます)。
この事実は、脳に近い表現形式が、モデルの数値的な精密さ(浮動小数点の精度)よりも、ネットワークが形成する「表現の幾何学(Representational Geometry)」そのものに宿っている可能性を強く示唆しています。

4. 異端児「GPTQ」:なぜ特定の圧縮手法だけが脳から離れるのか?
しかし、すべての道が脳へと通じているわけではありませんでした。研究の中で唯一、脳とのアライメントを著しく損なう手法として浮上したのが「GPTQ」です。
GPTQは、工学的なベンチマークでは極めて優秀な成績を収めます。しかし、ニューロサイエンティフィックな視点で見ると、この手法は脳の予測精度、特に「角回(Angular Gyrus)」などの重要な領域において明確な劣化を引き起こしました。
角回は、単なる意味処理の場所ではありません。視覚、聴覚、空間情報などを統合し、一つの概念へと昇華させる「セマンティック・ハブ(意味の中枢)」です。GPTQによる「数学的に効率的な圧縮」は、人間の脳が物語を理解する際に必要とする、情報の幾何学的な構造を破壊してしまっている可能性があります。ここには、「テストの点数が良くても、思考プロセスが人間とは似て非なるものになってしまう」という、現在のAI開発が直面している深い教訓が隠されています。

5. 「賢さ」と「脳らしさ」の分離:テストの点数が高くても、脳とは似ていない?
本研究の最も深遠な洞察は、AIの「言語能力(タスク性能)」と「脳との同期度」の間に見られた決定的な「乖離(Dissociation)」です。
FlashHolmesベンチマークを用いた66もの言語タスク分析により、以下のパラドックスが浮き彫りになりました。
モデルを圧縮すると、構文(Syntax)や形態論(Morphology)といった言語学的な正答率は目に見えて低下する。
しかし、それにもかかわらず、そのモデルが「脳活動を予測する精度」はほとんど変わらない。
これは何を意味するのでしょうか。AIが解いている「人工的な言語パズル(文法テストなど)」と、人間が日常的に物語を聞いて没入する際の「脳の言語処理」は、実は別物である可能性が高いのです。AIが文法的に完璧であることと、その内部表現が人間のように「物語を捉えている」ことは、必ずしも一致しません。私たちは今、AIの「知能」を評価する尺度を根本から見直すべき局面に立たされているのです。

6. 結論:コンパクトな知性が切り拓く、脳に優しいAIの未来
「巨大化こそが正義」というスケーリング則の狂騒曲の中で、本研究は静か、かつ強力な一石を投じました。3B(30億)という、現代ではコンパクトとも呼べる規模のモデルこそが、人間の脳を理解し、模倣するための「認知的に接地した(Cognitively grounded)」ツールになり得ることを証明したのです。

これからのNeuroAI研究、そして次世代のAI開発が進むべき道は、もはやパラメータの物量戦ではありません。脳が持つ驚異的な効率性と、情報の幾何学的な構造に学び、いかに「本質」を抽出するかという、研ぎ澄まされた美学へとシフトしていくでしょう。
最後に、一つの問いを投げかけて本記事を締めくくります。
「もし、わずか30億のパラメータで人間の脳の複雑さを再現できるとしたら、私たちが次に削ぎ落とすべきものは何でしょうか?」
解説動画:
参考資料:
その他記事、コラム、書籍はこちら↓