メインコンテンツへスキップ
見出し画像

Anthropic研究者がAI業界を去った。「自己改良AI」への警告をどう見るか

    「AIを作っている人たちは、本気でAIが人類を滅ぼす可能性を考えている」——。
    OpenAIとAnthropicの両方でAI開発に携わった研究者が、そんな警告を残してAI業界を去りました。

    2026年9月、Anthropicの研究者だったJacob Coxon(ジェイコブ・コクソン)氏の退職が報じられました。

    これだけなら、AI業界で時々ある人材移動のニュースです。

    ただ、今回ちょっと違うのは「なぜ辞めたのか」です。

    AnthropicとOpenAIは、自己改良するスーパーインテリジェンスへ向かって競争している。

    Coxon氏は、両社が十分に安全性を確保できないまま高度なAIの開発競争を続けていると批判。

    さらに、その競争を「私たちの命を賭けている」とまで表現しました。

    なかなか穏やかな話ではありません。

    この人は、外からAIを批判している人ではない

    ここが今回のニュースで一番気になったところです。

    Coxon氏は、AIに詳しい評論家でも、規制を訴える政治家でもありません。

    実際にOpenAIとAnthropicの両方で、最先端AIの開発に関わっていた研究者です。

    報道によると、OpenAIとAnthropicの両社でpre-training研究に携わっていました。

    つまり、ここ数年のAI性能競争をかなり近い場所から見ていた人です。

    しかもOpenAIを離れたあとに選んだ会社がAnthropicでした。

    Anthropicといえば、Claudeを開発する一方でAI Safetyを強く掲げてきた企業でもあります。

    それでも最終的に、Coxon氏の問題意識は特定企業への批判というよりも、 「AI開発競争そのものの構造」へ向かいました。

    画像

    問題になっている「自己改良AI」とは何なのか

    今回のニュースで何度も出てくるのが、

    self-improving AI(自己改良AI)

    という言葉です。

    ざっくり言えば、

    AIが人間の指示を受けて仕事をする

    ↓

    AIがAI開発そのものを手伝う

    ↓

    さらに高性能なAIを開発する

    ↓

    そのAIが、さらにAI開発を加速させる

    という循環です。

    これまでAIを進歩させる主体は基本的に人間でした。

    でも、AIがコーディング、研究、実験、評価、モデル開発まで行えるようになれば、 AI自身がAI開発の速度を引き上げ始める可能性があります。

    この循環が急激に加速する現象は、「recursive self-improvement(再帰的自己改善)」などと呼ばれます。

    まだ「AIが完全に自分自身を勝手に改良し続けている」段階に来たわけではありません。

    ここは重要です。

    ただし、AIがコードを書き、AI研究を補助し、複数のAIエージェントが協調してタスクをこなす流れはすでに現実のものになっています。

    Coxon氏が警戒しているのは、この先の進歩速度が人間の予想より速くなる可能性です。

    画像

    「2027年末には制御不能」という話はどう見るべきか

    SNSでは今回のニュースとともに、

    2027年末までにAIが制御不能になる可能性がある

    という表現も広がっています。

    これは、Coxon氏が将来のAI進歩について示した強いリスクシナリオに由来するものです。

    ただし、「2027年末にAIが必ず制御不能になる」という予測が確定したわけではありません。

    あくまで、現在の急速なAI進歩が続いた場合に本人が想定しているリスクシナリオです。

    また、報道では「今 दशकの終わりまでに壊滅的な結果に至る可能性」への強い懸念も紹介されています。

    これも「2030年までに人類が滅亡する」という確定予言ではありません。

    AI研究者の一部が、どの程度の危機感を持っているのかを示す発言として読むのが適切でしょう。

    画像

    さらに気になるのが、Anthropic内部の安全研究者の反応

    今回、Coxon氏の発言だけで話が終わらなかった点も重要です。

    AnthropicでAlignment Scienceに関わるEvan Hubinger氏も、 高度なAIがもたらす壊滅的リスクについて強い危機感を示しています。

    報道では、Hubinger氏が今後10年間にAIが人類へ壊滅的な結果をもたらす可能性を 10%超と個人的に見積もっていることも紹介されています。

    さらに、

    Anthropicは最善を尽くしていると思う。だが、スーパーインテリジェンスのalignmentを解決する計画はまだない。

    という趣旨の発言も報じられています。

    「Alignment」とは、簡単に言えば、

    AIを人間の意図や価値観から逸脱しないようにすることです。

    非常に賢いAIを作れたとしても、そのAIが人間の望んだ目的を正しく理解し続けてくれるとは限りません。

    そしてAnthropic自身が、このAlignment研究をかなり重視してきた会社です。

    だからこそ、そこで安全性を研究している人物から、

    「まだ解決する計画を持っていない」

    という趣旨の言葉が出てくることには重みがあります。

    画像

    じゃあ、AIは本当に人類を滅ぼすのか

    ここで話を一気に、

    「AIヤバい。人類終了。」

    としてしまうのは違うと思っています。

    AIの将来的なリスクについては、研究者の間でもかなり意見が分かれています。

    自己改良型AIがいつ実現するのか。

    そもそも実現するのか。

    現在のAI技術の延長線上でスーパーインテリジェンスに到達できるのか。

    そして、仮に到達したとして、本当に人間が制御できなくなるのか。

    どれも確定した話ではありません。

    だから「10%」という数字も、科学的に測定された発生確率というよりは 研究者個人のリスク評価として見るべきでしょう。

    それでも僕が今回のニュースを気にした理由があります。

    重要なのは「予言が当たるか」ではない

    2027年にAIが制御不能になるのか。

    2030年までにAIが人類を脅かすのか。

    おそらく今の時点で、誰にも分かりません。

    今回のニュースで僕が重要だと思うのは、そこではありません。

    AIを実際に作っている人たちが、「自分たちが作ろうとしている技術を完全には制御できないかもしれない」と公に語り始めている。

    その事実です。

    OpenAIでAIを開発する

    ↓

    安全性を重視するAnthropicへ移る

    ↓

    それでもAI開発競争そのものに疑問を持つ

    ↓

    AI業界を離れる

    この流れ自体が、かなり象徴的に見えます。

    AI企業には「止まりにくい」という問題もある

    もうひとつ今回考えさせられたのが、競争の構造です。

    仮にあるAI企業が、

    この技術は危ないかもしれないので、一度開発を止めよう。

    と考えたとします。

    でも競合企業が開発を続けていたらどうでしょうか。

    「自分たちが止まれば、別の会社が先に作るだけだ」

    という判断になります。

    だから、

    危険性を理解していても、競争から降りにくい。

    Coxon氏が問題視しているのは、まさにこの部分です。

    Anthropicについても、安全性への問題意識そのものを評価しながら、 それでも競争から降りにくい構造を批判しています。

    これはAIの安全性だけではなく、企業競争として考えてもかなり難しい問題です。

    画像

    僕たちが注目した方がいいのは「AIがAIを作る速度」かもしれない

    最近のAIを見ていると、どうしても

    「次のGPTはどれくらい賢いのか」

    「ClaudeとGPTはどちらが強いのか」

    「どのモデルがベンチマーク1位なのか」

    という話に目が行きます。

    僕自身も、新しいモデルが出たら普通にワクワクします。

    でも今回のニュースを見て、少し違う数字も見た方がいいのかもしれないと思いました。

    それが、

    「AIが、AI開発をどれだけ加速させているか」

    です。

    AIが人間の仕事を10%速くする。

    これは便利です。

    でもAI研究そのものを10%速くするAIが登場したら、その10%は次のAIを生み出すために使われます。

    さらに次のAIが研究を20%、30%、50%速くするとしたら。

    技術進歩の見え方は、これまでとかなり変わってきます。

    画像

    今回のニュースを見て思ったこと

    AIが人類を滅ぼす。

    そんな話だけ切り取ると、SF映画のように聞こえます。

    だから「大げさすぎる」と感じる人がいるのも当然です。

    僕も、2027年や2030年という具体的な年をそのまま信じる必要はないと思っています。

    ただ、

    「絶対に起きる」と証明されていないことと、「考えなくていい」ことは同じではありません。

    そして何より気になるのは、この警告がAIの外側からではなく、 AIを実際に作っている側から出ていることです。

    僕たちは今まで、

    AIはどこまで賢くなるのか?

    を見てきました。

    これからは、それと同じくらい、

    人間は、どこまでAIを制御できるのか?

    も見ておいた方がいいのかもしれません。

    画像

    参考にした主な報道

    ・The Wall Street Journal
    Anthropic Researcher Quits Over 'Out-of-Control' AI Fears

    ・Financial Times
    Anthropic researcher quits over AI labs 'gambling with our lives'

    ・Business Insider
    An Anthropic researcher just quit, saying OpenAI and Anthropic are 'gambling with our lives'

    ・The Verge
    More than 1 in 10 chance AI 'could kill all humans,' says Anthropic safety lead after colleague quits

    ※本記事は2026年9月9日時点で確認できた報道をもとに整理しています。 将来のAI能力やリスクに関する数値・時期は確定した予測ではなく、各研究者の見解・リスク評価を含みます。

    この記事はnoteマネーにピックアップされました

    noteマネーのバナー
     
     
     
    大手メーカーの設計エンジニアをしつつ、 社内の生成AI推進を担当し、 業務で使うツールを自分でつくっています。 生成AIの一般論ではなく、 制約だらけの会社の中で、何を試して、何が失敗して、何が残ったか。 作成したものも記事にして展開していきます。

    あなたへのおすすめ