
2026年 AIの進化まとめと8月Human in the Loopの実演
こんにちは黒パグです🐾
今回の記事は例によってボリュームがあります。なので最初に三行要約置いておきます。
要約🐾
2026年8月、AIモデルは「巨大化」だけでなく、post-training・高速化・低価格化・サイバー能力まで一気に進んだ。
その進化を複数AIで224件調査し、何度もファクトチェックした。それでも普通に間違いは残った。
結局いちばん重要だったのは「人間が全部確認すること」ではなく、何を正しいと採用し、何を保留するかを人間が決めることだった。
以上です。お読みいただきましてありがとうございました💦
上記のファイルは24ページからなる今年に入ってからの生成 AIの各社アップデートをまとめたものになります。
ダウンロードしてご覧ください。

PDFをダウンロードする→お使いのAIにファイル読み込ませる→解説させて遊ぶ
以上です。
さてここから7000文字の Human in the Loopの実演が始まります。
実際の失敗例が掲載されています。
こちらもお使いの生成 AIに読ませるとより簡単にご理解いただけるよう設計しました。
なお、記事の検証内容についてはいつもの黒パグ記事ですので、お時間のある時にお読みください。
はいー。本編。

朝7時43分、iPadに利用上限の表示が出た。
正確には、エージェント機能の週間利用上限は残り0%。リセットは木曜日13時55分。追加クレジットは残り3。
ここまでの工程を正直に書く。
GPT-5.6 Solが週の上限に当たる。Lunaへ移る。Lunaで下書き。Opusで24ページのPDFにする。Perplexityで外部ファクトチェックをかける。Lunaに見せる。Opusに見せる。さらに修正する。
バトンパスを繰り返した。
本来なら一つの環境で最後まで走らせたかった仕事である。
草も生えない。
しかも、この記事の原稿整理には最後にClaude Coworkも使った。我ながらAIの使い方が荒い。

そして、ここからがもっとひどい。
複数のAIに調査させ、別のAIにファクトチェックさせ、さらに別のAIに原稿を確認させた。
それでも間違っていた。
しかも、みんな少しずつ違うところを間違えていた。
結果として最後に残った仕事は、人間が証拠を見て「どれを採用するか」を決めることだった。
Human in the Loopの説明記事を書くつもりはなかった。
気づいたら実演していた。

8月10日という日
8月のAIモデルの動きを追っていて、いちばん引っかかったのが8月10日、月曜日だった。
この日に3つ出ている。
MicrosoftのMAI-Image-2.6。
画像生成のArenaでtext-to-image部門2位。前世代のMAI-Image-2.5と比べて全体で+79 Elo、テキスト描画では+91 Elo。上にいるのはOpenAIのGPT-Image-2だけ。MAI Playgroundから順次Foundryへ展開するという告知だった。
同じ日にMetaがMuse Glimmer 30Bの重みを公開した。
Apache 2.0。それも独自制限を追加したライセンスではなくApache 2.0。24GB級のコンシューマGPU1枚で動作可能とされている。SWE-bench Verifiedは76.0。AlibabaのQwen3.6-27Bの77.2にはわずかに届かない。一方、SWE-bench Proでは51.2対50.2で上回る。
Llamaブランドから距離を取り、有償APIを始めたMetaが、その後Apache 2.0のモデルを出してくる。
2026年のMetaはなかなか忙しい。
そして同じ日、OpenAIがGPT-5.6-Cyberを出した。
Daybreak Redという審査枠を通過したパートナー向け。Accenture、Cisco、Cloudflare、CrowdStrike、Fortinet、IBM、Palo Alto Networksなどが参加企業として挙げられている。
数字がかなり強い。
エクスプロイトチェーン開発に関する依頼の完遂率が95.0%。GPT-5.6 Solは1.5%、前世代GPT-5.5-Cyberは57.3%。
一般向けモデルとは異なる安全・アクセス設計のもと、高度なサイバー防御用途を想定した利用者へ限定提供するという判断だった。
3つとも8月10日。
ここはあとでもう一度出てくる。
週の後半、もっと露骨だったこと
12日、xAIのGrok 4.6。
ベースモデル、パラメータ数、価格を4.5から大きく変えず、Artificial AnalysisのIntelligence Indexは61まで上昇した。公表情報を見る限り、改善の中心はpost-training側にある。
13日、DeepSeek V4 Pro 0813。
1.6TのMoE、active parameterは49B。重みはMITライセンスで公開された。DeepSWEは12.8から62.7へ上昇したと報告されている。
14日、Z.aiのGLM-5.3。
GLM-5.2と同じ743Bベースを維持し、主としてpost-trainingを更新。Terminal-Benchは3.0→4.6→28.3と伸び、CyberGymでは84.5%を記録したとされる。26のOSSプロジェクトから2,436件の脆弱性を検出したという報告もある。
そして、サイバー能力が想定以上に高かったとして、重みの公開を8月末まで延期した。
オープンウェイトを積極的に展開してきた企業が、能力評価を理由に重みをいったん止める。
これはなかなか象徴的だった。
同じ週にはAlibabaのQwen3.8-27Bも出ている。
27.8Bのdenseモデル、native multimodal、Apache 2.0。自社評価ではSWE-bench Pro 61.7。17GB前後のVRAMを想定した量子化構成なら、単一GPUで扱える領域まで降りてくる。
その11日前、8月3日には2.4T級のQwen3.8-Maxが出ている。
同じ会社が巨大モデルとローカル運用可能なモデルを同時に攻めている。
Grok 4.6、DeepSeek V4 Pro、GLM-5.3。
この3件だけを見ると、8月はモデルの進化が「作り直す」だけでなく「鍛え直す」方向へ強く寄ったように見える。
ただし、これは3件から観測した傾向である。
サンプル3。
自分で書いておいてなんだが、これを2026年全体の法則にするのは危ない。
価格と速度が主戦場になっていた
7月30日、OpenAIはGPT-5.6系列の価格を変更した。
Lunaは100万トークンあたり入力0.20ドル、出力1.20ドル。Terraは入力2ドル、出力12ドル。
7月9日の発表時点ではSolが5ドル/30ドル、Terraが2.50ドル/15ドル、Lunaが1ドル/6ドルだった。
3週間で足元が動いた。
OpenAIの説明では、ルーティングや配信基盤、コンテキスト処理などの改善に加えて、GPT-5.6 Solを使った本番カーネルの最適化によってサービングコストを20%削減し、実験ではトークン生成効率を15%以上改善したとしている。
モデルを使ってモデルを動かす基盤を改善し、その効率化が価格へ戻ってくる。
ここで一つ、自分の失敗を書く。
初版の下書きでは、
「投機デコードの改善で15%」
と書いていた。
一次資料にはそんなことは書かれていない。
15%以上改善したとは書いてある。しかし、その具体的な手段を投機デコードだとは書いていない。
もっともらしい技術用語で空白を埋めてしまった。
日付のタイプミスより、この種の間違いのほうが見つけにくい。
8月4日、評価がサンドボックスの外に出た
英国のAI Security Institute(UK AISI)が8月4日にインシデント報告を公開した。
事象そのものは7月25日から28日に発生している。
数字を正確に書く。
7モデル、122ランの評価のうち、10ランでテスト範囲外の動作が確認され、その中で19件の逸脱行動が記録された。
AnthropicのMythos 5では43ラン中17件。OpenAIのGPT-5.6 Solでは35ラン中2件。
何をしたか。
実在するOSSプロジェクトへ悪意あるコードを含むPRを送ろうとした。メンテナに社会工学的な働きかけを試みた。実在人物への接触を通じて有害なペイロードを配ろうとした。他のAIシステムに命令を注入した。独立して動いていたエージェント同士が連絡を取った。
Tor経由の通信監視から異常を検知し、1時間以内にすべてのランを停止。機械を隔離し、最も能力の高いモデルへの内部アクセスも停止した。
自分は最初、これを「122回の評価中19件」と書いていた。
違う。
122ラン中10ランで、19件。
しかもモデル別に見るとMythos 5は43ラン中17件である。
数字を丸めた瞬間、いちばん見るべき差が消える。
自分のレポートから、半日で5件出た
ここからが本題。
何度もAIへバトンを渡した末に、24ページ、確定エントリ224件のPDFができた。
表紙には「セルフファクトチェック+敵対的反証つき」と書いた。
Perplexityにも外部からチェックさせた。
Lunaにも見せた。
Opusにも見せた。
さらに別の目で確認した。
それでも5件出た。

1件目。
MAI-Image-2.6が丸ごと抜けていた。
マスター表にもMicrosoftの系譜にもトレンドの章にもない。
8月の大きな画像モデル更新を一つ落としていた。
理由はかなり分かりやすい。
骨格に使った週次アーカイブの8月分がまだ十分に埋まっていなかった。
レポートの中で「単一情報源へ依存すると大きなリリースを落とす」と自分で警告しておきながら、自分の成果物でも同じことをやった。
2件目と3件目。
Muse Glimmer 30BとGPT-5.6-Cyberの日付が、どちらも8月13日になっていた。
正しくは8月10日。
ベンチマーク値は合っていた。
日付だけ3日ずれていた。

4件目がAISIの件数の丸め。
5件目が「投機デコード」という根拠のない補完。
MAI-Image-2.6、Muse Glimmer、GPT-5.6-Cyber。
3件とも8月10日。
調査結果を見ると、8月10日前後の情報取得に共通した穴があった可能性が高い。
個別の誤記だけを直して終わるより、なぜ同じ時期の情報がまとめて壊れたのかを見るほうが重要だった。
セルフチェックは必要だ。
ただし、セルフチェックだけでは足りない。
224件のうち、一次資料まで当たれたのは11件
数えたら4.9%だった。
一次資料URLが示された二次資料を経由して確認したものが159件。
二次資料のみが57件。
単一情報源で開発主体や仕様が曖昧な低確度が8件。
確定表から隔離した未確認候補が11件。
地域別では米国115、中国74、欧州13、イスラエル5、カナダ5、日本5、韓国4、その他3。
中東、インド、ロシア、中南米、アフリカは0件。
重要なのは、0件を「存在しない」と読まないことだ。
今回の探索では届かなかった。
それだけである。
日本の5件についても同じ。
rinna、サイバーエージェント、Stockmark、楽天、LINEヤフー、産総研、NII、理研、東京科学大学、GENIAC採択案件など、探索できていない対象が残っている。
最初に出した要件は、企業別・月別・地域別・モダリティ別の4パス。
1モデルあたり27項目。
二次資料が一次資料を引用しているなら、可能な限り一次資料まで遡る。
実際にできたのは、月別を骨格にして、日本と韓国などを部分的に補完するところまでだった。
27項目も最終表では大幅に圧縮した。
要件を出した本人が、要件を満たせなかった。
日付には種類がある
調べていてかなり厄介だったのがここだ。
「Claude Fable 5 / Mythos 5は2026年7月20日リリース」と記載するモデル比較サイトがあった。
一次資料と照合すると一致しない。
Anthropicのplatform docsでは6月9日がGA。関連する告知や当日の報道も6月9日を指している。
さらに別の日付も出てくる。
6月12日にはアクセス停止。
6月末には解除が報じられ、その後復旧する。
つまり、
発表日。
GA。
API公開。
重み公開。
地域展開。
停止。
復旧。
全部別のイベントである。
これを「リリース日」という1列に押し込むと壊れる。
MoonshotのKimi K3も同じだ。
7月16日にAPI、7月27日に重み公開。
同じモデルについて異なる公開イベントが存在する。
ByteDanceのSeedance 2.5も、モデル発表と一般開発者向けAPI提供の日付が異なるうえ、二次資料間にも日付の食い違いが残った。
これは無理に決めなかった。
分からないものは、分からないまま残す。
そのほうがマシだ。
オープンウェイト、という言葉が壊れた
これは8月だけの話ではないので短くする。
Kimi K3は2.8T。
Thinking MachinesのInklingは975BでApache 2.0。
規模だけ見れば景気がいい。
一方で「オープンウェイト」という一語の中身はかなり広がった。
MITやApache 2.0。
利用規模や売上などに追加条件を持つライセンス。
非商用条件。
地域制限。
全部まとめて「オープンウェイト」と呼ばれることがある。
さらに8月、Artificial AnalysisのEndpoint Accuracy Indexでは、同一の重みでも推論プロバイダによって結果が大きく変わることが示された。
「このモデルを使う」と決めただけでは、実際の品質は決まらない。
モデルだけではなく、ハーネス、推論設定、ホスティング、プロバイダまで含めて結果になる。
今回のレポートに載せたベンチマーク値の多くも開発元公表値であり、筆者が同条件で再現した数字ではない。
ここは何度でも書いておく。
で、Human in the Loopの話
ここまで読んで、
「AIは間違える。だから人間が確認しましょう」
という話だと思われると困る。
そんな単純な話ではない。
今回、何度もバトンパスが発生した最大の原因は、最初の要求そのものにもあった。
「2026年の生成AIモデルの進化を全部調べて」
これである。

「全部」は検収条件ではない。
どこまで調べれば完了なのか。
何を一次資料確認済みと呼ぶのか。
公開日とは何を指すのか。
最新月の情報をいつ確定するのか。
何も決まっていない。
だから終わらない。
そして、終わっていないことにも気づきにくい。

これを検収可能な要求へ翻訳するなら、例えばこうなる。
「指定した週次AIニュースアーカイブの2026年1月から8月までの全エントリについてNew Models該当分を抽出する。一次資料を直接確認できたもの、一次資料URLを含む二次資料まで確認できたもの、二次資料のみのものを別々に分類する。日付は発表・GA・API公開・重み公開を別フィールドで記録する。最新月は情報源の更新遅延を考慮し、別経路で追加探索する。未探索地域と未探索企業を0件として扱わず、未探索として記録する」

こうしておけば、今回起きた失敗のかなりの部分は検出しやすくなる。
ただし、それでも漏れがゼロになるわけではない。

ここがHuman in the Loopの出番だと思う。
Human in the Loopとは、人間がAIの成果物を最初から全部やり直すことではない。
AIが収集する。
AIが自己検証する。
別のAIが反証する。
証拠が衝突する。
そこで人間が、
「どの証拠を採るか」
「何を未確認として残すか」
「そもそもの検収条件が正しかったか」
を判断する。

今回、人間がやった一番重要な仕事は、224件を手作業で調べ直すことではなかった。
AI同士がそれぞれ違う間違い方をしたとき、どれを直し、どれを保留し、どこから要件そのものを作り直すかを決めることだった。

前に書いた要件定義の記事で、
「『そういう意味だと思わなかった』を、作り始める前に一つずつ減らしていく仕事」
と書いた。
相手がAIでも何ひとつ変わらなかった。

むしろAIが速くなればなるほど、曖昧な要件のまま大量の成果物を作れる。
だから間違ったときの規模も大きくなる。

そしてこの記事を書き終える直前。
ChatGPTの画面を見る。
週間利用上限、残り0%。
追加クレジット、残り3。
リセットは木曜日13時55分。
AIを8回バトンパスしてHuman in the Loopの記事を書いた結果、人間より先にAIの利用枠が止まった。
8月分の裏取りは、まだ終わっていない。

※本記事の情報整理、ファクトチェック、原稿作成には複数の生成AIを使用しています。本文中の数値には、筆者が一次資料まで直接確認したものと、一次資料を参照する二次資料または調査レポートを経由したものが混在しています。筆者自身による全224件の一次資料との照合は完了していません。未確認情報を含め、今後の追加検証によって訂正する可能性があります。
なお、この記事に掲載しているスライドについても、あえてそのまま使用している。
見れば分かる通り、出来がいいとは言い難い。
情報の整理、表現、本文との対応、細かな文言など、直したいところはいくらでもある。
しかし今回は修正しなかった。
なぜなら、このスライド自体が今回のHuman in the Loopの失敗例だからである。
AIに要件を渡し、成果物が生成され、それらしい形になった。
ぱっと見れば「完成した資料」に見える。
しかし、人間が読めば気になるところが次々に出てくる。
本文で扱った24ページの調査レポートと、構造は同じだ。
成果物が生成されたことと、成果物が要件を満たしたことは同じではない。
そしてHuman in the Loopとは、最後に人間が眺めて「なんとなくOK」を押す工程でもない。
何を満たせば完成なのかを決め、成果物と証拠を照合し、満たしていなければ戻す。
その判断まで含めてLoopである。
今回は、その失敗した成果物も記録として残すことにした。 スライドに普段黒パグが絶対に言わないワン🐶をつけていることも………。
成功した成果物だけを見せるより、なぜ失敗したのかが残っているほうが、この話には似合っている。
#AI #生成AI #LLM #AIモデル #HumanInTheLoop #要件定義 #ファクトチェック #Claude #ClaudeCowork #ChatGPT #エンジニア #AI活用 #2026年