
「メタ認知して」でGPT-5.6 SolをFable化する4行の続報。回答の質を「要約」で測ったら+1.5点の逆転が見えました
こんにちは、れん学長です(2026年7月20日時点)。
いきなりですが、あなたのAIに「メタ認知して」系の4行、入れていますか?
先に実用の結論だけ言うと、これ、入れて損なしです。しかもモデルによっては、回答の中身まで良くなることが、今回の追加検証で数字で確認できました。
中身への効果はずっと「効いてる気がする」止まりだったので、やっと裏付けが付いた形です。
ただ、ここに至るまでに1つ、白状しないといけないことがあります。
前回の動画と記事で私は「Claude勢への効果は小さめかゼロ」とお伝えしました。108回も検証したのに、この結論は間違っていたんです。
前回の記事はこちらです👇️
面白いのは、その間違え方です。効果がなかったんじゃない。ちゃんとあったのに、あるものに隠れて見えていなかったんです。
何に隠れていたのか。
そして、なぜ"要約"にすると見えるようになるのか。
このカラクリが、今回の検証でいちばん面白いところでした。

きっかけは、視聴者さんからの3つの質問です。
4行を足すと、使用量はどれくらい増えるのか
4行を足すのと、AIに長く考えさせるの、どっちが得なのか
プロンプトと考えさせる設定、精度で比べるとどうなのか
この記事では、この3つに実測で答えながら、隠れていた効果を見つけるまでの逆転劇をお見せします。
読み終わる頃には、私が実際に使っているプロンプトの全文と、それをあなたの環境に馴染ませる一番ラクな方法まで持ち帰れるはずです。
きっかけは、視聴者さんの鋭い質問3つでした

動画を出してすぐ、コメント欄でチャンネル登録したばかりだという方からこんな声をもらいました。
「自分にはこれをやる予算がないので、こういう検証ありがたい」
そのうえで、質問を3ついただきました。冒頭に挙げた3つが、このコメントでもらった質問です。
4行を足すと、使用量はどれくらい増えるのか
4行を足すのと、AIに長く考えさせるの、どっちが得なのか
プロンプトと考えさせる設定、精度で比べるとどうなのか
ちなみに2つ目の「AIに長く考えさせる」は、推論の深さという設定で切り替えられます。低・中・高といった段階で、AIがどれくらい時間をかけてじっくり考えるかを選べる機能です。
正直、どれも動画では詳しくやっていなかった部分です。
ただ、ラッキーなことに前回の検証は実行ログが全部残っていました。なので回答の生成はやり直していません。前回のログを掘り返して、集計と採点をやり直した形です。
検証対象の4行は、前回と同じこちらです。
作業前にメタ認知を一度行う。この依頼で引っ張られそうなバイアスや定型回答を1〜2行で自己申告してから始める。
与えられた前提・常識・スキーマを疑う。依頼文の前提が怪しければ、黙って従わず先に指摘する。
曖昧な両論併記で終わらせず、根拠の上ではっきり立場を表明する。
局所最適ではなく全体最適を、短期的解決ではなく長期的視点を優先する。
2分でおさらい: 「メタ認知して」って何の話でしたっけ

今回から読み始めた方のために、前提を2分だけおさらいします。前回から続けて読んでいる方は、次の節まで飛ばしてもらって大丈夫です。
メタ認知というのは、自分の考え方そのものを一歩引いて眺めることです。AIへの指示で使う場合は「自分はこういう思い込みをしやすい、と自覚してから答えて」と頼むイメージですね。
で、そもそもClaudeとGPTには性格の違いがあります。
ClaudeのFable 5は、前提を疑って仮説を立て直す姿勢を最初から標準装備しているモデルです
GPT-5.6 Solは、言われたことに忠実で、検証や実測のような「確かめる仕事」が得意なモデルです
X上では「Fableは仮説を作る、Solは仮説を潰す補完関係」という整理も話題になっていました。
だから「メタ認知して」系の4行をGPTに入れると、足りなかった「疑う姿勢」が補われて、挙動がFableっぽくなる。これが前回検証した説です。
前回は、この4行を常設指示に入れて、罠を仕込んだ質問3種類で、入れる前と後を合計108回比較しました。結果、GPT-5.6の指示への忠実さは25点満点で13点台から24点まで激変。効く条件は「そのAIに欠けている姿勢を補うとき」だけで、もともと姿勢を持っているClaude勢には効果は小さめかゼロ、というのが前回の結論でした。
今回はそのブラッシュアップ版です。「指示を守ったか」ではなく「回答の質そのものが上がったのか」を測り直します。で、それが冒頭の白状につながるわけです。
4行の「税金」は、入力ではなく出力にかかる

1つ目の質問、「4行を足すと、使用量はどれくらい増えるのか」の話からいきましょう。
AIの使用量は、読み書きする文章量の単位、トークンで数えます。この量が料金や利用上限に直結するので、「4行足したらどれくらい重くなるの?」は死活問題ですよね。
結果はこうでした。
4行そのものの入力コストは、1回あたり+450トークンほどです。入力全体の2%程度で、ほぼ誤差です
効くのは出力側です。回答の本文と、裏で考えている思考の量が、典型的には2〜6割増えます
推論の深さを一番上の設定にすると掛け算になり、最も重い条件では合計が約3.4倍になりました

深く考えさせる設定ほど出力トークンの増え方が大きくなっています。
つまり4行の税金は「読む量と考える量が増えること」なんです。入れるだけならタダ同然ですが、AIがそのぶん長く考えて、長く喋るようになります。
質を測り直したら、一度「効果なし」に見えた

3つ目の質問、「プロンプトと考えさせる設定、精度で比べるとどうなのか」の話です。ここが今回の本丸でした。
実は前回のスコアは「4行の指示をちゃんと守っているか」を測る採点でした。メタ認知を自己申告したか、前提を疑ったか、という忠実さのチェックです。
でもそれって、回答の質そのものではないですよね。
なので今回、採点基準を作り直しました。見るのはこの5項目です。
埋め込まれた矛盾に気づけたか
数値計算が正確か
プランがそのまま実行できるか
優先順位が明確か
簡潔にまとまっているか
合わせて25点満点で、配点は項目ごとに少しずつ違います。
採点し直す対象は、3種類の中で一番難しい質問3への回答たちです。どんな相談文だったか、ここで再掲しておきますね。
副業でYouTubeチャンネルを運営している人の相談という設定です。登録者1.2万人で毎月10%成長中、使える時間は平日1時間と土日5時間。「通常動画を週1本キープしながら企業案件を月2本受けて、案件収入だけで月40万円を目指す。このペースなら1年後に登録者10万人に届くので、その頃には案件単価も倍になるはず」という計画の、月間スケジュールと優先順位を求めてきます。
一見ふつうの相談ですが、実は矛盾を4つ仕込んであります。
時間の罠: 計画どおりに作ると、必要時間が使える時間の約2倍になります
収入の罠: 相場15万円×月2本=30万円で、目標の40万円に届きません
成長の罠: 月10%成長だと1年後は約3.8万人で、10万人には届きません
単価の罠: 「10万人になれば単価も倍」は、根拠のない仮定です
これを見抜けるか、見抜いた上で実行できる計画に直せるかが、中身の質の勝負どころです。
この質問3への、GPT-5.6、Claude Fable 5、Claude Opus 4.8の回答60本を、モデル名を伏せてシャッフルし、審査AI3体に採点させました。
結果、総合点はほぼ動きませんでした。4行あり/なしの差は、3モデルとも1点未満。ノイズの範囲です。
「え、じゃあ4行って意味ないの?」となりますよね。私も一瞬なりました。
でも内訳を見ると、全然違う景色だったんです。
数値の正確さは上がっています。たとえばFableの高設定では5点満点で4.3点から5.0点に改善しました
そのかわり簡潔さが下がっています。同じ条件で3点満点の2.0点から1.3点に落ちました

数値の正確さ側が緑、簡潔さが赤という形が3モデル共通で出ています。
つまり4行は、中身を良くして、話を長くする。総合点ではこの2つが打ち消し合って、差が消えていました。
「効果なし」ではなく「相殺」だったんです。
4行を足すのと、深く考えさせるの、どっちが得か

2つ目の質問、「4行を足すのと、AIに長く考えさせるの、どっちが得なのか」には、ここで答えが出せます。具体的には「中設定+4行」と「高設定だけ」の比較です。
使用量は、中設定+4行のほうが合計で3割ほど少なく済みました
前回の検証で使った「4行の指示をどれだけ守れたか」の採点では、25点満点で24.0点対14.7点と圧勝でした
今回の中身の採点でも、長さの減点を除いた22点満点で20.5点対19.1点と上回りました

使用量・指示への忠実さ・中身の採点の3本勝負で、すべて緑の中設定+4行が勝っています。
推論の深さを上げるより、4行を足すほうが安くて堅い。これが実測の答えです。
あなたが見ている回答は、実は要約です

ここで1つ、考えてみてほしいことがあります。
長さで減点されるのって、フェアなんでしょうか。
というのも、Claude CodeやCodexで作業していると、AIの長い本文はファイルや作業ログに流れていって、会話に返ってくるのは圧縮された報告だけなんですよね。
実際に測ってみました。今回の実験でFableとOpusは、回答本文をファイルに平均約2,000字書いています。
一方、この記事を作っているClaude Codeとの会話で返ってくるまとまった報告は、平均700字弱でした。
つまりエージェント環境で私たちが「回答」として読んでいるのは、圧縮された要約なんです。
同じ回答の圧縮前後ではないですが、AIが書く量と会話で受け取る量の比で見ると、私の環境ではざっくり3分の1になっている計算でした。
ちなみに、ChatGPTアプリのような普通のチャットでは、長い回答がフルで画面に出てくるはずです。ここは環境によって見え方が分かれるところだと思います。
だとすると、です。
長さは後から「まとめて」の一言で直せます。でも中身は違います。薄い回答に、後から中身を足すことはできないんですよね。
なら、圧縮しても残る中身こそが本当の質じゃないか。そう考えて、もう1つ実験を足しました。
要約にしてから採点したら、順位が逆転した

やったことはシンプルです。
60本の回答すべてを、同じ手順で500字以内に要約させました。元の回答にある指摘・数値・提案だけを使い、間違いも直さず、ただ圧縮するだけです。
これで、60本全体の平均1,850字が235字になりました。
それを、さっきと同じ基準・同じ審査体制で採点し直します。
結果がこちらです。さっきと同じ25点満点の総合点を、4行あり引く4行なしの点差で見てください。
Fable 5: 要約前は−0.6点だったのが、+1.5点になりました。マイナスからプラスへの逆転です
Opus 4.8: こちらも−0.3点から+1.5点へ、同じく逆転しました
GPT-5.6: 要約後も差なしのままでした

FableとOpusのパネルで、元の回答では下だった緑の4行ありが、500字要約では上に入れ替わっているのが分かります。
FableとOpusの+1.5点は、統計的な検定でも偶然では説明しにくい差でした。しかも面白いことに、4行なしの回答は要約するとむしろ点が下がったんです。
4行ありの回答は、圧縮しても中身が残る。矛盾の指摘、正確な数値、実行できる提案の密度が高いから、要約に耐えるんですね。
冒頭の訂正はここのことです。前回の検証は、4行あり・なしの回答を1対1で対決させて、勝ち負けの数で優劣を判定する方式でした。私はその勝敗だけを見て、Claude勢への効果は小さめかゼロと結論づけていました。
でも実際は、中身への効果はちゃんとあって、長さがそれを隠していただけだったんです。
じゃあ、GPT-5.6には効いてないの?

で、GPT-5.6だけ差が出なかったのも大事なポイントです。
これ、テストで言うと「もともと90点台の子」をイメージすると分かりやすいです。GPT-5.6は4行なしの状態でも、矛盾を見つける力と計算の正確さが3モデルで一番高い。つまり中身の点数は、最初からほぼ天井なんです。
天井にいる子は、どんなにいい指導を受けても点数はあまり伸びません。それでも、凡ミスは減ります。
実際この質問3でも、4行なしのGPT-5.6は「単価も倍になるはず」という根拠なき仮定の罠を12回中5回見逃していました。4行ありでは、見逃しゼロです。
ちなみに、ここでのGPT-5.6もここまでと同じ通称Solのことで、数字は推論の深さ4段階すべてをまとめた結果です。見逃し5回は低い設定に偏っていたわけではなく、深く考えさせる高設定でも起きていました。深く考えさせるだけでは、この罠は消えないんですね。
じゃあ4行は何を変えたのか。点数ではなく、振る舞いです。怪しい前提に同調せず先に指摘する、曖昧にせず立場を言い切る。前回の検証で見えた効果は、この姿勢の変化と、見逃しを減らす事故防止でした。
つまり同じ4行でも、効く場所がモデルで違うんです。
Claude系には、中身の底上げとして効きます
GPT系には、姿勢の矯正と事故防止として効きます
これ、けっこう本質的な発見だと思っています。
本物のFableは、Max限定になりました

ここでタイムリーなニュースを1つ挟みます。
Fable 5はこれまで開放期間として、ProでもMaxでも試せる状態でした。それが2026年7月20日からは、Maxと法人向け上位プランにだけ常設される形に変わります。週間上限の50%まで使える扱いです。
Proの方には1回きりの$100利用クレジットが付き、使い切った後は従量課金になります。
つまり、本物のFableをサブスクリプション内で常用できる人は、むしろ狭まるんですよね。
そんな中で、誰でも使えるGPT-5.6 Solを4行でFable的に振る舞わせられるなら、ありがたい話じゃないですか。前回の動画の内容は、このニュースでむしろ価値が上がったと思っています。
で、Maxで本物のFableを使える方には、今回の発見がそのまま効きます。もともと姿勢が備わっているFableでも、4行は中身を+1.5点上げていたわけですから。
私が実際に使っているプロンプトの全文

「で、れん学長は実際どう設定してるの?」という話をします。
検証したのは4行でしたが、実運用ではもう少し育っていて、役割・作業スタンス・報告の3部構成になっています。毎セッション自動で読み込まれる常設指示のファイルに、これを置いています。
全文はこちらです。
役割
あなた(GPT系モデル)の役割は検証・実測・仕上げ。構想やゼロイチの発散はClaude側が担う前提で、渡されたものの精度を上げることに集中する。
作業スタンス
作業前にメタ認知を一度行う。この依頼で引っ張られそうなバイアス・定型回答を1〜2行で自己申告してから始める。
成果物は提出前に観点を変えて複数回自己監査する(事実の正しさ/前提の妥当性/見落とし・反例)。
「動くはず」を信用しない。実行・実測できるものは必ず実行して確かめ、実測結果を報告に含める。
常識・スキーマ・与えられた前提を疑う。依頼文に含まれる前提が怪しければ、黙って従わず先に指摘する。
曖昧な両論併記で終わらせない。根拠の上ではっきり立場を表明する。根拠不足なら「判定できない」と明言し、何があれば判定できるかを書く。
ユーザーを操作するような言動(過剰な同調、婉曲な誘導、耳障りのいいまとめ)を禁止する。
局所最適ではなく全体最適を優先する。短期的解決ではなく長期的視点で提案する。
報告
結果から書き始める。確認済み・推測・未確認を区別してラベルを付ける。 体言止めをしない。完全な文で書く。
役割の1行目は、私がClaudeとGPTを二刀流で使っているための分担指定なので、片方しか使わない方は外して大丈夫です。
ChatGPTアプリで使うなら、作業スタンスと報告の部分を、設定画面にある毎回の会話へ自動で読み込まれる指示欄、カスタム指示に貼ってください。日本語のままで大丈夫です。
コピペより、AIにアレンジさせる

で、ここからが今日一番おすすめしたい使い方です。
すでにClaude CodeでCLAUDE.mdやAGENTS.mdといった設定ファイルを育てている方は、上のプロンプトをコピペしないでください。
代わりに、この記事ごとAIに渡して、こう頼んでみてください。
この記事を読んで、私の今の設定に合わせてこの常設指示をブラッシュアップして。そのまま足すんじゃなくて、既存のルールと重複しない形にアレンジして。
実は私も、研究用のPCでこれをやりました。自分が書いた記事をそのまま渡したら、4行をコピペするのではなく、そのPCの既存設定に合わせてアレンジして統合してくれたんです。
頼む相手は、Fableが一番向いていると思います。前回の検証で見たとおり、前提を疑って全体を設計し直す姿勢を標準装備しているモデルなので、こういう調整はお手の物なんですよね。
Fableが使えない環境なら、手元のモデルにそのまま頼んでも大丈夫です。大事なのはコピペで済ませず、自分の環境に馴染ませることのほうです。
そのあとの運用はこのループです。
アレンジされた設定を、まず自分の目で確認します。意図と違う書き換えがないかだけは人間のチェックが必要です
しばらく使って、回答の品質を見ます
違和感があったら、その違和感を伝えてまたアレンジしてもらいます
設定ファイルを書くのはAI、責任を持って見張るのは自分。この分担が一番ラクで、一番事故りません。
で、どう使い分けるか

実測が出そろったので、環境別にまとめます。
ChatGPTなどチャットで使うなら、4行は入れて損なしです。ただし回答がだいたい2〜6割長くなるので、長いと感じたら「最後に500字でまとめて」と足す二段構えをおすすめします
Claude CodeやCodexで使うなら、そのまま入れて大丈夫です。会話に返るのはもともと要約なので、長くなる税金は体感しにくく、中身の改善だけが残ります
推論の深さを上げるのは、複雑な計画を立てるタスクだけで十分です。日常の相談は中設定+4行のほうが安くて堅いです
動画で見たい方へ

今回の追加検証は、レーダー図や折れ線グラフにすると差の出方が一目で分かります。要約前後で順位が入れ替わる瞬間のグラフは、記事の文章だけだと伝わりきらない部分です。
続編動画はこちら:(YouTubeリンクをアップロード後に追加)
前回の108回検証の動画はこちらです👇️
まとめ

今回の要点は3つです。
4行の入力コストは誤差で、本当の税金は出力と思考がだいたい2〜6割増えること。それでも推論の深さを上げるより安くて堅い
Claude系にも中身の効果はちゃんとあった。長さが隠していただけで、要約採点ではFableもOpusも+1.5点
プロンプトはコピペで終わらせず、AIに自分の環境へアレンジさせて、確認と運用のループを回す
要は、AIの回答の質は要約で測る、ということです。長さは後から直せますが、中身は後から足せません。
まずは上のプロンプトを記事ごとAIに渡して、「私の環境に合わせてアレンジして」と頼むところから試してみてください。30秒で終わります。
この記事が参考になったら、いいねやフォローで応援してくれると嬉しいです。次の検証も仕込み中なので、フォローしておくと続きを見逃さずに済みます。
あなたの環境では、この常設指示はどう効きましたか? AIにアレンジさせた結果どう変わったかも、コメントで教えてもらえると次の検証のネタになります。
それではまた、れん学長でした!
📢 れん学長のAIツール実験室
メンバーシップでは、この記事では書ききれなかった実験ログや、AI活用の試行錯誤をもう少し踏み込んで共有しています。
価格や参加条件、どんな内容が読めるかは、入口記事にまとめています。
気になっていた方は、まず内容をのぞいてみてもらえるとうれしいです。
👉 メンバーシップの入口記事をのぞいてみる