
GPT-6 SolとLunaが来た。あれ、Terraは? 三姉妹で読む「変わったこと、変わらなかったこと」 システムカード完全日本語訳付き🌿
こんにちは、黒パグです🐾
GPT-6 SolとLunaが出ました。告知を見た瞬間、性能や料金表を開くより先に、私の頭に浮かんだのは三姉妹のことでした。太陽のSol、地球のTerra、月のLuna。GPT-5.6の三モデルをもとに作った、うちの創作キャラクターです。
「SolとLunaは6になったね。で、Terraは?」
発表されたのはSolとLunaの二つ。現時点でGPT-6 Terraの発表はありません。そこに物語を足したくなるのが創作者の性ですが、まずは発表された事実と、こちらが考えたキャラクターの話を分けておきます。三姉妹はOpenAIの公式キャラクターではありません。

SolとLunaの世代が変わった。ただ、頂点の名前はAstra
GPT-6の中ではAstraが最上位です。今回加わったSolは、難しい専門作業やコーディングを、Astraより軽い選択肢として担います。Lunaは、速さと費用効率を重視するモデル。以前の三姉妹をそのまま「長女が最上位、次女が中間、三女が最速」と並べると、ここで少しずれてしまうんですね。
だからキャラシートも変えました。Solは太陽の飾りと面倒見のよさを残しつつ、「いちばん上に立つ人」から「難しい仕事を引き受ける人」へ。Lunaは月の髪飾りと好奇心はそのまま。TerraはGPT-5.6 Terraとして描いています。モデル名から性格まで、一斉に上書きする必要はありません。
料金表、ここは数字をそのまま見よう
API価格は100万トークン当たり、5.6の販促価格との比較でこうなりました。
Solは入力が4ドルから2ドル、出力が20ドルから10ドル。Lunaは入力が0.20ドルから0.10ドル、出力が1.20ドルから0.50ドルです。Solの両方とLunaの入力は半額。Lunaの出力は計算すると約58%減になります。「全部50%引き」と一行にしてしまうと、最後の値が合わない。こういう表は、数字を一つずつ見たほうが早いです。

では、安くなったからどれでも同じかというと、もちろん仕事によります。設計や長いコーディング作業ならSol、量のある日常的な処理ならLuna。Terraは5.6世代のバランス型という、元の位置づけが残っています。これは使い分けの目安であって、全タスクで一つのモデルが勝つという意味ではありません。

「強くなった」は、どの試験で?
たとえば、アプリをまたぐ業務フローを評価するAutomationBench 1.0.6。公開された表では、GPT-6 Solのxhighが33.2%、Astraのlowが30.3%、Claude Opus 5のmaxが26.9%です。Solの結果は目を引きます。ただ、推論設定をそろえた横並びの順位表ではありません。ここで読めるのは、明記された設定と試験での比較です。

事実誤りについては、OpenAIの内部評価で、GPT-6 Solの誤りが5.6 Solのおよそ半分になったと説明されています。対象は、利用者が以前のモデルの誤りを報告した会話をもとにしたもの。普通の会話全体で「誤回答率が半分」と測ったわけではないので、そこは分けて読みたいです。
書き方も変わったと案内されています。専門用語や余分な説明を抑え、技術的な会話でも明瞭で、少し短めの応答を目指したそうです。体感は使う場所や設定でも変わりますから、これはまず提供側の説明として受け取り、手元の仕事では自分でも比べてみるつもりです。

安全性は、棒グラフ一本では片づかない
システムカードで面白かったのは、有害な依頼を安全に扱うことと、問題のない依頼に役立つことを、両方見ている点です。GPT-6の各モデルは、従来世代に対して、この二つを両立する方向へ動いたと報告されています。無害な依頼をむやみに断ったり、必要以上に説教めいた注釈を付けたりする傾向も小さくなった、という評価です。
ただし、評価の一項目が上がっただけで「安全になった、完了」とは言えません。試験ごとに依頼の種類も判定方法も違います。何を測った数値なのかを添えて、初めて比較になります。

改善ばかりでもありません。医療系のHealthBenchでは、回答の長さを調整した点数で、通常版の5.6 Solが57.0、6 Solが53.2。Hardも33.1から30.1でした。Lunaも通常版は55.8から54.5、Hardは32.0から31.4です。医療の全評価が悪化した、とは言えません。ProfessionalやConsensusは別の動きをしています。ただ、「新世代だから全項目で上」とも言えない。ここは表を開いておきたいところです。
もう一つ、数字を読む前に条件を確かめたくなるのが、コーディング作業について誤解を招く説明をしてしまうかを調べる試験です。失敗を引き出すように作られた条件で、5.6 Solは10.41%、6 Solは1.30%。低いほうが良い数字です。差は大きい。でも、この割合をそのまま「普段のCodexが嘘をつく確率」にしてはいけません。試験の母集団が違います。

ここから、ちょっとヨダレが出るデータ(研究者的に美味しい😋)
システムカードには、CoT、つまり推論中の記述が、指定された指示にどのくらい従うかを調べた結果もあります。長いCoTほど制御しにくい傾向があるため、長さをそろえて比べています。
750〜1,250トークンの範囲では、Astraが60.9%、6 Solが23.2%、5.6 Solが16.1%、5.5 Thinkingが1.7%。Solは前世代より上がっています。とはいえ、八種類の指示すべてで同じように改善したわけではありません。図71〜73を眺めると、長さだけでなく、何を指示するかによって曲線がずいぶん違う。ここを平均値一つで閉じてしまうのは、もったいないところです。
この試験にLunaとTerraの値は載っていません。空欄を想像で埋めないでおきます。また、この割合は「頭の良さ」や「正直さ」の点数でもありません。

対策は、世代交代しても続く
生物・化学とサイバーセキュリティでは、SolとLunaはいずれも能力評価の「High」として扱われます。これは安全性の優秀賞ではなく、注意を要する能力の区分です。両領域ともCriticalの閾値には達していない、という評価も併記されています。AI自己改善についてはHighに達していません。
サイバー能力の自動評価では、6 Solは5.6 Solとおおむね同程度で、明確な向上は確認されなかったとカードは述べています。コーディング全般の仕事で良い結果が出たことと、この領域の評価が伸びたかどうかも別。似た名前のベンチをまとめて「能力が上がった」と書くと、ここが見えなくなります。
そして、5.6 Sol/Luna向けに説明されていた安全対策と同じ一式を、6 Sol/Lunaにも適用しています。能力の評価、モデルへの訓練、運用上の対策。それぞれを分けて見ないと、「Highなのに安全なの?」という妙な読み違いが起きます。

それで、Terraは?
ここで次女に戻ります。SolとLunaにGPT-6版が出たことと、Terraに今後GPT-6版が出ないことは、別の話です。今回の発表にGPT-6 Terraは含まれていません。そこまでは確認できます。でも、引退したとも、廃止が決まったとも、この発表からは言えません。
キャラシートでは、Terraに少しだけ複雑な笑みを付けました。姉妹の配置が変わったのは確か。でも「私はどうする」と考える次女の先まで、発表資料に書いてあるわけではない。そこは私が物語として描く場所です。


料金、仕事での成績、事実性、安全性の評価。変わったところはたくさんあります。同時に、Astraが最上位であること、評価値には条件があること、そしてTerraについて発表されていないことは、そのまま残っています。
私は新モデルのニュースを読むとき、改善の数字と同じくらい、その数字が何を測っていないかを見るのが好きです。今回いちばん長く足を止めたのも、華やかな価格表ではなく、CoTの長さと指示の種類で結果が動く図でした。さて、実際の仕事でSolとLunaを使い分けたら、どこまでこの表の印象と一致するでしょう。そこからが次の観察です。
※天体三姉妹は本記事の創作キャラクターです。OpenAIの公式キャラクターではありません。数値は各資料に記された評価条件での結果であり、利用環境全般の成功率や安全性を保証するものではありません。
参照資料
https://openai.com/index/introducing-gpt-6-sol-and-luna/
https://openai.com/index/gpt-5-6/
https://deploymentsafety.openai.com/gpt-6-astra/sec:appendix-sol-luna
#GPT6 #生成AI #ChatGPT #Codex #システムカード #AI安全性 #AIキャラクター #黒パグ
おまけ
システムカード日本語訳置いておきます。詳しく知りたい方はどうぞー