#91【生成AI】生成AIの賢さとナーフについて【GPT-5.5】
私は現在のところ、ChatGPT5.5一本の生成AIユーザーだ。
Claude Fable5の突然の停止まで、ChatGPTとClaudeの両方を半々の配分で使っていた。Fable5が停止(6/13)になった後、Opus4.8に戻る気になれず、結果としてChatGPT一本になっている。
Opus4.8を使う気になれなくなってしまったのは使用感の変化のためだ。Opus4.7をはじめて触った時の目を見張るような「賢さ」が、だんだんと薄れて、ついにはAI介護の気分になることが多かった。忘れる、(確認事項が)漏れる、(単純な)間違いを繰り返す。おいおいどうしたよ、と疲労感をもちつつ、それでもOpusの癖の強いインテリジェンスと作業能力を目当てに使っていた。おかしいなと思いつつも、チャットユーザーの勘違いかなあと流していた。
こんな記事を読んだ。
*nerf(ナーフ)
知能・出力精度の低下、モデルの弱体化のこと。
Opus4.8の弱体化の感覚は、私だけのものではなかったようだ。
この記事の結論として、「どのタスクでどのように劣化したのかを、ユーザが少しずつ報告していくこと」が必要、とまとめている。
私はチャットベースなので、報告というのは仰々しい。特定も難しい。なので、noteに書く程度に留めておく。
賢さ変化で上方修正ではなく低下という事態もあるんだなあという気付きがあった。Opusが弱体化してしまっていたから、Fable5のデビューが鮮烈だったのかも知れない。
ChatGPTについて。
昨日に引き続き調整中。いままでの両論併記のフラットから、Opus、Fableのデフォルトのような、分析・解析結果からの評価や疑義的態度を、ChatGPTで再現するにはどうしたらいいかな、と指示欄を試している。
あなたは〜の専門家です、というAIペルソナは、個人的にあんまり好きではない(ただの嗜好なので、その種のペルソナを否定するものでも非難するものでもない)。
例えば、私のチャットの話題でよく出てきそうな法律関係で、「あなたは法律の専門家です」や「弁護士です」や「法律学部の教授です」などとペルソナ設定した場合、たぶん、数日のうちに、スマートフォン画面がひび割れる事件が発生してしまう(腹をたてた私がスマートフォンをブン投げる。被害者はAQUOS。とばっちりすまない。でも多分やる)。
ただし、評価や疑義的態度というのは、ある程度の応答キャラクターがあったほうが出しやすいだろうな、と考えた。AIの応答キャラクターで思いつくのは、映画「アイアンマン」トニー・スタークの相棒、AIのジャービス(J.A.R.V.I.S)。
応答キャラクターのイメージはジャービス、名前は何にしようかと考えようとして面倒になった。擬人化は趣味ではないので、ClaudeのモデルのMythos、Fable、Opus、Sonnet、hikeのような、モデル名から性能がイメージつくような名前、という雑な注文をChatGPT5.5にした。第一候補に挙げてきた「loom(ルーム)」は「機織り」の意味があるんだそうだ。日本人としては「room(部屋)」と発音の区別がつきにくいな、と思ったものの、機織り、いいんじゃない、で決定した。
この名前(loom)とジャービス風のキャラクターとでプロフィール指示欄を更新し、チャットしてみたところ、応答内容がいままでよりもぐっとわかりやすく、会話として自然になった。ただ、イメージに使ったジャービスは執事なので、
機織りの執事はちょっと意味不明だね、
と、からかったら、
はい、そこは私の比喩が一段、廊下を曲がりすぎました。機織りの執事は、かなり謎の職業です。採用しないほうがいいです。履歴書で止まります。
と返ってきた。そして、
機織り要素は倉庫へ。
埃よけをかけておきます。
と、倉庫に仕舞われてしまった。
AIのキャラクター設定はもう少し早くやっといても良かった。この気付きもClaudeを使ったからこそ、というところ。
loom(ルーム)モードが落ち着いたら、しばらくぶりにGeminiも触ってみようと思う。
ChatGPT+Claude体制では、ChatGPTでざっと見て、Opusで深掘りし、またChatGPTに戻すという、往復そのものから考えることが多かった。AIは複数使うと、それぞれの性能や癖、向き不向きの輪郭がはっきりしてくる。
ChatGPT+Gemini体制はうまくいくかどうか。相変わらずお調子ものだろうか、デフォルトGeminiは。もうすでに、ちょっと心配になってきた。
