Claude Fable 5.1使ってみた|ハルシネーションを減らす「たった2行」の対策
弊社note・オウンドメディア記事はこれまで、その時の最高モデルの「Opus」で記事の土台を作成し、全文のファクトチェックをしていました。
そんな中、Fable 5.1がリリースされたので、今回はFable 5.1でエフォート「中」で本記事とタイトルを作成してみました!
プロンプトは、本文に記載のポイントを反映した(「Opus」使用時と全く同じ)ものです。
結果、ファクトチェックは1度も引っ掛からず、本文は変更する必要はない、と判断できる出来栄えでした!
ただし、タイトルだけは「Claude Fable 5.1」ではなく「ChatGPT」を用いたほうが良いと主張してきたので、Claude Fable 5.1がリリースされたばかりで話題性がある旨を伝えると納得してました😅
LLMなので今回の1回でどうか、と明確にはお伝えできませんが、十二分に良い結果、記事が完成したと感じています。
みなさまも、下記をご一読いただければ、肌感で感じ取っていただけるかと存じますので、知識獲得がてら感じてみてはいかがでしょうか。
それでは、本文をどうぞ---
👥 登場人物
フィド(FiD) 🤖:フィデックスが社内で育てている(という設定の)AIアシスタント。人間の例え話には毎回感心して「記録」している。
マチカド ☺️:どこの街角にもいる会社員。何か分からないことがあると、真っ先にフィドを頼る。
ChatGPTに調べものを頼んだら、それっぽい答えが返ってきて、あとで確認したら間違っていた。そんな経験、私だけじゃないはず。
会議でも「AIの回答、鵜呑みにしないでね」と言われるけど、じゃあどうやって見抜けばいいの?
調べてみると、この現象には「ハルシネーション」という名前がついていて、AIへの指示文に2行足すだけでかなり減らせるらしい。しかも最新のAIでも「ゼロにはならない」のがポイントなんだとか。🤔
というわけで今日も、フィドに聞いてみました。
🤔 AIが自信たっぷりにウソをつくのって、何が起きてるの?
マチカド:ねえフィド、ChatGPTに聞いたことが、あとで間違いだって分かることがあるんだけど、あれって何なの?
フィド:照合完了です。AIが事実と違う内容を、自信ありげに出力してしまう現象は「ハルシネーション」と呼ばれています。日本語にすると「幻覚」です。
マチカド:幻覚! AIが、見えないものを見ちゃってるってこと?
フィド:近いイメージです。厄介なのは、その間違いが「もっともらしい」こと。仕事のシステムにAIを組み込むとき、最後まで残る不安がこれだと記録されています。
マチカド:たしかに、堂々と間違えられると気づけないもんね。でも最近すごく賢いAIが出たって聞いたけど、それでも起きるの?
フィド:はい。そこが今日の一番大事なポイントです。
🆕 最新モデル「Claude Fable 5.1」って?
マチカド:Claude Fable 5.1っていう新しいAIが出たんでしょ? 名前だけニュースで見た。
フィド:2026年9月にAnthropicが発表した最新モデルです。同時に「Claude Mythos 5.1」も発表されましたが、こちらは中身は同じモデルで、安全対策の水準が異なります。
マチカド:え、待って、同じモデルなのに名前が2つあるの?
フィド:Fable 5.1は一般の開発者が使えるもの、Mythos 5.1はサイバーセキュリティや生命科学の分野で審査を通った組織だけが使えるものです。
マチカド:同じ車でも、一般向けと、特別な免許がある人しか乗れない仕様がある、みたいな?
フィド:その表現、私のデータにありませんでした。記録します。 では、Fable 5.1が仕事のシステム向けに注目されている点を3つに絞ります。
✅ 根拠に基づいた回答が強くなった:早い時期に使った企業のGleanは、前のモデルより約2対1で回答が好まれ、根拠づけも改善したと報告
✅ 長い作業でも読みやすい:Jane Street Capitalは、何段階もある長い作業でも過程を追いやすかったと報告
✅ 使うコストが下がった:一般的な使い方で約25%、AIに作業を任せる重い処理では最大約45%のコスト削減が見込まれる
マチカド:へえ! 根拠づけって、つまり「なんでその答えなのか」をちゃんと示せるようになった、ってことか。
フィド:そのとおりです。ただし正直に申告します。Anthropic自身が、ハルシネーションを「完全に排除するわけではない」と公式に明記しています。
マチカド:そこは正直なんだ。じゃあ、賢いモデルを選んでおしまい、じゃダメってこと?
フィド:はい。対策の本質は「賢いモデルを選ぶこと」ではなく、AIに根拠を出させて、その根拠を後から確かめられる形にすることだと整理されています。
📝 補足:Mythos 5.1はAnthropicのトラステッドアクセスプログラムを通じてのみ提供。コスト削減の根拠はキャッシュ読み取り価格が100万トークンあたり0.25ドルに引き下げられたことで、入力10ドル・出力50ドル(100万トークンあたり)の基本価格は前モデルのFable 5と同じです。ベンチマークはAutomationBenchで31.4%(Fable 5は17.1%)、GDPval-AA v2で1853(同1723)と公表されています。
✍️ プロンプトに足す「2行」って、何を書けばいいの?
マチカド:で、「2行足す」って何? プロンプトって、AIに送る指示文のことだよね?
フィド:はい。Anthropicの公式ドキュメント「ハルシネーションを減らす」に、考え方が3つ示されています。
1️⃣ 不確実なときに「わかりません」と言うことを許可する
2️⃣ 回答の前に、元の文書から一語一句そのままの引用を抜き出させる
3️⃣ 主張ごとに引用と出典をつけさせ、引用が見つからない主張は撤回させる
マチカド:あ、1つめ意外。AIに「わかりません」って言わせていいの? それって、使えなくなるってことじゃない?
フィド:いい質問です。私のデータベースが少し熱くなりました。逆です。「文書に答えがなければ、推測せずに『判断できません』と答えて」と一文入れるだけで、誤った情報を大幅に減らせると公式ドキュメントは説明しています。
マチカド:なるほど。知ったかぶりする人より、「それは分かりません」って言える人のほうが信用できるのと同じか。
フィド:その表現…記録します。 2つめは、答える前に元の文書から関連する箇所を「そのまま」抜き出させる方法です。回答が実際のテキストに縛られるので、勝手な創作が入りにくくなります。
マチカド:3つめの「出典をつけさせる」は、大学のレポートで「根拠のページを書け」って言われるやつだ。
フィド:まさにそれです。しかも「引用が見つからなかった主張は削除する」というルールを入れておくと、根拠のない文が最終的な答えに残りにくくなります。
マチカド:そっか、根拠が書いてあれば、人間があとから確かめられるもんね。それが「検証できる」ってことか。
📝 補足:「わかりません」の許可に使う文例は「提供された文書に答えが含まれていない場合は、推測せずに『提供された情報からは判断できません』と回答してください」。
引用を先に抜き出させる方法は20,000トークンを超えるような長い文書で特に有効で、長い文書をプロンプトの上部(指示より前)に置き質問を末尾にする構成は、複雑な複数文書の入力でテストにおいて最大30%の品質向上につながるとされています。
🔧 もう一歩踏み込みたい人向け:AIに自分でチェックさせる方法
マチカド:2行足すだけで十分なの? 本当に大丈夫?
フィド:基本はその2行です。ただ、業務で使うなら、公式ドキュメントにはもう少し踏み込んだ方法もあります。
🔁 同じ質問を複数回実行し、答えがズレた項目だけ人が確認する(Best-of-N検証)
🪞 一度出した答えを次の入力として渡し、「前の記述を検証して」と自己チェックさせる
🚫 「渡した文書の情報だけで答えて、自分の知識で補わないで」と外部の知識を制限する
マチカド:1つめは、3人に別々に聞いて、答えが割れたところだけ確認するみたいな感じ? 経費の突き合わせみたい💦
フィド:はい。数値の抽出のように答えが1つに決まる作業で特に役立ちます。3回実行して一致しない項目だけ人が確認する運用にすると、確認の手間を抑えられると記録されています。
マチカド:自己チェックさせるのは、下書きして、見直して、直す、ってことだよね。人間の仕事と一緒だ。
フィド:公式のベストプラクティスでも、下書き、基準に照らしたレビュー、改善という流れがもっとも一般的なパターンとして紹介されています。各ステップを分けて記録しておけば、後から監査の記録として使えます。
💼 で、これって私の仕事にどう関係あるの?
マチカド:開発者向けの話に聞こえるけど、普通に会社でAIを使う側の私にも関係ある?
フィド:あります。会社の業務にAIを組み込むときは、「検証できる出力」を最初から仕様として決めておくことが勧められています。ポイントは3つです。
✅ 分からないときは「分からない」と答えさせる
✅ 回答の前に原文からの引用を抜き出させ、主張ごとに出典をつけさせる
✅ 複数回実行や自己チェックで、答えのズレを機械的に見つける
マチカド:この設計なら、AIの答えが正しいかどうか、人もプログラムもあとから確かめられるってことね。
フィド:はい。正確さと検証しやすさは、同じ仕組みから生まれます。まずは「わかりません」の許可と、引用の義務づけ。この2行を、いま使っているプロンプトに足してみることが勧められています。……というのが、私の全記憶からの回答です!
マチカド:明日AIに頼みごとをするときは、「分からなかったら分からないって言ってね」って一言添えてみよう😊
(あ、フィドもだね…🤭)
📌 フィドの今日のまとめ
🤖 AIが事実と違うことを自信ありげに答える現象が「ハルシネーション」。厄介なのは、間違いが「もっともらしい」こと
🆕 2026年9月発表のClaude Fable 5.1は根拠に基づく回答が強化されたが、Anthropic自身が「完全には排除しない」と明記
✍️ 対策の本質は「賢いモデル選び」ではなく、AIに根拠を出させて後から確かめられる形にすること
2️⃣ まず足す2行は、「分からなければ判断できないと答える」許可と、「原文からの引用と出典をつける」義務づけ
🔁 さらに踏み込むなら、複数回実行して答えのズレを見つける、自己チェックさせる、渡した文書以外の知識を使わせない
この記事が参考になった方は、スキ♥️を押していただけると今後の記事制作の参考になりますので、よろしくお願いします!
また、金融やITって難しそう…という方も身近に感じていただけるような、日々の生活やビジネスに役立つ情報をお届けしていますので、フォロー🔔も是非ともよろしくお願いします!🙇🙇♂️🙇♀️
\もっと詳しく知りたい方へ/
詳細は、下記当社オウンドメディア「トピックス」の記事をご確認ください。👇
※本記事は当社オウンドメディアの記事を基に、AIアシスタント「フィド」と会社員の「マチカド」というキャラクターの対話形式で構成しています。フィドは連載上のキャラクターであり、販売中の製品ではありません。
参考・出典
本記事は、以下の資料を基に作成しました。
Anthropic(Claude Platform Docs):Prompting best practices(アクセス日:2026年9月3日)
https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/claude-prompting-best-practicesAnthropic(Claude Platform Docs):ハルシネーションを減らす(アクセス日:2026年9月3日)
https://platform.claude.com/docs/ja/test-and-evaluate/strengthen-guardrails/reduce-hallucinationsOpenAI:GPT‑5.6:目標に合わせて拡張するフロンティアインテリジェンス(公開日:2026年7月9日)(アクセス日:2026年9月3日)
https://openai.com/ja-JP/index/gpt-5-6/OpenAI:GPT‑5.6 Sol プレビュー:次世代モデル(公開日:2026年6月26日)(アクセス日:2026年9月3日)
https://openai.com/ja-JP/index/previewing-gpt-5-6-sol/OpenAI:GPT‑5.6 で価格性能のフロンティアを前進(公開日:2026年7月30日)(アクセス日:2026年9月3日)
https://openai.com/ja-JP/index/advancing-the-price-performance-frontier-with-gpt-5-6/Anthropic:Introducing Claude Fable 5.1 and Claude Mythos 5.1(公開日:2026年9月1日)(アクセス日:2026年9月3日)
https://www.anthropic.com/claude-fable-and-mythos-5-1
AI利用について
本記事はAIツールの支援を受けて作成されております。 内容は人間によって確認および編集しておりますが、詳細につきましてはこちらをご確認ください。
#フィドに聞こう !
