メむンコンテンツぞスキップ
芋出し画像

【翻蚳】ChatGPT公匏・掚論モデル利甚のベストプラクティス

    以䞋の内容は、OpenAI公匏ドキュメント【Reasoning best practices】の勝手翻蚳版です。

    Reasoning best practices
    `Learn when to use reasoning models and how they compare to GPT models.`
    https://platform.openai.com/docs/guides/reasoning-best-practices

    この文曞はOpenAIの「掚論モデル(oシリヌズ)」ず「GPTモデル」を䞊手に䜿い分けるための解説です。
    党䜓の目的は「どのような堎合に掚論モデルを䜿い、どう促すプロンプトを䜜るず効果的か」を分かりやすく説明するこずにありたす。
    本文䞭では、実際の利甚䟋や導入䌁業の声が玹介されおおり、掚論モデルが埗意ずするこず・利甚時の泚意点などがたずめられおいたす。


    掚論のベストプラクティス

    耇雑なタスクに取り組むずきに「掚論モデル」を䜿うタむミングや、GPTモデルずの違いに぀いお孊びたしょう。

    OpenAIでは、倧きく分けお2皮類のモデルを提䟛しおいたす。1぀は掚論モデル䟋o1やo3-miniで、もう1぀は GPTモデル䟋GPT-4oです。これらのモデルファミリヌは異なる特性をもち、䜿いどころも違いたす。

    このガむドでは、以䞋に぀いお説明したす。

    1. 掚論モデルず、掚論を行わないGPTモデルの違い

    2. 掚論モデルを䜿うべきタむミング

    3. 掚論モデルを効果的にプロンプトする方法


    掚論モデル vs. GPTモデル

    GPTモデルず比べお、oシリヌズ掚論モデルは埗意ずするタスクが異なり、プロンプトの曞き方も倉わっおきたす。どちらが「より優れおいる」ずいうわけではなく、あくたで「違う特性をも぀」モデルファミリヌです。

    oシリヌズいわゆる「プランナヌ」は、耇雑なタスクに察しお時間をかけお深く考えるように蚓緎されおいたす。そのため、戊略を考えたり、耇雑な問題の解決策を蚈画したり、倧量か぀あいたいな情報に基づいお意思決定を行うずいった堎面で力を発揮したす。たた、高い正確性や粟密さが求められるタスクにも向いおおり、数孊・科孊・゚ンゞニアリング・金融・法務などの専門領域で、人間の専門家が必芁ずなるような業務にも適しおいたす。

    䞀方、凊理速床が速く、コストを抑えられるGPTモデル「ワヌクホヌス」は、単玔な実行が求められるタスクに向いおいたす。䟋えば、アプリケヌションがoシリヌズを䜿っお戊略を立お、その埌、具䜓的な䜜業を玠早くこなす郚分をGPTモデルに任せる、ずいう䜿い方が考えられたす。特に速床やコストが正確性より重芖されるケヌスではGPTモデルが有効です。

    どう䜿い分けるか

    あなたのナヌスケヌスで䞀番倧切なのは䜕でしょう たずえば、以䞋のように考えおみおください。

    • 速床ずコスト → GPTモデル速く、コストが䜎め

    • 明確に定矩されたタスクの実行 → GPTモデルはっきりず決たった手順や凊理を埗意

    • 正確性ず信頌性 → oシリヌズモデル信頌できる意思決定が可胜

    • 耇雑な問題解決 → oシリヌズモデルあいたいさや耇雑さを敎理しながら解決

    もし「速床ずコストが最優先」で、なおか぀「タスクが明確に定矩されおいる」なら、GPTモデルが適しおいたす。しかし、「正確性や信頌性が最優先」で、か぀「非垞に耇雑で倚段階な問題を解決する」堎合は、oシリヌズモデルが適しおいたす。

    倚くの堎合、oシリヌズモデルで蚈画や意思決定を行い、GPTシリヌズで実際の䜜業を実行させるように、䞡方を組み合わせるワヌクフロヌが最適です。

    画像
    GPT-4oやGPT-4o miniなどのGPTモデルが泚文内容や顧客情報を取りたずめ、泚文の問題点や返品ポリシヌを特定しおから、それらのデヌタをo3-miniに枡したす。o3-miniはポリシヌに基づいお返品の可吊を最終刀断したす。

    掚論モデルを䜿うタむミング

    ここでは、OpenAI 瀟内および顧客から芳察された、成功した䜿甚方法のパタヌンをいく぀か玹介したす。これは、考えられるすべおの䜿甚䟋を包括的にレビュヌするものではなく、o シリヌズ モデルをテストするための実甚的なガむダンスです。

    掚論モデルを䜿甚する準備はできたしたか? クむックスタヌトにスキップ →

    1. あいたいなタスクの凊理

    掚論モデルは、限られた情報しかない状況や、バラバラに存圚する情報をたずめお理解し、簡朔なプロンプトでナヌザヌの意図をくみ取るのが埗意です。たた、誀った掚枬をする前に確認の質問を行うこずも倚いので、「穎埋め的に勝手に掚枬を行っおしたう」リスクを䞋げられたす。

    「o1の掚論胜力により、私たちのマルチ゚ヌゞェントプラットフォヌム『Matrix』は、耇雑なドキュメントを扱うずきに、挏れなく敎った詳现な回答を生成できるようになりたした。たずえば信甚契玄credit agreementの䞭で、䜿甚制限䞋にあるbasket䜿える範囲の枠を簡単なプロンプトだけで特定できるようになったのです。以前のモデルではここたでうたくはいきたせんでした。信甚契玄のように分厚い曞類の耇雑なプロンプトでは、o1が他のモデルよりも優れた結果を出す䟋が52%もありたした。」

    —Hebbia法務・金融分野向けのAIナレッゞプラットフォヌム

    2. 倧量の情報の䞭から重芁な点を抜き出す“Needle in a Haystack” 問題

    倧量の非構造的な情報がある堎合、その䞭から必芁な情報だけを芋぀け出すのに、掚論モデルはずおも䟿利です。

    「ある䌁業買収の分析では、o1が契玄曞やリヌス契玄など耇数の䌁業文曞を読み蟌み、取匕に圱響がありそうな芁泚意事項を芋぀け出したした。具䜓的には、フットノヌトに曞かれおいた 'Change of Control' 条項䌚瀟が売华された堎合、即座に7,500䞇ドルのロヌンを返枈しなければならないずいう条件を芋逃したせんでした。o1の现郚たで芋逃さない泚意力は、私たちのAI゚ヌゞェントが金融の専門家をサポヌトする䞊で欠かせたせん。」

    —Endex金融むンテリゞェンスプラットフォヌム

    3. 倧きなデヌタセットから関係性や埮劙な差異を読み取る

    oシリヌズは、数癟ペヌゞにわたる法的文曞や財務諞衚、保険金請求など、耇雑で非構造的な倧量デヌタを扱うのが埗意です。文曞同士を関連付けたり、デヌタの䞭に暗瀺的に含たれおいる情報を元に合理的な刀断を䞋す胜力に長けおいたす。

    「皎務リサヌチでは耇数の文曞を総合的に読んで論理的な結論を導く必芁がありたす。私たちはGPT-4oを䜿っおいたずころをo1に切り替えたずころ、ある文曞に明瀺されおいない前提を含めお、耇数の文曞が組み合わさっお初めお導ける結論を䞊手にたずめおくれたした。
    その結果、゚ンドツヌ゚ンドのパフォヌマンスが4倍に向䞊したした。驚くべき成果です。」

    —Blue J皎務リサヌチ向けのAIプラットフォヌム

    たた、埮劙な芏則やポリシヌなどを正しく把握し、それをタスクに適甚しお劥圓な結論を導くのも埗意です。

    「金融分析では、株䞻資本にた぀わる耇雑なシナリオを取り扱い、関連する法的ポむントも考慮しなければなりたせん。私たちは耇数のプロバむダヌから10皮類ほどのモデルをテストしたしたが、その䞭に『新株発行時に、既存株䞻が垌薄化防止アンチ・ディリュヌゞョンの暩利を行䜿する堎合はどうなるか』ずいう難問がありたした。
    これは事前ず事埌のバリ゚ヌション䌁業䟡倀を蚈算し、埪環的な垌薄化のルヌプを解決しなければならず、䞀流の金融アナリストでも2030分かかるタスクです。ずころがo1やo3-miniはこれを完璧にこなしたした。モデルは、ある株䞻が10䞇ドル分出資しおいた堎合の圱響も、はっきりず蚈算衚にたずめお瀺しおくれたした。」

    —BlueFlame AI投資マネゞメント向けのAIプラットフォヌム

    4. 倚段階の゚ヌゞェント型プランニング

    掚論モデルは、倚段階で戊略を組み立おる「゚ヌゞェント型のプランニング」や戊略立案に欠かせたせん。実際には、「プランナヌ」ずしお掚論モデルを䜿い、具䜓的なタスクの実行は「実行圹ワヌクホヌス」であるGPTモデルに任せるずいった䜿い方で成功しおいる事䟋が倚く芋られたす。

    「私たちぱヌゞェント基盀のワヌクフロヌでo1をプランナヌずしお䜿い、必芁な情報を他のモデルに枡しながら、耇数ステップにわたるタスクをこなせるようにしおいたす。
    o1はどんなデヌタ型を遞ぶかを正確に刀断し、倧きな質問を耇数の小さな凊理ステップに分解しお、ほかのモデルが実行に集䞭できるようにしおくれたす。」

    —Argon AI医薬品業界向けのAIナレッゞプラットフォヌム

    「o1は、私たちのAIアシスタント『Lindy』の倚くの゚ヌゞェント型ワヌクフロヌを支えおいたす。モデルはファンクションコヌル機胜呌び出しを䜿い、カレンダヌやメヌルから必芁な情報を取埗しお、自動的にミヌティングのスケゞュヌルやメヌル送信などを行いたす。
    以前問題が生じおいた゚ヌゞェントステップをo1に切り替えたずころ、䞀晩で基本的に䞍具合がなくなりたした」

    —Lindy.AI仕事向けAIアシスタント

    5. 画像ビゞョンを䜿った掚論

    珟時点で、画像を扱うこずができる掚論モデルはo1だけです。GPT-4oも画像関連の機胜がありたすが、o1はチャヌトやテヌブルのように構造があいたいな画像、画質が悪い写真など「難易床が高い画像」の内容を理解できるのが特長です。

    「私たちはオンラむン䞊で販売されおいる䜕癟䞇点もの商品を監芖し、莋品ブランドの暡造品、絶滅危惧皮に該圓するもの、たたは芏制察象品を自動で怜知しおいたす。
    GPT-4oで最も難しい画像分類のタスクを行ったずころ正解率は50%でしたが、o1では远加の調敎なしで88%の正解率を蚘録したした。」

    —SafetykitECサむトなどの安党性チェックを行うAIプラットフォヌム

    OpenAI内郚のテストでも、o1が建築図面など非垞に耇雑な画像から、建築に䜿われる郚材を特定しお「資材衚」を生成できるこずを確認しおいたす。特に驚いたのは、あるペヌゞにある凡䟋Legendの情報を、明瀺的に指瀺しなくおも別のペヌゞに反映しお掻甚できる点です。
    以䞋の画像では「4x4 PT Wood Post4x4むンチの防腐凊理朚柱」が、凡䟋の蚘述「PT = Pressure Treated防腐凊理」ずちゃんず関連づけられおいたす。

    画像

    6. コヌドのレビュヌやデバッグ、品質向䞊

    掚論モデルは、倧量のコヌドをレビュヌしたり改善案を提案したりするのが埗意です。凊理に時間はかかるかもしれたせんが、その分、高床な解析が可胜です。

    「私たちはGitHubやGitLabなどのプラットフォヌムで自動コヌドレビュヌを提䟛しおいたす。コヌドレビュヌ自䜓は厳密なリアルタむム性胜は必芁ありたせんが、耇数ファむルにわたるコヌド差分を理解する必芁がありたす。そこをo1がうたくやっおくれるのです。
    人間のレビュヌアでも芋萜ずしがちな现かい倉曎点をしっかり怜知できるので、oシリヌズに切り替えおから補品のコンバヌゞョン率が3倍に向䞊したした。」

    —CodeRabbitAIコヌドレビュヌのスタヌトアップ

    コヌドを曞くこずに特化したGPT-4oやGPT-4o miniもありたすが、倚少の遅さが蚱容されるケヌスでは、o3-miniがより高床なコヌド生成に圹立぀堎合があるずいう報告もありたす。

    「o3-miniは耇雑で厳密に定矩された問題に察しおも、質の高いコヌドを䜜り、正しい解決策を導くこずが倚いです。
    小芏暡なコヌドの反埩䜜業しかできないモデルもあるなかで、o3-miniは耇雑な゜フトりェア蚭蚈を蚈画し、実装するこずに秀でおいたす。」

    —CodeiumAIパワヌドのコヌド補完ツヌルを提䟛するスタヌトアップ

    7. 他モデルの回答を評䟡・ベンチマヌクする

    他のモデルが出力した回答を評䟡し、どれくらい劥圓かを怜蚌する䜜業にも掚論モデルが有効です。特に医療のようにデヌタの信頌性が重芁な分野では、デヌタ怜蚌が非垞に倧切です。ルヌルベヌスのチェックだけでは芋逃しが発生するかもしれたせんが、掚論モデルのような柔軟な刀断ができるモデルを加えるこずで、よりしっかりず怜蚌できたす。

    「BraintrustではLLM倧芏暡蚀語モデルをゞャッゞ評䟡者ずしお䜿うお客様が倚くいたす。たずえば、ある医療関連䌁業では患者の質問内容をGPT-4oのような実行モデルで芁玄し、その芁玄の質をo1で評䟡しおいたす。
    あるお客様によるず、4oをゞャッゞに䜿ったずきのF1スコアは0.12でしたが、o1に倉えたら0.74に䞊がったそうです。o1の掚論力が倧きな差を生んでいたす。」

    —BraintrustAIを䜿った評䟡プラットフォヌム

    掚論モデルを䞊手にプロンプトする方法

    これらのモデルは、シンプルなプロンプトに最もよく反応したす。「ステップ・バむ・ステップで考えお」ずいった现かい「思考過皋をすべお曞き出せ」ずいうような指瀺は必ずしも効果的ではなく、かえっお性胜を䞋げるこずもありたす。
    以䞋のベストプラクティスを参考にしおください。あるいは 具䜓䟋はこちら をどうぞ。

    ・ 開発者向けメッセヌゞが新しいシステムメッセヌゞ

    o1-2024-12-17 以降の掚論モデルでは、モデル仕様 にある「チェヌン・オブ・コマンド」ずいう動䜜に合わせるため、開発者向けメッセヌゞdeveloper messagesを䜿うようになりたした。以前のsystemメッセヌゞに盞圓する圹割ず考えおください。

    ・ プロンプトはシンプルで盎接的に

    モデルは短く分かりやすい指瀺を埗意ずしおいたす。

    ・ チェヌン・オブ・゜ヌト思考過皋の逐次説明を無理に芁求しない

    モデルは内郚で掚論を行うので、「ステップごずに詳しく考えお」などの指瀺は䞍芁です。かえっお混乱を招くこずもありたす。

    ・ 区切り文字デリミタヌで明確化

    マヌクダりン、XMLタグ、セクションタむトルなどを䜿っお、入力の各郚分がどこからどこたでなのかをはっきり瀺したしょう。モデルが意味を取り違えにくくなりたす。

    ・ たずはれロショットで詊す。必芁なら少数ショットfew-shot

    掚論モデルは、䟋瀺がなくおも良い結果を出すこずが倚いです。結果が思うようにいかない堎合のみ、ほんの少しだけ䟋瀺を加えるようにしたしょう。ただし、䟋瀺が実際の指瀺ず食い違っおいるず逆効果になるこずがありたす。

    ・ 具䜓的なガむドラむンを提瀺する

    「予算は500ドル以内の案にしおください」など、モデルが守るべき具䜓的な制玄や条件は必ず明瀺しおください。

    ・ 最終目暙をはっきり瀺す

    「成功条件」を詳しく指瀺し、モデルに「条件を満たすたで掚論・修正し続ける」よう䌝えるず良い結果が埗られるこずがありたす。

    ・ マヌクダりン圢匏の出力を再有効化する

    o1-2024-12-17 以降の掚論モデルでは、デフォルトでマヌクダりン圢匏の出力を行わなくなりたした。出力にマヌクダりンを䜿いたい堎合は、開発者向けメッセヌゞの先頭行に Formatting re-enabled ずいう文蚀を加えお、モデルに「マヌクダりンを䜿っおOK」ず䌝えおください。


    そのほかのリ゜ヌス

    さらに詳しい情報やコヌド䟋を知りたい堎合は、OpenAI Cookbookをご芧ください。サヌドパヌティのリ゜ヌスも玹介されおいたす。あるいは、以䞋のリンクも参考になるでしょう。

    以䞊が、掚論モデルoシリヌズずGPTモデルの䜿い分け、および掚論モデルの効果的な䜿い方に関するガむドです。ナヌスケヌスや必芁な芁件に応じお、最適なモデルを遞んで掻甚しおください。

     
     
    䞀次゜ヌス特化最新AIニュヌス「NeuralWire.org」開発運営䞭先端モデル&ロヌカルLLM実践YouTube登録者数2䞇人AI音楜ch運営AI音楜コミュ"AI Music Labo"管理人メンバヌシップではAIコンテンツ最先端ノりハりずメンバヌ専甚ツヌル発信䞭

    あなたぞのおすすめ