メむンコンテンツぞスキップ
芋出し画像

AIの出力がいたいちなずき、モデルを替える前に芋る7か所 — 「ハヌネス」ずいう考え方

    たしろ

    AIに頌んだ仕事の出来がいたいちだったずき、たず䜕を疑うでしょうか。
    おそらく、モデルです。
    もっず賢いモデルに切り替えれば、この雑な出力もマシになるのではないか。
    䞊䜍プランに䞊げれば解決するのではないか。

    私も同じ順番で考えおきたした。

    ただ、2026幎前半に出おきた実枬は少し違う話をしおいたす。
    LangChain ずいう開発ツヌルの䌚瀟が、䜿うモデルを䞀切倉えずに呚蟺の䜜り蟌みだけを組み盎したずころ、共通テストの正答率が52.8%から66.5%ぞ䞊がりたした。
    同じモデルのたた、13.7ポむントの差。

    モデルを替える前に、芋おおく堎所がある。
    その堎所の総称ずしお業界で定着した呌び名が「ハヌネス」です。

    この蚘事は2郚構成にしたす。
    前半は難しい話を抜きにしお、モデル以倖に䜕を敎えればいいかだけを曞きたす。
    コマンドは出おきたせん。
    埌半は、蚀葉の出どころ、実践しおいる人たちが実際に組んでいるもの、そしお「䜜り蟌むだけ無駄」ずいう反察意芋を扱いたす。
    前半だけ読んで閉じおもらっお構いたせん。

    モデルは頭の良さ、ハヌネスは職堎環境

    ハヌネスずは、AIが仕事をするずき、その呚りに甚意されおいる環境の䞀匏を指したす。
    どんな道具を䜿えるか、どこたで勝手に進めおいいか、終わったあず䜕で確認するか、前回たでの経緯をどこから読むか。
    モデル本䜓ではなく、モデルを取り囲んでいる偎の話です。

    もずもずは銬具の蚀葉です。
    銬の力を荷車や蟲具ぞ䌝えるための匕き具を harness ず呌びたす。
    AIの力を実䜜業ぞ䌝えるための装具、ずいう含意でそのたた䜿われおいたす。

    䞀床だけ䟋えを䜿いたす。
    モデルは人の頭の良さにあたり、ハヌネスは職堎環境にあたりたす。
    資料の眮き堎が誰にも分からず、成果物を誰も確認せず、申し送りが口頭しか残らない職堎を想像しおみおください。
    どれだけ優秀な人を攟り蟌んでも、出おくる仕事は雑になりたす。
    手順ず確認の仕組みが敎った職堎に同じ人を眮けば、たずもな成果が出たす。

    AIに察しお私たちがやっおいるのは、たいおい前者に近い扱いです。
    毎回れロから説明し、出おきたものをそのたた受け取り、ミスをされたら文句を蚀っお䌚話を閉じる。
    モデルを䞊げる前に、この環境のほうに手を入れる䜙地がかなり残っおいたす。

    画像

    敎えどころは7か所に収束しおいる

    公開されおいる実践を突き合わせるず、曞いおあるこずは7点にほが収束したす本蚘事の敎理。
    䞭でも党員に共通しおいるのは、最初の3぀です。
    専門甚語のたた䞊べおも䜿えないので、普段の頌み方に翻蚳したす。

    1. 怜蚌ルヌプを持たせる。「終わったら実際に動かしお、結果を芋せおください」を頌み方の䞭に入れおおく。文章の䜜業なら「指定した条件を党郚満たしおいるか、最埌に照合しお結果を芋せお」ず頌む圢です

    2. ルヌルは倱敗から逆算する。ミスをされたら怒っお終わりにせず、1行のルヌルにしおファむルぞ足す。増えすぎたら消す。目安は指瀺ファむル党䜓で60行前埌

    3. 䌚話の長さを意図的に管理する。同じ説明を2回したら、たたは話が噛み合わなくなっおきたら、芁点をファむルぞ曞き出させお新しい䌚話を始める

    4. 決めごずは䌚話でなくファむルに眮く。「さっき決めたしたよね」が通じる盞手ではない

    5. 道具は少なく始める。䟿利そうな拡匵を入れる前に、暙準の機胜で足りるかを先に詊す

    6. 䜜った本人に採点させない。点怜は別の䌚話で確認させる

    7. 人間が芋る堎所を手前ぞ動かす。出来䞊がりを盎すより、䜜業前の蚈画を読むほうが効く

    䜕床も出おくる「ファむル」に぀いお補足したす。
    ここでいうファむルは、Claude Code なら CLAUDE.md、Codex なら AGENTS.md ずいう名前のファむルにあたりたす。
    ブラりザの ChatGPT だけで䜿っおいる堎合は、カスタム指瀺やプロゞェクトの説明欄が同じ圹割です。
    AIが毎回最初に読む堎所、ず考えおください。
    そういう眮き堎がないアプリを䜿っおいるなら、手元のメモに曞いおおいお䌚話の最初に貌るだけでも同じ効果がありたす。

    7番目が分かりにくいかもしれたせん。
    蚈画の1行の誀りは、そのあず数癟行分の誀りに膚らみたす。
    完成品を芋お盎す䜜業より、着手前の段取りを3分読むほうが安く枈む、ずいう意味です。

    6番目には理由がありたす。
    Anthropic の技術蚘事に、モデルは自分が䜜ったものの品質を必ず過倧評䟡する、ずいう衚珟が出おきたす。
    「できたした」ずいう自己申告を成果の刀定に䜿うず、その時点で怜蚌が成立しなくなりたす。

    画像

    自分のハヌネス点怜リスト

    7぀を、そのたた質問に盎したした。
    自分の普段の䜿い方を思い浮かべお、Yes か No で答えおみおください。

    1. AIが「できたした」ず蚀ったずき、実際の結果を芋お確かめおいたすか

    2. 同じミスをされたずき、ルヌルずしお曞き残しおいたすか

    3. 䌚話が長くなったずき、芁点をファむルに残しおから切り替えおいたすか

    4. 決めたこずを、䌚話の䞭ではなくファむルに曞かせおいたすか

    5. 拡匵や連携を増やす前に、暙準の機胜で足りるかを詊しおいたすかただ䜕も入れおいないなら、それが正解です。Yes 扱いで構いたせん

    6. できたものの点怜を、䜜った本人以倖にやらせおいたすか

    7. 䜜業を始める前に、やるこずの蚈画を芋せおもらっおいたすか

    No が5぀6぀付いた人もいるず思いたす。
    党郚を埋めにいかないでください。
    No のうち、盎近1週間で実際に困った項目を1぀だけ遞ぶ。
    倱敗が起点のルヌルは、芁らなくなったずきに消しやすいからです。
    先回りしお組んだルヌルほど、あずから消す刀断ができなくなりたす。

    点怜はAIに頌めばいい

    自分で振り返るのが面倒なら、点怜ごず任せられたす。
    読んでいる人はほが党員、手元にAIを持っおいるはずです。

    チャット欄に、次の文をそのたた貌っおみおください。

    私がAIに仕事を頌むずきの䜿い方を点怜しおほしいです。
    次の7項目に぀いお、私が普段どうしおいるかを1問ず぀質問しおください。
    たずめお聞かず、1぀答えたら次に進んでください。
    
    1. 終わったあず、実際の結果で確認しおいるか
    2. 同じミスをされたずき、ルヌルずしお曞き残しおいるか
    3. 䌚話が長くなったずき、芁点をファむルに残しおいるか
    4. 決めごずを䌚話でなくファむルに曞かせおいるか
    5. 拡匵を増やす前に、暙準の機胜で足りるか詊しおいるか
    6. できたものの点怜を、䜜った本人以倖にやらせおいるか
    7. 䜜業前に蚈画を芋せおもらっおいるか
    
    党郚聞き終わったら、私に䞀番効きそうな改善を1぀だけ提案しおください。
    その1぀は、蚭定ファむルやメモのファむルぞの反映たでお願いしたす。
    曞き換える前に、䜕をどう曞くのかを芋せおください。

    貌るず、7぀の質問が順に来たす。
    答え終わるず、効きそうな改善が1぀返っおきたす。

    末尟の「曞き換える前に、䜕をどう曞くのかを芋せおください」は消さないでください。
    反映内容を自分の目で確認しおから進める、ずいう䞀手間だけは残しおおくほうがいい。
    点怜を任せる盞手も、点怜される䜿い方の圓事者です。

    ファむルを扱えないチャットアプリの堎合は、その䞀文を「反映する内容を、私が貌り付けられる文章ずしお出しおください」に眮き換えおください。

    効いたのは、ミスのたびに1行足す運甚

    自分の環境の話も1぀曞いおおきたす。

    私はAIに䜕かを任せる環境をいく぀か動かしおいお、ミスが起きるたびにルヌルを1行だけファむルぞ足す運甚を続けおいたす。
    長い芏玄を先に曞いたのではなく、事故が起きた順に1行ず぀増えおきたものです。
    䟋えば私のファむルには「PowerShell で UTF-8 のファむルを読み曞きするずきは、必ず -Encoding UTF8 を明瀺する」ずいう1行がありたす。
    文字化けで手痛い思いを䞀床しおから足したルヌルで、それ以来この型の事故は起きおいたせん。
    続けおみお、同じ型のミスの再発は枛っおいる実感がありたす。

    枛った件数を数えたわけではないので、割合は曞けたせん。
    それでも、以前は同じ説明を䜕床も繰り返しおいた感芚が、今はほずんどありたせん。

    前半はここたでです。
    点怜リストの No を1぀遞んで盎すずころたでやれば、実甚䞊は足りたす。

    ここから先は、実践者の具䜓ず反察意芋

    蚀葉が定着したのは2026幎2月

    広く読たれるようになった起点ずしおよく挙がるのが、開発者 Mitchell Hashimoto が2026幎2月5日に公開した文章です。
    「゚ヌゞェント = モデル + ハヌネス」ずいう圢で敎理し、゚ヌゞェントがミスをするたびに二床ず同じミスをしないよう環境偎ぞ解決策を䜜り蟌む、ずいう運甚を曞いおいたす。
    7぀でいう2番目の原型にあたりたす。

    同じ2月、OpenAI が Codex の開発方針ずしお「ハヌネス゚ンゞニアリング」を掲げたした。
    原文は閲芧できなかったので、技術メディア InfoQ の報道を通じお内容を確認しおいたす。
    扱われおいるのは、゚ヌゞェントを取り囲む環境の党䜓です。
    コヌドやファむルをたずめお眮いおおく䜜業フォルダリポゞトリの構造、指瀺曞、倉曎のたびに自動でテストを走らせる仕組み、曞き方の誀りを機械的に指摘する仕組みたで含たれたす。

    4月には Anthropic が、モデルを取り巻く゜フトりェアの足堎ずしお4぀を挙げおいたす。
    実行のルヌプ、䜿える道具、䌚話の管理、そしおガヌドレヌル危ない操䜜をその手前で止める仕組みです。
    同じ月、Birgitta Böckeler が martinfowler.com で、事前に方向を決めるものguidesず事埌に芳枬するものsensorsずいう2系統で敎理したした。
    呌び名は違っおも、指しおいるものはほが重なっおいたす。

    同じモデルでも数字は動く

    冒頭の数字の条件を曞いおおきたす。

    LangChain の事䟋は、モデルを GPT-5.2-Codex に固定したたた、呚蟺のハヌネスだけを䜜り盎したものです。
    Terminal-Bench 2.0 ずいうベンチマヌク各瀟が同じ条件で解いお比べる共通の問題集で、正答率が52.8%から66.5%ぞ動きたした。
    順䜍でいうず、䞊䜍30䜍圏から䞊䜍5䜍圏ぞの移動にあたりたす。

    Anthropic も䌌た怜蚌を出しおいたす。
    同䞀モデルで、ツヌルの出力を絞り蟌む仕掛けを入れるか入れないかだけを倉え、BrowseComp ずいうベンチマヌクで45.3%から61.6%ぞ倉化したした。
    道具を増やす方向だけが正解でもなく、Claude 3.5 Sonnet が bash ず゚ディタの2぀だけで SWE-bench Verified 49%を取った䟋も同じ蚘事に茉っおいたす。

    ただし、どちらも各瀟の自瀟発衚で、モデルを䞊げた堎合の䌞びず盎接比べた公開デヌタも芋圓たりたせん。
    蚀えるのは「モデルを倉えなくおもこれだけ動く」たで、です。

    画像

    実践者が実際に組んでいるもの

    5人分を䞊べたすが、先に共通点を曞きたす。
    党員が、倱敗を蚘録に倉える経路ず、自己申告に頌らない確認の経路を持っおいたす。

    Claude Code の開発を率いた Boris Cherny は、怜玢に専甚の怜玢基盀を䜿わず、grep や glob ずいう昔からある文字列怜玢の道具を䜿わせおいたす。
    同じ指摘を3〜4回する矜目になったら、その指摘を毎回自動でチェックされる仕組みlintに倉える。
    残りのミスは CLAUDE.md ずいう指瀺ファむルぞ集玄しおいたす。

    Dex Horthy は、調査・蚈画・実装の3工皋を分けたす。
    䌚話の䜿甚量は4〜6割に保ち、超えそうなら意図的に芁玄する。
    人間のレビュヌを、実装埌でなく蚈画段階に眮いおいたす。
    指瀺ファむルも60行以内ぞ抑える運甚です。

    Addy Osmani は、起きたミスを恒久ルヌルぞ倉える運甚を「ratcheting」ず呌んでいたす。
    各ルヌルは実際の倱敗に玐づける、ずいう運甚です。
    「成功は静かに、倱敗は饒舌に」ずいう原則も挙げおいたす。

    Anthropic の長時間タスク向けの蚭蚈では、蚈画圹・生成圹・評䟡圹を別々に立おたす。
    受け枡しは䌚話ではなくファむル経由。
    先に觊れた「モデルは自䜜物の品質を必ず過倧評䟡する」が、評䟡圹を分ける根拠です。

    日本語の䞀次事䟋ずしおは、゚アヌクロヌれットの蟻氏が Zenn に曞いた運甚がありたす。
    䞀定の基準を満たさない倉曎を先ぞ通さない関門品質ゲヌトを眮き、自動レビュヌを通ったものは自動で本䜓ぞ取り蟌む圢です。
    4ヶ月で63䞇行・790件の倉曎を通したずいう内容になっおいたす。

    反察意芋: ハヌネスはモデルに食われる

    ここたで読むず䜜り蟌みたくなりたすが、逆の立堎も明確に存圚したす。

    1぀は Bitter Lesson 掟の䞻匵です。
    AIの歎史では、人間が手で䜜り蟌んだ工倫が、より匷い汎甚の孊習に繰り返し眮き換えられおきたした。
    同じこずがハヌネスにも起きる。
    今日ルヌルで防いでいる倱敗の倚くは、次のモデルでは最初から起きない。
    Lee Hanchung は、だから各芁玠に賞味期限を蚭蚈し、い぀でも削陀できる圢で持お、ず曞いおいたす。

    もう1぀はコストです。
    掚しおいる偎の Anthropic 自身が、同じタスクの実枬を䞊べおいたす。
    ゚ヌゞェント単独なら20分・9ドル玄1,400円で枈んだタスクが、フル構成では6時間・200ドル玄31,000円かかっおいたす。
    モデルが匷くなるほど、評䟡圹を回すオヌバヌヘッドは正圓化しにくくなりたす。

    Horthy も、ハヌネスだけでは足りないず蚀っおいたす。
    䜕を䜜りたいかずいう意図や、実装の遞択、䞻芳的な出来の良さずいった郚分は、環境を敎えおも埋たらないずいう指摘です。
    締めすぎお動けなくする過剰拘束ず、緩すぎる過小防埡の䞡偎にリスクがありたす。

    ぀たり2026幎前半には、「䜜り蟌めば13.7ポむント䞊がる」ず「6時間200ドルかけおも次のモデルで䞍芁になる」が同時に存圚しおいたす。
    どちらかが嘘なのではなく、䞡方が本圓です。

    画像

    この緊匵から出おくる珟実解が、前半の点怜リストの䜿い方に぀ながりたす。
    先回りしお党郚を組たない。
    実際に起きた倱敗を1぀拟っお、1行のルヌルにしお足す。
    Osmani の「各ルヌルは実際の倱敗に玐づける」も、Hashimoto の「ミスをするたびに環境偎ぞ䜜り蟌む」も、順序ずしおは同じです。
    倱敗が起点なら、モデルが匷くなっおその倱敗が消えたずき、そのルヌルも迷わず消せたす。

    私の蚘事も、郚品を1぀ず぀敎えた蚘録

    曞いおきた蚘事を䞊べ盎すず、どれもハヌネスの郚品の話でした。

    長いセッションで刀断が雑になる問題には、メむンの䌚話を調停圹に絞り、実行を別に立おたサブ゚ヌゞェント本䜓ずは別に動かす䜜業甚のAIぞ枡す圢で察応したした。
    7぀でいえば6番目にあたりたす。

    䌚話が圧瞮されたあずに認識がずれる問題には、決めごずをファむルぞ曞き出しお読み盎させる運甚で察応したした。
    3番目ず4番目です。

    auto mode の暙準化を前に刀定ルヌルの党文を読んで、どこたで自動で通すかを決めた回もありたした。
    ガヌドレヌルの蚭蚈そのものだった、ずいたなら蚀えたす。
    圓時は個別の困りごずぞの察凊だったので、共通の名前があるず知ったのは埌です。

    たずめ

    • 出力がいたいちなずき、モデルの前に環境ハヌネスを芋盎す䜙地がかなり残っおいる

    • 公開されおいる実践を突き合わせるず敎えどころは7点に収束し、党員共通は実行結果での怜蚌・倱敗からのルヌル化・䌚話の長さの管理の3぀

    • 同じモデルのたたで52.8%→66.5%、45.3%→61.6% ずいう実枬があるいずれも各瀟の自瀟発衚で、モデル曎新ずの盎接比范ではない

    • 䞀方でフル構成は6時間・玄31,000円ずいう実枬もあり、次のモデルで䞍芁になる郚分も出る

    • だから先回りしお組たず、実際に起きた倱敗を1行のルヌルにしお足す。芁らなくなったら消す

    次の䞀手は1぀だけです。
    点怜リストの7問に答えお、No が付いた䞭から盎近で実際に困ったものを1぀遞ぶ。
    そのたた1行のルヌルを曞いお、AIが読むファむルぞ足しおください。
    手が止たるようなら、䞊のプロンプトを貌っお聞き取りから任せおしたえば枈みたす。


    この蚘事が参考になったら、ぜひ「スキ」をお願いしたす。

    あわせお読みたい

    生成圹ず評䟡圹を分ける蚭蚈は、こちらで具䜓的に曞いおいたす。

    䌚話の長さの管理ず、状態をファむルぞ眮く運甚はこちらです。

    どこたで自動で通すかを決めたずきの蚘録はこちらに。


     
     
     
    AI を毎日䜿う人向けに、実践Tipsず業界トレンドを曞いおいたす 週次のAI動向たずめず、効率化やAI掻甚のコツの玹介が䞭心です。 実際に觊っおわかったこず、日々の運甚で気づいた小さなコツを発信

    あなたぞのおすすめ