メインコンテンツへスキップ

AIエージェントは「何をしたか」だけでなく、「その判断は今も有効か」を管理する時代へ

    <2026年7月22日以前のコンテンツ一覧はこちら>

    <始まりはLangfuseの記事からでした。その後議論が進み以前議論したものを拡張するということで作成してもらいました。トレースを拡大するということですな。>

    <案内文>

    この考察の出発点は、とても素朴な疑問でした。

    AIエージェントが仕事をするようになったとき、私たちは何を記録すればよいのだろうか。

    これまでの生成AIなら、入力した文章と返ってきた回答を保存しておけば、ある程度は何が起きたのかを追えました。しかしAIエージェントになると事情が変わります。検索し、資料を読み、別の資料と比較し、ツールを呼び出し、失敗すればやり直し、ときには別のエージェントへ仕事を渡し、人間へ承認を求めます。

    そこで最初に考えたのが、最終回答だけを見るのではなく、途中の行動そのものを見ることでした。

    検索、読込み、比較、計算、ツール実行といった一つ一つの行動をActivityとして記録し、その並びや依存関係をTrajectoryとして見る。すると、単なるログの集まりから、「これは契約内容を確認する仕事だった」「複数の情報源を照合していた」「失敗から復旧しようとしていた」といった、仕事としてのMeaningが見えてきます。

    Langfuseのような観測基盤について考えていたとき、この方向はかなり現実的だと感じました。AIの内部思考をすべて覗こうとしなくても、外から観測できる行動を丁寧に記録すれば、かなり多くのことが分かるからです。

    ただ、ここで次の問題が出てきました。

    あるAIエージェントが作った成果物について、「意味は確認済み」「証拠もある」「検証済み」「人間も承認済み」と記録されていたとします。

    そのあとAIエージェントが成果物を書き換えたら、以前の確認結果はそのまま使ってよいのでしょうか。

    ここが今回の考察で大きく方向が変わったところでした。

    重要なのは、MeaningやEvidence、Verification、Approvalを、成果物に永久に貼り付くラベルとして扱わないことです。

    「この意味は、どの状態について確認されたのか」

    「この証拠は、現在の状態をまだ支えているのか」

    「この検証結果は、変更後にも有効なのか」

    「この承認は、どの成果物を承認したものなのか」

    こう考えると、Stable Identity、Version、State、Observation Contextという考え方が必要になります。

    たとえばCandidate Nを人間が承認したあと、AIがCandidate N+1を作ったなら、Nへの承認を自動的にN+1へ移してはいけません。一方で、説明文を一文字直しただけなのに、すべての検証を最初からやり直すのも非効率です。

    そこで必要になるのが、変更の影響範囲を見つけることです。

    変更された部分がどこへ影響するのかを追い、影響しないものはCarry-forward、少し不確かなものはReconfirm、明らかに条件が変わったものはInvalidateする。

    この考え方は、AIエージェントだけの特殊な発想ではありませんでした。

    世界の類似事例を調べていくと、GitHubやGitLab、Gerritなどのコードレビューでは、変更後に承認を失効させたり、条件付きで引き継いだりする仕組みがあります。Kubernetesには、どの状態を観測して現在のConditionが成立しているのかを結び付ける考え方があります。Gradle、Bazel、Nxなどでは、変更によって影響を受けた部分だけを再計算・再実行します。SLSAやin-totoなどでは、成果物がどこから生成されたのかをEvidenceとして残します。

    つまり、必要な部品はすでに世界のさまざまな技術分野に存在していました。

    今回75の類似事例を調べて見えてきたのは、新しい巨大システムをゼロから発明する必要はない、ということです。

    必要なのは、それぞれ別々に発展してきた仕組みを、AIエージェントの仕事の流れに沿って接続することです。

    Activityを観測する。

    Trajectoryから仕事のMeaning候補を理解する。

    Evidenceを確認する。

    VerificationやApprovalを、その時点のStateへ結び付ける。

    変更が起きたらImpactを調べる。

    そして、影響した部分だけを再確認する。

    ここまでできれば、AIエージェントは「勝手に仕事をする便利なソフト」から、「なぜその仕事をし、何を根拠にし、どの判断が現在も有効なのかを説明できる業務主体」へ近づきます。

    未来の企業システムで重要になるのは、AIがどれだけ賢いかだけではないと思います。

    むしろ、

    そのAIの判断を、いつまで信じてよいのか。

    という問いです。

    AIエージェントが増えるほど、昨日正しかった判断が今日も正しいとは限りません。モデルが変わる。ツールが変わる。データが更新される。社内ルールが変わる。法律や契約条件が変わる。

    だから未来のAI基盤には、「答えを作る能力」だけでなく、答えや証拠や承認の有効範囲を管理し、変化したところだけを安全に再確認する能力が必要になります。

    AIエージェントの本当の基盤競争は、モデルの性能競争のその先で、すでに始まりつつあるのかもしれません。

    あなたへのおすすめ