Jevをまだ使っていない私が、自社の判断24個を質問に分けた
Jevが、文章を生成せず選択や点数を返すAIとして話題になっています。技術系ニュースによると、TypeSafe AIは9月15日にJevの早期提供を始めました。ただ、私はまだJevを使っておらず、ウェイトリストにも登録していません。精度や速さ、日本語での判定も測っていません。
代わりに、自社でAIに仕事を任せる決裁ルールと記事の審査ルールを、Jevの質問の型に当てはめました。数えたのは、実際の記事で判定を繰り返した回数ではありません。ルールに書かれている、1回の判定あたりの判断です。
決める部分は質問にできます。具体的にどう直すかを伝える文章は、その外側に残ります。この境目は、Jevを利用できるようになる前でも整理できます。
Jevが返すのは3つの型の答えだけ
公式ドキュメントによると、Jevへの質問は3つの型に限られます。Choiceは用意した選択肢から1つを選び、Scoreは用意した段階で点数を付けます。Noul(はい・いいえ型)は、はいである確率を0〜1で返します。
ChoiceとScoreの答えには、各選択肢の確率と、確信度を示す0〜1の数が付きます。Jevは、渡された選択肢や段階の中から答えを返す仕組みです。説明や修正案を自由な文章で生成する役割は持ちません。
公式ドキュメントは、質問を細かく分け、1問では詳しい人が一瞬で下せる判断を1つだけ聞くよう勧めています。「このピッチを評価して」のような広い質問は、市場規模、技術的な実現性、差別化などに分け、重み付けはコードで行うという考え方です。
公式の使い方が、うちの決裁ルールと同じ形だった
似ているのは、自動で進める範囲と人が見る範囲を、先に決めるところです。公式ドキュメントは、確信度を高・中・低の3つに分け、高い場合は自動で実行し、中くらいなら確認して進め、低い場合は実行せず人に回す使い方を勧めています。間違えた際の影響が大きい操作ほど、基準を高くするとも説明しています。
私の会社でも9月18日から、AIに任せる仕事をAUTO・私が決める仕事・BLOCKEDの3区分にしています。AUTOはAIが確認を求めず実行して報告する仕事です。BLOCKEDは安全装置や私の手作業で止まる仕事を指します。
一方、判断に使う材料には違いがあります。私のルールは操作の影響だけを見ており、AIが答えにどれほど自信を持っているかは基準に入れていません。
決裁ルールには「Claude が不安」は GATE の理由にならないと書きました。GATEは私が決める仕事、Claudeは仕事を任せているAIのことです。漠然とした不安による確認を減らすために、この一文を入れました。
ルールに書いた判断を数えたら24個あった
AIに仕事を任せる決裁ルールと記事の審査ルールの2つを合わせると、10+6+8=24個の判断が書かれています。内訳は次の通りです。
決裁で確認する、はい・いいえの質問:10問
記事を事実・根拠・分析・読者価値・差別化・目的別の質で採点する項目:6項目。各項目を1〜10点と合否で評価
本文に残っていないか確認するAIらしさのサイン:8種
無料記事の公開は、最初からAIが確認を求めず実行できる仕事に入っています。そのため、記事を出すたびに決裁の10問を通しているわけではありません。
公式の「1問で1つの判断」という基準で分け直すと、私の分類では、そのまま1問で聞けるものが16個、さらに分ける必要があるものが8個でした。
そのまま聞ける16個:決裁の7問(取り返しがつかないか・費用・法的な約束・価格・お客さんへの重大な約束・秘密情報や権限・元に戻せないか)、note の場合の目的別の質を確かめる1項目、AIらしさの8種
分けて聞く8個:複数の条件を含む決裁の3問(私にしか決められないか・既存ルールから導けないか・自動チェックで解けないか)と、評価範囲が広い審査の5項目
本文の数字が出典の台帳にあるかという照合は、Pythonのスクリプトが機械的に判定しています。ここは通常のコードで足ります。
渡せないのは「どう直すか」の文章
点数や合否だけでは、修正作業を進められない場合があります。私の会社の審査役は、不合格の際に、問題の内容、本文中の場所、合格に向けた直し方を文章で返す決まりです。
9月18日に作ったX投稿1本は、1回目の審査で「目的別の質」が6点となり、不合格でした。直し方の指示に沿って書き直した版は2回目の審査で合格し、6項目の平均は8.0でした。
修正に使ったのは、比較相手が見えないこと、相手の数字を並べて小さい側だと伝えること、字数の上限を守ることを示した文章です。
この指示を分けると、「比べる相手の数字が本文にあるか」は、はい・いいえで聞けます。どの数字を並べるか、何を入れないか、あと何字足せるかは文章で返す必要があります。
まだ分からないこと
そのまま1問で聞ける16個についても、Jevが日本語の記事や私の決裁ルールを現在のAIと同じ程度に判定できるかは分かりません。私は測っていません。
置き換えを試す場合、最初の候補はそのまま聞ける決裁の7問だと考えています。同じ質問を繰り返し使え、答えがはい・いいえに限られ、誤った場合に私へ回す仕組みがすでにあるからです。これは実測に基づく結論ではなく、検証前の候補です。
公式ドキュメントによると、Noulには確信度の数が別に付きません。はい・いいえで聞く場合、確率が0.5に近いかどうかで迷いを読むことになります。選択肢の型に書き換え、確信度を使う方法も考えられます。どちらが決裁に合うかは検証が必要です。
Jevが無くても今日できること
Jevを待たずに進められる手順は3つあります。紙に書いても、普段使っているAIとの会話で整理しても構いません。
ふだんAIに頼んでいる判断を書き出す
各判断に、はい・いいえ、選択、点数のどれで答えられるかを付ける
その型に収まらず、文章で返してほしい内容を分けて残す
最初の質問が「この記事を公開してよいか」なら、範囲が広すぎます。まず「本文の数字はすべて出典の台帳にあるか」のように、1つの性質だけを聞く形へ書き直します。
Jev研究室のほかの記事
