見出し画像

Jevをまだ使っていない私が、自社の判断24個を質問に分けた

Jevが、文章を生成せず選択や点数を返すAIとして話題になっています。技術系ニュースによると、TypeSafe AIは9月15日にJevの早期提供を始めました。ただ、私はまだJevを使っておらず、ウェイトリストにも登録していません。精度や速さ、日本語での判定も測っていません。

代わりに、自社でAIに仕事を任せる決裁ルールと記事の審査ルールを、Jevの質問の型に当てはめました。数えたのは、実際の記事で判定を繰り返した回数ではありません。ルールに書かれている、1回の判定あたりの判断です。

決める部分は質問にできます。具体的にどう直すかを伝える文章は、その外側に残ります。この境目は、Jevを利用できるようになる前でも整理できます。

Jevが返すのは3つの型の答えだけ

公式ドキュメントによると、Jevへの質問は3つの型に限られます。Choiceは用意した選択肢から1つを選び、Scoreは用意した段階で点数を付けます。Noul(はい・いいえ型)は、はいである確率を0〜1で返します。

ChoiceとScoreの答えには、各選択肢の確率と、確信度を示す0〜1の数が付きます。Jevは、渡された選択肢や段階の中から答えを返す仕組みです。説明や修正案を自由な文章で生成する役割は持ちません。

公式ドキュメントは、質問を細かく分け、1問では詳しい人が一瞬で下せる判断を1つだけ聞くよう勧めています。「このピッチを評価して」のような広い質問は、市場規模、技術的な実現性、差別化などに分け、重み付けはコードで行うという考え方です。

公式の使い方が、うちの決裁ルールと同じ形だった

似ているのは、自動で進める範囲と人が見る範囲を、先に決めるところです。公式ドキュメントは、確信度を高・中・低の3つに分け、高い場合は自動で実行し、中くらいなら確認して進め、低い場合は実行せず人に回す使い方を勧めています。間違えた際の影響が大きい操作ほど、基準を高くするとも説明しています。

私の会社でも9月18日から、AIに任せる仕事をAUTO・私が決める仕事・BLOCKEDの3区分にしています。AUTOはAIが確認を求めず実行して報告する仕事です。BLOCKEDは安全装置や私の手作業で止まる仕事を指します。

一方、判断に使う材料には違いがあります。私のルールは操作の影響だけを見ており、AIが答えにどれほど自信を持っているかは基準に入れていません。

決裁ルールには「Claude が不安」は GATE の理由にならないと書きました。GATEは私が決める仕事、Claudeは仕事を任せているAIのことです。漠然とした不安による確認を減らすために、この一文を入れました。

ルールに書いた判断を数えたら24個あった

AIに仕事を任せる決裁ルールと記事の審査ルールの2つを合わせると、10+6+8=24個の判断が書かれています。内訳は次の通りです。

  • 決裁で確認する、はい・いいえの質問:10問

  • 記事を事実・根拠・分析・読者価値・差別化・目的別の質で採点する項目:6項目。各項目を1〜10点と合否で評価

  • 本文に残っていないか確認するAIらしさのサイン:8種

無料記事の公開は、最初からAIが確認を求めず実行できる仕事に入っています。そのため、記事を出すたびに決裁の10問を通しているわけではありません。

公式の「1問で1つの判断」という基準で分け直すと、私の分類では、そのまま1問で聞けるものが16個、さらに分ける必要があるものが8個でした。

  • そのまま聞ける16個:決裁の7問(取り返しがつかないか・費用・法的な約束・価格・お客さんへの重大な約束・秘密情報や権限・元に戻せないか)、note の場合の目的別の質を確かめる1項目、AIらしさの8種

  • 分けて聞く8個:複数の条件を含む決裁の3問(私にしか決められないか・既存ルールから導けないか・自動チェックで解けないか)と、評価範囲が広い審査の5項目

本文の数字が出典の台帳にあるかという照合は、Pythonのスクリプトが機械的に判定しています。ここは通常のコードで足ります。

渡せないのは「どう直すか」の文章

点数や合否だけでは、修正作業を進められない場合があります。私の会社の審査役は、不合格の際に、問題の内容、本文中の場所、合格に向けた直し方を文章で返す決まりです。

9月18日に作ったX投稿1本は、1回目の審査で「目的別の質」が6点となり、不合格でした。直し方の指示に沿って書き直した版は2回目の審査で合格し、6項目の平均は8.0でした。

修正に使ったのは、比較相手が見えないこと、相手の数字を並べて小さい側だと伝えること、字数の上限を守ることを示した文章です。

この指示を分けると、「比べる相手の数字が本文にあるか」は、はい・いいえで聞けます。どの数字を並べるか、何を入れないか、あと何字足せるかは文章で返す必要があります。

まだ分からないこと

そのまま1問で聞ける16個についても、Jevが日本語の記事や私の決裁ルールを現在のAIと同じ程度に判定できるかは分かりません。私は測っていません。

置き換えを試す場合、最初の候補はそのまま聞ける決裁の7問だと考えています。同じ質問を繰り返し使え、答えがはい・いいえに限られ、誤った場合に私へ回す仕組みがすでにあるからです。これは実測に基づく結論ではなく、検証前の候補です。

公式ドキュメントによると、Noulには確信度の数が別に付きません。はい・いいえで聞く場合、確率が0.5に近いかどうかで迷いを読むことになります。選択肢の型に書き換え、確信度を使う方法も考えられます。どちらが決裁に合うかは検証が必要です。

Jevが無くても今日できること

Jevを待たずに進められる手順は3つあります。紙に書いても、普段使っているAIとの会話で整理しても構いません。

  1. ふだんAIに頼んでいる判断を書き出す

  2. 各判断に、はい・いいえ、選択、点数のどれで答えられるかを付ける

  3. その型に収まらず、文章で返してほしい内容を分けて残す

最初の質問が「この記事を公開してよいか」なら、範囲が広すぎます。まず「本文の数字はすべて出典の台帳にあるか」のように、1つの性質だけを聞く形へ書き直します。

Jev研究室のほかの記事

いいなと思ったら応援しよう!