見出し画像

【AIのメール仕分けが遅い人に効く】ライバルが38秒かかる30通を0.8秒で。判断専用AI「Jev」が速すぎて笑った

こんにちは、れん学長です。

ChatGPTやClaudeにメールを仕分けさせると、けっこう時間がかかる……ということ、ありませんか?

私のAI秘書も、毎時、賢いAIに届いたメールを全部読ませていたんですが、そのうち案件は4%ほどしかありませんでした。

そこで、過去のメール300通を、判断専用のAI「Jev」に仕分けさせてみました。

すると、出たばかりの GPT-6 Luna が38秒かかる30通を、Jev はたった0.8秒で仕分けてしまったんです。正直、笑ってしまいました。

最後にたどり着いたのは、Jev を門番にして、迷ったメールと案件だけを Claude Opus 5.5 に回す形です。この門番を置けば、メールが山のように届いても、賢いAIが判定し直すのは迷った分だけで済みます。

この記事では、次の4つをお伝えします。

  • 300通を仕分けたときの速さと正しさを、実測の数字で紹介します。

  • 安くて優秀な GPT-6 Luna もいる中で、見張り役に Jev を選んだ理由をお話しします。

  • Jev と Claude Opus 5.5 の組み合わせと、9月24日から始めた実際の運用への切り替えを紹介します。

  • 1日300通届く人の場合に、月の費用と判定の時間がどう変わるかを試算します。

1日に100通、300通とメールが届く方ほど、読み終わる頃には「受信箱の前に門番を置くと何が変わるか」を、数字でイメージできるはずです。

同じ内容を動画でも話しています。仕分けの実演は、画面で見るほうが速さが伝わると思います。

https://youtu.be/oc_RPxrq8Kc


Jev は、文章を書かずに確率で答えるAIです

Jev は、TypeSafe AI という会社が出している判断専用のモデルです。ChatGPT や Claude のように文章を書くのではなく、こちらが決めた問いに確率をつけて答えるだけなんですね。

  • 聞けること:「どれ?」「何点?」「はい、いいえ?」の問いに、確率つきで答えます。今回は「このメールは案件の依頼か」を0〜1の確率で答えてもらいました。

  • 値段:読み込ませる分が100万トークンあたり0.042ドルで、答えの出力は無料です。今回の300通は全部で約0.03ドルで、収録では思わず「べらぼうに安い」と言ってしまうほどでした。

  • 速さ:私の環境では1通あたり約0.5秒でした。まとめて送れるので、300通でも数秒で終わります。

  • 弱点:公式は、日本語は精度が落ちると書いています。今回の300通は、7割が日本語です。

ちなみに、トークンはAIが文章を読むときに数える単位で、今回のメールは1通あたり約2,200トークンでした。

私の狙いは、案件かどうかのふるい分けという安い部分を Jev に任せて、返信の下書きを書く高い部分だけを賢いAIに残すことです。

Jev の正体と使いどころは、9月20日に公開した記事で詳しく紹介しています。

https://note.com/renkon40/n/n00cca78e275e

私のAI秘書は、毎時すべてのメールを GPT-6 Astra に読ませていました

これまでは、AI秘書が1時間ごとに OpenAI の Codex で GPT-6 Astra を起動して、届いたメールを全部読んでいました。

冒頭で触れた「案件は4%ほど」は、4か月半で届いた1,775通で数えた数字です。賢いAIの時間のほとんどが、案件ではないメールを読むことに使われていたんですね。

で、メールが増えるほど、時間も費用も増えていきます。

そこで今回の課題は、AI秘書の「案件メールの見張り」を Jev に任せられるか、です。その1,775通から300通を選んで試しました。

  • 中身は、案件73通、案件ではないメール226通、進行中の案件の事務連絡1通です。

  • 正解は、当時のAI秘書の判定と、そのあと実際にどう扱ったかで決めました。

  • 迷いや食い違いがあった21通は、私が目で見て決めています。

試した条件です。effort は、AIにどれだけ考えさせるかを決める設定です。

  • 時期は、2026年9月21日〜24日です。

  • Jev は、TypeSafe AI の jev-1.13.0 を、プログラムから直接呼び出しました。

  • GPT-6 Luna は、Codex から effort を high にして、8本同時に動かしました。

  • Claude Opus 5.5 は、Claude Code から effort を high にして、4本同時に動かしました。

  • Claude Fable 5.1 と GPT-6 Astra は、50通だけの比較に使いました。どちらも50通では全問正解でした。Claude Fable 5.1 は、30通の競走にも入れています。

確率を見て「案件」「迷い」「案件ではない」の3つの箱に分けます

確率の範囲ごとに、3つの箱とその後の扱いをまとめた図です。

仕分けのしかたは、シンプルです。Jev が返した確率で、3つの箱に分けます。

  • 案件の箱は、確率0.85以上です。返信の下書きに進みます。

  • 迷いの箱は、確率0.10〜0.85です。AIが迷ったと正直に言ったメールなので、人か賢いAIが見直します。

  • 案件ではない箱は、確率0.10以下です。そのまま流します。

箱とは別に、確率0.5を境にした「案件か、案件ではないか」の答えも出しています。一致率や誤警報、拾えた案件の数は、こちらで数えています。

ポイントは、全部をAIに決めさせないことなんです。迷ったら迷ったと言ってもらって、その分だけ見直せばいいんですよね。

いちばん怖いのは、案件ではない箱に本物の案件が混ざることです。これが「取りこぼし」になるので、この記事ではここを重点的に見ていきます。

300通は約3秒で終わり、案件73通は1通も落としませんでした

受信箱のメールが Jev に飛んで、3つの箱に入っていく実演の画面です。右の列に、送り方ごとの時間が並んでいます。

まずは速さです。同じ300通を、同時に送る数を変えて流してみました。

  • 1通ずつ送ると、約160秒かかりました。1通あたりは約0.5秒です。

  • 10通ずつ同時に送ると、約17秒に縮みました。50通同時なら、5秒ほどです。

  • 100通同時だと3.3秒、300通いっぺんだと3.6秒で終わりました。

  • どの送り方でも、案件かどうかの答えは同じでした。

10通同時にした時点で、画面の中の仕分けがパパパッと進んで、1通ずつのときとは別物の速さでした。逆に、300通いっぺんは100通同時より少しだけ遅かったので、私は100通ずつ送る形に落ち着きました。

左の大きな数字が、いちばん大事な「自信を持って間違えたメール」の数で、右の棒グラフが Jev の答えた確率の分布です。下の段の3つは、左から昔の判定との一致率、拾えた案件の数、迷いの箱に入った数です。

で、肝心の正しさです。

Jev が自信を持って言い切ったメールに、間違いは1通もありませんでした。

確率0.85以上で「案件」、0.10以下で「案件ではない」と答えたメールは、全部合っていました。間違えそうなメールは、ちゃんと「迷い」の箱に入れてくれていたんです。

この0通があるから、人や賢いAIは迷いの箱だけを見直せば済みます。ここは、すごく良かった点です。

確率の分布を見ると、その理由が分かります。

  • Jev の答えは、0に近いか1に近いかの両端に集まっていました。0.10以下の「案件ではない」に210通、0.85以上の「案件」に73通です。

  • 真ん中はほとんど空っぽで、0.45〜0.65には1通もありませんでした。

  • 迷ったのは、黄色の「迷い」の帯に入った17通だけです。しかも、その17通は全部が案件ではないメールでした。

昔の判定、つまりこれまでのAI秘書の判定との一致は98%で、300通中294通が同じ答えでした。食い違った6通は、1通を除いて迷いの箱に入っていました。

案件ではないのに Jev が0.5を超えて読んだ4通は、同じアフィリエイト会社の一斉配信でした。0.69〜0.78と迷いながらの答えで、4通とも迷いの箱に入れていました。

公式が日本語は精度が落ちると書いていた割に、7割が日本語のこの300通では、かなり優秀だったんです。

出たばかりの GPT-6 Luna と、同じメールで比べました

ここで、ライバルの登場です。

OpenAI が9月23日(日本時間)に出した GPT-6 Luna は、安くて速い小型のモデルです。値段は、読み込ませる分が100万トークンあたり0.10ドル、答えの出力が0.50ドルです。

GPT-6 Sol と GPT-6 Luna を7分野で試した前回の動画では、メールの判定で、正解を決めてあった49通を GPT-6 Luna もすべて当てていました。

https://youtube.com/watch?v=XQEUm38f6EY

だったら、Jev じゃなくて GPT-6 Luna でいいのでは?と思いますよね。そこで、同じ300通と同じ問いで比べてみました。

左から Jev、GPT-6 Luna、Claude Fable 5.1 のレーンです。上の大きな数字が、30通を仕分け終わるまでの秒数です。

まずは、実際に測った応答時間をもとに、同じ30通を3つのAIに同時に流したときの様子を再生して比べました。

  • Jev は、0.8秒で終わりました。費用は0.003ドルです。

  • GPT-6 Luna は、37.8秒かかりました。Jev の約46倍です。

  • Claude Fable 5.1 は、40.9秒かかりました。費用は Jev の約250倍です。

30通の答えは、3つとも同じでした。正しさは同じで、速さだけが桁違いだったんですね。

ほかの2つの40分の1以下で終わる Jev の速さは、素晴らしかったです。

ただ、公平のために書いておくと、GPT-6 Luna と Claude Fable 5.1 の時間には、Codex や Claude Code を起動する時間も含まれています。Jev は、プログラムから直接呼び出した時間だけです。

同時に送った数も、Jev は30通いっぺん、GPT-6 Luna は8本、Claude Fable 5.1 は4本と違います。

300通で比べると、誤警報が少ないのは GPT-6 Luna、案件を落とさないのは Jev でした

「Jev が上」「Luna が上」「互角」の3つに分けた図です。下の一文が、決め手になったところです。

次は、300通での比較です。GPT-6 Luna は、effort を high にして3回流しました。

GPT-6 Luna が上だったのは、この2つです。

  • 案件ではないメールを案件と言ってしまう誤警報は、0通でした。Jev は4通です。

  • 迷いの箱に入った数は、2〜4通でした。Jev は17通です。

互角だったのは、この2つです。

  • 昔の判定との一致は、どちらも約98%でした。

  • 300通の費用は、問いだけを送った場合でどちらも数円でした。GPT-6 Luna のほうは推定です。

Jev が上だったのは、この2つです。

  • 案件を自信を持って捨てた数は、0通でした。GPT-6 Luna は、1回あたり0〜1通ありました。

  • 1通あたりの時間は、0.5秒でした。GPT-6 Luna は、Codex の起動込みで6.2秒です。

で、決め手になったのはこれです。

誤警報や迷いは、あとで Claude Opus 5.5 が見直せば消せます。でも、捨てた案件は誰も見直せません。

捨てた案件が実は本物だったら、そのメールには返信できなくなってしまうんです。

GPT-6 Luna は3回とも、案件73通のうち2〜3通を、0.5を下回る側に置きました。多くは迷いの箱に残りましたが、1回あたり0〜1通は、自信を持って捨てていたんです。

落とした案件は、どの回も同じ3通の中からでした。クリエイター向けの案件プラットフォームからの招待2通と、条件のはっきりしないコラボの相談1通です。

私が中身を見直しても、3通とも案件でした。

effort を上げても、GPT-6 Luna は境目の案件を拾えませんでした

境目の案件3通について、GPT-6 Luna と Jev が出した確率を1本の目盛りに置いた図です。0.5より右なら、案件と判定したことになります。

じゃあ、GPT-6 Luna にもっと考えさせれば拾えるのか。effort を xhigh と max に上げても試しました。

  • どの effort でも、境目の案件3通は、ほとんどが0.5より左の「案件ではない」側に置かれました。

  • 条件のはっきりしないコラボの相談は、high で0.18、xhigh で0.28、max で0.12でした。どの effort でも迷いの箱に入ったままで、案件の箱には届きませんでした。

  • 6月に届いた招待メールは、high の3回で0.08〜0.18、xhigh で0.08、max で0.18でした。0.08の回は、自信を持って捨てたことになります。

  • 7月に届いた招待メールは、同じ high でも1回目は0.82、3回目は0.04と、回ごとに大きく揺れました。

  • Jev は、この3通を0.86〜0.91で案件と判定しています。

考える量を増やしても、境目のメールは拾えなかったんですね。

落としたのは、製品も報酬もまだ書かれていない登録の案内や、条件のはっきりしないコラボの相談でした。こういうメールを案件に含めるかは、考える量より、何を案件と呼ぶかという決め方で決まるんだと思います。

Jev は12回流しても、案件かどうかの答えが1通も変わりませんでした

Jev の12回と GPT-6 Luna の3回を比べた図です。大きな数字が、流し直して答えや箱が変わったメールの数です。

もう1つ大事なのが、何度流しても同じ答えが返ってくるかです。

  • Jev は、同じ300通を3日間で12回流しました。送る数を1通ずつから300通同時まで変えた回も含みます。

  • 12回とも、案件かどうかの答えが変わったメールは0通でした。確率の動きは、最大でも0.08です。

  • 箱が変わったのは、0.10や0.85の線のちょうど上にいた3通だけでした。うち1通は前の節の6月の招待メールで、0.84〜0.88の間で案件の箱と迷いの箱を行き来しましたが、案件ではない箱に落ちたことはありません。

  • GPT-6 Luna は、同じ設定で3回流すだけで、回ごとに2〜5通の箱が変わりました。

GPT-6 Luna では、同じ招待メールが、ある回は案件になり、別の回は自信を持って捨てられていました。

見張り役としては、毎回同じ答えを返してくれるほうが安心ですよね。この確率が動かないところは、Jev を信頼できると感じた点です。

たどり着いたのは、Jev で振り分けて、迷ったものと案件を Claude Opus 5.5 に回す形です

ここまでを踏まえて、たどり着いた組み合わせです。Jev を門番にして全部を数秒で仕分け、箱ごとに行き先を変えます。

  • 案件の箱は、今回73通でした。ここに入ったメールは、Claude Opus 5.5 が返信の下書きを書く形にします。Claude Opus 5.5 が「案件ではなさそう」と読んでも捨てずに、メモを付けて私に回します。Claude Opus 5.5 は、境目の招待を0.40〜0.45と低めに読んだことがあるためです。

  • 迷いの箱の17通は、Claude Opus 5.5 が判定し直します。実際に17通を渡すと、すべて正しく判定できました。4本同時に動かして、かかったのは約27秒です。

  • 案件ではない箱の210通は、そのまま流します。今回、ここに案件は1通も入りませんでした。

返信を書くのは、どうせ賢いAIです。なので、迷ったメールの判定もそこにまとめて任せるのが、いちばんシンプルなんですよね。

この形なら、費用を抑えたまま速さも出せると思っています。

返信役を Claude Opus 5.5 にしたのは、企業への返信文が自然だからです。候補に考えた GPT-6 Sol は安いんですが、私が読むと文章が硬くて、企業の案件メールには向きにくいと感じました。

Jev と Claude Opus 5.5 の間に GPT-6 Luna は挟みません

「間に安い GPT-6 Luna を挟めば、もっと安くなるのでは?」とも考えました。でも、これはおすすめしません。

理由は3つです。

  • いちばん難しいメールを、境目に弱いモデルに任せることになります。迷いの箱には境目のメールが集まりますが、GPT-6 Luna は300通を単独で流したときに、まさにその境目の案件を自信を持って捨てることがありました。

  • 節約できる額が小さいです。1日300通届く人でも、減るのは月7ドル前後です。

  • 速くもなりません。GPT-6 Luna は Codex 経由だと1通6秒台で、Claude Opus 5.5 の1通約5秒より遅いです。どちらも起動の時間込みです。

実際、Jev を流し直した回には、12回流した節で触れた6月の招待メールが0.84で迷いの箱に入ったことがあります。GPT-6 Luna は、300通を単独で流したときに、このメールを0.08で捨てた回がありました。

間に挟むと、箱に入った案件が捨てられる危険は実際にあると私は見ています。

一方、GPT-6 Luna が落とした境目の案件3通を Claude Opus 5.5 に読ませると、確率は0.40〜0.80で、0.10以下で捨てることはありませんでした。ただ、3通のうち2通は0.5を下回り、6月の招待メールは0.40でした。

迷いの箱に本物の案件が入ったときに Claude Opus 5.5 が拾えるかは、試験運用で見ていきます。

9月24日から、AI秘書の見張りを「Jev + Claude Opus 5.5」で試験運用しています

毎時の見張りの流れを、左から4段階で示した図です。

で、実際に私のAI秘書の運用も切り替えました。9月24日の夜から10月1日まで、1週間の試験運用です。

  • 毎時13分に、Mac の中の自動実行の仕組みが動いて、新しいメールを集めます。

  • Jev が仕分けて、自信を持って「案件ではない」と言えるものは、ここで片付けます。

  • 迷ったメールや案件が残った回だけ、Claude Code で Claude Opus 5.5 を起動します。

  • Claude Opus 5.5 が、返信の下書きと私宛ての報告まで作ります。送信は私がします。

読む役は、これまでの Codex の GPT-6 Astra から、Claude Opus 5.5 に移しました。

Claude Opus 5.5 は、何もせずに1回起動するだけでも、定価で換算すると約0.4ドルかかりました。なので、読むべきメールが残った回だけ起動する形にしています。

切り替え直後の試運転では新着メールが0通で、Claude Opus 5.5 の出番はありませんでした。実際のメールでどう動いたかは、1週間の結果とあわせて報告します。

1週間で見るのは、この3つです。

  • 案件の取りこぼしがないかを確かめます。

  • Claude Opus 5.5 が何回起動したかを数えます。

  • 返信の下書きがそのまま使えるかを見ます。

結果がよければ、この形で本番の運用にするつもりです。

メールが1日300通届く人なら、月100〜270ドルほどの判定が月8ドル前後になる計算です

方式ごとに、1回の判定時間、月の費用、今回の取りこぼしを並べた試算です。いちばん上の行が、おすすめの組み合わせです。

ここからは、メールが多い方向けの話です。

正直に言うと、私のように1日10〜13通なら、差はあまり大きくありません。プログラムから直接呼び出すときの定価で計算しても、Claude Opus 5.5 だけで全部読んで月4〜5ドル、Jev を前に置けば月数十セントです。

サブスクリプションで回すなら、どちらも定額の範囲に収まります。Jev が効いてくるのは、メールが多い人なんです。

そこで、1日300通届いて、案件が4%、迷いが約20通という条件で、30日分を試算しました。

  • Jev で振り分けて、迷ったものの判定だけを Claude Opus 5.5 に回すと、月約8ドルです。1日分の300通をまとめて判定すると、約32秒で終わります。

  • Claude Opus 5.5 だけで全部読むと、月約110ドルかかります。

  • Claude Fable 5.1 だけだと月約270ドル、GPT-6 Astra だけだと推定で月約140ドルです。

  • GPT-6 Luna だけなら月約1.6ドルと安いですが、300通の判定に約5分かかり、境目の案件を落とすことがあります。

賢いAIだけで読むと月100〜270ドルほどかかる判定が、Jev を前に置くだけで月8ドル前後になるわけです。この差は、かなり大きいですよね。

費用は、プログラムから直接呼び出すときの定価で、問いだけを送った場合の計算です。返信の下書きを書く費用は、どの方式でも同じなので含めていません。

なお、図の取りこぼしの列のうち、賢いAIだけで読む方式は50通でしか測っていません。

安さだけなら、GPT-6 Luna だけで読むほうが安く済みます。それでも私が Jev を前に置くのは、次の3つが理由です。

  • 300通を数秒でさばける速さがあります。

  • 今回の300通で、案件を1通も落としませんでした。

  • 12回流しても、案件かどうかの答えが変わりませんでした。

1日300通なら、判定のために賢いAIへ回すのは、迷った約20通だけになります。サブスクリプションで回している方は、賢いAIに回す通数が減るぶん、利用枠も食いにくくなると私は見ています。

ほかの人の使い方と、次に試したいこと

左がテツメモさんの紹介していた事例集、右が私が次に試したい KEITO さんの使い方です。

Jev の使い道は、メールの仕分けだけじゃないんですよね。最近 X で見かけた2つの使い方を、紹介させてください。

テツメモさん(@tetumemo)が紹介していた事例集「Made with Jev」

Jev で作られたものが、ジャンル別にまとまっているサイトです。動画つきのポストも多くて、眺めているだけで使い道が浮かんできます。

テツメモさんが気になった9選も添えられていて、これが参考になりました。

9月26日に見たときは、作例が729件、手引きが156件ありました。メールを500通、3.5セントで仕分けた例もあって、今回の私の300通が2.8セントだったので、ほぼ同じ水準です。

テツメモさんのポストはこちらです。

https://x.com/tetumemo/status/2103645490231546076

Made with Jev はこちらです。

https://madewithjev.com/

KEITO さん(@keitowebai)の「コピーは1回、貼るたびに Jev が選ぶ」

KEITO さんは、Jev を使ったデスクトップアプリを自作されていました。

  • 文章全体を、1回だけコピーしておきます。

  • フォームの欄に貼るたびに、その欄に合う部分を Jev が裏で選んでくれます。

  • 欄ごとにコピーして貼る往復がなくなって、普通のコピペの速さで全部の欄が埋まります。

ブラウザの自動入力でも埋めてくれることはありますが、うまく埋まらずに結局自分で直す、ということがありますよね。これを Jev でやると、低コストで、自分の手間なくできてしまうという話なんです。

「この欄にはどれ?」を選ばせる、Jev の選択の問いそのままの使い方で、これは私もすごくやってみたいと思いました。

次回、私も作ってみます。うまくできたら、配ることも考えています。

KEITO さんのポストはこちらです。

https://x.com/keitowebai/status/2103652580719296629

動画で見たい方へ

記事だけだとイメージしにくい部分、ありますよね。

動画では、次のような場面を画面で見られます。

  • 受信箱の300通が Jev に飛んで、3つの箱に入っていく様子を、送る数ごとに見られます。

  • Jev、GPT-6 Luna、Claude Fable 5.1 が同じ30通で競走して、Jev だけが1秒以内に終わる場面も入っています。

特に速さの差は、数字で読むより画面で見たほうが伝わると思います。

動画はこちら👇️

https://youtu.be/oc_RPxrq8Kc


まとめ

  • Jev は300通を数秒で仕分けて、案件73通を1通も落とさず、12回流しても答えが変わりませんでした。

  • GPT-6 Luna は安くて誤警報が少ないですが、境目の案件を自信を持って捨てる回がありました。捨てた案件は見直せないので、見張り役には Jev を選びました。

  • Jev で振り分けて、迷ったものと案件を Claude Opus 5.5 に回すと、1日300通でも、賢いAIだけで月100〜270ドルほどかかる判定が月8ドル前後で済み、300通の判定も約32秒で終わる計算です。

要は、賢いAIに全部を読ませずに、門番の Jev が迷ったメールと案件だけを渡せばいい、ということです。

私のAI秘書も、9月24日からこの形で試験運用を始めています。1週間、実際のメールで試して、この形を続けるかどうかを決めます。

1日に何十通、何百通とメールが届く方は、まず自分の受信箱で「案件は何%くらいか」を数えてみてください。その割合が小さいほど、賢いAIに読ませなくていいメールが多いということになります。


この記事が参考になったら、いいねやフォローで応援してくれると嬉しいです。1週間の試験運用の結果と、KEITO さんの使い方を作ってみた結果も、まとまったら共有しますね。

Jev の使い方で「これを試してほしい」「自分はこう使っている」というものがあれば、コメントで教えてもらえると次の記事のネタになります。

それではまた、れん学長でした!


📢 れん学長のAIツール実験室

朝起きると、AIが今日やるといいことや予定、届いた案件を教えてくれて、私はそれを見て決めていく。そんなAI秘書の作り方は、メンバーシップとYouTubeチャンネルで、順に公開する予定です。

価格や参加条件、どんな内容が読めるかは、入口記事にまとめています。

気になっていた方は、まず内容をのぞいてみてもらえるとうれしいです。

👉 メンバーシップの入口記事をのぞいてみる https://note.com/renkon40/n/nab9c378d2148

📮 【無料】週1回のニュースレターやってます

実際に試したAIツールの「結局、誰が使うべきか」だけを、5分で読める形でメール配信しています。noteの更新を見逃したくない方もどうぞ。

https://renkon40.substack.com/?utm_source=note&utm_medium=article


#AI #Jev #AI秘書 #メール仕分け #GPT6Luna #ClaudeOpus #自動化 #生産性向上 #AIツール

いいなと思ったら応援しよう!

れん学長|AIツール実験室 よろしければ応援お願いします!いただいたチップは、新しいAIツールの検証費用に使わせていただきます🧪 これからも実験→発見を共有していきますね!