【AIのメール仕分けが遅い人に効く】ライバルが38秒かかる30通を0.8秒で。判断専用AI「Jev」が速すぎて笑った
こんにちは、れん学長です。
ChatGPTやClaudeにメールを仕分けさせると、けっこう時間がかかる……ということ、ありませんか?
私のAI秘書も、毎時、賢いAIに届いたメールを全部読ませていたんですが、そのうち案件は4%ほどしかありませんでした。
そこで、過去のメール300通を、判断専用のAI「Jev」に仕分けさせてみました。
すると、出たばかりの GPT-6 Luna が38秒かかる30通を、Jev はたった0.8秒で仕分けてしまったんです。正直、笑ってしまいました。

最後にたどり着いたのは、Jev を門番にして、迷ったメールと案件だけを Claude Opus 5.5 に回す形です。この門番を置けば、メールが山のように届いても、賢いAIが判定し直すのは迷った分だけで済みます。
この記事では、次の4つをお伝えします。
300通を仕分けたときの速さと正しさを、実測の数字で紹介します。
安くて優秀な GPT-6 Luna もいる中で、見張り役に Jev を選んだ理由をお話しします。
Jev と Claude Opus 5.5 の組み合わせと、9月24日から始めた実際の運用への切り替えを紹介します。
1日300通届く人の場合に、月の費用と判定の時間がどう変わるかを試算します。
1日に100通、300通とメールが届く方ほど、読み終わる頃には「受信箱の前に門番を置くと何が変わるか」を、数字でイメージできるはずです。
同じ内容を動画でも話しています。仕分けの実演は、画面で見るほうが速さが伝わると思います。
Jev は、文章を書かずに確率で答えるAIです

Jev は、TypeSafe AI という会社が出している判断専用のモデルです。ChatGPT や Claude のように文章を書くのではなく、こちらが決めた問いに確率をつけて答えるだけなんですね。
聞けること:「どれ?」「何点?」「はい、いいえ?」の問いに、確率つきで答えます。今回は「このメールは案件の依頼か」を0〜1の確率で答えてもらいました。
値段:読み込ませる分が100万トークンあたり0.042ドルで、答えの出力は無料です。今回の300通は全部で約0.03ドルで、収録では思わず「べらぼうに安い」と言ってしまうほどでした。
速さ:私の環境では1通あたり約0.5秒でした。まとめて送れるので、300通でも数秒で終わります。
弱点:公式は、日本語は精度が落ちると書いています。今回の300通は、7割が日本語です。
ちなみに、トークンはAIが文章を読むときに数える単位で、今回のメールは1通あたり約2,200トークンでした。
私の狙いは、案件かどうかのふるい分けという安い部分を Jev に任せて、返信の下書きを書く高い部分だけを賢いAIに残すことです。
Jev の正体と使いどころは、9月20日に公開した記事で詳しく紹介しています。
https://note.com/renkon40/n/n00cca78e275e
私のAI秘書は、毎時すべてのメールを GPT-6 Astra に読ませていました

これまでは、AI秘書が1時間ごとに OpenAI の Codex で GPT-6 Astra を起動して、届いたメールを全部読んでいました。
冒頭で触れた「案件は4%ほど」は、4か月半で届いた1,775通で数えた数字です。賢いAIの時間のほとんどが、案件ではないメールを読むことに使われていたんですね。
で、メールが増えるほど、時間も費用も増えていきます。
そこで今回の課題は、AI秘書の「案件メールの見張り」を Jev に任せられるか、です。その1,775通から300通を選んで試しました。
中身は、案件73通、案件ではないメール226通、進行中の案件の事務連絡1通です。
正解は、当時のAI秘書の判定と、そのあと実際にどう扱ったかで決めました。
迷いや食い違いがあった21通は、私が目で見て決めています。
試した条件です。effort は、AIにどれだけ考えさせるかを決める設定です。
時期は、2026年9月21日〜24日です。
Jev は、TypeSafe AI の jev-1.13.0 を、プログラムから直接呼び出しました。
GPT-6 Luna は、Codex から effort を high にして、8本同時に動かしました。
Claude Opus 5.5 は、Claude Code から effort を high にして、4本同時に動かしました。
Claude Fable 5.1 と GPT-6 Astra は、50通だけの比較に使いました。どちらも50通では全問正解でした。Claude Fable 5.1 は、30通の競走にも入れています。
確率を見て「案件」「迷い」「案件ではない」の3つの箱に分けます

確率の範囲ごとに、3つの箱とその後の扱いをまとめた図です。
仕分けのしかたは、シンプルです。Jev が返した確率で、3つの箱に分けます。
案件の箱は、確率0.85以上です。返信の下書きに進みます。
迷いの箱は、確率0.10〜0.85です。AIが迷ったと正直に言ったメールなので、人か賢いAIが見直します。
案件ではない箱は、確率0.10以下です。そのまま流します。
箱とは別に、確率0.5を境にした「案件か、案件ではないか」の答えも出しています。一致率や誤警報、拾えた案件の数は、こちらで数えています。
ポイントは、全部をAIに決めさせないことなんです。迷ったら迷ったと言ってもらって、その分だけ見直せばいいんですよね。
いちばん怖いのは、案件ではない箱に本物の案件が混ざることです。これが「取りこぼし」になるので、この記事ではここを重点的に見ていきます。
300通は約3秒で終わり、案件73通は1通も落としませんでした

受信箱のメールが Jev に飛んで、3つの箱に入っていく実演の画面です。右の列に、送り方ごとの時間が並んでいます。
まずは速さです。同じ300通を、同時に送る数を変えて流してみました。
1通ずつ送ると、約160秒かかりました。1通あたりは約0.5秒です。
10通ずつ同時に送ると、約17秒に縮みました。50通同時なら、5秒ほどです。
100通同時だと3.3秒、300通いっぺんだと3.6秒で終わりました。
どの送り方でも、案件かどうかの答えは同じでした。
10通同時にした時点で、画面の中の仕分けがパパパッと進んで、1通ずつのときとは別物の速さでした。逆に、300通いっぺんは100通同時より少しだけ遅かったので、私は100通ずつ送る形に落ち着きました。

左の大きな数字が、いちばん大事な「自信を持って間違えたメール」の数で、右の棒グラフが Jev の答えた確率の分布です。下の段の3つは、左から昔の判定との一致率、拾えた案件の数、迷いの箱に入った数です。
で、肝心の正しさです。
Jev が自信を持って言い切ったメールに、間違いは1通もありませんでした。
確率0.85以上で「案件」、0.10以下で「案件ではない」と答えたメールは、全部合っていました。間違えそうなメールは、ちゃんと「迷い」の箱に入れてくれていたんです。
この0通があるから、人や賢いAIは迷いの箱だけを見直せば済みます。ここは、すごく良かった点です。
確率の分布を見ると、その理由が分かります。
Jev の答えは、0に近いか1に近いかの両端に集まっていました。0.10以下の「案件ではない」に210通、0.85以上の「案件」に73通です。
真ん中はほとんど空っぽで、0.45〜0.65には1通もありませんでした。
迷ったのは、黄色の「迷い」の帯に入った17通だけです。しかも、その17通は全部が案件ではないメールでした。
昔の判定、つまりこれまでのAI秘書の判定との一致は98%で、300通中294通が同じ答えでした。食い違った6通は、1通を除いて迷いの箱に入っていました。
案件ではないのに Jev が0.5を超えて読んだ4通は、同じアフィリエイト会社の一斉配信でした。0.69〜0.78と迷いながらの答えで、4通とも迷いの箱に入れていました。
公式が日本語は精度が落ちると書いていた割に、7割が日本語のこの300通では、かなり優秀だったんです。
出たばかりの GPT-6 Luna と、同じメールで比べました

ここで、ライバルの登場です。
OpenAI が9月23日(日本時間)に出した GPT-6 Luna は、安くて速い小型のモデルです。値段は、読み込ませる分が100万トークンあたり0.10ドル、答えの出力が0.50ドルです。
GPT-6 Sol と GPT-6 Luna を7分野で試した前回の動画では、メールの判定で、正解を決めてあった49通を GPT-6 Luna もすべて当てていました。
https://youtube.com/watch?v=XQEUm38f6EY
だったら、Jev じゃなくて GPT-6 Luna でいいのでは?と思いますよね。そこで、同じ300通と同じ問いで比べてみました。

左から Jev、GPT-6 Luna、Claude Fable 5.1 のレーンです。上の大きな数字が、30通を仕分け終わるまでの秒数です。
まずは、実際に測った応答時間をもとに、同じ30通を3つのAIに同時に流したときの様子を再生して比べました。
Jev は、0.8秒で終わりました。費用は0.003ドルです。
GPT-6 Luna は、37.8秒かかりました。Jev の約46倍です。
Claude Fable 5.1 は、40.9秒かかりました。費用は Jev の約250倍です。
30通の答えは、3つとも同じでした。正しさは同じで、速さだけが桁違いだったんですね。
ほかの2つの40分の1以下で終わる Jev の速さは、素晴らしかったです。
ただ、公平のために書いておくと、GPT-6 Luna と Claude Fable 5.1 の時間には、Codex や Claude Code を起動する時間も含まれています。Jev は、プログラムから直接呼び出した時間だけです。
同時に送った数も、Jev は30通いっぺん、GPT-6 Luna は8本、Claude Fable 5.1 は4本と違います。
300通で比べると、誤警報が少ないのは GPT-6 Luna、案件を落とさないのは Jev でした

「Jev が上」「Luna が上」「互角」の3つに分けた図です。下の一文が、決め手になったところです。
次は、300通での比較です。GPT-6 Luna は、effort を high にして3回流しました。
GPT-6 Luna が上だったのは、この2つです。
案件ではないメールを案件と言ってしまう誤警報は、0通でした。Jev は4通です。
迷いの箱に入った数は、2〜4通でした。Jev は17通です。
互角だったのは、この2つです。
昔の判定との一致は、どちらも約98%でした。
300通の費用は、問いだけを送った場合でどちらも数円でした。GPT-6 Luna のほうは推定です。
Jev が上だったのは、この2つです。
案件を自信を持って捨てた数は、0通でした。GPT-6 Luna は、1回あたり0〜1通ありました。
1通あたりの時間は、0.5秒でした。GPT-6 Luna は、Codex の起動込みで6.2秒です。
で、決め手になったのはこれです。
誤警報や迷いは、あとで Claude Opus 5.5 が見直せば消せます。でも、捨てた案件は誰も見直せません。
捨てた案件が実は本物だったら、そのメールには返信できなくなってしまうんです。
GPT-6 Luna は3回とも、案件73通のうち2〜3通を、0.5を下回る側に置きました。多くは迷いの箱に残りましたが、1回あたり0〜1通は、自信を持って捨てていたんです。
落とした案件は、どの回も同じ3通の中からでした。クリエイター向けの案件プラットフォームからの招待2通と、条件のはっきりしないコラボの相談1通です。
私が中身を見直しても、3通とも案件でした。
effort を上げても、GPT-6 Luna は境目の案件を拾えませんでした

境目の案件3通について、GPT-6 Luna と Jev が出した確率を1本の目盛りに置いた図です。0.5より右なら、案件と判定したことになります。
じゃあ、GPT-6 Luna にもっと考えさせれば拾えるのか。effort を xhigh と max に上げても試しました。
どの effort でも、境目の案件3通は、ほとんどが0.5より左の「案件ではない」側に置かれました。
条件のはっきりしないコラボの相談は、high で0.18、xhigh で0.28、max で0.12でした。どの effort でも迷いの箱に入ったままで、案件の箱には届きませんでした。
6月に届いた招待メールは、high の3回で0.08〜0.18、xhigh で0.08、max で0.18でした。0.08の回は、自信を持って捨てたことになります。
7月に届いた招待メールは、同じ high でも1回目は0.82、3回目は0.04と、回ごとに大きく揺れました。
Jev は、この3通を0.86〜0.91で案件と判定しています。
考える量を増やしても、境目のメールは拾えなかったんですね。
落としたのは、製品も報酬もまだ書かれていない登録の案内や、条件のはっきりしないコラボの相談でした。こういうメールを案件に含めるかは、考える量より、何を案件と呼ぶかという決め方で決まるんだと思います。
Jev は12回流しても、案件かどうかの答えが1通も変わりませんでした

Jev の12回と GPT-6 Luna の3回を比べた図です。大きな数字が、流し直して答えや箱が変わったメールの数です。
もう1つ大事なのが、何度流しても同じ答えが返ってくるかです。
Jev は、同じ300通を3日間で12回流しました。送る数を1通ずつから300通同時まで変えた回も含みます。
12回とも、案件かどうかの答えが変わったメールは0通でした。確率の動きは、最大でも0.08です。
箱が変わったのは、0.10や0.85の線のちょうど上にいた3通だけでした。うち1通は前の節の6月の招待メールで、0.84〜0.88の間で案件の箱と迷いの箱を行き来しましたが、案件ではない箱に落ちたことはありません。
GPT-6 Luna は、同じ設定で3回流すだけで、回ごとに2〜5通の箱が変わりました。
GPT-6 Luna では、同じ招待メールが、ある回は案件になり、別の回は自信を持って捨てられていました。
見張り役としては、毎回同じ答えを返してくれるほうが安心ですよね。この確率が動かないところは、Jev を信頼できると感じた点です。
たどり着いたのは、Jev で振り分けて、迷ったものと案件を Claude Opus 5.5 に回す形です

ここまでを踏まえて、たどり着いた組み合わせです。Jev を門番にして全部を数秒で仕分け、箱ごとに行き先を変えます。
案件の箱は、今回73通でした。ここに入ったメールは、Claude Opus 5.5 が返信の下書きを書く形にします。Claude Opus 5.5 が「案件ではなさそう」と読んでも捨てずに、メモを付けて私に回します。Claude Opus 5.5 は、境目の招待を0.40〜0.45と低めに読んだことがあるためです。
迷いの箱の17通は、Claude Opus 5.5 が判定し直します。実際に17通を渡すと、すべて正しく判定できました。4本同時に動かして、かかったのは約27秒です。
案件ではない箱の210通は、そのまま流します。今回、ここに案件は1通も入りませんでした。
返信を書くのは、どうせ賢いAIです。なので、迷ったメールの判定もそこにまとめて任せるのが、いちばんシンプルなんですよね。
この形なら、費用を抑えたまま速さも出せると思っています。
返信役を Claude Opus 5.5 にしたのは、企業への返信文が自然だからです。候補に考えた GPT-6 Sol は安いんですが、私が読むと文章が硬くて、企業の案件メールには向きにくいと感じました。
Jev と Claude Opus 5.5 の間に GPT-6 Luna は挟みません

「間に安い GPT-6 Luna を挟めば、もっと安くなるのでは?」とも考えました。でも、これはおすすめしません。
理由は3つです。
いちばん難しいメールを、境目に弱いモデルに任せることになります。迷いの箱には境目のメールが集まりますが、GPT-6 Luna は300通を単独で流したときに、まさにその境目の案件を自信を持って捨てることがありました。
節約できる額が小さいです。1日300通届く人でも、減るのは月7ドル前後です。
速くもなりません。GPT-6 Luna は Codex 経由だと1通6秒台で、Claude Opus 5.5 の1通約5秒より遅いです。どちらも起動の時間込みです。
実際、Jev を流し直した回には、12回流した節で触れた6月の招待メールが0.84で迷いの箱に入ったことがあります。GPT-6 Luna は、300通を単独で流したときに、このメールを0.08で捨てた回がありました。
間に挟むと、箱に入った案件が捨てられる危険は実際にあると私は見ています。
一方、GPT-6 Luna が落とした境目の案件3通を Claude Opus 5.5 に読ませると、確率は0.40〜0.80で、0.10以下で捨てることはありませんでした。ただ、3通のうち2通は0.5を下回り、6月の招待メールは0.40でした。
迷いの箱に本物の案件が入ったときに Claude Opus 5.5 が拾えるかは、試験運用で見ていきます。
9月24日から、AI秘書の見張りを「Jev + Claude Opus 5.5」で試験運用しています

毎時の見張りの流れを、左から4段階で示した図です。
で、実際に私のAI秘書の運用も切り替えました。9月24日の夜から10月1日まで、1週間の試験運用です。
毎時13分に、Mac の中の自動実行の仕組みが動いて、新しいメールを集めます。
Jev が仕分けて、自信を持って「案件ではない」と言えるものは、ここで片付けます。
迷ったメールや案件が残った回だけ、Claude Code で Claude Opus 5.5 を起動します。
Claude Opus 5.5 が、返信の下書きと私宛ての報告まで作ります。送信は私がします。
読む役は、これまでの Codex の GPT-6 Astra から、Claude Opus 5.5 に移しました。
Claude Opus 5.5 は、何もせずに1回起動するだけでも、定価で換算すると約0.4ドルかかりました。なので、読むべきメールが残った回だけ起動する形にしています。
切り替え直後の試運転では新着メールが0通で、Claude Opus 5.5 の出番はありませんでした。実際のメールでどう動いたかは、1週間の結果とあわせて報告します。
1週間で見るのは、この3つです。
案件の取りこぼしがないかを確かめます。
Claude Opus 5.5 が何回起動したかを数えます。
返信の下書きがそのまま使えるかを見ます。
結果がよければ、この形で本番の運用にするつもりです。
メールが1日300通届く人なら、月100〜270ドルほどの判定が月8ドル前後になる計算です

方式ごとに、1回の判定時間、月の費用、今回の取りこぼしを並べた試算です。いちばん上の行が、おすすめの組み合わせです。
ここからは、メールが多い方向けの話です。
正直に言うと、私のように1日10〜13通なら、差はあまり大きくありません。プログラムから直接呼び出すときの定価で計算しても、Claude Opus 5.5 だけで全部読んで月4〜5ドル、Jev を前に置けば月数十セントです。
サブスクリプションで回すなら、どちらも定額の範囲に収まります。Jev が効いてくるのは、メールが多い人なんです。
そこで、1日300通届いて、案件が4%、迷いが約20通という条件で、30日分を試算しました。
Jev で振り分けて、迷ったものの判定だけを Claude Opus 5.5 に回すと、月約8ドルです。1日分の300通をまとめて判定すると、約32秒で終わります。
Claude Opus 5.5 だけで全部読むと、月約110ドルかかります。
Claude Fable 5.1 だけだと月約270ドル、GPT-6 Astra だけだと推定で月約140ドルです。
GPT-6 Luna だけなら月約1.6ドルと安いですが、300通の判定に約5分かかり、境目の案件を落とすことがあります。
賢いAIだけで読むと月100〜270ドルほどかかる判定が、Jev を前に置くだけで月8ドル前後になるわけです。この差は、かなり大きいですよね。
費用は、プログラムから直接呼び出すときの定価で、問いだけを送った場合の計算です。返信の下書きを書く費用は、どの方式でも同じなので含めていません。
なお、図の取りこぼしの列のうち、賢いAIだけで読む方式は50通でしか測っていません。
安さだけなら、GPT-6 Luna だけで読むほうが安く済みます。それでも私が Jev を前に置くのは、次の3つが理由です。
300通を数秒でさばける速さがあります。
今回の300通で、案件を1通も落としませんでした。
12回流しても、案件かどうかの答えが変わりませんでした。
1日300通なら、判定のために賢いAIへ回すのは、迷った約20通だけになります。サブスクリプションで回している方は、賢いAIに回す通数が減るぶん、利用枠も食いにくくなると私は見ています。
ほかの人の使い方と、次に試したいこと

左がテツメモさんの紹介していた事例集、右が私が次に試したい KEITO さんの使い方です。
Jev の使い道は、メールの仕分けだけじゃないんですよね。最近 X で見かけた2つの使い方を、紹介させてください。
テツメモさん(@tetumemo)が紹介していた事例集「Made with Jev」
Jev で作られたものが、ジャンル別にまとまっているサイトです。動画つきのポストも多くて、眺めているだけで使い道が浮かんできます。
テツメモさんが気になった9選も添えられていて、これが参考になりました。
9月26日に見たときは、作例が729件、手引きが156件ありました。メールを500通、3.5セントで仕分けた例もあって、今回の私の300通が2.8セントだったので、ほぼ同じ水準です。
テツメモさんのポストはこちらです。
https://x.com/tetumemo/status/2103645490231546076
Made with Jev はこちらです。
KEITO さん(@keitowebai)の「コピーは1回、貼るたびに Jev が選ぶ」
KEITO さんは、Jev を使ったデスクトップアプリを自作されていました。
文章全体を、1回だけコピーしておきます。
フォームの欄に貼るたびに、その欄に合う部分を Jev が裏で選んでくれます。
欄ごとにコピーして貼る往復がなくなって、普通のコピペの速さで全部の欄が埋まります。
ブラウザの自動入力でも埋めてくれることはありますが、うまく埋まらずに結局自分で直す、ということがありますよね。これを Jev でやると、低コストで、自分の手間なくできてしまうという話なんです。
「この欄にはどれ?」を選ばせる、Jev の選択の問いそのままの使い方で、これは私もすごくやってみたいと思いました。
次回、私も作ってみます。うまくできたら、配ることも考えています。
KEITO さんのポストはこちらです。
https://x.com/keitowebai/status/2103652580719296629
動画で見たい方へ
記事だけだとイメージしにくい部分、ありますよね。
動画では、次のような場面を画面で見られます。
受信箱の300通が Jev に飛んで、3つの箱に入っていく様子を、送る数ごとに見られます。
Jev、GPT-6 Luna、Claude Fable 5.1 が同じ30通で競走して、Jev だけが1秒以内に終わる場面も入っています。
特に速さの差は、数字で読むより画面で見たほうが伝わると思います。
動画はこちら👇️
まとめ

Jev は300通を数秒で仕分けて、案件73通を1通も落とさず、12回流しても答えが変わりませんでした。
GPT-6 Luna は安くて誤警報が少ないですが、境目の案件を自信を持って捨てる回がありました。捨てた案件は見直せないので、見張り役には Jev を選びました。
Jev で振り分けて、迷ったものと案件を Claude Opus 5.5 に回すと、1日300通でも、賢いAIだけで月100〜270ドルほどかかる判定が月8ドル前後で済み、300通の判定も約32秒で終わる計算です。
要は、賢いAIに全部を読ませずに、門番の Jev が迷ったメールと案件だけを渡せばいい、ということです。
私のAI秘書も、9月24日からこの形で試験運用を始めています。1週間、実際のメールで試して、この形を続けるかどうかを決めます。
1日に何十通、何百通とメールが届く方は、まず自分の受信箱で「案件は何%くらいか」を数えてみてください。その割合が小さいほど、賢いAIに読ませなくていいメールが多いということになります。
この記事が参考になったら、いいねやフォローで応援してくれると嬉しいです。1週間の試験運用の結果と、KEITO さんの使い方を作ってみた結果も、まとまったら共有しますね。
Jev の使い方で「これを試してほしい」「自分はこう使っている」というものがあれば、コメントで教えてもらえると次の記事のネタになります。
それではまた、れん学長でした!
📢 れん学長のAIツール実験室
朝起きると、AIが今日やるといいことや予定、届いた案件を教えてくれて、私はそれを見て決めていく。そんなAI秘書の作り方は、メンバーシップとYouTubeチャンネルで、順に公開する予定です。
価格や参加条件、どんな内容が読めるかは、入口記事にまとめています。
気になっていた方は、まず内容をのぞいてみてもらえるとうれしいです。
👉 メンバーシップの入口記事をのぞいてみる https://note.com/renkon40/n/nab9c378d2148
📮 【無料】週1回のニュースレターやってます
実際に試したAIツールの「結局、誰が使うべきか」だけを、5分で読める形でメール配信しています。noteの更新を見逃したくない方もどうぞ。
https://renkon40.substack.com/?utm_source=note&utm_medium=article
#AI #Jev #AI秘書 #メール仕分け #GPT6Luna #ClaudeOpus #自動化 #生産性向上 #AIツール
いいなと思ったら応援しよう!
よろしければ応援お願いします!いただいたチップは、新しいAIツールの検証費用に使わせていただきます🧪 これからも実験→発見を共有していきますね!