記事一覧へ

AIエージェントの費用を減らすJevで判断を分担する方法と約90%削減の条件

Jevへ分類を任せ、生成AIへ難しい判断と文章作成を任せる分担によって、AIの判断費用を減らす概念図

TypeSafeのJevは、文章を書く代わりに、用意した選択肢から答えを選び、確率を返すAIモデルです。メールの分類などをJevへ任せ、難しい案件だけ通常の生成AIへ回すと、判断に使う料金を抑えられます。月1万件を分類する例では、再判定に回す割合が10%なら、Kimi K3だけで分類する場合の90ドルから9.42ドルへ下がります。約89.5%の削減が成り立つ条件と、エージェント全体の費用への影響、最初に試す手順を整理します。

エージェントは途中の判断にも料金を使う

受信したメールを読み、担当部署を決め、社内の資料を探して、返信の下書きを作る。こうした仕事をAIエージェントへ任せると、生成AIは最後の文章を一度書くだけでは済みません。「請求の相談か、製品の不具合か」「見つかった資料は質問に関係するか」「追加で検索する必要があるか」と、途中でも判断を繰り返します。

自分でエージェントを組み立てるとき、同じ高性能なモデルへ判断も文章作成も任せれば、仕組みは分かりやすくなります。ただ、答えが「請求担当」の一つで足りる場面でも、入力を読み、答えを生成するたびに料金がかかります。判断を何度も挟む仕事では、小さな呼び出しの費用が積み上がります。

TypeSafeが提供するJevは、こうした途中の判断を担うAIモデルです。プログラムがメール本文と「請求・不具合・使い方・その他」という選択肢を渡すと、Jevは選んだ答えと各選択肢の確率を返します。返ってきた値を使って、プログラムが担当部署を決めたり、別のモデルへ詳しい検討を頼んだりします。

この分担によって、難しい案件の検討や返信の文章作成には生成AIを使いながら、分類に使う費用を下げられます。Jevが判断した後にメールを移動する、資料を検索する、下書きを保存するといった操作は、エージェント側のプログラムが実行します。

「Jevで90%安くなる」という話を自分の仕事へ当てはめるには、まず何を分類しているのか、その分類にいくら使っているのかを切り分けます。ここではメール対応を例に、置き換えられる工程、料金が下がる計算、品質を確かめながら切り替える方法を順に見ます。

Jevへ任せる判断を切り出す

メール対応の工程を見直すと、AIに頼みたい仕事の種類が分かれます。Jevが向いているのは、入力の意味を読んで、あらかじめ定義した答えから選ぶ工程です。

表は横にスクロールできます

メール対応の工程任せる先の例分ける理由
相談を請求・不具合・使い方・その他へ分類Jev選択肢を先に定義できる
本文が返金を求めているか判定Jevはい・いいえで答えられる意味の判断
注文金額の合計や返金期限を計算通常のプログラム決まった計算規則をそのまま実行できる
経緯を整理して返信の下書きを作成生成AI新しい文章を作る必要がある
返金の実行や対外メールの送信を承認業務担当者分類の正しさに加え、実行する権限と責任の確認が要る

Jevには、選択肢から一つ選ぶChoice、基準に沿って段階評価するScore、条件が当てはまる確率を返すNoulという質問形式があります。メールの部署分けならChoice、返金要求の有無ならNoulで足ります。返信文や自由な分析を書かせる場面は、生成AIへ残します。

メールを受け取ってから返信の下書きへ進む処理を比べると、分類の前後で誰が何をするかが分かります。Jevを使う場合は、プログラムがメール本文と分類候補をJevへ渡します。返された分類先と、確率分布から求めた信頼度を使って、その判定を自動採用するかを決めます。

Jevなしではメール全件を生成AIで分類する。JevありではJevの分類先と確率をプログラムが採用基準と照合し、採用できる判定はそのまま使い、再判定が必要なメールだけ生成AIへ渡す。両方ともプログラムが部署分けと資料検索を行い、生成AIが返信の下書きを作る。解決できない分類は業務担当者が確認する
図を拡大図を拡大
左は全件を生成AIで分類する処理、右はJevを先に使う処理です。プログラムが分類先と信頼度を採用基準と比べ、基準を満たさない判定や「その他」のメールを再判定へ回します。Jevを使う経路でも、資料検索はプログラム、返信の下書きは生成AIが担当します。

判定を採用できるメールは、その分類先を使ってプログラムが担当部署を決め、必要な資料を検索します。採用基準を満たさないメールは、生成AIへ元の本文を渡して分類をやり直します。どちらの経路でも、返信の文章は生成AIが作成します。分類を解決できない案件は業務担当者が確認します。

Jevが安い仕組みは、使う側から見ると二つあります。文章を生成せず、判断結果を直接返すこと。そして、その用途向けの低い入力料金で提供されていることです。2026年10月1日に確認したJev 1.13の公式料金は、入力100万トークンあたり0.042ドルで、出力料金は無料です。

トークンは、モデルが文章を扱うときの分割単位です。メール本文だけでなく、判定の指示や選択肢も入力料金に含まれます。「一回の判断が安い」と「毎回長い履歴を読ませても安い」は別の条件なので、実際に送る量も測ります。

この使い分けには、エージェントからモデルを呼び出すプログラムの変更が必要です。プログラムとサービスを接続するAPIを使って、分類の呼び出し先をJevへ替え、難しい案件を生成AIへ渡す処理を加えます。ChatGPTやClaudeの通常の月額プランを契約していても、Jevを別途使うだけでその定額料金が下がるわけではありません。

月1万件の分類費用はどう変わるか

同じメール分類を、すべて生成AIへ任せる場合と、Jevを先に使う場合で比べます。生成AIの例には、Moonshot AIが提供するKimi K3を使います。Jevが迷う案件を詳しく読み直す役割で、ほかの生成AIでも同じ分担を組めます。

次の数値は、公式料金を使った計算例です。実際のメールを月1万通処理して測った平均ではありません。

表は横にスクロールできます

条件計算に使う値
分類するメール月1万通
Jevへ渡す入力一通あたり1000トークン。指示と選択肢を含む
Kimi K3へ渡す入力一通あたり1500トークン
Kimi K3の出力一通あたり300トークン。分類や理由などの課金対象を含む
Jevの単価入力100万トークン0.042ドル、出力無料
Kimi K3の単価通常入力100万トークン3ドル、出力100万トークン15ドル
JevからKimi K3へ回す割合10%、1000通

全1万通をKimi K3へ渡すと、入力1500万トークンが45ドル、出力300万トークンが45ドルで、合計90ドルです。

先にJevで全件を分類する場合、1000万入力トークンの料金は0.42ドルになります。Jevの判定を採用できず、Kimi K3へ回す1000通の料金は9ドルなので、合計は9.42ドル。分類費用は90ドルから約89.5%下がります。

次の図は、Jevを入れる前後の作業の流れと、各段階で発生する料金を示しています。生成AIの呼び出しを9000回省く分岐が、料金差を生む場所です。同じ本文への複数質問をまとめる方法は、さらに入力料金を減らす追加の改善として示しています。

月1万通をKimi K3で分類すると90ドル。Jevが全件を0.42ドルで先に判定し、9000通はJevの判定を採用してKimiの呼び出しを省略し、1000通だけKimiで9ドルで再判定する。合計9.42ドル、分類費用は約89.5%削減。同じ本文への質問の一括評価による追加の節約と、全体費用の削減は別計算であることも示した図
図を拡大図を拡大
月1万通の分類で、Jevの判定を90%採用でき、10%だけKimi K3で再判定するという仮定です。安い入力単価、無料の出力、生成AIの呼び出し削減を料金へ対応させています。複数質問をまとめる追加の節約は9.42ドルの計算に含めていません。

この比較には、キャッシュによる入力割引、税、サーバーや検索ツールの料金、開発・保守、人による確認の費用を含めていません。また、難しい案件だけ長い入力や出力が必要になる場合、Kimi K3の再判定費用はここでの想定より増えます。自分の料金表と利用量へ置き換えて計算する必要があります。

再判定の割合と全体の費用を分けて見る

Jevの安さを生かせるかは、通常の生成AIへ何件戻すかで変わります。前節の単価とトークン数を固定し、再判定へ回す割合だけを変えると、分類費用は次のようになります。

表は横にスクロールできます

Kimi K3へ回す割合JevとKimi K3の合計Kimi K3全件の90ドルに対する削減
10%9.42ドル約89.5%
30%27.42ドル約69.5%
50%45.42ドル約49.5%
100%90.42ドル0.42ドルの増加

全件を結局Kimi K3へ渡すなら、Jevの料金がそのまま追加されます。Jevの判定を採用できる案件が増えるほど、高価なモデルの呼び出しを省けます。

ただし、「信頼度が0.95以上なら採用する」と設定しても、再判定率が10%になるとは限りません。文章の種類、選択肢、質問の書き方によって、基準を下回る案件の割合は変わります。安くするために基準を下げる前に、自動採用した判定がどの程度間違っているかを確かめます。

分類以外の仕事も残ります。たとえば、エージェントの月額費用が450ドルで、内訳が分類90ドル、返信生成や検索など360ドルだったとします。分類を9.42ドルへ下げても、ほかの費用が同じなら合計369.42ドルです。全体の削減率は約17.9%になります。

全体への効果は、「元の費用に占める置き換え対象の割合」と「その工程の削減率」を掛けると概算できます。分類が20%を占め、分類費用を89.5%減らせるなら、全体では約17.9%です。文章生成が費用の大半を占めるエージェントでは、分類だけを替える効果は限られます。

同じ本文を繰り返し送らない

Jevへ替えた後も、呼び出し方によって料金は変わります。一通のメールから「担当部署」「返金要求の有無」「緊急対応が必要か」を判定するなら、本文と三つの質問を一度に渡せます。同じ本文を三回送る費用を省き、追加で必要になるのは質問の分です。

TypeSafeの公開例では、約5万4000文字の同じ文書に13問を出しています。Jev 1.12を使った5回の平均で、一問ずつ13回呼ぶ費用は0.006090ドル、一度に13問を出す費用は0.000497ドルでした。文書が入力の大部分を占める条件で、費用は約12.2分の1になっています。現在の全用途で同じ倍率になることを示す結果ではありません。

まとめて送れるのは、同じ入力だけで判断できる質問です。担当部署の判定結果を使って、初めて別の社内資料を取得する場合、その資料を読む質問は後の呼び出しになります。同じ呼び出しの中では、一つの質問の答えを別の質問が参照できません。

入力から不要な情報を除く方法も併用します。部署分類に関係しない過去の全メールや、検索結果の全文を毎回渡すと、料金が増えるだけでなく、無関係な内容に判断が引っ張られる場合があります。本文、必要な履歴、判断基準に関係する情報を残し、関係のない内容を先に除きます。

公開された100通の例から分かること

料金計算が魅力的でも、分類の正しさは別に確かめる必要があります。JevのChoiceに付くconfidenceは、選択肢に対する確率分布から計算された信頼度の指標です。0.95という値を、その案件が95%の確率で正しいという保証として扱うことはできません。自分のメールで、信頼度の高い判定が実際にどの程度正しいかを測ります。

開発者のHassanが公開している「jev-fraud」は、Jevでメールを判定し、信頼度が0.95未満のメールをKimi K3へ渡すデモです。詐欺メール50通と正当なメール50通を使い、Kimi K3は元のメールを独立して読み直します。

筆者は公開リポジトリの保存結果を取得し、各メールの判定をローカルで再集計しました。Jevだけでは90通が正解で、70通をそのまま採用し、30通をKimi K3へ回しています。Kimi K3が二つの誤りを訂正した結果、組み合わせ全体では92通が正解でした。保存された処理時間は約6.1秒です。

この保存結果では、詐欺メール50通のうち42通を検出し、8通を正当なメールと判定しています。全体で92%正解でも、詐欺を見逃す用途上の問題は残ります。普通のメールを誤って隔離する件数と、詐欺を通してしまう件数は、分けて評価した方が導入判断に使えます。

費用には注意が要ります。記録上の合計は約0.102ドルですが、Kimi K3の料金はトークン数からの推計で、Jevの料金は提供側から返された0ドルの値です。実際の請求総額を確認した数字ではなく、Jevが常に無料という意味でもありません。保存結果には全100通をKimi K3だけで判定した比較結果が含まれないため、この例の実際の削減率は算出できません。

以前の紹介投稿にある「96通正解・約0.07ドル」は別の実行結果です。今回の再集計は第三者が保存した結果の確認で、新しく有料APIを呼んだ実験ではありません。100通の小さな均等標本を、日本語の受信箱や本番の詐欺発生率へそのまま当てはめることもできません。

一つの判断から導入する手順

最初に移す候補として、筆者は「メールを請求・不具合・使い方・その他へ分類する」のように、繰り返し回数が多く、誤っても分類を戻せる仕事を勧めます。返信文の作成や送信まで一度に替えず、分類結果と費用を比べられる状態を作ります。

  1. 現在のエージェントの記録から、分類の呼び出し回数、入力と出力のトークン数、料金を取り出します。返信生成や検索の費用と分け、置き換え対象が全体の何%を占めるかを確認します。
  2. 分類先と条件を書きます。たとえば「請求は請求金額・支払方法・契約料金の相談」「不具合は製品が期待どおり動かない報告」と定義し、当てはまらない案件用に「その他」を用意します。分類先の名前だけで意味を伝えず、質問文へ判断する内容を書きます。
  3. Jevへメール本文と質問を渡す処理を加えます。最初は実際の振り分けを従来の仕組みで続け、Jevの答えは記録だけ残します。同じ本文で独立に判断できる返金要求の有無などは、一度の呼び出しへまとめます。
  4. 業務担当者が正解を付けたメールと照合します。日本語、短い本文、複数の相談が混ざる本文も含め、信頼度の範囲ごとの正答率、誤った分類の内容、生成AIへ回る割合を測ります。TypeSafeも、英語以外の内容は自分のデータで検証するよう案内しています。
  5. 品質が許容できる範囲だけJevの判定を採用します。「その他」、情報不足、APIの失敗、採用基準に満たない判定は、既存の生成AIか担当者の確認へ回します。生成AIでも解決できない案件は担当者へ残し、返金や送信の承認は別に行います。
  6. Jev、再判定、再試行、人の確認まで含めて、正しく分類を終えた一件あたりの費用を比べます。採用基準を調整した後は、モデルの版も固定します。TypeSafeの直接APIならjev-1.13.0を指定し、質問文やモデルを変えたときは同じ評価用メールで確かめ直します。

分類の条件を細かくするほど、質問の曖昧さも見えてきます。「急ぎで重要か」とまとめて聞くより、「本文に回答期限が書かれているか」「契約停止を求めているか」を分けた方が、どこで判定がずれたか追えます。一方、日付の前後比較や金額の集計は通常のプログラムへ任せます。

一つの判断を移して、減ったモデル料金と、増えた再確認の手間を比べる。その結果から次の工程へ広げる方が、エージェント全体の費用を見直しやすくなります。分類費用が小さいなら、生成に渡す履歴や不要な呼び出しの削減を先に検討する選択もあります。

参照リンク12件
  1. TypeSafeIntroduction
  2. TypeSafeModels — Jev 1.13の料金と対応入力
  3. TypeSafePrimitives — 質問形式と複数質問の扱い
  4. TypeSafeConfidence — 信頼度の意味と採用基準
  5. TypeSafeJev 1.13 jaggedness — 苦手な判断
  6. TypeSafeAPI reference
  7. TypeSafeSpeculative fan-out — 同じ入力へ複数の質問
  8. TypeSafeParallel questions — 13問をまとめる費用比較
  9. Moonshot AIKimi API Platform — Kimi K3の料金
  10. Hassan / Nutlopejev-fraud — JevとKimi K3のメール判定デモ
  11. Hassan / NutlopeVALIDATION — 保存実行の精度と費用の根拠
  12. Hassan / Nutloperecording.json — 再集計した保存結果

2026年10月1日時点の公式資料を確認しています。仕様は更新される可能性があります。

この記事はここまで102

次の記事

PCを閉じてAIにWeb作業を任せる条件 dotsのブラウザ・接続・認証を公式資料で整理

関連記事

LLMの使い分けでコストと待ち時間を下げる 分類と検査を文章生成から切り離す

本番エラーをAIのコード修正につなぐ Cloudflare Issuesで組む自動化の設計

自社ソフトに仕事を任せるAIエージェントを組み込む 技術選定と費用の考え方