Jevで何ができる?ゲーム・ブラウザ操作・大量仕分け・AIの見張り役まで、50以上の使い方を総整理して未来まで予想【2026年9月】

🔮 2026年9月20日時点 / 根拠ラベル付き

Jev、何に使える?ゲーム・ブラウザ操作・大量仕分け・AIの見張り役。使い方を並べて、未来まで予想する

文章を書かず「選ぶ」だけのAI。だから、1秒に何度も判断できる。

🎮 ゲーム 🌐 ブラウザ操作 📬 大量仕分け 🛡️ AIの見張り役 🔮 未来予想

結論:Jevは「書くAI」ではなく「選ぶAI」。だから“1秒に何度も・大量に・ほぼ無料で”判断する仕事に向いている

  1. 使い方は大きく4つ+おまけ。ゲームなどの「反射神経」、ブラウザやパソコンを動かす「目と手」、大量の書類を分ける「仕分け係」、他のAIを検査する「見張り役」。公式・第三者・個人の報告から、50件以上を集めました(公式の想定例を含む)。
  2. 仕組みはどれも同じ。プログラムが状況を文字にして選択肢を用意し、Jevが1つ選ぶだけです。画面や映像を「見て」動いているわけではありません。
  3. 速さと安さは本物、ただし倍率は控えめに。1回0.07〜0.5秒、1,000トークンの判断で約0.00004ドル。宣伝の「193.6倍速い」は自社評価の最良に近く、公平な公開デモでは、全問正解の最速AIの約3倍、最新の大型AI(GPT・Claudeの上位モデルなど)の約5〜20倍でした。
  4. 万能ではありません。文章は書けず、画像も読めず、「これはフィッシング?」と1問で聞くとClaude Haiku 4.5に負けた検証もあります。小さな質問に分けて使うのがコツです。
  5. これから:「AIを見張るAI」が標準部品になり、「反射(Jev型)+熟考(大型AI)+規則(プログラム)」の3段構えが定番になる、と予想します(根拠は第8章)。今日は、自分の仕事から「選択肢を先に書き出せる判断」を1つ探してみてください。

Jevの本質は「賢さ」ではなく「回数」。人間には無理な回数の判断を、毎秒・ほぼ無料で回せる。ここから新しい使い方が生まれています。

CHAP1

第1章 / 全8章+Q&A

まず3分で分かる:Jevは「マークシート方式」のAI

📝

ChatGPTは「記述式」、Jevは「マークシート式」

Jevは、TypeSafe AI社が2026年9月15日に公開したAIモデルです(現在は先行公開=Early Access中)。ChatGPTのようなAIは、答えを文章で1語ずつ書きます(記述式の試験)。Jevは違います。用意された選択肢から1つ選び、「どれくらい自信があるか」も一緒に返すだけです(マークシート式の試験)。書く時間がないぶん、答えが速く、料金も安く済みます。TypeSafe社は、心理学でいう「直感で速く判断する思考(システム1)」にちなんで、この種類のAIを「System One(システムワン)モデル」と呼んでいます。

比べるポイント記述式のAI(ChatGPTなど)マークシート式のAI(Jev)
答え方文章を1語ずつ書く選択肢から選ぶ(確率つき)
応答の速さ数秒〜数分(公式の比較表では3〜329秒)0.07〜0.5秒(公称)
料金
(AIに読ませる量100万トークンあたり)
約0.2〜10ドル。書く分は約5倍0.042ドル。書く分は無料
得意文章・要約・コード・相談仕分け・採点・はい/いいえ・選択
苦手大量・高速の処理(時間と料金がかさむ)文章を書く、計算、日付の比較、画像を読む
人の準備質問を書くだけ答えの候補(選択肢)を先に決める

※ 速さと料金は、TypeSafe公式の比較表による数字です(第7章で検証します)。トークンとは、AIが読み取る文章量の単位です。

Jevが答える「3種類の質問」

型どんな質問?例(Cloudflare公式ドキュメントのサンプルより)返ってくる答え
Noul
(はい/いいえ型)
「はい」である確率を返すこの不審なログイン状況は、人が調べるべきか?0.81
(81%の確率で「はい」)
Choice
(選択型)
選択肢から1つ選ぶこの問い合わせは、どの部署に回す?(請求/技術/営業)請求(87%)
確信度0.80
Score
(点数型)
段階で採点するこのアカウント活動の危険度は?(低/中/高)高(84%)
確信度0.77

1回のやりとりは、こんな感じ

■ 入力(状況) アカウント作成から12日/ログイン失敗が5回/新しい国からパスワード再設定の要求/普段の端末からのログインは成功 ■ 質問と答え ①(点数)このアカウント活動の危険度は? 低・中・高 → 高(84%) 確信度 0.77 ②(はい/いいえ)人による確認に回すべきか? → 81%で「はい」 ■ ここから先は、人が書いたプログラムの仕事 「81%なら一時ロックして担当者に通知」など、どう動くかは自分で決める

Cloudflare公式ドキュメント「Account risk assessment」のサンプル出力(2026-09-20確認)。

💡

マークシートのたとえを、本物のJevに置き換えると

・選択肢 = 人が書いたプログラムが用意する「答えの範囲」
・問題文 = ログ・メール・ゲームの状況などを文字にしたもの(公式では「state」)
・自信の印 = 確信度(0〜1)。Jevが自分で返します(Noul型は、確率そのものが自信の代わり)
・マークシートと違って、選択肢づくりは人間の仕事です。選択肢が悪いと、答えも悪くなります。

🏷️

この記事の「根拠ラベル」の見方

公式 TypeSafe自身の資料 実測 第三者が手順やデータを公開して測ったもの 申告 X投稿などの自己申告(再現は未確認) 想定 「こう使える」という例だけで、実績の数字がないもの
紹介するGitHubのリポジトリは、すべて実在を確認しています(2026年9月20日)。

この記事の地図:Jevの使い方は5つに分けられる

役割ひとことで代表例章
① 反射神経1秒に何度も選ぶDoom・テトリス・Pong第2章
② 目と手画面の部品から、次の1手を選ぶ航空券の検索・パソコン操作第3章
③ 仕分け係大量の書類を、安く分けるメール500通が3.5セント第4章
④ 見張り役他のAIの入出力を検査する危険なコマンドの判定・AIへの不正な指示の検知第5章
⑤ 意外な使い方暮らしやツールの中に入り込むスマートホーム・スポンサースキップ第6章
第1章 おわり ―― 次は第2章「ゲーム」
CHAP2

第2章 / ① 反射神経

ゲームで、1秒に何度も選ぶ

🎮

なぜ、最初の例がゲームなの?

ゲームは待ってくれません。ボールは止まらず、敵は動き続けます。文章を書くAIは1回の判断に数秒かかるので、追いつけません。Jevは0.2秒前後で答えるので、「1秒に何度も判断する」ことの見せ場に、ゲームがちょうどよいのです。

💡

AIは、画面を見ていません

ゲームの例では、プログラムが状況を文字にして(例:「敵まで3マス・体力60」)、ルール上できる行動の一覧を用意し、Jevがその中から1つ選びます。TypeSafe公式のDoomデモも、画像ではなくテキストの状態データを使っています(画像は「まだ」とのこと)。ルールの判定や、失敗したときの代わりの動きは、プログラム側の仕事です。

遊びJevに選ばせていること数字・内容根拠
Doom敵への対応など、次の行動1秒に10回判断して、約7ドル/時間(約1,000円)公式
Wikiracing
(リンクだけをたどって、2つのページをつなぐ遊び)
数百〜数千のリンクから、次の1手選択肢は255個まで。それ以上は「採点→選択」の2段階公式
Pongパドルを上・下・そのまま12秒で47回判断(他のAIは2〜3回)。ただし遅延のデモ(下で解説)実測
Snake進む方向できる手はプログラムが作り、Jevは1回ごとに1つ選ぶ申告
スーパーマリオエミュレータの状態から、次の操作公開リポジトリあり(★291)申告
ポケモン赤分かれ道の選択だけ。道順や計算はプログラム1回およそ100ms申告
テトリスブロックの置き場所1手0.3秒。2分で357ピース・134ライン申告
Slay the Spire 2カードの選択1手0.7秒申告
Subway Surfersジャンプ・しゃがむ・レーン変更1セント未満で、50ゲームを同時に申告
Minecraft敵と戦うか、逃げるか約2分・約15万トークン・約1セント申告
ドローン
(パソコン内の物理シミュレータ)
進路の選択(1秒に2.5回)実機ではなく、シミュレータの中申告

※ 円は1ドル=150円で換算した目安です。

Pongの「47回 対 2回」を、公平に見直す

この数字は、Ablyというサービスの共同創業者Matthew O’Riordan氏が作った対戦デモのものです。ボールは「AIが1回判断するごとに1マス進む」作りなので、判断が遅いAIほど、ボールもゆっくり動きます。作者自身がREADMEで、これは遅延のデモであって、賢さのデモではないと明記していて、チャットAI側の正解率も95〜100%でした。

では、公平に測るとどうなるか。同じ作者が、同じ質問を各30回ずつ投げた追加測定(9月19日)を公開しています。

AI(設定)応答時間の中央値Jevとの差正解
Jev222ms1.0倍28/29
Ministral 3B(標準)396ms1.8倍26/30
Gemini 3.5 Flash-Lite(思考オフ)660ms3.0倍30/30
Claude Haiku 4.5(思考オフ)791ms3.6倍30/30
GPT-5.6 Sol(標準)1,153ms5.2倍30/30
GPT-6 Astra(推論・低)1,542ms6.9倍30/30
Claude Fable 5.1(適応思考・低)4,530ms20.4倍30/30

出典:Ably「jev-pong」README(2026-09-19測定、Vercel東海岸リージョンから、1語で答える1回の判断)。実測

読み取れることは3つです。①Jevは、全問正解できた最速のAI(Gemini 3.5 Flash-Lite)の約3倍、最新の大型AIの約5〜20倍の速さでした。速さは本物です。②それでも、宣伝の「193.6倍」とはだいぶ違います。測っているものが違うからです(宣伝=複雑な業務の流れ全体を自社で評価。Ably=1語で答える1回の判断を、データ公開つきで測定)。③Jevも29問中28問正解で、全問正解ではありませんでした。速さは、無料ではありません。

⚠ 注意:ゲームのデモから読み取れること・読み取れないこと

TypeSafe自身が、AIを使わない普通のDoomボットの方が上手にプレイできる、と認めています。デモが示しているのは「ゲームのうまさ」ではなく「反応の速さ」です。実用に置き換えるなら、「判断の回数がとても多い仕事」で、速さと安さが活きる、と読むのが安全です。

第2章 おわり ―― 次は第3章「ブラウザやパソコンの操作」
CHAP3

第3章 / ② 目と手

ブラウザやパソコンを動かす

🌐

AIは、どうやってブラウザを操作するの?

人は画面を見て「ここをクリック」と決めます。Jevの場合は、プログラムがページの操作できる部品(ボタン・入力欄など)に番号を振った一覧表を作り、Jevが「どの番号を、どう操作するか」を1回のやりとりで選びます。スクリーンショットは使いません。文字を入力する場面だけ、小さな文章AIが入れる文字を書きます。

■ プログラムが作る「部品の一覧表」(航空券検索ページの例) [1] ボタン  チケットの種類 ・ 往復 [2] 入力欄  出発地 ・ 東京 [3] 入力欄  到着地 ・ (空) [4] 入力欄  出発日 ・ (空) 選べる操作:クリック/文字入力/選択/スクロール/待つ/完了/行き詰まり ■ Jevの答え 「文字入力」を「[3]」に → 小さな文章AIが、入れる文字を書く:「ロンドン」

Browser Use社の公式サンプルの表([3] combobox Where to? ・ empty など)を、説明用に日本語化した例です。

「表を作る → Jevが選ぶ → ブラウザが実行する → 画面が変わる → また表を作る」。この繰り返しで、目的が達成されるまで進みます。

実例内容数字根拠
jev-ultrafast
(Browser Use社の公開リポジトリ)
Google Flightsで「チューリッヒ→ロンドンの片道」を検索7.1秒。Jevへの要求は17回(1回の中央値178ms)、入力は約9万トークン=公表単価で計算すると約0.004ドル実測
同じ仕組みの別の課題Wikipediaで指定の記事を開く/自作のホテル検索画面で条件を絞り込む2.8秒/1.9秒実測
Jev for Chrome
(非公式のChrome拡張)
今開いているタブを、ログインしたまま操作。パスワード欄は読まず、入力もしない設計デモは10回の判断で約13秒申告
Stagehand連携遠隔のブラウザで、ページの情報を渡してJevに次の操作を選ばせる1タスクあたり約0.001ドル申告
Macの画面全体部品の検出と文字認識(OCR)で画面を文字にして、Jevに渡す。画像は外に出さない1回およそ90ms申告

GitHubの調査(Qiita記事)では、ブラウザ・電卓・スマホ操作系の公開リポジトリが23件ありました。

⚠️

作者自身が書いている「できないこと」

・ページに埋め込まれた別画面、図形の描画領域、ファイルのアップロード、別タブのポップアップなどは未対応
・「完了」の判定は、Jev自身ではなく、別の検証役が画面を読み直して確かめる
・検証は、1つの課題を3回試しただけ。作者が、一般的な信頼性のベンチマークではないと明記

🚨 重要:ログイン済みのブラウザを、判断の速いAIに任せるということ

速く動くAIは、間違いも速く広がります。しかもJev自身、ページや文章に仕込まれた命令や誘導で、答えが動くことがあると公式が認めています(こうした攻撃を「プロンプトインジェクション」といい、AIが読む文章にこっそり命令を混ぜて操る手口です。仕組みは間接プロンプトインジェクションの解説記事をどうぞ)。
購入・送金・削除・送信のような取り返しのつかない操作は、確信度が高くても必ず人が確認してください。試すなら、専用のブラウザや、権限を絞ったアカウントで。「完了しました」というAIの申告だけを信じるのも禁物です。

第3章 おわり ―― 次は第4章「大量の仕分け」
CHAP4

第4章 / ③ 仕分け係

大量の書類を、安く・速く分ける

📬

いくらで、どれだけ回せる?

Jevの料金は「AIに読ませた量」だけで決まり、答えの分は無料です。だから1回の判断は、数千分の1セント。同じ状況に質問を増やしても、状況を読ませる分は1回で済みます(公式クックブックでは、13個の質問を1回にまとめると、別々に聞くより12.2倍安く、10倍速くなりました)。

判断の回数(1回1,000トークンとして)料金円の目安
1回約0.00004ドル約0.006円
1,000回約0.042ドル約6円
100万回約42ドル約6,300円

公式価格(入力0.042ドル/100万トークン、出力は無料)からの計算。1ドル=150円で換算。1,000トークンは、ざっくり日本語で数百文字〜千文字ほどの量です。

実例:何が、いくらで分けられた?

何を分ける?数字根拠
自分のメール500通の仕分け数秒・3.5セント申告
詐欺メール100通の判定(本物50・詐欺50)1.42秒で仕分け。確信度95%未満の31通だけ大型AIに回して、最終96/100正解。合計約0.07ドル申告
競合の広告724件(37ブランド)の分析40秒・約0.09ドル申告
見込み客700件の採点40秒・約0.09ドル申告
求人サイトHiringCafeの、履歴書と求人の関連度づけ人手の評価との順位相関:Jev 0.79/DeepSeek V4 Flash 0.77/Gemini 3.1 Flash-lite 0.72。費用はJevが最安と投稿申告
AI論文1,018本を24トピックに分類約0.08ドル。1本あたり中央値256ms申告
自分のX投稿3,282件に、8つずつ質問8分34秒・約0.13ドル申告
編集部の文章1,709件の「らしさ」判定(Every)合計0.01ドル未満・1段落0.35秒申告
Webページの「AIっぽさ」チェック(35項目)243ms・約0.00015ドル申告
サポート問い合わせの部署振り分け公式サンプルは約380トークン=約0.00002ドル公式
検索結果の並べ替え(30件の候補を1件ずつ採点)法務の検索課題40問で、正解が1位に来る割合が5%→18%、上位10件に入る割合が38%→62%(絶対値はまだ低い)公式
🧭

詐欺メール判定の「3段構え」(Hassan氏の投稿)

① Jevが100通を1.42秒で判定。費用は約0.003ドル(3分の1セント)
② 確信度が95%未満だった31通だけ、大型AI(Kimi K3)にもう一度判定させる。費用は約0.068ドル
③ 合わせて96/100正解。考え方は、安いところで大半をさばき、迷ったものだけ高い頭脳へ回すこと
※ 100通という小さな規模の、個人の投稿です。全部を大型AIに任せた場合との比較は示されていません。

業界別の「使えそうな場面」(公式の例示)

分野Jevに判断させること
カスタマーサポート問い合わせの内容・緊急度・返金の意図を判定して、担当窓口へ振り分ける
採用履歴書を、仕事に関係する条件に照らして採点し、迷うものは人へ
保険保険金請求の複雑さ・不足情報・不正の兆候を判定し、急ぐ案件を選ぶ
金融犯罪対策取引の説明文や過去の警報から、疑わしさの高い順に並べる
法務・コンプライアンス契約書の抜けている条項や、禁止された表現を見つける
ECモール出品情報の整理、偽物の兆候や禁止出品の検知
投稿・コメントの監視有害・スパム・個人情報の露出を、サービス独自の基準で判定
広告ブランドの安全性、規制に触れる表現、広告とページ内容の一致を確認
ゲーム運営チャットの荒らし、離脱しそうなプレイヤーの兆候を検知
研究論文が条件に合うかのふるい分け、引用が主張を支えているかの確認

想定 実績の数字はなく、TypeSafe公式の「Example use cases」が示した「こう使える」という例です。

第4章 おわり ―― 次は第5章「見張り役」
CHAP5

第5章 / ④ 見張り役

AIをチェックするAI(セキュリティの主戦場)

🛡️

なぜ「速くて安い」が、セキュリティに効くの?

AIが文章を作ったり、コマンドを実行したりするたびに、「悪い指示が混ざっていないか」「秘密が漏れていないか」「危険な操作ではないか」を毎回チェックしたい。でも大型AIで毎回調べると、時間も料金も倍かかります。1回0.2秒・数千分の1セントの見張り役なら、全件チェックが現実的になります。公式も、AIの入力・出力・道具の呼び出しすべてに「意味を見るチェック」を置く使い方(ガードレール=AIが道を外れないための安全柵)を、主な用途に挙げています。

見張る対象何をするか根拠
AIアプリの入出力「不正な指示(ジェイルブレイク=AIの安全ルールを回避させようとする入力)か」「従ったらどれだけ有害か」を採点し、通す・確認・止めるを決める公式
AIエージェントの
コマンド・道具の呼び出し
実行の前に危険度を採点し、許可・確認・拒否に振り分ける(jev-guard)。VercelのCEOが、コマンドの安全審査をJevに置き換えて、ほぼ最悪時の待ち時間が最大18倍速くなったと投稿した、とQiitaの調査記事が紹介申告
「終わりました」の検証コーディングAIが「完了」と言っても、変更したファイルとテスト結果の証拠を確かめ、未検証なら止める(jev-belay)。Jevへの問い合わせは1回だけ申告
コミット前の秘密情報チェック変更の記録を送る前に、差分に秘密の鍵や破壊的なコマンドがないかを1秒未満で確認(jev-git)申告
悪意あるコードの走査ソースや設定ファイルを走査し、しきい値を超えたら2回目の確認をして、報告の重大度を決める(is-malicious)申告
引用・でたらめのチェック引用元の前後の文脈が、その主張を本当に支えているかを判定し、怪しいものは人へ公式
資料検索つきAIに混ざる隠し命令検索で取り出した資料のうち、隠し命令を含むものを、AIに渡す前に落とす公式
セキュリティ警報の一次仕分け1警報につき15個の判断を1回で。約0.000082ドル・約270ms(判断を1個足しても約1ms増えるだけ)申告
動作ログの重要度づけログに重要度を付け、価値の低いものは高価なAI分析を飛ばす(jevlogs)申告
アカウントの不審検知ログイン失敗5回+新しい国からの再設定 → 「高リスク84%」「人の確認81%」(第1章の例)公式
AIの回答の採点役Everyは、編集部の文章1,709件を合計0.01ドル未満で採点。最上位級のAIが必要な採点で、25倍速く600倍安かったと投稿申告

実験で分かった「質問の分け方」の大切さ(フィッシングメール2,000通)

公開されていて再現できる検証(anisselbd/jev-phishing-bench)を紹介します。合成のフィッシングメール2,000通で、JevとClaude Haiku 4.5を比べたものです。

質問のしかた正解率1,000通あたりの料金メモ
Jevに「これはフィッシング?」と1問62.6%0.038ドルフィッシングを見つけられたのは43.2%(半数以上を見逃し)
Claude Haiku 4.5に、同じ1問81.3%0.462ドル見つけられたのは76.4%
Jevに5つの小さな質問(無料ホスティングか/送信元とリンク先は一致するか…)をして、点数を足し合わせて判定95.0%約0.04ドル半分のメールで重みを決め、残り半分で測った数字
(対照)AIを使わない単純なルール:短縮URLや無料ホストのリスト+送信元とリンク先の比較91.8%0円データが単純で、AIなしでも約92%出る
(対照)Haiku 4.5に、同じ5つの質問をして、同じ方法で合成93.2%約1.02ドルJevとの差は、統計的にはっきりしない

実測 出典:anisselbd/jev-phishing-bench README(2026-09-17)。データはPhishNChips v5.2(合成メール。正解ラベルはURLの評判情報から作成)。

⚠️

この検証から言えること

・1問で聞くと、Jevはフィッシングの半分以上を見逃しました。Jevに「最終判定」をさせないでください。
・小さな質問に分けて合成すると95%前後まで上がります。ただし、単純なルールでも約92%出るデータで、メールも実物ではなく合成です。
・Jevの強みは精度ではなく、同じ品質の判断を、約27倍安く・約5倍速く回せること(Haikuに同じ5つの質問をした場合との比較)です。

🚨 重要:見張り役自身が、騙される

公式ドキュメントは、Jevの弱点として、与えられた状況が単なるデータとして扱われ、敵意のある内容だとは最初から疑われないことを挙げています。命令を仕込んだ文章、誤解を誘う言い回し、自分の分類を主張する文章で、答えが動くことがあります。
だから、見張り役を1枚だけ置いて安心せず、①他の防御と重ねる(多層防御)、②攻撃文を用意して導入前に試す、③危険な操作は確信度が高くても人が確認、の3点を守ってください。

第5章 おわり ―― 次は第6章「意外な使い方」
CHAP6

第6章 / ⑤ 意外な使い方

暮らし・ツール・画面の中へ

🏠

息抜きの章:小さな道具の中に入り込む

速くて安い判断は、「入力しながら」「見ながら」「置いておくだけで」動く、小さな道具の中に入り込み始めています。ここに並べたものは、ほとんどが個人の試作です。

使い方内容根拠
スマートホーム「家中の電気を消して」を、種類・場所・機器・操作に分解して判断。関係ないかもしれない質問も先に一括で投げ、いらない答えはあとで捨てる。雑談や複雑な依頼だけ文章AIに回す(公式デモ)。スマートホーム用のオープンソースソフト(Home Assistant)に組み込む公開リポジトリもある(★28)公式
YouTubeの
スポンサー区間スキップ
字幕を読んで、区間ごとに「スポンサーである確率」を出す。SponsorBlock(みんなで広告区間を記録する仕組み)が記録した区間の77%を、23本の動画で捕捉。誤ってスキップした時間は1時間あたり34秒。1本約0.0008ドル申告
ダウンロードフォルダの自動整理請求書かどうかを判定して、決まったフォルダに正しいファイル名で移す。文章AIは使わない申告
キー入力の先回り「さっきダウンロードしたPDF」と打つだけで、最新のPDFが候補の先頭に。1文字ごとに約100ms申告
表計算の自動採点列の名前に「緊急度」と打つと、各行を「フォロー不要」〜「緊急」で自動評価(1行あたり約100ms)申告
リアルタイムClippy迷い・つまずきを検知して、困っていそうなときだけ助け舟を出す申告
SNSの投稿フィルター「こんな投稿は隠す」と自然な言葉で指定する拡張機能。速すぎて気づかないという投稿申告
データベースの意味検索SQLの条件に「在宅勤務できそうな人」のような文章を書ける拡張。129行を約1秒・約0.0009ドル。2回目はキャッシュで6ms申告
自動売買暗号資産の売買判断を、1秒未満のループで行う公開リポジトリ(★1,407)。既定は模擬売買。おすすめしません申告
⚠ 注意:便利さと引き換えに、データが外へ出る

キー入力を1文字ごとに外部のサービスへ送る仕組み、家の状況を送るスマートホーム、ブラウザの中身を読む拡張機能。Jevは今のところ外部のサービスとして呼び出す形なので、入力したものは外へ出ます。送ってよいデータかを、先に確認してください。お金が動く仕組み(自動売買など)は、特に慎重に。

第6章 おわり ―― 次は第7章「落とし穴」
CHAP7

第7章 / 落とし穴

数字を鵜呑みにしないための8つの確認

🔎

発表から5日。数字の多くは「自己申告」です

ここまでの数字の大半は、TypeSafe自身か、個人の申告です。使う前に、次の8つを確認してください。

確認ポイント何が起きる?根拠
① 倍率は、自社の最良に近い値「193.6倍速い・444.6倍安い」は、自社が作った業務フロー評価の数字です。公式も、実際の効果の中では高い側の数字だと説明しています。基準は、他社の大型AI2つの平均予測との一致で、正解ラベルではありません。公平な公開デモでは約3〜20倍公式 実測
② 精度は、最上位のAIに一歩劣る自社評価で67.8%。GPT-5.6 Sol 74.1%、Opus 5 73.1%(報道による)。1問で聞くと見逃しも多い(第5章)公式
③ 「でたらめを言わない」は、形だけ「答えの形が崩れない」ことは、設計上保証されます。中身が正しい保証ではありません(公式も、個々の答えが正しいことまでは保証しないと明記)公式
④ 苦手なことが決まっている計算・数え上げ・日付の比較・二重否定・文章の生成。関係のない情報が多いと精度が下がり、質問の言葉は字義どおりに読まれます公式
⑤ 悪意ある文章で、答えが動く命令を仕込んだ文章などで、答えが動くことがあると公式が認めています(第5章)公式
⑥ 日本語と、日本からの利用英語が最も精度が高く、日本語などは、対応はするが同等ではない(公式)。個人の検証(48回・208件)は良好ですが小規模です。サービスは米国西海岸で、待ち時間の実測は300ミリ秒前後公式 申告
⑦ 単価が安くても、システム全体は安くならないYTAL社の本番ログ検証:Jev単体は約96%安いのに、判断の保留が多く、全体では約4.1%高くなる試算で採用見送り(下の囲み)実測
⑧ 先行公開の不安定さと、データの行き先先行公開中で、レート制限は変動(現在1分1,200リクエスト)。価格が補助されている可能性も公式が認めています。入力は外部へ送られます(Vercel経由なら、ゼロデータ保持・学習に使わない指定が可能)公式
🧮

検算のすすめ:数字を見たら、まず掛け算

たとえば「2,200万トークンを使って、費用は数セント」という投稿があります(Smash Bros.を4キャラ同時に動かしたデモ)。公表単価(入力0.042ドル/100万トークン、出力は無料)で計算すると、全部が入力でも約0.92ドル、出力分を引いても0.7ドル台で、「数セント」とは開きがあります。割引や計測方法の違いなど、別の事情があるのかもしれません。
一方、「X投稿3,282件で合計約425万トークン、0.1282ドル」という別の投稿は、出力分が無料であることを考えると、つじつまが合います。数字は、掛け算で確かめてから使いましょう。

🏢

実際に本番の記録で試した会社は、採用を見送った

業務資料67件から作った525個の項目の「名寄せ」(「A社」と「株式会社A」のように、同じものを1つにまとめる作業)を、本番の保存済みログを使って再現した検証です(YTAL社、2026年9月17日)。Jev単体の料金は本番処理の約4%(=約96%安い)でしたが、判断を保留したものが228件と多く、それを既存の処理に戻す設計だと、システム全体では約4.1%高くなる試算でした。
同社は、今回の設計のままでは本番の名寄せに採用しないとしつつ、Jevが名寄せに向かないという意味ではなく、保留が多く見えたのは質問の単位や集約ルールなど自社の設計の影響が大きかったと分析しています。 実測

✅ 使う前の5つの質問(Jev向き度チェック)

  • 答えの候補(選択肢)を、先に書き出せる
  • 間違えたとき、取り返しがつく(取り返しがつかない操作は、必ず人が確認する)
  • 計算・日付・個数の数え上げは、プログラムに任せられる
  • 迷ったものを送る先(人・大型AI・別の仕組み)がある
  • 自分のデータ100件ほどで、正解率と確信度の関係を測れる(正解の分かっているデータがある)

5つ全部にチェックがつかないなら、まだJevの出番ではありません。

第7章 おわり ―― 次は最終章「統合と未来予想」
CHAP8

第8章 / 統合と未来予想

使い方は全部「同じ形」。そして、これから起きること

🧩

4つの役割は、実は同じ「3段構え」

ゲーム、ブラウザ、仕分け、見張り。使い方はバラバラに見えますが、中身はどれも同じ形です。①プログラムが状況を文字にして選択肢を用意し、②Jevが選び、③確信度で「そのまま実行/確認/実行せず人か大型AIへ」を仕分けます。公式ドキュメントも、確信度を高・中・低の3つに分けて使うことを、最初の型として勧めています。

🔧 全部に共通する「3段構え」

① プログラムが整える 状況を文字にして、選択肢を用意 ② Jevが選ぶ 0.2秒・数千分の1セント・確信度つき ③ 確信度で仕分け(プログラムの仕事) 高い そのまま 自動で実行 中くらい 人や本人に 確認する 低い 実行せず 大型AIか人へ 危険な操作ほど、高い基準を求める 例:残高を見る→0.6以上/送金の承認→0.85超
役割① プログラムが用意② Jevが選ぶ③ 自信が低いとき
ゲーム今できる手の一覧と状況次の1手プログラム側に用意した、安全な代わりの動きに切り替える
ブラウザ操作部品の番号表操作と対象確信度50%未満の「完了」「行き詰まり」は1回だけ再確認。3回連続で変化がなければ停止(Jev for Chrome)
仕分け書類の要点分類・点数大型AIか人へ(詐欺メールの例では31通)
見張りAIの入出力・コマンド危険か・違反か実行せず確認、または拒否(jev-guard)

確信度の基準は、危険度で変える

操作自動で実行する基準理由
残高を見る確信度0.6以上間違えても、画面を見直すだけで済む
送金を承認する0.85を超えたとき(0.6〜0.85は本人に確認)取り返しがつかないので、基準を高くする
どれにも自信がない0.6未満は人へ「分からない」を正直に返せるのが強み

公式 公式ドキュメント「Confidence-gated routing」の音声バンキングの例。数字はあくまで例で、公式も、保守的な基準から始め、自分のデータで試して調整するよう勧めています。

未来予想:根拠と、外れる条件つきで

🔮

予想の読み方

ここからは、事実ではなく予想です。「根拠」は確認できた事実、「確度」は私の見立て、「外れる条件」はその予想が崩れるきっかけです。モデル名の「Jev」は、蒸気機関が効率化されると石炭の使用量がかえって増えた、という歴史で知られる経済学者ジェヴォンズにちなんだもの。TypeSafe自身は、AIの判断が1桁安くなるたびに、用途は桁違いに増えると見ています。

半年〜1年:もう始まっていること

予想根拠(確認できた事実)確度/外れる条件
「AIを見張るAI」が、AIエージェントの標準部品になるGitHub 383件の調査で最多は、コーディングAI向けの道具(77件)申告。VercelとCloudflareが公式に提供公式。公式も用途の柱に「ガードレール」を挙げる公式確度:高め
外れる条件:命令を仕込んだ文章で、見張り役が簡単に突破される事例が続く。または、大型AI側の標準機能に吸収される
同じ方式のモデルが、他社やオープンソースからも出てくるJev互換の再現実装がすでに22件(Qiita調査)。オープンモデルで動く互換サーバー(openjev-sglang ★207)、Apple Siliconで動かす実験(jevmlx)も公開済み申告確度:高い(すでに始まっている)
外れる条件:確信度の質(自信が当たっているか)が本家に遠く及ばず、広まらない
対応範囲が広がる(画像・音声・日本語)公式ブログは画像を「まだ(yet)」と書き、今は文字のみ公式。個人が画面を文字にして回避している申告。日本語は英語ほど良くないと公式が認める公式確度:中(時期は不明)
外れる条件:「文字だけ」で速さと安さを守る方針が続き、画像対応は別の製品になる

1〜3年:定番になっていくこと

予想根拠(確認できた事実)確度/外れる条件
「反射(Jev型)+熟考(大型AI)+規則(プログラム)」の3段構えが、業務システムの定石になる公式が、確信度で3段階に分ける設計を最初の型として推奨公式。詐欺メールで31通だけ大型AIに回した例申告。ただし総コストは設計次第(YTAL)実測確度:中〜高
外れる条件:小型の文章AIがさらに速く安くなり、分ける手間に見合わなくなる(Ablyの表でも、小型モデルは約2〜4倍差まで迫っている)
画面や道具が「先回り」するようになるキー入力の先回り・表計算の自動採点は約100ms申告。公式は、150ms=人の知覚より速い判断を売りにしている公式確度:中
外れる条件:入力を外部に送ることへの抵抗が強い。または、端末の中で動く小型モデルに置き換わる
セキュリティ運用で一次仕分けが自動化され、人は「迷いの大きい判断」に集中する1警報15判断が約270ms・約0.000082ドル申告。公式サンプルにアカウントの危険度判定公式。ただし1問判定はフィッシングの見逃しが多い実測確度:中
外れる条件:見逃しによる大きな事故が起きる。または「理由の説明」が必須の領域で、確率だけの判断が使えない

3年以降:不確実だが、備えておきたいこと

予想根拠(確認できた事実)確度/外れる条件
攻撃する側も、自動化のコストが下がる(筆者の推測)推測の材料:ブラウザ操作が1手あたり約0.0002ドルになったという報告申告。ブラウザ操作の公開リポジトリが、公開から数日で約1万スター実測確度:「コストが下がる」は中。「どれだけ悪用されるか」は不明
外れる条件:本人確認や行動分析など、自動操作を見抜く仕組みが先に進む。防御側も同じ道具を使える
AIの判断が「何%の自信で決めたか」つきで、記録に残る公式が、確率と確信度を返し、結果をログに残す設計を勧める公式。ただしJevは、理由を文章では説明しない公式確度:中〜低
外れる条件:規制や監査で「理由の説明」が求められ、確率だけでは足りないとされる
🚫

たぶん起きないこと

・Jev型がChatGPT型を置き換える:文章を書けない設計なので、起きません。役割分担になります。
・実機のロボット・ドローン・自動運転への本格導入が、すぐ広がる:今の例はシミュレータの中だけで、安全性の検証も公開されていません。

今日からできること

あなたが…まずやることやってはいけないこと
個人・ブロガー自分の作業から「選択肢を先に書き出せる判断」を1つ探す(例:メールの振り分け)。Made with Jevの実例で雰囲気をつかむ「数セントで全部できる」という投稿を、検算せずに信じる
情シス・セキュリティ担当過去のアラートやメール100件ほどで試し、正解と確信度の関係を測る。迷いの大きい判断は人へ回す設計にする1問で「悪意があるか?」と聞いて、本番の判定に使う
開発者質問を小さく分け、状況の文字はできるだけ短く、計算と日付はプログラムで。確信度の基準は危険度ごとに変える送金・削除・購入などの操作を、確信度だけで自動化する
経営・管理職「モデル単体の料金」ではなく、「迷ったものを戻す先まで含めた総コスト」で評価するよう求める自社発表の倍率(193.6倍など)を、そのまま稟議に書く
✅ まとめ:Jevの本質は「賢さ」ではなく「回数」

Jevは、文章を書くAIの代わりではなく、「回数の多い小さな判断」を任せる新しい部品です。使い方はゲーム・ブラウザ・仕分け・見張りと広がっていますが、中身はどれも同じ「選択肢を用意 → Jevが選ぶ → 確信度で仕分け」の3段構え。迷ったものは大型AIか人へ回します。この形を押さえておけば、これから出てくる新しい使い方も、同じ目線で見分けられます。

第8章 おわり ―― 次はよくある質問
Q&A?

よくある質問

Jevの使い方について、よくある質問

Jevは、今すぐ使えますか?

TypeSafe直営の窓口は、順次招待(待機リスト)です。9月16日からVercel AI Gateway(モデルID:typesafe-ai/jev)で、Cloudflare Workers AI(typesafe/jev)でも呼び出せます。料金は、TypeSafe直営とVercelで入力0.042ドル/100万トークン、出力は無料です(Cloudflareは料金ページで確認してください)。2026年9月20日時点の情報です。

ChatGPTの代わりになりますか?

なりません。Jevは、返信・コード・理由の説明を作りません(公式が明記)。文章を書くAIと役割分担する部品です。

自分でゲームやブラウザ操作を試せますか?

公開リポジトリ(jev-ultrafastなど)はありますが、APIキーと従量課金が必要で、動作は自己責任です。ブラウザ操作は、ログイン済みの環境を避け、使える金額の上限を決めて試してください。

個人情報や社内データを送っても大丈夫ですか?

入力は外部のサービスに送られます。TypeSafeは顧客データを学習に使わないと説明し、ゼロデータ保持は企業向けに提供しています。Vercel AI Gateway経由なら、リクエスト単位で「ゼロデータ保持」「学習に使わない」を指定できます。それでも、送ってよいデータかどうかは、自社の規程で確認してください。

日本語でも使えますか?

公式は、英語が最良で、日本語などは、対応はするが同等ではないとしています。個人の検証(日本語16文×3回、208件の分類など)は良好でしたが、小規模です。自分のデータで、正解率と確信度の関係を測ってから使いましょう。サービスは米国拠点で、日本からの待ち時間は300ミリ秒前後です。

「193.6倍速い」は、嘘なのですか?

嘘とは言えませんが、自社の複雑な業務フロー評価の、高い側の数字だと公式が説明しています。公平に測った公開デモでは約3〜20倍でした。倍率より、自分の仕事で測った数字を信じてください。

未来予想は、どのくらい当たりますか?

確度と外れる条件を併記しました。特に3年以降は不確実です。先行公開中で状況が速く動くため、2026年11月に見直します。

セキュリティ担当者は、何を気にすべきですか?

①見張り役自身が騙される点(プロンプトインジェクション)、②1問判定の見逃し、③入力データの行き先、④攻撃側の自動化コストの低下(筆者の推測)、の4つです。

主な出典(一次情報を優先・2026-09-20確認)

TypeSafe公式・提供元

第三者の検証・測定

  • Ably「jev-pong」README(Pongの遅延比較・30回の追加測定)— github.com/ably-labs/jev-pong
  • Browser Use「jev-ultrafast」README・performance.md — github.com/browser-use/jev-ultrafast
  • anisselbd「jev-phishing-bench」(フィッシング2,000通の比較・対照実験つき)— github.com/anisselbd/jev-phishing-bench
  • YTAL「TypeSafe AIの「Jev」は本番で使えるか。本番環境のログで名寄せを再生して見えた、AI運用の設計課題」(2026-09-17)— ytal.io
  • Supa Journal「Jevはどれだけ優秀なif文か?軽量モデルを分類器用途で比較してみた」— journal.supa.ai
  • Zenn「文章を生成しないAI「Jev」を日本語で48回試した。速さより面白かったのは「迷い」」— zenn.dev
  • RuntimeWire「TypeSafe raises $40M for Jev, its AI model built to skip chat」— runtimewire.com
  • The Register「TypeSafe AI debuts model for machines that plays Doom」(2026-09-16)— theregister.com

事例集・調査記事(個人の申告を含む)

※ Jevは執筆時点(2026年9月20日)で先行公開中の新製品です。仕様・料金・レート制限・精度指標は今後変わる可能性が高いため、導入検討時は必ず公式ドキュメント(docs.typesafe.ai)の最新情報を確認してください。GitHubのスター数も同日時点の値です。見直し目安:2026-11(正式版への移行、独立検証の公開状況、第8章の予想の答え合わせ)。

あわせて読みたい

🔮 「賢さ」より「回数」のAI

Jevの使い方は、ゲーム・ブラウザ・仕分け・見張りと急速に広がっています。ただし、ここで紹介した数字の多くは自社か個人の申告で、正解率では最上位のAIに一歩及びません。「選択肢を用意して、確信度で仕分け、迷ったら人へ」。この形を守って、小さく試すのが安全な入り口です。

やさしいサイバーセキュリティ / 最終更新:2026年9月20日 | 掲載情報は執筆時点のものです

コメント