Jev、何に使える?ゲーム・ブラウザ操作・大量仕分け・AIの見張り役。使い方を並べて、未来まで予想する
文章を書かず「選ぶ」だけのAI。だから、1秒に何度も判断できる。
結論:Jevは「書くAI」ではなく「選ぶAI」。だから“1秒に何度も・大量に・ほぼ無料で”判断する仕事に向いている
- 使い方は大きく4つ+おまけ。ゲームなどの「反射神経」、ブラウザやパソコンを動かす「目と手」、大量の書類を分ける「仕分け係」、他のAIを検査する「見張り役」。公式・第三者・個人の報告から、50件以上を集めました(公式の想定例を含む)。
- 仕組みはどれも同じ。プログラムが状況を文字にして選択肢を用意し、Jevが1つ選ぶだけです。画面や映像を「見て」動いているわけではありません。
- 速さと安さは本物、ただし倍率は控えめに。1回0.07〜0.5秒、1,000トークンの判断で約0.00004ドル。宣伝の「193.6倍速い」は自社評価の最良に近く、公平な公開デモでは、全問正解の最速AIの約3倍、最新の大型AI(GPT・Claudeの上位モデルなど)の約5〜20倍でした。
- 万能ではありません。文章は書けず、画像も読めず、「これはフィッシング?」と1問で聞くとClaude Haiku 4.5に負けた検証もあります。小さな質問に分けて使うのがコツです。
- これから:「AIを見張るAI」が標準部品になり、「反射(Jev型)+熟考(大型AI)+規則(プログラム)」の3段構えが定番になる、と予想します(根拠は第8章)。今日は、自分の仕事から「選択肢を先に書き出せる判断」を1つ探してみてください。
Jevの本質は「賢さ」ではなく「回数」。人間には無理な回数の判断を、毎秒・ほぼ無料で回せる。ここから新しい使い方が生まれています。
📋 目次
- まず3分で分かる:Jevは「マークシート方式」のAI
- ① 反射神経:ゲームで、1秒に何度も選ぶ
- ② 目と手:ブラウザやパソコンを動かす
- ③ 仕分け係:大量の書類を、安く・速く分ける
- ④ 見張り役:AIをチェックするAI
- ⑤ 意外な使い方:暮らし・ツール・画面の中へ
- 落とし穴:数字を鵜呑みにしない8つの確認
- 統合と未来予想:全部“同じ形”、そして次に起きること
- よくある質問
※ 表は「辞書」として使ってください。気になる行だけ読めば十分です。
まず3分で分かる:Jevは「マークシート方式」のAI
ChatGPTは「記述式」、Jevは「マークシート式」
Jevは、TypeSafe AI社が2026年9月15日に公開したAIモデルです(現在は先行公開=Early Access中)。ChatGPTのようなAIは、答えを文章で1語ずつ書きます(記述式の試験)。Jevは違います。用意された選択肢から1つ選び、「どれくらい自信があるか」も一緒に返すだけです(マークシート式の試験)。書く時間がないぶん、答えが速く、料金も安く済みます。TypeSafe社は、心理学でいう「直感で速く判断する思考(システム1)」にちなんで、この種類のAIを「System One(システムワン)モデル」と呼んでいます。
| 比べるポイント | 記述式のAI(ChatGPTなど) | マークシート式のAI(Jev) |
|---|---|---|
| 答え方 | 文章を1語ずつ書く | 選択肢から選ぶ(確率つき) |
| 応答の速さ | 数秒〜数分(公式の比較表では3〜329秒) | 0.07〜0.5秒(公称) |
| 料金 (AIに読ませる量100万トークンあたり) | 約0.2〜10ドル。書く分は約5倍 | 0.042ドル。書く分は無料 |
| 得意 | 文章・要約・コード・相談 | 仕分け・採点・はい/いいえ・選択 |
| 苦手 | 大量・高速の処理(時間と料金がかさむ) | 文章を書く、計算、日付の比較、画像を読む |
| 人の準備 | 質問を書くだけ | 答えの候補(選択肢)を先に決める |
※ 速さと料金は、TypeSafe公式の比較表による数字です(第7章で検証します)。トークンとは、AIが読み取る文章量の単位です。
Jevが答える「3種類の質問」
| 型 | どんな質問? | 例(Cloudflare公式ドキュメントのサンプルより) | 返ってくる答え |
|---|---|---|---|
| Noul (はい/いいえ型) | 「はい」である確率を返す | この不審なログイン状況は、人が調べるべきか? | 0.81 (81%の確率で「はい」) |
| Choice (選択型) | 選択肢から1つ選ぶ | この問い合わせは、どの部署に回す?(請求/技術/営業) | 請求(87%) 確信度0.80 |
| Score (点数型) | 段階で採点する | このアカウント活動の危険度は?(低/中/高) | 高(84%) 確信度0.77 |
1回のやりとりは、こんな感じ
Cloudflare公式ドキュメント「Account risk assessment」のサンプル出力(2026-09-20確認)。
マークシートのたとえを、本物のJevに置き換えると
・選択肢 = 人が書いたプログラムが用意する「答えの範囲」
・問題文 = ログ・メール・ゲームの状況などを文字にしたもの(公式では「state」)
・自信の印 = 確信度(0〜1)。Jevが自分で返します(Noul型は、確率そのものが自信の代わり)
・マークシートと違って、選択肢づくりは人間の仕事です。選択肢が悪いと、答えも悪くなります。
この記事の「根拠ラベル」の見方
公式 TypeSafe自身の資料 実測 第三者が手順やデータを公開して測ったもの 申告 X投稿などの自己申告(再現は未確認) 想定 「こう使える」という例だけで、実績の数字がないもの
紹介するGitHubのリポジトリは、すべて実在を確認しています(2026年9月20日)。
この記事の地図:Jevの使い方は5つに分けられる
| 役割 | ひとことで | 代表例 | 章 |
|---|---|---|---|
| ① 反射神経 | 1秒に何度も選ぶ | Doom・テトリス・Pong | 第2章 |
| ② 目と手 | 画面の部品から、次の1手を選ぶ | 航空券の検索・パソコン操作 | 第3章 |
| ③ 仕分け係 | 大量の書類を、安く分ける | メール500通が3.5セント | 第4章 |
| ④ 見張り役 | 他のAIの入出力を検査する | 危険なコマンドの判定・AIへの不正な指示の検知 | 第5章 |
| ⑤ 意外な使い方 | 暮らしやツールの中に入り込む | スマートホーム・スポンサースキップ | 第6章 |
ゲームで、1秒に何度も選ぶ
なぜ、最初の例がゲームなの?
ゲームは待ってくれません。ボールは止まらず、敵は動き続けます。文章を書くAIは1回の判断に数秒かかるので、追いつけません。Jevは0.2秒前後で答えるので、「1秒に何度も判断する」ことの見せ場に、ゲームがちょうどよいのです。
AIは、画面を見ていません
ゲームの例では、プログラムが状況を文字にして(例:「敵まで3マス・体力60」)、ルール上できる行動の一覧を用意し、Jevがその中から1つ選びます。TypeSafe公式のDoomデモも、画像ではなくテキストの状態データを使っています(画像は「まだ」とのこと)。ルールの判定や、失敗したときの代わりの動きは、プログラム側の仕事です。
| 遊び | Jevに選ばせていること | 数字・内容 | 根拠 |
|---|---|---|---|
| Doom | 敵への対応など、次の行動 | 1秒に10回判断して、約7ドル/時間(約1,000円) | 公式 |
| Wikiracing (リンクだけをたどって、2つのページをつなぐ遊び) | 数百〜数千のリンクから、次の1手 | 選択肢は255個まで。それ以上は「採点→選択」の2段階 | 公式 |
| Pong | パドルを上・下・そのまま | 12秒で47回判断(他のAIは2〜3回)。ただし遅延のデモ(下で解説) | 実測 |
| Snake | 進む方向 | できる手はプログラムが作り、Jevは1回ごとに1つ選ぶ | 申告 |
| スーパーマリオ | エミュレータの状態から、次の操作 | 公開リポジトリあり(★291) | 申告 |
| ポケモン赤 | 分かれ道の選択だけ。道順や計算はプログラム | 1回およそ100ms | 申告 |
| テトリス | ブロックの置き場所 | 1手0.3秒。2分で357ピース・134ライン | 申告 |
| Slay the Spire 2 | カードの選択 | 1手0.7秒 | 申告 |
| Subway Surfers | ジャンプ・しゃがむ・レーン変更 | 1セント未満で、50ゲームを同時に | 申告 |
| Minecraft | 敵と戦うか、逃げるか | 約2分・約15万トークン・約1セント | 申告 |
| ドローン (パソコン内の物理シミュレータ) | 進路の選択(1秒に2.5回) | 実機ではなく、シミュレータの中 | 申告 |
※ 円は1ドル=150円で換算した目安です。
Pongの「47回 対 2回」を、公平に見直す
この数字は、Ablyというサービスの共同創業者Matthew O’Riordan氏が作った対戦デモのものです。ボールは「AIが1回判断するごとに1マス進む」作りなので、判断が遅いAIほど、ボールもゆっくり動きます。作者自身がREADMEで、これは遅延のデモであって、賢さのデモではないと明記していて、チャットAI側の正解率も95〜100%でした。
では、公平に測るとどうなるか。同じ作者が、同じ質問を各30回ずつ投げた追加測定(9月19日)を公開しています。
| AI(設定) | 応答時間の中央値 | Jevとの差 | 正解 |
|---|---|---|---|
| Jev | 222ms | 1.0倍 | 28/29 |
| Ministral 3B(標準) | 396ms | 1.8倍 | 26/30 |
| Gemini 3.5 Flash-Lite(思考オフ) | 660ms | 3.0倍 | 30/30 |
| Claude Haiku 4.5(思考オフ) | 791ms | 3.6倍 | 30/30 |
| GPT-5.6 Sol(標準) | 1,153ms | 5.2倍 | 30/30 |
| GPT-6 Astra(推論・低) | 1,542ms | 6.9倍 | 30/30 |
| Claude Fable 5.1(適応思考・低) | 4,530ms | 20.4倍 | 30/30 |
出典:Ably「jev-pong」README(2026-09-19測定、Vercel東海岸リージョンから、1語で答える1回の判断)。実測
読み取れることは3つです。①Jevは、全問正解できた最速のAI(Gemini 3.5 Flash-Lite)の約3倍、最新の大型AIの約5〜20倍の速さでした。速さは本物です。②それでも、宣伝の「193.6倍」とはだいぶ違います。測っているものが違うからです(宣伝=複雑な業務の流れ全体を自社で評価。Ably=1語で答える1回の判断を、データ公開つきで測定)。③Jevも29問中28問正解で、全問正解ではありませんでした。速さは、無料ではありません。
TypeSafe自身が、AIを使わない普通のDoomボットの方が上手にプレイできる、と認めています。デモが示しているのは「ゲームのうまさ」ではなく「反応の速さ」です。実用に置き換えるなら、「判断の回数がとても多い仕事」で、速さと安さが活きる、と読むのが安全です。
ブラウザやパソコンを動かす
AIは、どうやってブラウザを操作するの?
人は画面を見て「ここをクリック」と決めます。Jevの場合は、プログラムがページの操作できる部品(ボタン・入力欄など)に番号を振った一覧表を作り、Jevが「どの番号を、どう操作するか」を1回のやりとりで選びます。スクリーンショットは使いません。文字を入力する場面だけ、小さな文章AIが入れる文字を書きます。
Browser Use社の公式サンプルの表([3] combobox Where to? ・ empty など)を、説明用に日本語化した例です。
「表を作る → Jevが選ぶ → ブラウザが実行する → 画面が変わる → また表を作る」。この繰り返しで、目的が達成されるまで進みます。
| 実例 | 内容 | 数字 | 根拠 |
|---|---|---|---|
| jev-ultrafast (Browser Use社の公開リポジトリ) | Google Flightsで「チューリッヒ→ロンドンの片道」を検索 | 7.1秒。Jevへの要求は17回(1回の中央値178ms)、入力は約9万トークン=公表単価で計算すると約0.004ドル | 実測 |
| 同じ仕組みの別の課題 | Wikipediaで指定の記事を開く/自作のホテル検索画面で条件を絞り込む | 2.8秒/1.9秒 | 実測 |
| Jev for Chrome (非公式のChrome拡張) | 今開いているタブを、ログインしたまま操作。パスワード欄は読まず、入力もしない設計 | デモは10回の判断で約13秒 | 申告 |
| Stagehand連携 | 遠隔のブラウザで、ページの情報を渡してJevに次の操作を選ばせる | 1タスクあたり約0.001ドル | 申告 |
| Macの画面全体 | 部品の検出と文字認識(OCR)で画面を文字にして、Jevに渡す。画像は外に出さない | 1回およそ90ms | 申告 |
GitHubの調査(Qiita記事)では、ブラウザ・電卓・スマホ操作系の公開リポジトリが23件ありました。
作者自身が書いている「できないこと」
・ページに埋め込まれた別画面、図形の描画領域、ファイルのアップロード、別タブのポップアップなどは未対応
・「完了」の判定は、Jev自身ではなく、別の検証役が画面を読み直して確かめる
・検証は、1つの課題を3回試しただけ。作者が、一般的な信頼性のベンチマークではないと明記
速く動くAIは、間違いも速く広がります。しかもJev自身、ページや文章に仕込まれた命令や誘導で、答えが動くことがあると公式が認めています(こうした攻撃を「プロンプトインジェクション」といい、AIが読む文章にこっそり命令を混ぜて操る手口です。仕組みは間接プロンプトインジェクションの解説記事をどうぞ)。
購入・送金・削除・送信のような取り返しのつかない操作は、確信度が高くても必ず人が確認してください。試すなら、専用のブラウザや、権限を絞ったアカウントで。「完了しました」というAIの申告だけを信じるのも禁物です。
大量の書類を、安く・速く分ける
いくらで、どれだけ回せる?
Jevの料金は「AIに読ませた量」だけで決まり、答えの分は無料です。だから1回の判断は、数千分の1セント。同じ状況に質問を増やしても、状況を読ませる分は1回で済みます(公式クックブックでは、13個の質問を1回にまとめると、別々に聞くより12.2倍安く、10倍速くなりました)。
| 判断の回数(1回1,000トークンとして) | 料金 | 円の目安 |
|---|---|---|
| 1回 | 約0.00004ドル | 約0.006円 |
| 1,000回 | 約0.042ドル | 約6円 |
| 100万回 | 約42ドル | 約6,300円 |
公式価格(入力0.042ドル/100万トークン、出力は無料)からの計算。1ドル=150円で換算。1,000トークンは、ざっくり日本語で数百文字〜千文字ほどの量です。
実例:何が、いくらで分けられた?
| 何を分ける? | 数字 | 根拠 |
|---|---|---|
| 自分のメール500通の仕分け | 数秒・3.5セント | 申告 |
| 詐欺メール100通の判定(本物50・詐欺50) | 1.42秒で仕分け。確信度95%未満の31通だけ大型AIに回して、最終96/100正解。合計約0.07ドル | 申告 |
| 競合の広告724件(37ブランド)の分析 | 40秒・約0.09ドル | 申告 |
| 見込み客700件の採点 | 40秒・約0.09ドル | 申告 |
| 求人サイトHiringCafeの、履歴書と求人の関連度づけ | 人手の評価との順位相関:Jev 0.79/DeepSeek V4 Flash 0.77/Gemini 3.1 Flash-lite 0.72。費用はJevが最安と投稿 | 申告 |
| AI論文1,018本を24トピックに分類 | 約0.08ドル。1本あたり中央値256ms | 申告 |
| 自分のX投稿3,282件に、8つずつ質問 | 8分34秒・約0.13ドル | 申告 |
| 編集部の文章1,709件の「らしさ」判定(Every) | 合計0.01ドル未満・1段落0.35秒 | 申告 |
| Webページの「AIっぽさ」チェック(35項目) | 243ms・約0.00015ドル | 申告 |
| サポート問い合わせの部署振り分け | 公式サンプルは約380トークン=約0.00002ドル | 公式 |
| 検索結果の並べ替え(30件の候補を1件ずつ採点) | 法務の検索課題40問で、正解が1位に来る割合が5%→18%、上位10件に入る割合が38%→62%(絶対値はまだ低い) | 公式 |
詐欺メール判定の「3段構え」(Hassan氏の投稿)
① Jevが100通を1.42秒で判定。費用は約0.003ドル(3分の1セント)
② 確信度が95%未満だった31通だけ、大型AI(Kimi K3)にもう一度判定させる。費用は約0.068ドル
③ 合わせて96/100正解。考え方は、安いところで大半をさばき、迷ったものだけ高い頭脳へ回すこと
※ 100通という小さな規模の、個人の投稿です。全部を大型AIに任せた場合との比較は示されていません。
業界別の「使えそうな場面」(公式の例示)
| 分野 | Jevに判断させること |
|---|---|
| カスタマーサポート | 問い合わせの内容・緊急度・返金の意図を判定して、担当窓口へ振り分ける |
| 採用 | 履歴書を、仕事に関係する条件に照らして採点し、迷うものは人へ |
| 保険 | 保険金請求の複雑さ・不足情報・不正の兆候を判定し、急ぐ案件を選ぶ |
| 金融犯罪対策 | 取引の説明文や過去の警報から、疑わしさの高い順に並べる |
| 法務・コンプライアンス | 契約書の抜けている条項や、禁止された表現を見つける |
| ECモール | 出品情報の整理、偽物の兆候や禁止出品の検知 |
| 投稿・コメントの監視 | 有害・スパム・個人情報の露出を、サービス独自の基準で判定 |
| 広告 | ブランドの安全性、規制に触れる表現、広告とページ内容の一致を確認 |
| ゲーム運営 | チャットの荒らし、離脱しそうなプレイヤーの兆候を検知 |
| 研究 | 論文が条件に合うかのふるい分け、引用が主張を支えているかの確認 |
想定 実績の数字はなく、TypeSafe公式の「Example use cases」が示した「こう使える」という例です。
AIをチェックするAI(セキュリティの主戦場)
なぜ「速くて安い」が、セキュリティに効くの?
AIが文章を作ったり、コマンドを実行したりするたびに、「悪い指示が混ざっていないか」「秘密が漏れていないか」「危険な操作ではないか」を毎回チェックしたい。でも大型AIで毎回調べると、時間も料金も倍かかります。1回0.2秒・数千分の1セントの見張り役なら、全件チェックが現実的になります。公式も、AIの入力・出力・道具の呼び出しすべてに「意味を見るチェック」を置く使い方(ガードレール=AIが道を外れないための安全柵)を、主な用途に挙げています。
| 見張る対象 | 何をするか | 根拠 |
|---|---|---|
| AIアプリの入出力 | 「不正な指示(ジェイルブレイク=AIの安全ルールを回避させようとする入力)か」「従ったらどれだけ有害か」を採点し、通す・確認・止めるを決める | 公式 |
| AIエージェントの コマンド・道具の呼び出し | 実行の前に危険度を採点し、許可・確認・拒否に振り分ける(jev-guard)。VercelのCEOが、コマンドの安全審査をJevに置き換えて、ほぼ最悪時の待ち時間が最大18倍速くなったと投稿した、とQiitaの調査記事が紹介 | 申告 |
| 「終わりました」の検証 | コーディングAIが「完了」と言っても、変更したファイルとテスト結果の証拠を確かめ、未検証なら止める(jev-belay)。Jevへの問い合わせは1回だけ | 申告 |
| コミット前の秘密情報チェック | 変更の記録を送る前に、差分に秘密の鍵や破壊的なコマンドがないかを1秒未満で確認(jev-git) | 申告 |
| 悪意あるコードの走査 | ソースや設定ファイルを走査し、しきい値を超えたら2回目の確認をして、報告の重大度を決める(is-malicious) | 申告 |
| 引用・でたらめのチェック | 引用元の前後の文脈が、その主張を本当に支えているかを判定し、怪しいものは人へ | 公式 |
| 資料検索つきAIに混ざる隠し命令 | 検索で取り出した資料のうち、隠し命令を含むものを、AIに渡す前に落とす | 公式 |
| セキュリティ警報の一次仕分け | 1警報につき15個の判断を1回で。約0.000082ドル・約270ms(判断を1個足しても約1ms増えるだけ) | 申告 |
| 動作ログの重要度づけ | ログに重要度を付け、価値の低いものは高価なAI分析を飛ばす(jevlogs) | 申告 |
| アカウントの不審検知 | ログイン失敗5回+新しい国からの再設定 → 「高リスク84%」「人の確認81%」(第1章の例) | 公式 |
| AIの回答の採点役 | Everyは、編集部の文章1,709件を合計0.01ドル未満で採点。最上位級のAIが必要な採点で、25倍速く600倍安かったと投稿 | 申告 |
実験で分かった「質問の分け方」の大切さ(フィッシングメール2,000通)
公開されていて再現できる検証(anisselbd/jev-phishing-bench)を紹介します。合成のフィッシングメール2,000通で、JevとClaude Haiku 4.5を比べたものです。
| 質問のしかた | 正解率 | 1,000通あたりの料金 | メモ |
|---|---|---|---|
| Jevに「これはフィッシング?」と1問 | 62.6% | 0.038ドル | フィッシングを見つけられたのは43.2%(半数以上を見逃し) |
| Claude Haiku 4.5に、同じ1問 | 81.3% | 0.462ドル | 見つけられたのは76.4% |
| Jevに5つの小さな質問(無料ホスティングか/送信元とリンク先は一致するか…)をして、点数を足し合わせて判定 | 95.0% | 約0.04ドル | 半分のメールで重みを決め、残り半分で測った数字 |
| (対照)AIを使わない単純なルール:短縮URLや無料ホストのリスト+送信元とリンク先の比較 | 91.8% | 0円 | データが単純で、AIなしでも約92%出る |
| (対照)Haiku 4.5に、同じ5つの質問をして、同じ方法で合成 | 93.2% | 約1.02ドル | Jevとの差は、統計的にはっきりしない |
実測 出典:anisselbd/jev-phishing-bench README(2026-09-17)。データはPhishNChips v5.2(合成メール。正解ラベルはURLの評判情報から作成)。
この検証から言えること
・1問で聞くと、Jevはフィッシングの半分以上を見逃しました。Jevに「最終判定」をさせないでください。
・小さな質問に分けて合成すると95%前後まで上がります。ただし、単純なルールでも約92%出るデータで、メールも実物ではなく合成です。
・Jevの強みは精度ではなく、同じ品質の判断を、約27倍安く・約5倍速く回せること(Haikuに同じ5つの質問をした場合との比較)です。
公式ドキュメントは、Jevの弱点として、与えられた状況が単なるデータとして扱われ、敵意のある内容だとは最初から疑われないことを挙げています。命令を仕込んだ文章、誤解を誘う言い回し、自分の分類を主張する文章で、答えが動くことがあります。
だから、見張り役を1枚だけ置いて安心せず、①他の防御と重ねる(多層防御)、②攻撃文を用意して導入前に試す、③危険な操作は確信度が高くても人が確認、の3点を守ってください。
暮らし・ツール・画面の中へ
息抜きの章:小さな道具の中に入り込む
速くて安い判断は、「入力しながら」「見ながら」「置いておくだけで」動く、小さな道具の中に入り込み始めています。ここに並べたものは、ほとんどが個人の試作です。
| 使い方 | 内容 | 根拠 |
|---|---|---|
| スマートホーム | 「家中の電気を消して」を、種類・場所・機器・操作に分解して判断。関係ないかもしれない質問も先に一括で投げ、いらない答えはあとで捨てる。雑談や複雑な依頼だけ文章AIに回す(公式デモ)。スマートホーム用のオープンソースソフト(Home Assistant)に組み込む公開リポジトリもある(★28) | 公式 |
| YouTubeの スポンサー区間スキップ | 字幕を読んで、区間ごとに「スポンサーである確率」を出す。SponsorBlock(みんなで広告区間を記録する仕組み)が記録した区間の77%を、23本の動画で捕捉。誤ってスキップした時間は1時間あたり34秒。1本約0.0008ドル | 申告 |
| ダウンロードフォルダの自動整理 | 請求書かどうかを判定して、決まったフォルダに正しいファイル名で移す。文章AIは使わない | 申告 |
| キー入力の先回り | 「さっきダウンロードしたPDF」と打つだけで、最新のPDFが候補の先頭に。1文字ごとに約100ms | 申告 |
| 表計算の自動採点 | 列の名前に「緊急度」と打つと、各行を「フォロー不要」〜「緊急」で自動評価(1行あたり約100ms) | 申告 |
| リアルタイムClippy | 迷い・つまずきを検知して、困っていそうなときだけ助け舟を出す | 申告 |
| SNSの投稿フィルター | 「こんな投稿は隠す」と自然な言葉で指定する拡張機能。速すぎて気づかないという投稿 | 申告 |
| データベースの意味検索 | SQLの条件に「在宅勤務できそうな人」のような文章を書ける拡張。129行を約1秒・約0.0009ドル。2回目はキャッシュで6ms | 申告 |
| 自動売買 | 暗号資産の売買判断を、1秒未満のループで行う公開リポジトリ(★1,407)。既定は模擬売買。おすすめしません | 申告 |
キー入力を1文字ごとに外部のサービスへ送る仕組み、家の状況を送るスマートホーム、ブラウザの中身を読む拡張機能。Jevは今のところ外部のサービスとして呼び出す形なので、入力したものは外へ出ます。送ってよいデータかを、先に確認してください。お金が動く仕組み(自動売買など)は、特に慎重に。
数字を鵜呑みにしないための8つの確認
発表から5日。数字の多くは「自己申告」です
ここまでの数字の大半は、TypeSafe自身か、個人の申告です。使う前に、次の8つを確認してください。
| 確認ポイント | 何が起きる? | 根拠 |
|---|---|---|
| ① 倍率は、自社の最良に近い値 | 「193.6倍速い・444.6倍安い」は、自社が作った業務フロー評価の数字です。公式も、実際の効果の中では高い側の数字だと説明しています。基準は、他社の大型AI2つの平均予測との一致で、正解ラベルではありません。公平な公開デモでは約3〜20倍 | 公式 実測 |
| ② 精度は、最上位のAIに一歩劣る | 自社評価で67.8%。GPT-5.6 Sol 74.1%、Opus 5 73.1%(報道による)。1問で聞くと見逃しも多い(第5章) | 公式 |
| ③ 「でたらめを言わない」は、形だけ | 「答えの形が崩れない」ことは、設計上保証されます。中身が正しい保証ではありません(公式も、個々の答えが正しいことまでは保証しないと明記) | 公式 |
| ④ 苦手なことが決まっている | 計算・数え上げ・日付の比較・二重否定・文章の生成。関係のない情報が多いと精度が下がり、質問の言葉は字義どおりに読まれます | 公式 |
| ⑤ 悪意ある文章で、答えが動く | 命令を仕込んだ文章などで、答えが動くことがあると公式が認めています(第5章) | 公式 |
| ⑥ 日本語と、日本からの利用 | 英語が最も精度が高く、日本語などは、対応はするが同等ではない(公式)。個人の検証(48回・208件)は良好ですが小規模です。サービスは米国西海岸で、待ち時間の実測は300ミリ秒前後 | 公式 申告 |
| ⑦ 単価が安くても、システム全体は安くならない | YTAL社の本番ログ検証:Jev単体は約96%安いのに、判断の保留が多く、全体では約4.1%高くなる試算で採用見送り(下の囲み) | 実測 |
| ⑧ 先行公開の不安定さと、データの行き先 | 先行公開中で、レート制限は変動(現在1分1,200リクエスト)。価格が補助されている可能性も公式が認めています。入力は外部へ送られます(Vercel経由なら、ゼロデータ保持・学習に使わない指定が可能) | 公式 |
検算のすすめ:数字を見たら、まず掛け算
たとえば「2,200万トークンを使って、費用は数セント」という投稿があります(Smash Bros.を4キャラ同時に動かしたデモ)。公表単価(入力0.042ドル/100万トークン、出力は無料)で計算すると、全部が入力でも約0.92ドル、出力分を引いても0.7ドル台で、「数セント」とは開きがあります。割引や計測方法の違いなど、別の事情があるのかもしれません。
一方、「X投稿3,282件で合計約425万トークン、0.1282ドル」という別の投稿は、出力分が無料であることを考えると、つじつまが合います。数字は、掛け算で確かめてから使いましょう。
実際に本番の記録で試した会社は、採用を見送った
業務資料67件から作った525個の項目の「名寄せ」(「A社」と「株式会社A」のように、同じものを1つにまとめる作業)を、本番の保存済みログを使って再現した検証です(YTAL社、2026年9月17日)。Jev単体の料金は本番処理の約4%(=約96%安い)でしたが、判断を保留したものが228件と多く、それを既存の処理に戻す設計だと、システム全体では約4.1%高くなる試算でした。
同社は、今回の設計のままでは本番の名寄せに採用しないとしつつ、Jevが名寄せに向かないという意味ではなく、保留が多く見えたのは質問の単位や集約ルールなど自社の設計の影響が大きかったと分析しています。 実測
✅ 使う前の5つの質問(Jev向き度チェック)
- 答えの候補(選択肢)を、先に書き出せる
- 間違えたとき、取り返しがつく(取り返しがつかない操作は、必ず人が確認する)
- 計算・日付・個数の数え上げは、プログラムに任せられる
- 迷ったものを送る先(人・大型AI・別の仕組み)がある
- 自分のデータ100件ほどで、正解率と確信度の関係を測れる(正解の分かっているデータがある)
5つ全部にチェックがつかないなら、まだJevの出番ではありません。
使い方は全部「同じ形」。そして、これから起きること
4つの役割は、実は同じ「3段構え」
ゲーム、ブラウザ、仕分け、見張り。使い方はバラバラに見えますが、中身はどれも同じ形です。①プログラムが状況を文字にして選択肢を用意し、②Jevが選び、③確信度で「そのまま実行/確認/実行せず人か大型AIへ」を仕分けます。公式ドキュメントも、確信度を高・中・低の3つに分けて使うことを、最初の型として勧めています。
🔧 全部に共通する「3段構え」
| 役割 | ① プログラムが用意 | ② Jevが選ぶ | ③ 自信が低いとき |
|---|---|---|---|
| ゲーム | 今できる手の一覧と状況 | 次の1手 | プログラム側に用意した、安全な代わりの動きに切り替える |
| ブラウザ操作 | 部品の番号表 | 操作と対象 | 確信度50%未満の「完了」「行き詰まり」は1回だけ再確認。3回連続で変化がなければ停止(Jev for Chrome) |
| 仕分け | 書類の要点 | 分類・点数 | 大型AIか人へ(詐欺メールの例では31通) |
| 見張り | AIの入出力・コマンド | 危険か・違反か | 実行せず確認、または拒否(jev-guard) |
確信度の基準は、危険度で変える
| 操作 | 自動で実行する基準 | 理由 |
|---|---|---|
| 残高を見る | 確信度0.6以上 | 間違えても、画面を見直すだけで済む |
| 送金を承認する | 0.85を超えたとき(0.6〜0.85は本人に確認) | 取り返しがつかないので、基準を高くする |
| どれにも自信がない | 0.6未満は人へ | 「分からない」を正直に返せるのが強み |
公式 公式ドキュメント「Confidence-gated routing」の音声バンキングの例。数字はあくまで例で、公式も、保守的な基準から始め、自分のデータで試して調整するよう勧めています。
未来予想:根拠と、外れる条件つきで
予想の読み方
ここからは、事実ではなく予想です。「根拠」は確認できた事実、「確度」は私の見立て、「外れる条件」はその予想が崩れるきっかけです。モデル名の「Jev」は、蒸気機関が効率化されると石炭の使用量がかえって増えた、という歴史で知られる経済学者ジェヴォンズにちなんだもの。TypeSafe自身は、AIの判断が1桁安くなるたびに、用途は桁違いに増えると見ています。
半年〜1年:もう始まっていること
| 予想 | 根拠(確認できた事実) | 確度/外れる条件 |
|---|---|---|
| 「AIを見張るAI」が、AIエージェントの標準部品になる | GitHub 383件の調査で最多は、コーディングAI向けの道具(77件)申告。VercelとCloudflareが公式に提供公式。公式も用途の柱に「ガードレール」を挙げる公式 | 確度:高め 外れる条件:命令を仕込んだ文章で、見張り役が簡単に突破される事例が続く。または、大型AI側の標準機能に吸収される |
| 同じ方式のモデルが、他社やオープンソースからも出てくる | Jev互換の再現実装がすでに22件(Qiita調査)。オープンモデルで動く互換サーバー(openjev-sglang ★207)、Apple Siliconで動かす実験(jevmlx)も公開済み申告 | 確度:高い(すでに始まっている) 外れる条件:確信度の質(自信が当たっているか)が本家に遠く及ばず、広まらない |
| 対応範囲が広がる(画像・音声・日本語) | 公式ブログは画像を「まだ(yet)」と書き、今は文字のみ公式。個人が画面を文字にして回避している申告。日本語は英語ほど良くないと公式が認める公式 | 確度:中(時期は不明) 外れる条件:「文字だけ」で速さと安さを守る方針が続き、画像対応は別の製品になる |
1〜3年:定番になっていくこと
| 予想 | 根拠(確認できた事実) | 確度/外れる条件 |
|---|---|---|
| 「反射(Jev型)+熟考(大型AI)+規則(プログラム)」の3段構えが、業務システムの定石になる | 公式が、確信度で3段階に分ける設計を最初の型として推奨公式。詐欺メールで31通だけ大型AIに回した例申告。ただし総コストは設計次第(YTAL)実測 | 確度:中〜高 外れる条件:小型の文章AIがさらに速く安くなり、分ける手間に見合わなくなる(Ablyの表でも、小型モデルは約2〜4倍差まで迫っている) |
| 画面や道具が「先回り」するようになる | キー入力の先回り・表計算の自動採点は約100ms申告。公式は、150ms=人の知覚より速い判断を売りにしている公式 | 確度:中 外れる条件:入力を外部に送ることへの抵抗が強い。または、端末の中で動く小型モデルに置き換わる |
| セキュリティ運用で一次仕分けが自動化され、人は「迷いの大きい判断」に集中する | 1警報15判断が約270ms・約0.000082ドル申告。公式サンプルにアカウントの危険度判定公式。ただし1問判定はフィッシングの見逃しが多い実測 | 確度:中 外れる条件:見逃しによる大きな事故が起きる。または「理由の説明」が必須の領域で、確率だけの判断が使えない |
3年以降:不確実だが、備えておきたいこと
| 予想 | 根拠(確認できた事実) | 確度/外れる条件 |
|---|---|---|
| 攻撃する側も、自動化のコストが下がる(筆者の推測) | 推測の材料:ブラウザ操作が1手あたり約0.0002ドルになったという報告申告。ブラウザ操作の公開リポジトリが、公開から数日で約1万スター実測 | 確度:「コストが下がる」は中。「どれだけ悪用されるか」は不明 外れる条件:本人確認や行動分析など、自動操作を見抜く仕組みが先に進む。防御側も同じ道具を使える |
| AIの判断が「何%の自信で決めたか」つきで、記録に残る | 公式が、確率と確信度を返し、結果をログに残す設計を勧める公式。ただしJevは、理由を文章では説明しない公式 | 確度:中〜低 外れる条件:規制や監査で「理由の説明」が求められ、確率だけでは足りないとされる |
たぶん起きないこと
・Jev型がChatGPT型を置き換える:文章を書けない設計なので、起きません。役割分担になります。
・実機のロボット・ドローン・自動運転への本格導入が、すぐ広がる:今の例はシミュレータの中だけで、安全性の検証も公開されていません。
今日からできること
| あなたが… | まずやること | やってはいけないこと |
|---|---|---|
| 個人・ブロガー | 自分の作業から「選択肢を先に書き出せる判断」を1つ探す(例:メールの振り分け)。Made with Jevの実例で雰囲気をつかむ | 「数セントで全部できる」という投稿を、検算せずに信じる |
| 情シス・セキュリティ担当 | 過去のアラートやメール100件ほどで試し、正解と確信度の関係を測る。迷いの大きい判断は人へ回す設計にする | 1問で「悪意があるか?」と聞いて、本番の判定に使う |
| 開発者 | 質問を小さく分け、状況の文字はできるだけ短く、計算と日付はプログラムで。確信度の基準は危険度ごとに変える | 送金・削除・購入などの操作を、確信度だけで自動化する |
| 経営・管理職 | 「モデル単体の料金」ではなく、「迷ったものを戻す先まで含めた総コスト」で評価するよう求める | 自社発表の倍率(193.6倍など)を、そのまま稟議に書く |
Jevは、文章を書くAIの代わりではなく、「回数の多い小さな判断」を任せる新しい部品です。使い方はゲーム・ブラウザ・仕分け・見張りと広がっていますが、中身はどれも同じ「選択肢を用意 → Jevが選ぶ → 確信度で仕分け」の3段構え。迷ったものは大型AIか人へ回します。この形を押さえておけば、これから出てくる新しい使い方も、同じ目線で見分けられます。
Jevの使い方について、よくある質問
Jevは、今すぐ使えますか?
TypeSafe直営の窓口は、順次招待(待機リスト)です。9月16日からVercel AI Gateway(モデルID:typesafe-ai/jev)で、Cloudflare Workers AI(typesafe/jev)でも呼び出せます。料金は、TypeSafe直営とVercelで入力0.042ドル/100万トークン、出力は無料です(Cloudflareは料金ページで確認してください)。2026年9月20日時点の情報です。
ChatGPTの代わりになりますか?
なりません。Jevは、返信・コード・理由の説明を作りません(公式が明記)。文章を書くAIと役割分担する部品です。
自分でゲームやブラウザ操作を試せますか?
公開リポジトリ(jev-ultrafastなど)はありますが、APIキーと従量課金が必要で、動作は自己責任です。ブラウザ操作は、ログイン済みの環境を避け、使える金額の上限を決めて試してください。
個人情報や社内データを送っても大丈夫ですか?
入力は外部のサービスに送られます。TypeSafeは顧客データを学習に使わないと説明し、ゼロデータ保持は企業向けに提供しています。Vercel AI Gateway経由なら、リクエスト単位で「ゼロデータ保持」「学習に使わない」を指定できます。それでも、送ってよいデータかどうかは、自社の規程で確認してください。
日本語でも使えますか?
公式は、英語が最良で、日本語などは、対応はするが同等ではないとしています。個人の検証(日本語16文×3回、208件の分類など)は良好でしたが、小規模です。自分のデータで、正解率と確信度の関係を測ってから使いましょう。サービスは米国拠点で、日本からの待ち時間は300ミリ秒前後です。
「193.6倍速い」は、嘘なのですか?
嘘とは言えませんが、自社の複雑な業務フロー評価の、高い側の数字だと公式が説明しています。公平に測った公開デモでは約3〜20倍でした。倍率より、自分の仕事で測った数字を信じてください。
未来予想は、どのくらい当たりますか?
確度と外れる条件を併記しました。特に3年以降は不確実です。先行公開中で状況が速く動くため、2026年11月に見直します。
セキュリティ担当者は、何を気にすべきですか?
①見張り役自身が騙される点(プロンプトインジェクション)、②1問判定の見逃し、③入力データの行き先、④攻撃側の自動化コストの低下(筆者の推測)、の4つです。
主な出典(一次情報を優先・2026-09-20確認)
TypeSafe公式・提供元
- TypeSafe AI公式ブログ「Introducing System One Models & Jev」(2026-09-15)— typesafe.ai/blog/introducing-system-one-models-and-jev
- 公式ドキュメント:Models/Jev 1.13 jaggedness/Example use cases/Confidence/Confidence-gated routing/Guardrails for LLMs/Smart home demo
- Vercel「TypeSafe AI’s Jev now available on AI Gateway」(2026-09-16)— vercel.com/changelog
- Cloudflare AI docs「Jev (typesafe)」— developers.cloudflare.com/ai/models/typesafe/jev
第三者の検証・測定
- Ably「jev-pong」README(Pongの遅延比較・30回の追加測定)— github.com/ably-labs/jev-pong
- Browser Use「jev-ultrafast」README・performance.md — github.com/browser-use/jev-ultrafast
- anisselbd「jev-phishing-bench」(フィッシング2,000通の比較・対照実験つき)— github.com/anisselbd/jev-phishing-bench
- YTAL「TypeSafe AIの「Jev」は本番で使えるか。本番環境のログで名寄せを再生して見えた、AI運用の設計課題」(2026-09-17)— ytal.io
- Supa Journal「Jevはどれだけ優秀なif文か?軽量モデルを分類器用途で比較してみた」— journal.supa.ai
- Zenn「文章を生成しないAI「Jev」を日本語で48回試した。速さより面白かったのは「迷い」」— zenn.dev
- RuntimeWire「TypeSafe raises $40M for Jev, its AI model built to skip chat」— runtimewire.com
- The Register「TypeSafe AI debuts model for machines that plays Doom」(2026-09-16)— theregister.com
事例集・調査記事(個人の申告を含む)
- Made with Jev(X投稿などの事例を集めたページ。各事例に出典リンクあり)— madewithjev.com
- Qiita「Jev(TypeSafe AI)はみんなどうやって使っているのか?」(GitHub 383件の分類)— qiita.com
- MindStudio「Jev AI Plays Minecraft, Subway Surfers, and Drives Cars: Demos Reviewed」— mindstudio.ai
- awesome-jev-by-typesafe(用途と実装の一覧)— github.com/Anil-matcha/awesome-jev-by-typesafe
- 紹介したGitHubリポジトリ(すべて実在確認済み):jev-guard/jev-belay/jev-git/is-malicious/jevlogs/jev-skip/jev-for-chrome/typesafe-mario/typesafe-snake/jev-plays-pokemon-red/jev-drone/HA-Jev/jev-trader/openjev-sglang/jevmlx
※ Jevは執筆時点(2026年9月20日)で先行公開中の新製品です。仕様・料金・レート制限・精度指標は今後変わる可能性が高いため、導入検討時は必ず公式ドキュメント(docs.typesafe.ai)の最新情報を確認してください。GitHubのスター数も同日時点の値です。見直し目安:2026-11(正式版への移行、独立検証の公開状況、第8章の予想の答え合わせ)。
あわせて読みたい
- 見張り役が騙される仕組み:間接プロンプトインジェクション実践編|Web・メール・PDFに潜む「見えない命令」の仕組みと防御
- AIに操作を任せるときの安全対策:AIエージェント/MCPのセキュリティ完全ガイド
- 「仕分け係」を自分で作ってみる:Ollamaで作るAI-SOC|Webログを自動でトリアージ
- AI×セキュリティの記事を一覧で:AI×セキュリティ完全ガイド|記事まとめ
🔮 「賢さ」より「回数」のAI
Jevの使い方は、ゲーム・ブラウザ・仕分け・見張りと急速に広がっています。ただし、ここで紹介した数字の多くは自社か個人の申告で、正解率では最上位のAIに一歩及びません。「選択肢を用意して、確信度で仕分け、迷ったら人へ」。この形を守って、小さく試すのが安全な入り口です。
やさしいサイバーセキュリティ / 最終更新:2026年9月20日 | 掲載情報は執筆時点のものです


コメント