EP19 Jev / System One — 出典と測定条件
確認日:2026-09-20。画面共有用資料は Jev / System One — 判断を、ソフトウェアの部品にする。
読み方と操作
HTML をブラウザで開く。「説明用の例」と表示した図解・操作例は概念の説明。「実測(2026-09-20、Claude が手元で測定)」および公開評価とは区別する。引用図の原著者は TypeSafe AI。各図の出典リンクと figures/ の同梱画像を参照。性能・較正・入力対応は確認日時点の情報。
Jev API と SemIf の小規模な実測結果を、このページの「手元で実測したこと」に要約した。日本語は各 1 例のみ。ホスト自身の利用経験や本番導入効果の確認とは分ける。番組では資料で確認したことと、実際に使って分かったことを分ける。
訂正(2026-09-20):前版と実測メモの「output tokensが課金される」という解釈は、本資料では採用しない。実測が示すのは利用量報告の数値であり、料金ではない。TypeSafe公式Models は入力に課金し、出力トークンは無料と説明している。Gateway経由の請求明細は確認していない。根拠メモの原文は変更していない。
用語は「何をするためのものか」から説明する
| 用語 | 意味と、ここで使う理由 |
|---|---|
| LLM | 大量の文章から学んだ言語モデル。文章の生成や説明を担当する。型を指定したデータを作ることもできる |
| トークン | モデルが文章を扱うときの単位。単語や文字の一部に相当し、1文字と同じではない。SemIfでは答えを1トークンの文字に割り当て、長い文章を作る手間を省く |
| logits(ロジット) | 次に出すトークンの候補ごとに、モデルが計算した点数。負の値も取り、確率とは異なる。SemIfは生成する前にこの点数を読む |
| softmax(ソフトマックス) | 各点数を指数関数で正の値に変換し、その合計で割る計算。高い点数ほど大きく、全体で1になる。SemIfでは指定した選択肢だけに適用し、候補間の確率を得る。現実の正答率に合う保証はない |
| argmax(アーグマックス) | 値が最大になる選択肢を取り出す操作。今回の比較では「最も確率が高い答えが同じか」を調べるために使う。最大値そのものとは違う |
| 分布 | 各候補に確率がどう配られているか。最高確率の答えが同じでも、ほかの候補に残る確率は違いうる |
| 較正(キャリブレーション) | 予測の確率と、実際に当たる割合を近づけること。80%と予測した事例を集めたときに、実際にも約80%が当たるかを見る。個々の答えの正解保証ではない |
| primitive(プリミティブ) | プログラムから呼ぶための基本的な問いの種類。JevはChoice・Score・Noulを用意し、開発者が用途に合う回答形式を選べる |
| confidence | Choice・Scoreが返す、確率の配分全体から求める補助指標。最大確率そのものでも、個々の答えの正解保証でもない。Noulには付かない |
| RLHF / RLVR / RLCD | 言語モデルに追加で学ばせる方法。順に、人の好む答え、正否を検証できる課題、確率と現実の一致を重視する。最後のRLCDはTypeSafeが説明する学習方法 |
| 閾値 | 確率などの数値で処理を分ける境目。モデルの値が境目の近くで揺れる場合、人の確認に回すなどの設計が必要 |
| 4bit / BF16 | モデルの数値を保存・計算するときの精度。4bitは軽量化できるが、数値や判断が変わる場合がある。今回の手元測定は4bit、公開比較はBF16で、同じ条件ではない |
| シャドー評価 | 既存の処理を変えず、新しい判定も並行して記録する方法。導入前に、食い違う場面や見逃しを調べるために使う |
| wedge | 新しい事業で最初に顧客へ届ける、狭く具体的な用途。今回は「AIの判断全般」から、返信の確認先や商品照合へ絞る議論 |
一次ソース
| ID | 出典 | 支える内容 | 読み方 |
|---|---|---|---|
| S1 | Introducing System One Models & Jev / 2026-09-15 | 2年のステルス開発、初の公開モデル、並列 sampler、RLCD、workflow eval | 創業者・提供元の発表。2年間の内訳や開発マイルストーンまでは未公開 |
| S2 | InstructGPT paper / 2022-03-04 | Diogo Almeida が共著者 | RLHF全体の単独発明者、ChatGPT全体の単独開発者とは書かない |
| S3 | Manifesto | machine-native / composable AI、意味判断を通常のコードへ組み込む思想 | 会社の戦略・世界観。AGI達成や経済成長の予測を客観的事実にしない |
| S4 | The Bitterest Lesson | 課題設定 → データ → 計算資源 → アルゴリズムという優先順位 | 著者の主張。普遍的な定理ではない |
| S5 | System One | テキスト入力、型付き判断と確率、自由文を生成しない | System One は TypeSafe の呼称。人間の認知区分がそのままモデル分類になるわけではない |
| S6 | AI primer | RLHF / RLVR / RLCD、事前学習済み言語モデルからの分岐、校正の意味 | 公開された概念説明。モデルサイズ、層構造、損失関数の全仕様を示す論文とは異なる |
| S7 | Choice | 定義済み候補から選択、全候補の確率、confidence | スキーマ内でも意味的に間違った候補を選びうる |
| S8 | Score | 順序付きの記述レベル、その間を含むスコア、分布、confidence | 単なる好きな数値の自由生成とは違う |
| S9 | Noul | 命題が真である確率 0〜1 | separate confidence はない。0.5付近は不確実、0付近は強いNo |
| S10 | Confidence | Choice / Score の分布の形から算出、実行・確認・エスカレーション | confidence と選択肢の確率を同一視しない。適切な閾値は利用データで検証 |
| S11 | How to build with TypeSafe | 決定論的ルール・制御フロー・副作用はコード、狭い判断だけモデル | 複数の独立した問いをまとめ、必要な答えをコードで組み合わせる |
| S12 | Workflow evals | 提供元が公開した比較の詳細 | 193.6倍 / 444.6倍は万能な倍率ではない。S1の条件・注釈とセットで読む |
| S13 | Lies, Damned Lies, and Benchmarks | 公開ベンチマークへの最適化を避け、日付付き評価と注釈を出す方針 | 会社の評価思想。自社evalの独立性まで保証するものではない |
| S14 | Models | テキストのみ、英語が主、日本語等は精度が一様でない。顧客ごとのfine-tuningなし | 日本語実データで検証。モデルIDを記録して閾値の前提を保つ |
| S15 | Jev 1.13 jaggedness / 最終レビュー2026-09-17 | 計算・日付・長い無関係な入力・多段の間接参照・敵対的入力等の弱点 | 型制約と注入耐性は別。厳密な計算や論理的整合性はコードで担保 |
| S16 | SemIf | 旧OpenJev。独立プロジェクト、TypeSafe 非公式、MIT。オープンモデルによるlogits直読みの実装 | Jevの非公開モデル・学習の再現ではなく、インターフェースの再現 |
手元で実測したこと(2026-09-20)
以下は編集時の手元測定。資料で確認した仕様・公開評価とは分けて読む。公開用資料の編集時にAPIの再測定はしていない。
| 観測 | 実測(2026-09-20、Claude が手元で測定) |
|---|---|
| 実行環境・テスト | M4 Pro / 48GB、Qwen3.5-4B 4bit(3GB)。pytest 41 passed。初回 2.0 秒、その後 1 判定 0.23–0.28 秒、入力 120–150 tokens |
| argmax | 同梱3例、曖昧な例、日本語、同じ入力に対する6問のYes/No判定で、最高確率の選択肢が一致。短い明快な判定の小サンプルであり、一般的な同等性ではない |
| policy-1 | Jev: required .08 / not_required .90 / ins .02。SemIf: required .060 / not_required .937 / ins .003 |
| 曖昧例の分布 | Jev: yes 0 / no .80–.88 / ins .12–.20(8回)。SemIf: yes .033 / no .964 / ins .003。残余の置き場所が異なる |
| Jevの反復 | no: 0.80 / 0.82 / 0.82 / 0.82 / 0.83 / 0.83 / 0.84 / 0.88。観測値は0.01刻み、極端値(p≈1 / 0)は反復しても一致 |
| SemIfの反復・順序 | 同一入力2回で表示小数点以下3桁まで一致(.033 / .964 / .003)。選択肢反転でinsufficient .003 → .119、yes .033 → .002。文字位置バイアスが分布に乗る |
| Jev usage.output_tokens | boolean 1問=21、2問=38、4問=72、6問=106。choice 3択=41–43、8択=73。Gatewayが報告する出力トークン数は質問数・選択肢数にほぼ比例。料金が発生する証拠ではない。TypeSafe公式は出力トークン無料と説明(S14)。内部の計数方式は未確認 |
| Jev往復レイテンシ | 1問 586ms、4問 522ms、6問 478–519ms、8択 729ms。今回の質問数増加ではほぼフラット |
| SemIfの複数判定 | shared: prefill 0.23s / cache複製 0.06s / batch forward 0.63s、合計 0.93 秒。serial cache hit 0.114 秒/判定(fresh 0.285 秒) |
| 日本語 | 各1例のみargmax一致。Jevの日本語測定は1回のみで2.5秒。品質・速度の一般化はしない |
資料・コードで確認したこと(上の実測とは別):SemIfは汎用のQwen3.5-4Bを、学習済みのパラメーターを変えずに使う(frozen)。入力を読み終えた時点の候補の点数(logits)から、選択肢に割り当てたA〜Pだけを取り出す。これを合計1の確率へ変換する計算(softmax)にかける。生成トークン0、追加学習なし。Choice相当(2–16択)のみで、17択以上、Score / Noul / confidence、較正目的の学習はない。公開データの一部102行を使った評価の精度は Jev .883 / SemIf(BF16).845。これは手元の4bit測定ではなく、較正性能を直接測った値でもない。Jevは、確率と現実の割合を近づける追加学習(RLCD)を行うと提供元が説明している(S1・S6)。
〈仮説〉:0.01刻み・中間値でのばらつき・極端値の安定は複数のサンプルから確率を推定する方式と矛盾しない。発表記事にもparallel sampler(並列サンプラー)という表現がある。ただし内部方式は外から断定できない。
制約:単日・小サンプル。SemIf実走はBF16ではなく4bit量子化。JevのusageとレイテンシはVercel AI Gateway報告値・往復込みで、ローカル実行と同条件の速度比較ではない。最高確率の選択肢が一致しても、確率の値が現実の割合と合っているとは限らない。
実践例の現在地
公開デッキの実践例は、陶山が2026-09-20時点で検討していた内容を、案件名・個人名・原文データを除いて要約したもの。いずれも導入効果を測った実績ではなく、設計・評価準備または事業検討の段階にある。
- 既存システム:法務AIの回答評価、会計・事業計画AIの誤指摘確認、会話から抽出した金額・日付の照合を、既存処理と並走して比較する案。計算や権限はコードに残す。
- Flow Studio:AI返信の確認先振り分けと、電材の商品照合を具体的な検証候補として検討中。営業は未送信・未受注で、Jevの採用も未確定。