EP19 Jev / System One — 出典と測定条件

確認日:2026-09-20。画面共有用資料は Jev / System One — 判断を、ソフトウェアの部品にする。

読み方と操作

HTML をブラウザで開く。「説明用の例」と表示した図解・操作例は概念の説明。「実測(2026-09-20、Claude が手元で測定)」および公開評価とは区別する。引用図の原著者は TypeSafe AI。各図の出典リンクと figures/ の同梱画像を参照。性能・較正・入力対応は確認日時点の情報。

Jev API と SemIf の小規模な実測結果を、このページの「手元で実測したこと」に要約した。日本語は各 1 例のみ。ホスト自身の利用経験や本番導入効果の確認とは分ける。番組では資料で確認したことと、実際に使って分かったことを分ける。

訂正(2026-09-20):前版と実測メモの「output tokensが課金される」という解釈は、本資料では採用しない。実測が示すのは利用量報告の数値であり、料金ではない。TypeSafe公式Models は入力に課金し、出力トークンは無料と説明している。Gateway経由の請求明細は確認していない。根拠メモの原文は変更していない。

用語は「何をするためのものか」から説明する

用語 意味と、ここで使う理由
LLM 大量の文章から学んだ言語モデル。文章の生成や説明を担当する。型を指定したデータを作ることもできる
トークン モデルが文章を扱うときの単位。単語や文字の一部に相当し、1文字と同じではない。SemIfでは答えを1トークンの文字に割り当て、長い文章を作る手間を省く
logits(ロジット) 次に出すトークンの候補ごとに、モデルが計算した点数。負の値も取り、確率とは異なる。SemIfは生成する前にこの点数を読む
softmax(ソフトマックス) 各点数を指数関数で正の値に変換し、その合計で割る計算。高い点数ほど大きく、全体で1になる。SemIfでは指定した選択肢だけに適用し、候補間の確率を得る。現実の正答率に合う保証はない
argmax(アーグマックス) 値が最大になる選択肢を取り出す操作。今回の比較では「最も確率が高い答えが同じか」を調べるために使う。最大値そのものとは違う
分布 各候補に確率がどう配られているか。最高確率の答えが同じでも、ほかの候補に残る確率は違いうる
較正(キャリブレーション) 予測の確率と、実際に当たる割合を近づけること。80%と予測した事例を集めたときに、実際にも約80%が当たるかを見る。個々の答えの正解保証ではない
primitive(プリミティブ) プログラムから呼ぶための基本的な問いの種類。JevはChoice・Score・Noulを用意し、開発者が用途に合う回答形式を選べる
confidence Choice・Scoreが返す、確率の配分全体から求める補助指標。最大確率そのものでも、個々の答えの正解保証でもない。Noulには付かない
RLHF / RLVR / RLCD 言語モデルに追加で学ばせる方法。順に、人の好む答え、正否を検証できる課題、確率と現実の一致を重視する。最後のRLCDはTypeSafeが説明する学習方法
閾値 確率などの数値で処理を分ける境目。モデルの値が境目の近くで揺れる場合、人の確認に回すなどの設計が必要
4bit / BF16 モデルの数値を保存・計算するときの精度。4bitは軽量化できるが、数値や判断が変わる場合がある。今回の手元測定は4bit、公開比較はBF16で、同じ条件ではない
シャドー評価 既存の処理を変えず、新しい判定も並行して記録する方法。導入前に、食い違う場面や見逃しを調べるために使う
wedge 新しい事業で最初に顧客へ届ける、狭く具体的な用途。今回は「AIの判断全般」から、返信の確認先や商品照合へ絞る議論

一次ソース

ID 出典 支える内容 読み方
S1 Introducing System One Models & Jev / 2026-09-15 2年のステルス開発、初の公開モデル、並列 sampler、RLCD、workflow eval 創業者・提供元の発表。2年間の内訳や開発マイルストーンまでは未公開
S2 InstructGPT paper / 2022-03-04 Diogo Almeida が共著者 RLHF全体の単独発明者、ChatGPT全体の単独開発者とは書かない
S3 Manifesto machine-native / composable AI、意味判断を通常のコードへ組み込む思想 会社の戦略・世界観。AGI達成や経済成長の予測を客観的事実にしない
S4 The Bitterest Lesson 課題設定 → データ → 計算資源 → アルゴリズムという優先順位 著者の主張。普遍的な定理ではない
S5 System One テキスト入力、型付き判断と確率、自由文を生成しない System One は TypeSafe の呼称。人間の認知区分がそのままモデル分類になるわけではない
S6 AI primer RLHF / RLVR / RLCD、事前学習済み言語モデルからの分岐、校正の意味 公開された概念説明。モデルサイズ、層構造、損失関数の全仕様を示す論文とは異なる
S7 Choice 定義済み候補から選択、全候補の確率、confidence スキーマ内でも意味的に間違った候補を選びうる
S8 Score 順序付きの記述レベル、その間を含むスコア、分布、confidence 単なる好きな数値の自由生成とは違う
S9 Noul 命題が真である確率 0〜1 separate confidence はない。0.5付近は不確実、0付近は強いNo
S10 Confidence Choice / Score の分布の形から算出、実行・確認・エスカレーション confidence と選択肢の確率を同一視しない。適切な閾値は利用データで検証
S11 How to build with TypeSafe 決定論的ルール・制御フロー・副作用はコード、狭い判断だけモデル 複数の独立した問いをまとめ、必要な答えをコードで組み合わせる
S12 Workflow evals 提供元が公開した比較の詳細 193.6倍 / 444.6倍は万能な倍率ではない。S1の条件・注釈とセットで読む
S13 Lies, Damned Lies, and Benchmarks 公開ベンチマークへの最適化を避け、日付付き評価と注釈を出す方針 会社の評価思想。自社evalの独立性まで保証するものではない
S14 Models テキストのみ、英語が主、日本語等は精度が一様でない。顧客ごとのfine-tuningなし 日本語実データで検証。モデルIDを記録して閾値の前提を保つ
S15 Jev 1.13 jaggedness / 最終レビュー2026-09-17 計算・日付・長い無関係な入力・多段の間接参照・敵対的入力等の弱点 型制約と注入耐性は別。厳密な計算や論理的整合性はコードで担保
S16 SemIf 旧OpenJev。独立プロジェクト、TypeSafe 非公式、MIT。オープンモデルによるlogits直読みの実装 Jevの非公開モデル・学習の再現ではなく、インターフェースの再現

手元で実測したこと(2026-09-20)

以下は編集時の手元測定。資料で確認した仕様・公開評価とは分けて読む。公開用資料の編集時にAPIの再測定はしていない。

観測 実測(2026-09-20、Claude が手元で測定)
実行環境・テスト M4 Pro / 48GB、Qwen3.5-4B 4bit(3GB)。pytest 41 passed。初回 2.0 秒、その後 1 判定 0.23–0.28 秒、入力 120–150 tokens
argmax 同梱3例、曖昧な例、日本語、同じ入力に対する6問のYes/No判定で、最高確率の選択肢が一致。短い明快な判定の小サンプルであり、一般的な同等性ではない
policy-1 Jev: required .08 / not_required .90 / ins .02。SemIf: required .060 / not_required .937 / ins .003
曖昧例の分布 Jev: yes 0 / no .80–.88 / ins .12–.20(8回)。SemIf: yes .033 / no .964 / ins .003。残余の置き場所が異なる
Jevの反復 no: 0.80 / 0.82 / 0.82 / 0.82 / 0.83 / 0.83 / 0.84 / 0.88。観測値は0.01刻み、極端値(p≈1 / 0)は反復しても一致
SemIfの反復・順序 同一入力2回で表示小数点以下3桁まで一致(.033 / .964 / .003)。選択肢反転でinsufficient .003 → .119、yes .033 → .002。文字位置バイアスが分布に乗る
Jev usage.output_tokens boolean 1問=21、2問=38、4問=72、6問=106。choice 3択=41–43、8択=73。Gatewayが報告する出力トークン数は質問数・選択肢数にほぼ比例。料金が発生する証拠ではない。TypeSafe公式は出力トークン無料と説明(S14)。内部の計数方式は未確認
Jev往復レイテンシ 1問 586ms、4問 522ms、6問 478–519ms、8択 729ms。今回の質問数増加ではほぼフラット
SemIfの複数判定 shared: prefill 0.23s / cache複製 0.06s / batch forward 0.63s、合計 0.93 秒。serial cache hit 0.114 秒/判定(fresh 0.285 秒)
日本語 各1例のみargmax一致。Jevの日本語測定は1回のみで2.5秒。品質・速度の一般化はしない

資料・コードで確認したこと(上の実測とは別):SemIfは汎用のQwen3.5-4Bを、学習済みのパラメーターを変えずに使う(frozen)。入力を読み終えた時点の候補の点数(logits)から、選択肢に割り当てたA〜Pだけを取り出す。これを合計1の確率へ変換する計算(softmax)にかける。生成トークン0、追加学習なし。Choice相当(2–16択)のみで、17択以上、Score / Noul / confidence、較正目的の学習はない。公開データの一部102行を使った評価の精度は Jev .883 / SemIf(BF16).845。これは手元の4bit測定ではなく、較正性能を直接測った値でもない。Jevは、確率と現実の割合を近づける追加学習(RLCD)を行うと提供元が説明している(S1・S6)。

〈仮説〉:0.01刻み・中間値でのばらつき・極端値の安定は複数のサンプルから確率を推定する方式と矛盾しない。発表記事にもparallel sampler(並列サンプラー)という表現がある。ただし内部方式は外から断定できない。

制約:単日・小サンプル。SemIf実走はBF16ではなく4bit量子化。JevのusageとレイテンシはVercel AI Gateway報告値・往復込みで、ローカル実行と同条件の速度比較ではない。最高確率の選択肢が一致しても、確率の値が現実の割合と合っているとは限らない。

実践例の現在地

公開デッキの実践例は、陶山が2026-09-20時点で検討していた内容を、案件名・個人名・原文データを除いて要約したもの。いずれも導入効果を測った実績ではなく、設計・評価準備または事業検討の段階にある。

デッキへ戻る