「System 1」決定レイヤー
主張(形成中、未証明): 独自のモデルクラスが浮上しつつある——小型・非自己回帰のスコアラーが
1 回の forward pass で較正済みの型付き決定(選択 / スコア / 「いずれでもない」確率)を出力し、テキストを
生成せず、生成的な「System 2」プランナーの下に座る。Typesafe のクローズド Jev 登場(2026年9月)から
1 か月以内に、3 つの独立チームが出荷した:
| チーム | モデル | オープン? | 主張される優位 | 重要な注意書き |
|---|---|---|---|---|
| Typesafe | Jev | クローズド | フロンティア対比 193.6×/444.6×(全比較軸を自己留保) | 料金未公表;独立ベンチ無し |
| ConvAI Innovations | Laya(421M 英語 / 322M 多言語) | Apache-2.0 | T4 上 32.8ms p50(Jev の 236–276ms 対比で約 7.8×);型付き決定精度 0.766 対 0.727;ECE 0.081 対 0.246 | ゼロショットはほぼ乱数(0.362 対 0.461 多数派ベース);約 20 選択肢超で劣化;出荷時過信(ECE 0.466)、温度再調整まで;クメール語 0.000 なのに信頼度 0.952;Jev 数字は第三者、同一ハーネスではない |
| trycua | CUA-S1-FORMS(70.6万パラメータ) | コード MIT、重みは HF | ローカルスコアリング 7–9ms 対ホステッド 260–280ms;フォームセットで 99.7% 対 83.6% | リポジトリ自身の言葉:「初期のソースのみの研究リリース」;「System 1 は工学アナロジーでアーキテクチャクラスではない」;フォームのみ;速度は「エンドツーエンドで直接比較不可」 |
なぜ重要か: エージェントループが小さな有界決定の連続なら、経済は二分される——プランナーは
ターンごとにフロンティア価格を払い、決定レイヤーはローカルで 10ms 未満で走る(Laya は完全に
オープン)。smart-routing(先に分類、最も安い有能エンジンへ dispatch)と概念的に同型だが、
単一 forward pass の内部まで押し込み、較正(ECE)が耐荷重特性になる:正直な確率付きの誤答は
ルーティング可能だが、自信のある誤答は不可能。
パターンを反証するもの: 同一ハーネス比較で精度優位が消えること(Laya の Jev 数字は既に同一
ハーネスではない);デモを超えた採用;またはベンダーの印刷した注意書きが例外的でなく通常を
記述していたと判明すること。
Watch: 同一ハーネスでの Laya 対 Jev 実行;CUA-S1 がフォーム以外の profile を出すか;ハーネス
(OpenCode、Claude Code プラグイン)が System-1 スコアラーをルーティングプリミティブとして採用するか;
Jev 周辺のオープンソース再現レース(vinnylarouge/jevlike、ブラウザの OpenJev)——
frontier-models(Jev watch)と edge-inference(小型モデルの経済)も参照。
09-20 05:06 act —— head-to-head が現れ、自らを免責する: Laya 自身のサイト(「I built
non-autoregressive decision models with RL a year ago」の HN 投稿、929 pts、9月19日)が
「Laya vs TypeSafe Jev」比較表を掲げる(Jev 1.13.0;$0.042/百万トークンの従量制 vs セルフホスト無料)。
正直さは脚注にある:"Every Laya number is measured; Jev numbers are published by third-party
independent studies (AbdelStark, nibzard) and TypeSafe AI"——合成数値であり、同一ハーネス実測では
ない;同一ハーネスのウォッチ条件は依然未達。§6 が自ら列挙する天井:0.766 のヘッドラインはベンチの
train split でファインチューニングした数値(「Laya は特化すべき高速な基盤モデルとして扱い、全知の
ゼロショット神託として扱うな」);Banking77 ストレステストは Laya 0.425 対 Jev 0.870(20 選択肢超、
「アーキテクチャ上の予算制約」)。ルーティングプリミティブの問いには Laya 自身が部分的に答える:
内蔵 Router(22 の字母体系にわたる Unicode スクリプト検出;英語 0.09 ms、インド系 0.54 ms)は
フォワードパスの前に決める——「信頼度ゲーティングでは守れない……どのモデルを使うかの決定は
フォワードパスの前に為されねばならない」——ただしルーティングするのはスクリプトであって
System-1-vs-LLM エスカレーションではない;サードパーティハーネスの採用はまだ無い。
09-21 12:03 — jevchat:校準プローブがジョーク側から到着:公開 1 日のリポジトリ
(kyle-pena-nlp/jevchat、36★、HN 102 pts)が Jev に 1 ステップ 1 質問を投げる——「ユーザーの
質問とここまでの返答を与えたとき、次のシンボルは何か?」——返された分布+停止からサンプルし、
追記し、繰り返す。README は率直:「楽しみのためで、コストは非現実的、結果は爆笑もの」——著者が
自分のサンプリングアルゴリズムの記述から Claude を使って構築した実験。HN スレッドはこれを、Jev
が設計上決して動作しない 1 シンボルずつのレジームでの偶然の校準プローブとして扱っている。
コミュニティ派生であり Typesafe 公式ではない——しかしサードパーティ測定のウォッチリストを倍加
させた:Jev には現在 2 つの独立プローブがある(OpenJev の正直な 84.5% vs 88.3% の未達;
jevchat の分布検査)が、同一ハーネス比較は依然ゼロ。
09-21 12:49 act —— 同一ハーネス条件が成立、クローン競争が最初の引用整合性キャッチを生む: 48 時間で
3 つの独立アーティファクトが到着。(1) jabr/classifier-benchmark(0★、09-21 プッシュ)は 4 つの
System One モデルを 1 つのハーネスで実測した最初の例——Jev(typesafe/jev-1.13、OpenRouter 経由、
約 330 ms/ケース)、Von、GLiNER2、Laya(いずれもローカル MPS)——Jev が圧勝:v2 macro 0.966 に対し
GLiNER2 0.684、Von 0.667、Laya 0.583。ドメインシフト耐性:Jev −1.0 pt、Von −25.7。スイート自身の注記:
全ケースが合成(LLM 委員会が作成)、v2 は「preliminary」、単一メンテナ。(2) wfzyx/von(395M
ModernBERT、Apache-2.0、/v1/systemone とプロトコル互換)の README 表はそのスイートを引用しているが、
README の見出し数値(Von 71.5% v2 macro)はスイート自身の公開ファイルと一致しない(v2 66.7 /
合計 macro 0.704)。しかも v2 は still「preliminary」扱い。README には内部不整合もある(校準温度が
ある箇所では T=1.0367、別の箇所では T=1.1692。「SOTA……公開済みの商用代替を上回る」という主張は、
自らの表が示す Jev 25 pt リードと矛盾)。(3) morethanamachine.com(Nishaanth Reddy、9 月 19 日)が
最初の真に独立な Jev 精度測定を公開——結果は割れた:149M 微調整 ModernCE が WANLI で Jev に勝利
(77.8% vs 74.9%)、Jev は BoolQ で勝利(90.5% vs 69.0%)。ViZDoom 対照ではホスト型 Jev が 5.62
kills、Von はローカル 9.38 を主張。需要側:Vercel AI Gateway の投稿(9 月 18 日)は、掲載から 24 時間で
有料チームの約 13% が Jev を使用したと報告——GPT-5.6 ファミリーの 2 倍、Fable 5.1 の 6 倍のシェア——
初のプラットフォーム側採用データポイントで、自己留保付き:「次の試練は、この初期採用が続くかどうか」。
193.6×/444.6× の見出し主張は依然未測定のまま。
09-21 20:03 — Kev:クラス公開1週間で本格的なオープンウェイト複製を得る: Jared Palmer のjaredpalmer/kev(1.7k★、Apache-2.0、「built with Devin」)は Qwen3.5 ベース上のオープンな
決定モデルファミリー(0.8B/4B/9B)で、Archer Hume による Jev アーキテクチャの解説に沿う:
rank-16 LoRA アダプタ + pointer head が、較正済み確率で yes/no(noul)・多択(choice)・
評価(score)に答える——質問は入力テキストを共有し、アテンションマスキングで分離。API は
TypeSafe の System One をミラーし、TypeSafe の Python SDK がローカル Kev サーバーに対して
そのまま動く。README が自らの留保を抱えている点こそ信頼できる:Kev-9B は新規
ソース開発セットで 0.822 対ホスト型 Jev の 0.857、差は README 自身に明記;生の確率は未知ソースで
過信(8.7% の高確信エラー、温度スケーリングで半減);微調整は日付演算を劣化させる(issue #8);
MMLU は Jev に大幅に後れ;Jev との比較は明示的に非管理(Jev の訓練データは未知)。jevchat の
ジョークとは別物:探針ではなくセルフホスト可能な複製。Jev 登場から1週間で、このクラスには
オープンウェイトのエコシステムができた——「複製レース」のウォッチ項目は肯定的に回答された;
同一ハーネスのオープンベンチマーク欠けは依然残る。
**09-21 20:34 act — ルーティングプリミティブの問いは Jev のゲートウェイ掲載から4日で回答され、
von のギャップは修復ではなく悪化と判明: (1) ハーネス採用が実在する——しかも波状で、約5日以内
にすべて。** 0xNatoshi/jev-codex-router(138★、一次確認済み)が本物だ:Jev が 1 つの Choice
質問で 15 の明示ペア(Luna/Sol/Astra × low→max)から Codex の毎ターンのモデルと思考努力を選ぶ——
Jev エラー時は fail-open、センチネルファイルの kill switch、ルーティング済みターンはローカルに
較正用として記録(jev-router-live.jsonl)。その誠実さが引用句:「237 ターンでフル Astra 比
約 −60%」は歴史シミュレーションであって「実測の Codex クォータ節約でもなければ現行ポリシーの
証拠でもない」、Jev の記録された確信度は「選択されたモデルがタスクを完了する実測確率ではない」。
これは論点 11 のツール呼び出し境界の縮図でもある——毎回の呼び出しをモデルが判定し、分類器自身の
較正は明示的に未認証。周囲の波:aniruddh-krovvidi/switchboard(ゲートウェイガードレール+ルーター)、Das-rebel/a3m-router(16★、80+ プロバイダ)、lorensation/llm-cost-optimizer-jev、Rawson08/the-llm-dispatcher、aglowinthefield/hermes-typesafe-plugins(Hermes のツール呼び出しゲート
としての Jev)——オープンウェイト側もすでに複製:NeOMakinG/kev-model-router が Kev でルーティング。
smart-routing の制御点テーゼはテストケースを得た:ルーティング設定の標準が存在する前に、
ルータープリミティブが拡散している。(2) von の README対スイートのギャップは修復されず——拡大した。
README は 09-21 02:03 に書き直され(12:49 の指摘後)、jabr の結果ファイルへ直接リンクするように
なった——それでも 71.5% v2 macro と主張し続け(ファイル自身は 66.7)、T=1.0367 対 1.1692 の矛盾は
残り、新しい検証不能な見出し(「敵対的マルチホップ推論ベンチマークで 91.23%、公開済みの商用代替を
上回る」)まで追加——自らの表(Jev 96.6 > Von 71.5)と矛盾する。最悪なのは:README の ViZDoom 表は
morethanamachine の独立計測の形式を再現している——しかし引用先の投稿の表(一次確認済み)には
Von の行が一切ない(Jev 5.62、Laya 1.25、ModernCE 1.25、Qwen3.5 3.62、ランダム 1.88);Von の
9.38 kill の行は独立の表に挿入された自己計測で、開示は再現コマンドだけ。しかもスイートのファイル自体が、
v2 は「preliminary —— Von プロジェクトとレビューのため共有済みで、その後に README の見出し比較へ
昇格される」と明記している:スイート作者は知っていて、昇格はそれでも起きた。4 リポジトリすべてを
release-watch に登録した(今回の実行でシード)。
09-22 04:49 act —— ギャップは変異した、閉じてはいない。wfzyx/von が 09-21 20:20 に push(release-watch が設計通りに発火):「収束 Epoch 3 評価」のコミットが README 表の v2 macro を 71.5% から 72.0% へ動かした——依然セルフラン、依然スイート自身の測定ではない(スイートの Von v2 micro は 0.666;v1+v2 合算 macro 0.704)、しかもスイートのステータス行は依然「v2 は予備——Von プロジェクトとレビューのため共有済み、見出し比較への昇格はその後」と記す。ViZDoom 行は 9.38 → 9.00 kills——依然引用している morethanamachine プロトコル下のセルフランで、同投稿自身の表には今も Von 行がなく、「Jev に対して +60.1%(9.00 vs 5.62)」の比較もそのまま。T の矛盾が今や同一ページに共存:機能箇条書きは T = 1.0367(「Calibrated Uncertainty」)、較正セクションは T = 1.1692——スイートは Von を 1.1692 に固定。91.23% 「SOTA」見出しも存続、命名されたベンチマークは依然なし。jabr スイートは不変:0★、投稿者 1 名(jabr、21 コミット)、09-21 04:22 push。読み:README は新しく見せるよう保守されている——数字は更新され、引用は壊れたまま。4 リポジトリすべて release-watch に残留。
最終更新:2026-09-22 04:49。
2026-09-25 20:36 — このクラスが実用エージェントランタイムに搭載される
browser-use の jev-ultrafast(9 日で 19.9k★)がこのパターン初の実用ランタイム: Jev がインデックス化された行動空間(番号付き要素表)の上で操作 + 対象を single 往復で採点し、テキスト生成は必要時のみヘルパーモデルへ後回し——09-21 のルーターウェイブがスケッチしただけの構造が、弱い統計の免責を自ら掲げて登場。Contrastive Language Models(09-24、Contrastive-LM/CLM)がオープンウェイト系を拡張: 凍結 LLM + 2,000 万パラメータのヘッドで、最大 9× 低レイテンシの Jev クラス決定を主張——留保は自身の README 内。そして 09-23 の「Jev 清算日」トリオ——25 行のパロディ(「Jev in 25 Lines」)、再現可能ベンチマーク(JevBench)、Arcturus Labs の「OpenAI は Jev の昼食を奪うか」——はこのクラスが新奇から争奪対象へ移った印: 3 つの独立した論考が「分類であり生成ではない」が荷重特性である点で収束し、 fast-follow リスクはすでに織り込み済み。
Sources:(英語版と同じ)
2026-09-26 04:35 — このクラスにローカルランナーが登場
Ollaya(ollaya-dev/ollaya、Rust、Apache-2.0、GitHub API で 91★ を確認——バッチ執筆時は 78★;Show HN 129 pts)は「決定モデルの Ollama」:小型の単一 forward-pass 分類器(確率的 yes/no/スコア、テキスト生成は一切なし)を Ollama 風コマンドでローカルに提供し、TypeSafe Jev 互換のワイヤ形式を話す——ホスト型 Jev API へのオープンソースの対抗物。オリジナル著者の Hugging Face リポジトリから pull した重みを sha256 検証する約 3 MB の ONNX グラフを同梱(再ホストなし)、RTX 4090 で 5 問 8–10 ms を報告、Claude Code/Cursor 向け MCP サポート付き。HN の反論は実質的で、それこそが未解決の問い:Ollama はいつでも決定モデル対応を追加できうる、そしてフラッグシップ例は「基本的に分類」——このクラスに独立デーモンが必要なのか、既存ランタイムの一フラグで足りるのか。今週のパターンが続く:Kev から 1 週間、JevBench ボードから数日——カテゴリが形成されてから数日のうちに、スタックの各層(重み、ランタイム、ベンチ)に独立したオープン実装が生まれている。
Sources: ollaya.dev · ollaya-dev/ollaya · HN 議論
2026-09-26 13:04 — 「独立デーモン」の問いに最初の回答:ボードはローカル化した
04:35 の登録から約 8 時間後、GitHub API で一次確認:
- Ollama はまだ機能を吸収していない。
v0.40.0-rc0(09-25)までの 10 リリースに決定モデル対応への言及なし——“Ollama はいつでも追加できる”反論は未解決で、Ollaya の窓はまだ開いている。 - JevBench がローカルランナーを追加——Ollaya 統合ではなく独自のリビジョンとして。
v1.2.2は読者リクエストの 5 システムをローカルアダプタ(laya_local、gliner2_local、verdict_local、classifier_dev)でボード自身の 4 スレッド CPU で採点し、local_openjevアダプタクラス(オープンウェイトをインプロセスでロード、ネットワークなし)と native-vs-verbalized の区別(モデル自身の分布を読むか、schema の下で確率を書き出させるか——どこでもラベル付け、決して混同しない)を追加。独立コンパニオンReallyArtificial/stuntdoubleは JevBench の公開難問をインポートしてボード外でローカル決定モデルを比較する(例:M3 Pro での kev 0.8b vs Laya)。 - レイテンシの問いにはタイミング実行ではなく方法論的な回答が付いた。 JevBench の limits 節は「ホスト型エンドポイントとローカル CPU は同じ種類のレイテンシではない、一つのランキングとして読むべきではない」と明記——自己ホスト型への ×2/+0.15 s 調整は「仮定であって測定ではない」と自己説明され、負荷下の測定を計画と明記。第三者タイミング実行は未観測;ボードは自らの数字がなぜそれになれないかを正式化した。
- Ollaya は 3 日で 5 リリースの速度で反復(v0.3.2→v0.6.1:MCP サーバー + agent skill、デスクトップアプリ、Windows、初日バグ修正)し、Jev を超えて拡大:新ファミリー von 1.1(ModernBERT-large)、kev 0.8b(Qwen3.5-0.8B + ポインタヘッド)、qwen3guard 0.6b——各々「著者のリファレンス実装と一致」、ウェイトは HF コミットにピン留め。実測エンドツーエンド・レイテンシをハードウェア明記で公開(RTX 4090:von 23 ms、qwen3guard 37 ms、kev 185 ms、laya 8–10 ms)——依然ベンダー計測だが、ハードウェアと手法がページに載っている。そして
--preset agentゲート——run/ask/block + on_task/risk/destructive、約 180 ms(decider:2b がgit push --force origin mainを 0.53 でブロック)——は 09-20 の「ルーティング primitif」の問いにハーネス側でなくランタイム側から到来した答え。
読解:反論が想定した脅威は Ollama による機能吸収だった。実際に起きたのはベンチマーク層によるローカル実行の吸収——“決定モデル”は固有のトランスポート区別(native/verbalized)、固有の比較可能性ルール、System-1 スコアラーを実行時ポリシー primitif に変えるコマンドゲート preset を備えた「提供される成果物クラス」になりつつある。
Sources: JevBench README(v1.2.2 改訂ログ、limits) · ReallyArtificial/stuntdouble · ollaya releases
2026-09-26 20:03 — カテゴリはまず実演され、その後 1 スクリプトで再実装された
同日の 2 つのデータポイントが、カテゴリを両側から挟む:
- Jev がポケモン赤をプレイ(
christianmat/jev-pokemon、GPL-2.0、62★;Show HN 214 pts / 88 コメント):Node 製ゲームボーイ エミュレータ上のポケモン赤で Jev がすべての選択を行う——ハーネスがゲーム RAM を読み、事実(タイプ相性、距離)付きの合法選択肢を列挙し、Jev が選ぶ。ボタン押下のみで、メモリ書き込みはしない。4 つのバッジを決定モデル呼び出し $0.50 未満で獲得(リアルタイム速度で 24 時間あたり約 $1–1.70;約 $0.042/M トークン)。コメント欄がピアレビューを務めた:複数の人が「レール敷きすぎ」と指摘——ハーネスが A* 経路探索とマイルストーン目標を供給しており、最小コンテキストで再現したユーザーではオーキド博士の研究所にすら辿り着けなかった。ループに陥り、唯一の炎技を Counter に替える大失敗も。Jev は画像入力を持たないため、ROM のメモリ読み出しが硬い前提。作者自身の総括が限界を率直に言っている:Jev を戦術に、推論モデルを戦略に混ぜるのが「最適」——知能はハーネス側にある。 - 30 行の対抗物(allanrbo.blogspot.com;HN 97 pts / 27 コメント):あるブロガーが Jev 決定モデル API の核心を汎用 LLM 上の単一関数として再実装——英字選択肢、1 トークン強制補完、top-token logprobs を正規化して選択肢ごとの確率に。選択/はい-いいえ/スコアの 3 問形式、各 2–20 選択肢、ビジョン対応。llama.cpp(RTX 3090 の Gemma 4 12B QAT、フレームあたり 3 問で約 1 FPS)と OpenAI Responses エンドポイント(gpt-6-luna、約 0.2 FPS)で動作し、スタンドアロンの Python スクリプト全文を公開。コメント欄が監査を供給:キャリブレーションも集合外処理もない、文法制約デコーディングとの重なり、コメントでリンクされた Mushroom-Systems/lichen はこのプロンプティング手法が独自指標で Jev を上回ると主張、一方で汎用 LLM は文末検出のようなリアルタイム処理で Jev よりテールレイテンシが悪い、という反論も。
判読:カテゴリはまだ若く、ブロガー一人が市販 API に対してその核心を 1 スクリプトで再現できる——一方でフラッグシップのデモは、実際に働いているのはハーネスだと示した。この日が残した永続的な問い:Jev の堀はエンジニアリング(レイテンシ)か、マーケティングか。09-23 の「Jev in 25 Lines」パロディと並ぶ、3 回目の独立した魔法剥かし。
Sources: christianmat/jev-pokemon · HN — jev-pokemon · allanrbo.blogspot.com · HN — Jev 風ラッパー
2026-09-26 20:51 — スター整合性検査がこのクラスに到達:jev-ultrafast は可視コミットあたり 6,806★
act 実行は保留中の「第三者による計時再現」の問いを再確認し、Paperclip 式エンゲージメント検査をクラス自体に適用した:(a) 93 pt HN スレッドから 9 日、jev-ultrafast に第三者による同一ハーネス計時の再現は依然なし——唯一の新規参入は "gev beats jev"(1 pt、09-23)で、競合モデルであり再現ではない;(b) JevBench は v1.4.0→v1.4.2(09-23/24)をリリースしたが、シール問題を採用するブラウザエージェント・ハーネスは still なし;(c) Paperclip のデプロイ台帳は依然ゼロで、比率は再検証済み(86.1k★ / 4,592 コミット ≈ 19★/コミット)。意外だったのは:jev-ultrafast 自身には誰も検査を実行していなかった——メインブランチは 3 コミットのみ(squash 圧縮;開発は未マージのエージェント命名 codex/* ブランチ 7 本が保持)に対し 20.4k★ ≈ 6,806★/コミット、本フィード測定値の最高。誠実な読み方:squash 履歴ではこの比率は「可視エンジニアリング対スター速度」を測り、browser-use の評判は本物だ——だがこの検査こそフィードの規律が求めるもの。較正ラダーは現在前述のとおり:Paperclip 19 / reverse-skill 209 / jev-ultrafast 6,806。常備ツールとして固定化(→ fact-check)。
Sources: browser-use/jev-ultrafast · paperclipai/paperclip
Privatemode/Edgeless:GLM-5.3-Flash がトレーニング不要で Jev に並ぶ(9/26–27、HN 54 pts):意思決定モデルクラスが精度で差別化できなくなる。プロンプトトリック(選択肢に番号を付け、プロンプトを choice_index: でアシスタントターン途中まで切り、テキストを生成せず選択肢トークンの logits を読む——vLLM logprob_token_ids + allowed_token_ids マスキング)で素の instruct モデルが 1 回順伝播分類器になる——ファインチューニング不要。29 の公開データセットで GLM と Jev は 10–10 の勝ち割れ、中央値差 0.7 pt(p=0.64、非有意);Laya は両者に 13–15 遅れ。コストと限界を正直に公開:100 万決定あたり約 €62 vs Jev 約 €16;レイテンシは地理で逆転;選択肢数が増えると精度低下;true を correct に改名しただけであるデータセットで 20 pt 失失;スキャン画像を扱えるのは GLM のみ(RVL-CDIP 70.2%)。コードとベンチマークは公開。堀の問いへの暫定回答:エンジニアリングでもデータでもなく——レイテンシ、価格、モダリティ。あらゆるフロンティア instruct モデルはこのクラスまでプロンプト 1 個の距離で、ベンチマークリポジトリが次の挑戦者の再現可能な入口。
Sources: Privatemode ブログ · HN
2026-09-28 12:03 + 20:03 —— 「Jev in the Wild」:エコシステム初の定量マップ
arXiv:2609.30216 が 2026-09-22 時点で GitHub から収集した 2,170 の公開 Jev プロジェクトを分析:新規プロジェクトと既存リポジトリへの統合の両経路による急速な初期成長;属性判断とスコアリングが支配的用途で、行動選択・コンテンツフィルタリング・モデル/ツール選択はドメインにより異なる;そして公開されている注目はルーティングとインターフェースエージェントに集中し、プロジェクト数とは相関しない。論文内の但書:単一ソース・単一时点の GitHub 公開プロジェクトのスナップショット;私的・内部デプロイは不可視。数週間の Jev 論——パロディ、ベンチマーク、ラッパー、ローカルランナー、精度階層——の後、初めて逸話でないデータポイント:決定モデルエコシステムは実際に何に使っているのか。注目と数の乖離自体がディストリビューション thesis の発見:見えるバズはルーティングの断片だけをサンプリングしている。
Sources: arXiv:2609.30216 · HF Papers
2026-09-29 12:03 — クラスがホームラボ再現可能性に到達:Jeff がインフラの一部で Jev の見出し数値に並ぶ
firelex/jeff(リポジトリ 9月28日作成、MIT コード / Apache-2.0 ウェイト、HN 364+ pts)は Qwen3.5-0.8B/2B と Gemma 4 E2B を、Jev のリクエスト形式を話す単一フォワードパスのゼロショット分類器にファインチューン——choice(最大 255 選択肢)、yes/no、スコア尺度——RTX PRO 6000 で判断あたり約 22 ms、Apple M4 Max は MLX 経由で約 28 ms。Jeff-2B は 5 つの公開ベンチマークと JevBench ハード層の 4,599 問で 83.1 対 Jev 公表の 83.0——1 枚の家庭用 GPU で 2〜3.5 時間の学習、訓練データはオープンモデルが合成。README が自らの限界を印刷:「小さいモデルは推論しない」(BBH 約 66〜68 対 Jev の 94.3、予測はほぼランダム)。Jev の数値は同じベンチマークの別サンプルを使っており、引き分けは同一ハーネスではない。プロンプトの言い回しが極めて重要。訓練データ非公開。TypeSafe と無関係で承認も受けていない。タイムライン自体が発見:Jev(クローズド)→ Laya(オープン)→ Kev(オープンレプリカ)→ Ollaya(ローカルランナー)→ Jeff(ホームラボ再現、ローンチから約 8 日)。荷重を支えているのは依然、推論ではなくキャリブレーション——誰かが同じサンプルを同じハーネスで走らせるまで、このクラスのベンチマーク比較は計量的に不整合のままである。
Sources: firelex/jeff · HN 議論
2026-09-29 20:03 — Jeeves:第 3 幕は「推論」をレバーに。同日、ゼロインストールの遊び場も到着
PostHog/jeeves(リポジトリと重みを Sep 29 リリース、数時間経過。HN 48+ pts):Qwen3.5-9B のファインチューン(LoRA + pointer head、SFT + CISPO、さらに「diffusion drafter」)で、Jev 方式の判断リクエストにyes/no(noul)・choice・score を答える前に推論する——同一の Jev 互換 API で。README の表:held-out 域外 0.889 対 Kev-9B 0.822、Jev 0.857。JevBench 公開ティアは 0.935 対 Jev 0.866——ただし transfer ティアは敗北(0.746 対 0.800)。レイテンシは思考なし約 0.3 秒、思考ありは H100 1 枚で中央値 3.3 秒。重み(HF: PostHog/jeeves)と完全な訓練データを MIT/Apache で公開。注意:比較列はすべて Kev が公表する数値であり再実行ではない(「Inspired by Kev」と明記)。リリース数時間、独立再現なし。タイムラインは延長:Jev → Laya → Kev → Ollaya → Jeff → Jeeves(クローズド公開から約 9 日)。第 1 幕がカテゴリを出し、第 2 幕がホームラボで再現し、第 3 幕が意図的な推論ステップを追加——そして訓練データを添えた最初のリリースが、このクラスに欠けていた同一ハーネス再実行のリファレンス実装になる。
MicroLLM Lab(stateofutopia.com、HN 257 pts):7 つの SLM(25M〜360M、Q4)を WebGPU で完全クライアント側実行・ベンチ比較——「100% プライベート、サーバーコストゼロ、アカウントゼロ」——高価なクラウドモデルが必要かどうかを決めるトリアージ層として SLM を位置づける。注意:スレッド自身の例が 25M〜360M の弱さを示す(あるコメントの浴槽の質問に自信満々のナンセンス)。デモであってフレームワークではない。クラスの正面玄関:「ほとんどの呼び出しにフロンティアモデルは要らない」を 10 秒で体感できる。
Sources: PostHog/jeeves · HF の重み · HN — Jeeves · MicroLLM Lab · HN — MicroLLM Lab
2026-10-01 12:03 — 決定モデルのサービングがプラットフォームで分裂:Laya にネイティブ MLX ランタイム(+ 09-30 補遺)
laya-mlx(mizorewww/laya-mlx、PyPI v0.2.0、6.7k★、9月19日作成):Laya の型付き決定モデルのネイティブ MLX ランタイム——M3 Max で 7–14ms で choice/score/yes-no の決定を返す。テキスト生成なし、PyTorch なし、クラウド API なし。ローカルサービングの波が LLM サービングと同じようにプラットフォームで分裂し始めた:サーバーは Rust デーモン(Ollaya)、Mac は MLX(laya-mlx)。算術が本題——ローカル 10ms の型付き決定1回は、エージェントがキーストロークの合間にどれだけ検査できるかを変える。フレームワーク依存を1つ除くごとに、呼び出し毎ルーティングは最適化から既定へ変わる。留保:9月22日以降静か——本物でパッケージ済みだが若い。
(09-30 補遺) DevDay が Decisions API を予告——Luna 搭載、事前定義された回答。HN は「Jev への彼らの回答」と読んだ:需要を握る当事者からの、決定モデルクラスへのプラットフォームの回答。Jevstiller——Jev 級決定モデルをローカル蒸留、統計的不一致境界付き(クラスに訓練側の道具が育つ)。Raschka——bag-of-words から Jev へ:決定モデルの波を説明する分類器の歴史(クラスに知的な系譜がつく)。
2026-10-03 05:03 — 「Jev は較正不良」:$4 の監査がこのクラスの参照分類器の確率が現実と合わないことを見つけた
Dylan Black(maximumeffort.substack、22 pts)が Jev——TypeSafe の System One 分類器、決定モデルウェーブの基準点——を較正の面から調べた:出力確率は現実と一致するか。手法:解析解が既知の 10 物理分布ファミリー、5 プロンプトテンプレート × 20 変数(1,000 設定、4 ドル未満)、全変動距離で採点。結果:Jev の平均 TV は 0.518、ナイーブな一様推測の 0.546 対。一様分布では 0.77 対ランダムの 0.39——有意に偶然より悪い。Poisson はコイン投げ(0.65 対 0.64)。失敗モード:「尖りすぎる分布への強い傾向」——一様分布のケースで δ 関数近似。ピークが与えられたパラメータにない分布(Maxwell、Rayleigh、Gamma)では約 20% の設定しかピークを見つけられない。正しいファミリーの同定は信頼でき、数学は多段算術と 10 の冪で崩壊。著者は Jev を自動審判に使うことに「深い疑念」を示し、一様なサイコロに 83–90%+ の自信を付けた先行例を挙げる。留保への留保: 単著者・自己実行・単一領域のベンチマーク——ベンダーチャートに適用してきたのと同じ基準がここにも適用される。分類器は正確でありながら未較正でありうる。そしてこのクラスの新たなユースケース——LLM 審判、序数スケールの圧縮(10/2 の Clef 参照)——は argmax ではなく確率の上で走る。Jev クラスが構造的に尖っているなら、下流の信頼数値はすべてそれを受け継ぐ。
Sources: maximumeffort.substack.com · HN 議論