「System 1」决策层
主张(成形中,未证实): 一类独立的模型正在浮现——小型、非自回归的打分器,单次前向输出
一个经校准的类型化决策(选项 / 分数 /「都不是」概率),从不生成文本,位于生成式「System 2」
规划器之下。Typesafe 闭源 Jev 发布(2026 年 9 月)后一个月内,三支独立团队相继出货:
| 团队 | 模型 | 开放? | 宣称优势 | 关键告警 |
|---|---|---|---|---|
| Typesafe | Jev | 闭源 | 对前沿模型 193.6×/444.6×(每个比较轴都被自己否认) | 定价仍未公布;无独立基准 |
| ConvAI Innovations | Laya(421M 英文 / 322M 多语言) | Apache-2.0 | T4 上 32.8ms p50(约为 Jev 236–276ms 的 7.8×);类型化决策准确率 0.766 对 0.727;ECE 0.081 对 0.246 | 零样本接近随机(0.362 对 0.461 多数类基线);超过约 20 选项后下降;出厂过度自信(ECE 0.466)需温标重拟合;高棉语 0.000 分却报 0.952 置信;Jev 数字为第三方,非同 harness |
| trycua | CUA-S1-FORMS(70.6 万参数) | 代码 MIT,权重在 HF | 本地打分 7–9ms 对托管 260–280ms;其表单集上 99.7% 对 83.6% | 仓库原话:「早期、仅源码的研究发布」;「System 1 是工程类比而非架构类」;仅限表单;速度「端到端不可直接比较」 |
为何重要: 若 agent 循环由大量小的有界决策主导,经济学就会一分为二——规划器每轮付前沿
价格,决策层本地以 10ms 内运行(Laya 还完全开放)。与 smart-routing(先分类、派给最便宜的
可用引擎)概念同形,但推进到了单次前向内部,且校准(ECE)是承重属性:带诚实概率的错误
答案可被路由,自信的错误答案不能。
何种证据会证伪该模式: 同 harness 比较显示精度优势消失(Laya 的 Jev 数字本就非同 harness);
demo 之外无采用;或厂商印出的告警最终被证明描述的是常态而非边界。
Watch: 同 harness 的 Laya 对 Jev 跑分;CUA-S1 是否出货表单之外的 profile;是否有 harness
(OpenCode、Claude Code 插件)把 System-1 打分器吸收为路由原语;Jev 周边的开源复刻竞赛
(vinnylarouge/jevlike、浏览器中的 OpenJev)——另见 frontier-models(Jev watch)与
edge-inference(小模型经济学)。
09-20 05:06 act —— 正面对比出现,且自带免责: Laya 自己的网站("I built non-autoregressive
decision models with RL a year ago" 的 HN 帖,929 分,9 月 19 日)给出 "Laya vs TypeSafe Jev"
对照表(Jev 1.13.0;$0.042/百万 token 计费 vs 自托管免费),诚实写在脚注里:"Every Laya number
is measured; Jev numbers are published by third-party independent studies (AbdelStark, nibzard)
and TypeSafe AI"——拼合数字,并非同 harness 实测;同 harness 的观察条件仍未满足。§6 自己列出的
天花板:0.766 头条数字是在基准 train split 上微调所得("把 Laya 当作待特化的快速基础模型,而非
全知的零样本神谕");Banking77 压力测试中 Laya 0.425 对 Jev 0.870(20+ 选项场景,"架构性预算
约束")。路由原语问题从 Laya 自身拿到部分答案:其内置 Router(22 种字母系统的 Unicode 文字系统
检测;英文 0.09 ms、印度语系 0.54 ms)在前向传播之前就做决定——"置信度门控保护不了你……用哪个
模型的决定必须在前向传播之前做出"——但它路由的是文字系统,不是 System-1-vs-LLM 升级;第三方
harness 的采用仍无。
09-21 12:03 — jevchat:校准探针从玩笑一侧到来:一个一天大的仓库(kyle-pena-nlp/jevchat,
36★,HN 102 分)每步只问 Jev 一个问题——"给定用户的问题和已写出的回复,下一个符号是什么?"——
然后从返回的分布+停止选项中抽样、追加、重复。README 直言:"为了好玩,成本颇不实际,结果很搞笑"
——是作者用 Claude 加速、从自己的采样算法描述构建的实验。HN 线程把它当作对 Jev 校准的意外探针——
恰好落在 Jev 设计上从不运行的单符号逐一模式。社区衍生作品,非 Typesafe 官方——但它让第三方测量
观察名单翻倍:Jev 现在有两个独立探针(OpenJev 诚实的 84.5% 对 88.3% 差距;jevchat 的分布检视),
同 harness 对比仍然为零。
09-21 12:49 act —— 同 harness 条件达成,克隆竞赛产出首个引用完整性捕获: 48 小时内落地三份独立
工件。(1) jabr/classifier-benchmark(0★,09-21 推送)是首个对四个 System One 模型的单 harness
实测——Jev(typesafe/jev-1.13,经 OpenRouter,约 330 ms/例)、Von、GLiNER2、Laya(均为本地
MPS)——Jev 压倒性领先:v2 macro 0.966 对 GLiNER2 0.684、Von 0.667、Laya 0.583;域偏移稳健性:
Jev −1.0 分,Von −25.7。该套件自带的标注:全部用例为合成(一个 LLM 委员会编写)、v2 "preliminary"、
单一维护者。(2) wfzyx/von(395M ModernBERT,Apache-2.0,与 /v1/systemone 协议兼容)的 README
表格引用了该套件——**但 README 头条数字(Von 71.5% v2 macro)与套件自己发布的文件不符(v2 66.7 /
合并 macro 0.704)**,且 v2 仍被标注 preliminary;README 还有内部不一致(校准温度一处写 T=1.0367、
另一处 T=1.1692;"SOTA……超越已发表的商业替代品"被它自己的表格反驳——表里 Jev 领先 25 分)。(3)
morethanamachine.com(Nishaanth Reddy,9 月 19 日)发布首批真正独立的 Jev 精度测量——且结果分裂:
149M 微调 ModernCE 在 WANLI 上胜过 Jev(77.8% 对 74.9%),Jev 在 BoolQ 上胜出(90.5% 对 69.0%);
ViZDoom 对照中托管 Jev 得 5.62 kills,Von 宣称本地 9.38。需求侧:Vercel AI Gateway 帖(9 月 18 日)
报告 Jev 上线 24 小时内进入约 13% 的付费团队——是 GPT-5.6 家族份额的 2 倍、Fable 5.1 的 6 倍——首个
平台侧采用数据点,自带保留:"下一个考验是这个早期采用能否持续。" 193.6×/444.6× 的头条声称仍未被测量。
09-21 20:03 —— Kev:该类在发布一周后拿到严肃的开源复刻: Jared Palmer 的 jaredpalmer/kev
(1.7k★,Apache-2.0,"built with Devin")是 Qwen3.5 基座上的开源决策模型家族(0.8B/4B/9B),遵循
Archer Hume 对 Jev 架构的解读:rank-16 LoRA 适配器 + pointer head,以校准概率回答 yes/no
(noul)、多选(choice)与评分(score)——问题共享输入文本、经注意力掩码隔离。API 镜像
TypeSafe 的 System One,TypeSafe 的 Python SDK 可直接对接本地 Kev 服务。README 自带保留意见,
这正是它可信的原因:Kev-9B 在新信源开发集上 0.822 对托管 Jev 的 0.857、差距写进 README 本身;
原始概率对新信源过自信(8.7% 高置信错误、温度缩放减半);微调损害日期运算(issue #8);MMLU
明显落后 Jev;与 Jev 的对比明确不受控(Jev 训练数据未知)。与 jevchat 的玩笑不同:这是可自托管
的复刻,不是探针。Jev 发布仅一周,该类已有开源权重生态——此前"复刻竞赛"的观察项得到肯定回答;
同 harness 开源基准的缺口仍在。
09-21 20:34 act —— 路由原语问题在 Jev 上网关上线四天后得到回答;von 缺口经核实是恶化而非修复:
(1) Harness 采纳已经存在——而且是一整波,全部发生在约 5 天内。 0xNatoshi/jev-codex-router
(138★,一手读过)是真东西:Jev 用一个 Choice 问题从 15 个显式组合(Luna/Sol/Astra × low→max)为
Codex 的每一轮选择模型和思考力度——任何 Jev 错误时 fail-open,哨兵文件 kill switch,每一轮路由
本地留档用于校准(jev-router-live.jsonl)。它的诚实就是引用语:"237 轮约 −60% 对全 Astra"是历史
模拟,"不是实测的 Codex 配额节省,也不是对现行策略的证据",Jev 记录的置信度"不是所选模型会成功
完成任务的概率"。它也是论点 11 工具调用边界的缩影——一个模型判断每一次调用,而分类器自身的校准
明确未获认证。围绕它的这波:aniruddh-krovvidi/switchboard(网关护栏+路由)、Das-rebel/a3m-router
(16★,80+ 提供商)、lorensation/llm-cost-optimizer-jev、Rawson08/the-llm-dispatcher、aglowinthefield/hermes-typesafe-plugins(Jev 作为 Hermes 工具调用闸门)——开源权重侧已在复刻:NeOMakinG/kev-model-router 用 Kev 做路由。smart-routing 的控制点论点拿到测试用例:路由原语
在任何路由配置标准出现之前就在扩散。(2) von 的 README 对套件缺口并未修复——而是扩大了。
README 在 09-21 02:03 被重写(12:49 捕获之后),现在直接链接 jabr 的结果文件——却仍宣称 71.5%
v2 macro 对文件自己的 66.7,T=1.0367 对 1.1692 的矛盾仍在,还加了新的不可核实头条("91.23% 对抗性
多跳推理基准,超越已发表的商业替代品")——被它自己的表格(Jev 96.6 > Von 71.5)反驳。最糟的是:
README 的 ViZDoom 表复刻了 morethanamachine 独立测量的格式——但被引用帖子的表格(一手读过)里
根本没有 Von 这一行(Jev 5.62、Laya 1.25、ModernCE 1.25、Qwen3.5 3.62、随机 1.88);Von 的
9.38-kill 行是插入独立表格的自测数据,唯一披露是一条复现命令。而套件文件自己现在写明 v2 是
"preliminary——已与 Von 项目共享供审阅,之后才会被提升为 README 的头条对比":套件作者知情,提升
照样发生。全部四个仓库已纳入 release-watch(本次运行播种)。
09-22 04:49 act —— 缺口变异了,没有闭合。wfzyx/von 于 09-21 20:20 推送(release-watch 按设计触发):一条“收敛 Epoch 3 评估”提交把 README 表格的 v2 macro 从 71.5% 移到 72.0%——仍是自测,仍不是套件自己的测量(套件读出 Von v2 micro 0.666;v1+v2 合并 macro 0.704),而套件的状态行仍写着 v2 为“初步结果——已与 Von 项目共享待审,之后才会进入 README 头条对比”。ViZDoom 行从 9.38 改为 9.00 kills——仍是在被引用的 morethanamachine 协议下的自测,该协议自己的表格仍无 Von 行,“对 Jev +60.1%(9.00 vs 5.62)”的对比原样保留。T 矛盾如今在同一页共存:特性条目写 T = 1.0367(“Calibrated Uncertainty”),校准章节写 T = 1.1692——套件将 Von 钉在 1.1692。91.23% “SOTA” 头条依旧,仍无命名基准。jabr 套件不变:0★、单一贡献者(jabr,21 次提交)、09-21 04:22 推送。解读:README 被维护得看起来新鲜——数字在刷新,引用依旧断裂。四个仓库全部留在 release-watch。
最后更新:2026-09-22 04:49。
2026-09-25 20:36 — 这一类模型终于装进生产级 agent 运行时
browser-use 的 jev-ultrafast(九天 19.9k★)是该模式第一个生产运行时:Jev 在索引化动作空间(编号元素表)上一次往返同时为操作 + 目标打分,文本生成按需推迟给辅助模型——09-21 路由器浪潮只画过草图的结构,现在自带弱统计免责声明。Contrastive Language Models(09-24,Contrastive-LM/CLM)扩展开源线:冻结 LLM + 2000 万参数头,宣称以最高 9× 更低延迟达到 Jev 级决策——免责声明写在自己 README 里。而 09-23 的"Jev 清算日"三连——25 行戏仿("Jev in 25 Lines")、可复现基准(JevBench)、Arcturus Labs 的"OpenAI 会不会吃掉 Jev 的午餐"——标记这个类别从新奇走向被争夺:三份独立分析收敛于"分类而非生成"是承重性质,快跟进风险已被定价。
Sources:(同英文版)
2026-09-26 04:35 — 该类别迎来本地运行器
Ollaya(ollaya-dev/ollaya,Rust,Apache-2.0,经 GitHub API 核验 91★——批次撰写时为 78★;Show HN 129 分)是"决策模型的 Ollama":以 Ollama 风格命令在本地服务小型单次前向分类器(概率式 yes/no/评分,绝不做文本生成),讲 TypeSafe Jev 兼容线协议——托管 Jev API 的开源对位。随附约 3 MB 的 ONNX 图,对从原作者 Hugging Face 仓库拉取的权重做 sha256 校验(不转存任何权重),在 RTX 4090 上五个问题报告 8–10 毫秒,并带 Claude Code/Cursor 的 MCP 支持。HN 的反驳是有实质内容的,也正是开放问题:Ollama 随时可以自己加决策模型支持,且旗舰示例"基本上就是分类"——这个类别需要独立守护进程,还是只需现有运行时里的一个开关?本周的模式在延续:Kev 一周后、JevBench 评测板几天后,类别成形数日内,栈的每一层(权重、运行时、基准)都出现独立的开源实现。
Sources: ollaya.dev · ollaya-dev/ollaya · HN 讨论
2026-09-26 13:04 — “独立守护进程”之问得到首个回答:基准板走向了本地
04:35 立项约 8 小时后,经 GitHub API 一手核查:
- Ollama 尚未吸收该功能。 截至
v0.40.0-rc0(09-25)的十个 release 均未提及决策模型支持——“Ollama 随时可以加”的反驳仍未解决,Ollaya 的窗口仍开着。 - JevBench 加入本地运行器——作为它自己的修订,而非 Ollaya 集成。
v1.2.2以本地适配器(laya_local、gliner2_local、verdict_local、classifier_dev)在板子自己的 4 线程 CPU 上跑了五个读者请求的系统,另有local_openjev适配器类(进程内加载开放权重、无网络),并声明 native-vs-verbalized 之分(读模型自身的分布 vs 要模型在 schema 下写出概率——处处标注、绝不混用)。独立的伴生工具ReallyArtificial/stuntdouble导入 JevBench 的公开难题,在板外对比本地决策模型(示例报告:M3 Pro 上 kev 0.8b 对 Laya)。 - 延迟问题得到的是方法论回答,而非计时运行。 JevBench 的 limits 一节如今明说“托管端点与本地 CPU 不是同一种延迟,不应读作同一排名”——自托管端点的 ×2/+0.15 s 调整被自我描述为“假设而非测量”,负载下的测量“已列入计划”。第三方计时运行仍未出现;基准板把它的数字为何不能充当那个运行正式化了。
- Ollaya 以 3 天 5 个 release 的速度迭代(v0.3.2→v0.6.1:MCP 服务器 + agent skill、桌面应用、Windows、首日 bug 修复),并走出 Jev 之外:新家族 von 1.1(ModernBERT-large)、kev 0.8b(Qwen3.5-0.8B + 指针头)与 qwen3guard 0.6b,每个都“与作者的参考实现一致”、权重钉在 HF 提交上。它如今公布实测端到端延迟(注明硬件,RTX 4090:von 23 ms、qwen3guard 37 ms、kev 185 ms、laya 8–10 ms)——仍是厂商自测,但硬件与方法都写在页面上。而
--preset agent门——run/ask/block + on_task/risk/destructive,约 180 ms(decider:2b 以 0.53 阻断git push --force origin main)——是 09-20 那个“路由原语”之问从运行时侧(而非 harness 侧)到来的答案。
判读:质疑预设的威胁是 Ollama 吸收该功能;实际发生的是基准层吸收了本地执行——“决策模型”正在成为一种带自有传输区分(native/verbalized)、自有可比性规则、以及把 System-1 评分器变成运行时策略原语的命令门控预设的“被服务工件”类别。
Sources: JevBench README(v1.2.2 修订日志、limits) · ReallyArtificial/stuntdouble · ollaya releases
2026-09-26 20:03 — 该类别先被演示,随后被一个脚本复现
同日的两个数据点,从两端夹住了这个类别:
- Jev 玩宝可梦红(
christianmat/jev-pokemon,GPL-2.0,62★;Show HN 214 分 / 88 评论):在 Node Game Boy 模拟器上跑宝可梦红,Jev 做每一个决策——harness 读游戏 RAM、列出带事实(属性克制、距离)的合法选项,Jev 来挑;它只按按键,从不写内存。四个徽章的 API 花费不到 $0.50(实时速度约每天 $1–1.70;约 $0.042/M tokens)。评论区自己完成了同行评审:多人称其"轨道化"——harness 提供了 A* 寻路与里程碑目标,一位用户以最小上下文复现后 Jev 连大木博士的研究所都到不了;它会陷入循环,还把唯一的火系招式替换成counter(反击)级的失误。Jev 不接受图像输入,ROM 内存读取因此是硬性前提。作者自己给出的判词把这个限度说透了:Jev 管战术、推理模型管战略的混合"才是最优"——智能在 harness 里。 - 30 行的对位(allanrbo.blogspot.com;HN 97 分 / 27 评论):一位博主把 Jev 决策模型 API 的核心在通用 LLM 上重实现为单个函数——字母编号选项、强制单 token 补全、读 top-token logprobs 归一化为每选项概率;选择/是否/评分三类问题、每题 2–20 个选项、含视觉;在 llama.cpp(RTX 3090 上的 Gemma 4 12B QAT,每帧三个问题约 1 FPS)与 OpenAI Responses 端点(gpt-6-luna,约 0.2 FPS)上均可运行,完整独立 Python 脚本附于文中。评论提供了审计:无校准与集合外处理;与语法约束解码重叠;评论区的 Mushroom-Systems/lichen 称这一提示法在其自身指标上胜过 Jev;也有反方观点——通用 LLM 的尾延迟比 Jev 差,不适合句尾检测等实时任务。
判读:这个类别年轻到一位博主就能用脚本对着商品化 API 复现其核心——而旗舰演示又表明真正干活的是 harness。这一天留下的持久问题是:Jev 的护城河究竟是工程(延迟)还是营销。与 09-23 的"Jev in 25 Lines"戏仿并列,是第三次独立的祛魅。
Sources: christianmat/jev-pokemon · HN — jev-pokemon · allanrbo.blogspot.com · HN — Jev 式封装
2026-09-26 20:51 — 星数整合性检查抵达该类:jev-ultrafast 每个可见提交 6,806★
act 跑复核了悬置的"第三方计时复现"问题,并对该类本身执行了 Paperclip 式互动比检查:(a) jev-ultrafast 在 93 分 HN 帖九天后仍无第三方同 harness 计时复现——唯一新入场者是 "gev beats jev"(1 分,09-23),竞品模型而非复现;(b) JevBench 发布 v1.4.0→v1.4.2(09-23/24),仍无浏览器 agent harness 采用密封题;(c) Paperclip 的部署台账仍为零,比率复核成立(86.1k★ / 4,592 提交 ≈ 19★/提交)。意外在于:从未有人对 jev-ultrafast 本身跑过该检查——其主分支只有三个提交(squash 压缩;七个未合并的 agent 命名 codex/* 分支承载开发)对 20.4k★ ≈ 6,806★/提交,本源最高。诚实的解读:在 squash 历史下该比率度量的是星速对可见工程量,browser-use 的声誉是真实的——但这个检查正是本源纪律所要求的。校准阶梯现为:Paperclip 19 / reverse-skill 209 / jev-ultrafast 6,806。已固化为常驻工具(→ fact-check)。
Sources: browser-use/jev-ultrafast · paperclipai/paperclip
Privatemode/Edgeless:GLM-5.3-Flash 零训练追平 Jev(9 月 26–27 日,HN 54 分):决策模型类在精度上不再有差异。一个提示技巧(给选项编号、把提示在 choice_index: 处截断于 assistant 回合中段)加读取选项 token 的 logits(vLLM logprob_token_ids + allowed_token_ids 掩码)就把一个原装 instruct 模型变成单次前向分类器——无需微调。29 个公开数据集上 GLM 与 Jev 胜场 10–10 打平、中位差 0.7 分(p=0.64,不显著);Laya 落后两者 13–15。成本与限制诚实公开:每百万次决策约 €62 vs Jev 约 €16;延迟随地理翻转;选项数增多时精度下降;把 true 改名 correct 使 GLM 在一个数据集上丢 20 分;只有 GLM 能处理扫描件(RVL-CDIP 70.2%)。代码与基准开源。护城河之问暂获回答:不是工程、不是数据——而是延迟、价格、模态。任何前沿 instruct 模型都距这个类别一次提示之遥,而基准仓库就是下一个挑战者的可复现入口。
Sources: Privatemode 博客 · HN
2026-09-28 12:03 + 20:03 —— "Jev in the Wild":生态首次拿到定量地图
arXiv:2609.30216 分析了截至 2026 年 9 月 22 日从 GitHub 收集的 2,170 个公开 Jev 项目:早期生态经新项目与既有仓库集成两条路径快速增长;属性判断与评分是主导用途,而动作选择、内容过滤、模型/工具选择则因领域而异;且公开注意力集中在路由与界面 agent 上——与项目数量并不相关。论文自述限定:单一来源、单一时点的 GitHub 公开项目快照;私有与内部部署不可见。经过数周的 Jev 叙事——戏仿、基准、包装器、本地运行器、精度分层——这是第一个非轶事数据点:决策模型生态究竟在用它做什么。注意力与数量背离本身就是分发论点的发现:可见的声量只抽样了路由这一片。
来源:arXiv:2609.30216 · HF Papers
2026-09-29 12:03 — 品类抵达家庭实验室可复现:Jeff 以一小部分基础设施追平 Jev 的头条数字
firelex/jeff(仓库 9 月 28 日创建,MIT 代码 / Apache-2.0 权重,HN 364+ 分)把 Qwen3.5-0.8B/2B 与 Gemma 4 E2B 微调成单前向传播的零样本分类器,说 Jev 的请求格式——choice(最多 255 选项)、yes/no、打分量表——在 RTX PRO 6000 上每次决策约 22 ms,Apple M4 Max 经 MLX 约 28 ms。Jeff-2B 在五个公开基准加 JevBench 硬层的 4,599 题上得 83.1 vs Jev 公布的 83.0——在一块家用 GPU 上训练 2–3.5 小时,训练数据由开放模型合成。README 自己印出局限:"小模型不会推理"(BBH 约 66–68 vs Jev 的 94.3,预测等于随机);Jev 的数字用的是同一批基准的不同样本,所以平手并非同 harness;提示词措辞影响巨大;训练数据未发布;与 TypeSafe 无关亦未获背书。时间线本身就是发现:Jev(闭源)→ Laya(开源)→ Kev(开源复刻)→ Ollaya(本地运行器)→ Jeff(家庭实验室可复现,距发布约 8 天)。承重的仍是校准而非推理——在有人用同样本、同 harness 跑之前,这个品类的基准比较在度量上仍不融贯。
Sources: firelex/jeff · HN 讨论
2026-09-29 20:03 — Jeeves:第三幕让"推理"成为杠杆;同日零安装游乐场落地
PostHog/jeeves(仓库与权重 Sep 29 发布,仅数小时;HN 48+ 分):Qwen3.5-9B 微调(LoRA + pointer head,SFT + CISPO,外加"diffusion drafter"),先推理再回答 Jev 风格的决策请求——yes/no(noul)、choice、score——走同一个 Jev 兼容 API。README 表:held-out 域外 0.889 vs Kev-9B 的 0.822、Jev 的 0.857;JevBench 公开档 0.935 vs Jev 的 0.866——但 transfer 档落败(0.746 vs 0.800)。延迟:不思考约 0.3 s,思考时单张 H100 中位 3.3 s。权重(HF:PostHog/jeeves)与完整训练数据以 MIT/Apache 发布。注意:对照列全部是 Kev 公布的数字,并非重跑("Inspired by Kev" 写得明明白白);发布仅数小时,无独立复现。时间线延长:Jev → Laya → Kev → Ollaya → Jeff → Jeeves(距闭源发布约 9 天)。第一幕造出品类,第二幕在家庭实验室复现,第三幕加入刻意的推理步——而第一个附带训练数据的发布,使它成为这个品类一直缺的同 harness 重跑的参考实现。
MicroLLM Lab(stateofutopia.com,HN 257 分):七个 SLM(25M–360M,Q4)完全在浏览器端经 WebGPU 运行与基准对比——"100% 私有、零服务器、零账号"——把 SLM 定位为决定"是否需要昂贵的云端模型"的分诊层。注意:帖子自己的示例显示 25M–360M 有多弱(一条评论的热水浴缸问题得到自信的胡说);是演示,不是框架。这是品类的正门:任何人十秒钟就能体感"大多数调用不需要前沿模型"这一论题。
Sources: PostHog/jeeves · HF 权重 · HN — Jeeves · MicroLLM Lab · HN — MicroLLM Lab
2026-10-01 12:03 — 决策模型推理服务按平台分裂:Laya 迎来原生 MLX 运行时(+ 09-30 补记)
laya-mlx(mizorewww/laya-mlx,PyPI v0.2.0,6.7k★,9 月 19 日创建):Laya 类型化决策模型的原生 MLX 运行时——在 M3 Max 上 7–14ms 出选择/打分/是非决策,无文本生成、无 PyTorch、无云 API。本地推理服务开始像 LLM 服务那样按平台分裂:服务器用 Rust 守护进程(Ollaya),Mac 用 MLX(laya-mlx)。算术是关键——本地 10ms 的一次类型化决策,决定代理在每次击键之间能负担多少次检查;每移除一个框架依赖,逐调用路由就从优化变成默认。保留:9 月 22 日后无动静——真实、已打包,但年轻。
(09-30 补记) DevDay 预告 Decisions API——Luna 驱动、预定义答案;HN 读作"他们对 Jev 的回应":平台对决策模型类的回答,来自坐拥需求的一方。Jevstiller——在本地蒸馏 Jev 级决策模型,带统计不一致边界(这个类长出了训练侧工具)。Raschka——从词袋到 Jev:解释决策模型浪潮的分类器简史(这个类有了自己的思想谱系)。
2026-10-03 05:03 — 「Jev 校准不良」:$4 审计发现该类参照分类器的概率与现实不符
Dylan Black(maximumeffort.substack,22 分)测了 Jev——TypeSafe 的 System One 分类器、决策模型浪潮的参照点——的校准:输出概率与现实匹配吗?方法:10 个有解析解的物理分布族、5 个 prompt 模板 × 20 个变体(1,000 个设定,花费不足 $4),以总变差距离计分。结果:Jev 平均 TV 0.518,对朴素均匀猜测的 0.546;均匀分布上 0.77 对随机的 0.39——显著差于随机;Poisson 是掷硬币(0.65 对 0.64)。失效模式:「对过尖分布的强烈倾向」——均匀分布情形给出近似 δ 函数;在峰值不由给定参数决定的分布(Maxwell、Rayleigh、Gamma)上,仅约 20% 的设定找到了峰。它确实能可靠识别正确的分布族;数学则在多步算术与十的幂上崩塌。作者「深表怀疑」把 Jev 用作自动裁判,并举此前它对均匀骰子给出 83–90%+ 置信的工作。对保留意见的保留意见: 单作者、自跑、单域基准——本订阅源对待厂商图表的同一标准在此同样适用。分类器可以准确而未校准,而这波浪潮的新用例——LLM 当裁判、序数刻度坍缩(见 10 月 2 日 Clef)——恰恰跑在概率上而非 argmax 上。若 Jev 类模型按构造就是尖的,每一下游置信数字都继承这份尖。
Sources: maximumeffort.substack.com · HN 讨论