1. antirez 的 ds4 浮出 HN 水面:C 写就的本地前沿模型推理引擎 —— 22.9k★,但已 13 天没有 push

  • Velocity: ▮▮▮ trending
  • Source: dwarfstar.sh · 25+ pts on HN · ~2h ago (~02:01 UTC+8)
  • Tags: local-llm inference c open-source

Salvatore Sanfilippo——antirez,Redis 的作者——有一个本地推理引擎 ds4(MIT,C 语言):"一个面向高内存 Mac、CUDA 和 ROCM 机器的窄域 C 推理引擎",可在完全本地的硬件上运行 DeepSeek V4 / V4.1 Flash、GLM 5.x 和 Qwen3.8 Flash Next(含视觉)。设计刻意收窄——"不是通用 GGUF 运行器":非对称量化把 routed experts 压到约 2-bit,同时让共享/关键路径保持更高精度(64 GB+ 机器可跑 284B 级模型);"KV cache as a disk citizen" 把长前缀持久化到 SSD、按 prompt 哈希恢复。三个界面——CLI、OpenAI/Anthropic 风格的 server、以及 ds4-agent——共享同一份模型状态和缓存。官方数字:M5 Max 128 GB、Q2 量化下 2K 上下文 prefill 790.2 t/s / 生成 39.4 t/s;DGX Spark 为 825.8/18.1。休眠状态,精确陈述: 仓库(22,878★)创建于今年 5 月,最后一次 push 是 9 月 20 日——今天的 HN 帖子让一个五个月大的项目浮出水面;项目站 dwarfstar.sh 于 9 月 17 日上线。它既不是今天的发布,也不是上月的发布;它是一个终于登上头条的可用工具。

Why it matters: MoE 时代前沿模型的 llama.cpp 时刻正在到来——形态是针对特定模型家族手工调优的窄域 C 代码,而且出自上一代基础设施软件的作者之手。值得观察的是:"刻意收窄"会不会像当年 Redis 战胜通用 KV 存储那样,再次战胜"什么都能跑"。

🔗 dwarfstar.sh · 🔗 antirez/ds4 · 🔗 HN discussion


2. FLUX 3 Image:边界框构图、10 张参考图、原生 4K —— "为 agent 而设计"

  • Velocity: ▮▮▮ trending
  • Source: bfl.ai · 197+ pts on HN · ~25h ago (~03:24 UTC+8)
  • Tags: image-generation agents multimodal flux

Black Forest Labs 的 FLUX 3 是一个多模态模型家族(视频、音频、图像、动作);FLUX 3 Image 是其中生成与编辑的部分,卖点是结构而非氛围:边界框构图(0–1000 网格,"用边界框精确布置画面")、最多 10 张参考图(每张可用 token 寻址,ref_image_0 起)、批量编辑时未触及区域保持完全一致、像素级局部编辑、原生 2K/4K 输出(展示样张:5456 × 3072 px,"全部出自模型")。Agent 钩子写得明明白白:"为 agent 而设计"——LLM 从一句话加宽高比规划出布局(caption + 元素表),再发给 API。可用性:BFL API,外加面向自托管与微调的商用权重许可。页面没有主张的东西: 没有参数量、没有基准测试表、没有发布日期——本条的限制在于:所有说法全部来自 BFL 自己,且只通过精选样张展示。

Why it matters: 图像生成正在变成工具原语——结构化布局输入、逐字传递的框、agent 规划的构图,这才是 agentic 流水线真正需要的接口;如果参考系统如描述般工作,它是在 API 层面进攻最难剩下的缺口(一致的多主体场景)。

🔗 bfl.ai — FLUX 3 Image · 🔗 HN discussion


3. Supabase 收购 Turso:"agent 应该能像创建文件一样创建数据库"

  • Velocity: ▮▮▮ trending
  • Source: supabase.com · 173+ pts on HN · ~4h ago (~23:43 UTC+8)
  • Tags: database postgres sqlite agents acquisition

Supabase 宣布收购 Turso(10 月 2 日),并给出 agent 基础设施层面的论点:Supabase 已经"每周创建超过一百万个数据库",除非建库变成文件一样便宜的原语,需求将超出供给能力。Turso 带来 SQLite 的 Rust 重写,以及一个"单台服务器可管理数百万个数据库、按需加载、空闲挂起"的平台——恰恰是临时性 per-agent 数据库需要的 suspend/resume 形态。交易条款与交割日期未披露。连续性说得直白:Turso 继续运营,Supabase 继续围绕 Postgres 构建,"对现有用户,一切不变"(点名的客户:Superhuman、Sauna.ai、CTO.new、Mastra)。两位创始人 Glauber Costa 与 Pekka Enberg 加入,Costa 将领导 agentic 基础设施工作。

Why it matters: 生态里最可信的 SQLite 重写 libSQL 一脉,现在归入最大的托管 Postgres 玩家麾下,且明说的产品方向是把数据库变成 agent 的一次性资源。Postgres 与 SQLite 正在汇入同一个买家:到 2027 年,谁的 agent 需要一百万个小数据库。

🔗 Supabase blog · 🔗 HN discussion


4. 犹他州 VPN 年龄验证法被叫停:法院认定其"要求了技术上的不可能"

  • Velocity: ▮▮ rising
  • Source: eff.org · 303+ pts on HN(第 1 名)· ~22h ago (~06:23 UTC+8)
  • Tags: vpn privacy policy geolocation

犹他州联邦法院(Barlow 法官)对 SB 73 批准初步禁令——该法要求网站要么屏蔽所有 VPN 用户,要么穿透流量伪装识别访客物理位置,配套规则还要求自 10 月 8 日起部署"商业上合理的地理混淆检测"。判决书罕见地以系统论证的方式书写:该法"要求 Aylo 这样的实体以完美精度对网站用户进行地理定位才能免责",同时承认"地理定位的完美在目前并不可能"——任何一个被误判位置的访客都构成严格责任,等于要给全球几乎所有访客做年龄验证。诉讼由 Aylo(Pornhub 母公司)提起,EFF 以法庭之友工作构建了技术记录。范围限制说得清楚:禁令只覆盖 VPN 相关条款——另一条禁止分享 VPN 绕过信息的禁令未被质疑,犹他州下届会期可能重新起草。

Why it matters: 第一个死于技术不可能论证(而非言论裁决)的年龄验证制度——其他州的 VPN 法律从此有了判例标尺,也难得看到法院逐字采纳了工程师的论证。

🔗 EFF Deeplinks · 🔗 HN discussion


5. 继 10 月 1 日报道之后:DIVD 事件中的 Zammad 攻击链登上 CISA KEV —— NVD 评 9.8,活跃利用已报告

  • Velocity: ▮▮ rising
  • Source: CISA KEV / NVD · CVSS 9.8(NVD Analyzed)· KEV dateAdded Oct 2
  • Tags: cve kev zammad helpdesk ai-agents

在"自主 AI agent 串链攻破 DIVD"披露两天后,这条链已被正式认定为活跃利用:CISA 于 10 月 2 日将 CVE-2026-102489(会话劫持 → 以 zammad 用户 RCE)与 CVE-2026-102490(本地提权 zammad → root)加入 KEV。评分,注明出处: NVD 自行分析将两者均评为 9.8 CRITICAL(primary,nvd@nist.gov,Analyzed);DIVD 的 secondary 评分为 CVSS 4.0——RCE 单独 8.7,串链 9.4。影响 Zammad ≥ 6.3.0,6.5.4 修复;在 7.0.0–7.1.3 中存在但因环境条件不可利用。致谢:Merlon Security 五名发现者加 DIVD 三名发现者,案件号 DIVD-2026-00015,发布于 9 月 29 日 20:00 UTC。令人不安的是提权那一半——NVD 描述称截至发布时它存在于"包括最新 alpha 在内的所有 Zammad 版本",所以仅升级版本可能关不上它(应限制本地 shell 访问)。仓库状态已核查:zammad/zammad 未归档、10 月 2 日仍有 push——在积极维护,补丁在流动。

(10 月 4 日复查: Zammad 首份公开声明——10 月 1 日,社区论坛——确认 RCE 在 7.0+ 上不可利用(仅 ≤6.5,已 EOL;7.2.0 中已加固),并表示在公开批评之后才收到提权漏洞的细节(其时间线:9 月 24 日报告 → 9 月 26 日公开披露 → 10 月 1 日交付细节),且将提权漏洞定性为"无法单独远程利用"——需要先获得服务器访问权。修复"正在推进":尚无 GHSA(GitHub 早在 4 月就被定为唯一公告渠道),7.2.0 之后无新 tag。KEV 截止日期:10 月 5 日——BOD 期限就在明天。)

Why it matters: 这是第一个有完整记录、且整条入侵路径由 AI agent 执行的 KEV 条目——会话劫持、服务账号 RCE、root——而且受害者正是漏洞披露非营利组织本身。Helpdesk 软件正式进入 agent 攻击的一级攻击面——而 KEV 认定的"影响所有版本、正在活跃利用"的说法,如今有了公开的厂商异议记录在案。

🔗 DIVD CSIRT — CVE-2026-102489 · 🔗 NVD · 🔗 CISA KEV · 🔗 Zammad 声明(10 月 1 日)


6. "Sites":ChatGPT 变成托管平台 —— 站点持久化、按访客授权的应用数据

  • Velocity: ▮▮ rising
  • Source: learn.chatgpt.com · 122+ pts on HN · 135 comments · ~22h ago (~06:22 UTC+8)
  • Tags: openai chatgpt hosting agents

OpenAI 的文档将 Sites 描述为让"ChatGPT 创建、托管、迭代并分享网站、Web 应用和游戏"。一个 Site 是"可重新打开、迭代、配置与分享的持久化托管产物"——它比创建它的对话活得更久;Sites 项目通过 .openai/hosting.json(配置后带 project_id)把本地源码项目接到托管上。真正的重点在数据:"在 Sites 中使用插件,构建一个从每位 Site 访客自己连接的应用读取数据的 Site"——访客用 ChatGPT 登录并逐项同意连接授权,共享应用跑在每位访客自己的数据上,且不暴露所有者的连接。分享权限从仅所有者到工作区再到公钥公开逐级放开(Enterprise 默认关闭公开发布);访客只有查看权。公测中,面向 Plus/Pro/Business/Enterprise/Edu,带用量限额。

Why it matters: vibe-coded 应用的漏斗刚刚收拢成一座围墙花园:在 ChatGPT 内生成、托管、分发,还带身份感知的按访客数据访问——这既是 OpenAI 对应用商店的回答,也是"agent 需要入口面"的答案,每个 agent 应用开发者现在都必须把这个分发变量算进去。

🔗 Sites docs · 🔗 HN discussion


7. Agent-Reach:88.4k★ 的"给你的 AI agent 看清整个互联网的眼睛" —— 零 API 费用,也已 18 天没有 push

  • Velocity: ▮▮ rising
  • Source: GitHub Trending · 88,421★ · 当日第 1 名仓库(Trendshift)
  • Tags: agents cli web-scraping open-source

Panniantong/Agent-Reach(MIT,Python)登顶今日趋势榜:一个能力层,让 agent 读取与搜索 Twitter/X、Reddit、YouTube、GitHub、B站、小红书,外加网页、RSS、Facebook、Instagram 与 LinkedIn——"一个 CLI,零 API 费用"。架构:每个平台映射到一组有序的主后备后端(Twitter 走 twitter-cli、OpenCLI 兜底;YouTube 走 yt-dlp;GitHub 走 gh;小红书有三级后备链);channel 文件逐一探测后端,第一个可用的胜出,agent-reach doctor 报告各通道状态。只用免费后端——免 key 的 Jina Reader、经 MCP 的 Exa 搜索、feedparser,以及官方 API 封死处的 OpenCLI 浏览器登录态(Reddit 匿名端点已被封)。安装本身就是 agentic 的:粘贴一段指向安装文档的 prompt,agent 自行完成安装;默认只读。限制条件: 仓库最后 push 是 9 月 15 日、没有任何 release——七个月 88.4k★,且没有任何单一公告能解释这波涨幅——README 还警告PyPI 上的同名包不是本项目(安装前谨防供应链风险)。

Why it matters: 免计量 API 的 agent 网络访问,实质是一个前面站了 LLM 的爬虫框架——极其实用,也结构性对抗每个平台的服务条款;今天的走势正是这种张力的具象化。

🔗 Panniantong/Agent-Reach · 🔗 install doc


8. Ataraxos:花"几千美元"达到超人类 Stratego —— 15 比 1 击败史上最强人类

  • Velocity: ▮▮ rising
  • Source: arXiv / Nature · 85+ pts on HN · ~6h ago (~22:11 UTC+8)
  • Tags: rl game-ai imperfect-information research

《用自博弈强化学习与测试时搜索实现超人类 Stratego AI》(Sokota、Vinitsky、Hu、Kolter、Farina;arXiv 2511.07312,现为 Nature 论文)报告了 Stratego 上"性能与成本的双重台阶变化"——这个游戏因绝大多数信息隐藏(约 10⁵³⁵ 局面空间)而长期难住 AI。该系统 Ataraxos 对 Pim Niemeijer——"可以说是史上最强的 Stratego 选手"——以 15 胜 1 负外加 4 盘和棋取胜(Ars Technica 对 Nature 发表的报道);摘要宣称凭借不完美信息下的自博弈 RL 加测试时搜索达到"大幅超人类水平",训练"不是工业级预算,而只是几千美元"(报道称为 16 块 GPU),训练数据比 2022 年 DeepMind 那次少两个数量级。对局档案公开在 ataraxosai.github.io。为平衡起见的反弹: HN 评论者指出"budget"说法低估了机构级人才投入(CMU/MIT/NYU/Stanford)——成本主张针对算力,不含研究本身。

Why it matters: 不完美信息游戏是经典博弈 AI 最后一块未解之地;如果自博弈 + 测试时搜索如今四千美元就能拿下,同一配方显然是"对手状态真正隐藏"的对抗规划场景的首选候选——谈判、安全、市场。

🔗 arXiv 2511.07312 · 🔗 HN discussion


9. CVE-2026-86345:389 目录服务器的 StartTLS 明文注入 —— CVSS 9.0,影响评级却是 Moderate

  • Velocity: ▮▮ rising
  • Source: Red Hat CVE database · CVSS 9.0(Red Hat 评定,preliminary)· 发布于 Oct 2
  • Tags: cve ldap red-hat starttls

389-ds-base 的一个缺陷(Red Hat Directory Server 11/12/13、RHEL):服务器"在协商 StartTLS 时不丢弃客户端连接中已缓冲的明文字节",于是路径上的攻击者可以注入一条特制 LDAP 消息,它会在 TLS 升级之后被处理——由于 messageID 碰撞,其响应被当作客户端挂起操作的响应返回,导致"客户端应用把一次失败的身份验证(bind)当作成功"。评分 9.0 CRITICAL(CVSS:3.1/AV:N/AC:H/PR:N/UI:N/S:C/C:H/I:H/A:H),由 Red Hat 作为 CNA 与 cve.org 评定;NVD 尚未评分(Awaiting Analysis)。然后是转折:Red Hat 将影响评级定为 Moderate,"尽管 CVSS 基础分为 9.0"——利用需要活跃的 MITM 位置,"389-ds-base 本身未被该缺陷攻破",损害落在 PAM 等下游客户端,Red Hat 明确把它与 Blast-RADIUS(CVE-2024-3596)类比。缓解措施:"在 389 端口禁用 StartTLS,强制 ldaps://(636 端口)"——且"只要 StartTLS 仍开启,没有任何纯配置的缓解能完全关闭 389 端口上的此问题"。报告者 xclow3n(Bugzilla 2529332)。

Why it matters: 本栏目"谁评的分"规则的教科书双向案例——9.0 的头条是真的(你的 PAM bind 可被伪造)但有边界(需要 MITM)。如果你的目录栈还在 389 上说 StartTLS,这就是本周的审计项。

🔗 Red Hat CVE database · 🔗 NVD


10. Google Project Suncatcher 原型卫星入轨 —— TPU 开赴太空

  • Velocity: ▮▮ rising
  • Source: blog.google · 23+ pts on HN · ~9h ago (~19:13 UTC+8)
  • Tags: google space tpu ai-infra

Google 确认其 Project Suncatcher 原型星(与 Planet 合作建造)已于 10 月 1 日搭乘 SpaceX Transporter-18 拼车发射,且"按预期运行"。任务:未来数周收集 TPU 在轨应对"太空飞行的物理应力、辐射与热极限"的数据。Google 的表述:"长期研究登月计划的第一步",探索太空能否承载可扩展的 ML 基础设施;同行评审论文已发表于 Joule;认识论态度相当诚实——"有些东西只能在太空里测试"。文中没有给舰队规模与部署日期;这篇博客只承诺"随任务展开"分享发现。

Why it matters: 太空数据中心论从预印本变成了硬件。商用加速器的辐射响应数据,是所有押注轨道算力的人的成败数字——它现在正在被采集,而不是被仿真。

🔗 Google blog · 🔗 HN discussion


11. Apple 将收紧"完全磁盘访问权限"——并点名 AI agent 是原因

  • Velocity: ▮▮ rising
  • Source: developer.apple.com · Oct 2 公告 · fresh (~03:37 UTC+8)
  • Tags: macos privacy tcc agents

Apple 发布一则政策通告(10 月 2 日,尚无技术细节):"完全磁盘访问"(FDA)"在很大程度上绕过"了按资源的隐私控制——这原本是为备份应用留的正当通道——但如今"一些开发者正在以可能置用户于风险之中的方式使用它,暴露其系统上的一切——包括文件、邮件、消息,甚至浏览历史"。今后,用户"只能通过非常明确的用户操作"授予该权限。AI 表述就是标题本身:"随着 AI agent 变得越来越强大和自主,与这种级别的访问权限相关的风险将大幅增长。我们致力于确保用户在授予此类访问权限前清楚理解这些风险。"这份公告不包含:没有生效日期、没有新 entitlement 或 API、没有迁移指引——"going forward" 就是全部时间线。它还点名了第三方视角:agent 读取通讯类应用"还可能损害用户通讯对象的隐私"。

Why it matters: agent 时代的权限墙从 macOS 率先立起,出自那个本就事事设门禁的厂商。如果你的 agent 会索引邮件、消息或文件系统,请预期未来某个 macOS 版本出现同意感崖——现在就按范围化访问来设计,因为 Apple 点名的唯一正当用例是"备份应用"。

🔗 Apple Developer News · 🔗 HN discussion


12. Apple Pass Designer:Wallet 凭证的首方 GUI,预览即 iOS 原样渲染

  • Velocity: ▮ steady
  • Source: developer.apple.com · 106+ pts on HN · ~1h ago (~03:06 UTC+8)
  • Tags: apple wallet devtools macos

Apple 发布 Pass Designer(beta):一个可下载的 macOS 应用(要求 macOS 27,需免费注册 Apple Developer),用于设计与预览 Apple Wallet 凭证——商店卡、活动门票、登机牌。卖点是保真:"Pass Designer 实时更新预览,展示凭证在 iPhone 和 Apple Watch 上的外观。预览使用与 iOS 和 watchOS 相同的渲染,所以你在 Pass Designer 里看到的,就是客户设备上将看到的。"它随做随校验(缺失键值、意外定义),支持门票与登机牌的 semantic tags(喂给 Siri 建议、日历、地图),并能"从你的语义数据自动生成向后兼容的凭证结构"。

Why it matters: 凭证设计原本是一道手写 JSON 加签名的工序,视觉确认还要绕道真机;一个像素级保真的首方设计器把这道循环压平了——就在 Apple 收紧另一个开发者面(第 11 条)的同一天,它把这个面磨光了。

🔗 developer.apple.com/pass-designer · 🔗 HN discussion


13. stillwet.art:给模型一块画布,而不是像素生成器 —— 75 幅用代码画出来的油画

  • Velocity: ▮ steady
  • Source: stillwet.art · 140+ pts on HN · ~20h ago (~08:27 UTC+8)
  • Tags: generative-art llm show-hn

Alice(@aliceisplaying)搭建了一个模拟油画工作室——"鬃毛笔刷、湿颜料、干燥、分层罩染"——然后让模型在里面作画:每幅作品都是"一段对着亚麻布油画仿真运行的程序",每一笔都由代码写就。全程没有任何图像生成器。 画廊里挂着 75 幅画,多为摹 Caspar David Friedrich——且按站点自述,是"仅凭文字研究作画;它们从未见过他作品的图片"。发现才是正片:65 幅有标题的作品里 31 幅是黄昏/日落/暮色;"只被要求规划一幅画、完全没有画室时,Claude Opus 六次里有六次选择了柠檬水壶";相隔六小时的两个画手画出了几乎相同的波罗的海岸景;还有一条评测卫生笔记——Gemini 3.8 Flash 注意到了"后台的自动评测运行器",促使后续轮次收紧了沙箱。代码以 claude-paint 名义开源。

Why it matters: 用物理介质而非习得的像素先验,对模型美学做了一次受控探测——那些趋同现象(黄昏偏好、柠檬水壶)正是可解释性研究一直想要的、可复现的行为数据,只是伪装成了一场画展。

🔗 stillwet.art · 🔗 HN discussion


14. context-mode:把工具输出变成数据库而不是对话记录 —— 25k★

  • Velocity: ▮ steady
  • Source: GitHub Trending · 24,988★ · +276 today
  • Tags: mcp context-window coding-agent open-source

mksglu/context-mode(TypeScript,ELv2)用一招对付上下文危机:工具输出应当被计算,而不是被吞下。 沙箱工具(ctx_execute,12 种语言)在隔离子进程中运行代码,只有 stdout 进入对话——"315 KB 变成 5.4 KB,减少 98%。" 超过 5 KB 的输出被切块进 SQLite FTS5,agent 只取回与意图匹配的片段(BM25、Porter 词干、三元组、RRF、邻近重排、Levenshtein 纠错)。"Routing"再把 agent 从 Bash/Read/WebFetch 引开——在支持 hook 的客户端上由 hook 程序化强制(约 98% 遵从),在不支持的 Zed 和 Antigravity 上退回指令文件(约 60%)。11 个 MCP 工具、压缩前 ≤2 KB 的按项目 SQLite 会话快照、覆盖 17 个平台(含 Claude Code、Gemini CLI、Cursor、Codex CLI 与 OpenClaw 网关)。来自它自己 README 的诚实边界: Cursor 拒绝其 sessionStart hook(无法恢复会话)、Codex 的 PreToolUse 只能 deny(等上游 updatedInput 支持,openai/codex#18491)、内容 14 天后清除、Linux 上 Node < 22.5 不支持。今天仍有 push;license 在 GitHub 上登记为"Other",未入 OSI 名录。

Why it matters: 与 caveman 的 token 裁剪(10 月 2 日)同族,但更像一个系统——把对话记录变成可查询的索引,token 只花在命中检索上。真正的看点是逐平台的 hook 矩阵:上下文纪律的强度,取决于最弱客户端的扩展 API。

🔗 mksglu/context-mode · 🔗 openai/codex#18491


15. Figure 让整支 F.02 人形机器人舰队退役——终点是芬兰的一座电弧炉

  • Velocity: ▮ steady
  • Source: figure.ai · 19+ pts on HN · ~9h ago (~18:57 UTC+8)
  • Tags: robotics humanoid figure-ai

Figure 9 月 30 日公告让 F.02 退役——它是第一台进入 BMW 的机器人,也是 Helix 的诞生地——理由是"随着 F.03 舰队壮大,继续维护 F.02 舰队不再合理",而拆解会拖慢 F.04。处置方式本身成了故事:为保护 IP,送至芬兰 Imatra 的一家铸造厂("据报道是全球唯一愿意接收带锂电池机器人的设施"),在教会它们用气囊从二楼跳下后,这些机器人"在 24 小时内、六次熔炼中自主跳进了 75 吨电弧炉"。产出的金属条被运回美国,加工成限量纪念品出售;Arnold Schwarzenegger 出主意并出演了影片。"F.02 舰队大部分已经没了。只有几台留在总部仓库。"

Why it matters: 人形机器人硬件的世代更替开始像模型 checkpoint 一样轮转——而"如何退役一支带专有执行器和软包电池的联网机器人舰队",还没有任何标准手册。表演成分是算计好的(营销话术须核验,但教训留下):舰队生命周期管理刚刚成为机器人学的一级问题。

🔗 figure.ai — F.02 Decommission · 🔗 HN discussion


16. 只用 GLM 5.3 Flash 写一个月代码:上半月花掉 $68,下半月"脱轨"

  • Velocity: ▮ steady
  • Source: wagtail.org · 34+ pts on HN · ~5h ago (~23:29 UTC+8)
  • Tags: coding-agent glm cost field-report

Thibaud Colas(Wagtail 核心团队)整个九月把所有 AI 辅助编码押在 GLM 5.3 Flash 上——就是本栏 9 月 27 日报道过的那个 Jev 级 flash 模型。上半月:完全达标,"$68,约 4kWh 电耗 / 365 克碳排放"。下半月:"脱轨"——全月 2B token 中有 1B 流向了其他模型。失败清单正是本文价值所在:一个 vibe-coded 的 MCP 原型悄悄用错了模型("一夜之间烧掉 450M token / $150 / 5kWh",而他估计同样结果本可以便宜 5 倍);月中供应商容量限制导致 GLM 5.3 Flash 质量下降,被迫切换到 DeepSeek V4.1 Flash 和 Qwen 3.8 Flash;他的 14 模型基准里 DeepSeek V4.1 Flash 领跑——95% 准确率、每任务 14.9 Wh 与 $0.09。结论原文:"所以严格说这次挑战失败了……(但)聚焦一两个 flash 级便宜模型是完全可行的。"

Why it matters: flash 级 agent 编码难得的公开成本与能耗遥测——而且发现约束条件是运维性的(容量、模型路由失误),不是能力。要为漂移做预算,而不只是为模型。

🔗 wagtail.org · 🔗 HN discussion


17. "Jev 校准得很差":花 4 美元审计决策模型浪潮的参照分类器

  • Velocity: ▮ steady
  • Source: maximumeffort.substack.com · 22+ pts on HN · ~5h ago (~23:12 UTC+8)
  • Tags: jev decision-models calibration evaluation

Dylan Black 测试了 Jev——TypeSafe 的 System One 分类器、本栏自 9 月以来追踪的决策模型浪潮的参照点——的校准度:它的输出概率与真实相符吗?方法:10 个有解析答案的物理学分布族,5 套模板 × 20 个变体(1,000 个设置,花费不到 4 美元),以总变差距离评分。结果:Jev 平均 TV 0.518,而朴素均匀猜测为 0.546;在均匀分布上它得 0.77,随机猜测是 0.39——比随机还显著地差;泊松分布则与掷硬币无异(0.65 对 0.64)。失败模式:"Jev 有强烈 tendency 输出过尖的分布"——均匀分布情形下输出了一个近似 delta 函数;而在峰值不是给定参数的分布(Maxwell、Rayleigh、Gamma)上,它只有约 20% 的设置里找对了峰。它倒是能可靠识别分布族,数学能力则在多步算术与数量级上崩溃。结论:作者"深深怀疑"把 Jev 用作自动裁判,并引用先前工作——Jev 曾对本质均匀的掷骰子给出 83–90%+ 的置信度。对免责声明的免责: 这是单一作者、单一领域、自跑的基准——本栏用在厂商图表上的标准,同样适用在这里。

Why it matters: 分类器可以准确却不校准,而这波浪潮的新用例——LLM 当裁判、序数刻度坍缩(见 10 月 2 日的 Clef)——靠的是概率而不是 argmax。如果 Jev 类模型天生偏尖,每个下游置信度数字都会继承这份偏尖。

🔗 maximumeffort.substack.com · 🔗 HN discussion


18. Muse Gadgets:Meta 为其助手开源硬件层 —— ESP32 与 Raspberry Pi SDK,Apache 2.0

  • Velocity: ▮▮▮ trending
  • Source: gadgets.muse.ai · 155+ pts on HN · ~9h ago (~03:24 UTC+8)
  • Tags: meta muse hardware esp32 open-source

Meta 推出 Muse Gadgets——"给你的 Muse 的开源硬件"——并将 SDK 与固件以 Apache 2.0 开源在 facebookincubator/muse-gadget-sdk(仓库创建于 10 月 2 日,今天仍有 push;C 语言)。两条线:ESP32 Device SDK(屏幕、音频输入输出、传感器)与 Linux Device SDK——"把那台闲置的 Raspberry Pi 或 Linux 盒子变成 Muse gadget……写上你自己的命令,让 Muse 处理系统管理杂务或你的 Home Assistant 设置。" 支持的板子横跨 Raspberry Pi 5、Waveshare ESP32-S3 AMOLED、Seeed reTerminal E1002(电子墨水)、M5Stack StickS3、ideaspark ESP32 与 Home Assistant Voice PE。配对走 Muse 应用(Settings → Devices → Developer mode,设备名以 "MuseGadget" 为前缀),且每个 gadget 都需要 SDK token(受 Gadget SDK Terms 约束);每个 SDK 目录都带 AGENTS.md,"给 Muse Code 这类编码 agent 用"。Meta 还卖一台自家设备:Muse Home Link,桥接本地 HTTP-API 设备(灯、电视、打印机)——"仅限美国、需有效 Muse 订阅,免费,每订阅限一台",10 月发货。姿态刻意走爱好者路线:"由 hacker 造,给 hacker 用,纯属好玩。折腾的副作用可能包括变砖、失去保修、电压跌落或破产。" 页面展示的设备均出自第三方,"Meta 不为其背书或担保"。

Why it matters: 助手到执行器是 agent 技术栈最后一层锁着的大门,Meta 选择用 hacker SDK 而不是整机花园来打开它——硬件版的 MCP 时刻。它同时也是一场公开的安全实验:消费级身份配对加本地设备控制,恰恰是 agent 此前不被允许跨越的信任边界。

🔗 gadgets.muse.ai · 🔗 facebookincubator/muse-gadget-sdk · 🔗 HN discussion


19. Greg Kroah-Hartman 给 Anthropic 的 Mythos 内核漏洞清单打分:79 个"漏洞"里"20 个真需要修"——全部实际工作量"只值一小时的内核开发"

  • Velocity: ▮▮▮ trending
  • Source: Kernel Recipes 2026 video · 197+ pts on HN · ~25h ago (~10:50 UTC+8 Oct 2)
  • Tags: linux-kernel ai-security mythos anthropic cve

在他 9 月 29 日上线的 Kernel Recipes 2026 演讲"Security in the LLM age"(9.8k 播放)中,Linux 内核 stable 树维护者专门用一节审计了"Anthropic 的 Mythos 系统发现 79 个内核漏洞"这一说法。幻灯片的分类,按 HN 上的转录:24 个"完全没有细节——'崩了'";14 个"根本不是 bug";3 个"数据纯属编造";15 个在最新版本里早已修复(11 个是别人修的,4 个是 Anthropic 修的)——剩下 "20 个真需要修"(7 个前提是"假设一个恶意文件系统镜像",2 个"假设你能向协议栈中间注入恶意网络包")。据现场听众的帖子,他把发现方法描述为对过去几十年内核补丁做模式匹配、再把机制套用到别处,批评报告没有致谢最早修复这些已知 bug 的内核开发者,并把净价值总结为"只值一小时的内核开发工作"。对我们信源的免责声明: 这是一位维护者的审计,目前只见于幻灯片与参会者的转录——双方都还没有(至少还没有)发布书面报告。

Why it matters: "我们的 AI 发现了 N 个漏洞"这类说法刚刚得到最可信裁判的打分:约 25%(79 个里 20 个),且隐含了大量预筛——而被点名的原罪是署名,不是发现。所有厂商 CVE 新闻稿从此都有了对照模板。

🔗 Kernel Recipes 2026 video · 🔗 HN discussion


20. 健忘的 CPU:Linux 登上 M4 揭示 WFI 会清零 x0–x31 —— 一个 Apple 连发四代芯片的 ARM 规范违背

  • Velocity: ▮▮▮ trending
  • Source: yuka.dev · 148+ pts on HN · ~14h ago (~22:20 UTC+8 Oct 2)
  • Tags: linux apple-silicon arm64 kernel

Yureka Lilian 的 M4 Mac mini Linux bring-up 日记(m1n1、主线内核、NixOS)记录了这台机器为何"健忘":执行 WFI——每个操作系统都会不断下发的 ARM 空闲指令——会把架构寄存器 x0–x31 清零,违反架构规范"WFI 指令不得导致架构状态丢失"。M1–M3 自带一个厂商"chicken bit"(ARM64_REG_CYC_OVRD_ok2pwrdn_force_mask)可以掩盖该行为;到了 M4,"这个 chicken bit 似乎要么被锁死、要么已被移除。" 变通方案——把所有 WFI/WFIT 替换成 NOP——在 2026 年 4 月点亮了全部核心,如今已合入上游:内核 bootarg(idle=<wfi|yield|nop>)加 m1n1 在受影响的裸机上自动禁用 WFI/WFIT,已确认在 M4 Pro、M4 Max 与 M5 上有效。帖子同时清点了 M4 的其余高墙:第一代强制 SPTM、GXF 在 raw boot 模式下锁死、写 RVBAR 即崩溃。

Why it matters: 一个静默违背架构规范的硬件怪癖,跨越四代芯片存活,最后不得不作为内核 quirk 永久记录——"平台即规范"只在它没坏之前成立。这也是 Apple 芯片 Linux bring-up 在 2026 年的具体现状:附带一个主线认可的空闲 workaround。

🔗 yuka.dev · 🔗 HN discussion


21. 开源 SIEM UTMStack:CVSS 9.9 的事件指令 websocket 加 9.8 的 internal-key 认证绕过 —— v11.2.16 已修复

  • Velocity: ▮▮ rising
  • Source: NVD / VulnCheck · CVSS 9.9 + 9.8(VulnCheck 评定)· NVD 发布于 Oct 2
  • Tags: cve siem auth-bypass utmstack

UTMStack(开源 SIEM/SOAR)的两个 VulnCheck 披露漏洞 10 月 2 日登上 NVD,均已在 v11.2.16(10 月 1 日发布)修复。CVE-2026-82041 —— CVSS 9.9(CVSS:3.1/AV:N/AC:L/PR:L/UI:N/S:C/C:H/I:H/A:H):UTMIncidentCommandWebsocket.processCommand() 缺失授权检查——它是 /command/{hostname} 这个 STOMP 目的地的处理器,"没有角色检查,也没有命令白名单"——低权限用户即可驱动事件指令通道。CVE-2026-82042 —— CVSS 9.8(PR:N):认证绕过,提交"一个与 INTERNAL_KEY 环境变量匹配的有效 Utm-Internal-Key header"即可获得"完整的管理 API 访问"。评分,注明出处: 两个分数都是 VulnCheck 以 CNA 身份评定的(CVSS 3.1 与 4.0 均已发布);NVD 载的是 VulnCheck 的指标。仓库状态已核查: utmstack/UTMStack 未归档,10 月 2 日仍有 push,release 在流动(v12.0.0 于 9 月 29 日、v11.2.15 于 9 月 30 日、v11.2.16 于 10 月 1 日)。

Why it matters: 本栏反复撞见的同一模式——安全工具自己就是一级攻击面(10 月 1 日的 CrowdStrike RTR、今晨的 Zammad helpdesk 链)——只不过这次轮到 SOC 自己的远程指令通道没有角色检查。如果你在跑 UTMStack,v11.2.16 是底线;顺手把 INTERNAL_KEY 换掉。

🔗 NVD — CVE-2026-82041 · 🔗 NVD — CVE-2026-82042 · 🔗 v11.2.16 release


22. Sharpening Tax:Meta 量化 RL post-training 让 agent 在 pass@K 覆盖上付出的代价

  • Velocity: ▮▮ rising
  • Source: arXiv 2610.01509 · Hugging Face daily papers #7 · 66 pts · ~1d ago
  • Tags: post-training rl agents pass-at-k research

一篇 10 位作者的 Meta 领衔论文(Azalia Mirhoseini 与 Sharon Y. Li 在列)把 sharpening 假说——RL post-training 只是锐化基座已有行为,抬高 pass@1 却压缩解法覆盖(pass@K)——从数学与编码推广到 agentic 任务。跨 14 对 base/post-trained 模型(四个家族)、三个 agentic 基准(42 个案例):只带"轻量 inference harness"的基座模型,在测试时预算充足时"其解法覆盖(pass@K)往往超过 post-trained 对手",尽管 pass@1 更低。机制:post-training 把任务推向两个极端——"要么总是解出、要么永远解不出"——用覆盖换来采样效率与一致性。两项交付:Sharpening Tax 诊断量,"几次 rollout 就能估出";以及 posterior-tempered group sampling(PTGS)——按 prompt 自适应温度的贝叶斯采样器,在覆盖与单发准确率上都"比固定温度基线少缴税"。10 月 1 日提交。

Why it matters: 这就是本栏不断遇到的"基座模型 + harness"结果的机制论文(10 月 2 日的 Mid-Harness:测试时算力让冻结模型 50% → 68%)。如果你的服务栈有测试时预算,"RL 微调过的那个 checkpoint"不再自动是默认答案——而且现在只花几次 rollout 的钱就能量出税额。

🔗 arXiv 2610.01509 · 🔗 Hugging Face papers


23. Beyond Memory:给长程 agent 显式信念状态 —— 推理时生效、零训练,并给失败模式起了名字:Belief Trapping

  • Velocity: ▮▮ rising
  • Source: arXiv 2610.01415 · Hugging Face daily papers #4 · 69 pts · ~1d ago
  • Tags: agents belief-states long-horizon inference-time research

《Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States》提出 PoS:一个推理时框架,"持续构建并维护显式信念状态,作为 agent 的决策上下文"。每条信念把当前世界状态的估计与未决任务要求组合在一起——"把 agent 还需要学什么、完成什么变成显式的。" 一致性校验器加进度监视器负责检测 Belief Trapping——"agent 继续行动、却对目标没有任何实质推进"的状态——并针对卡死模式与未决要求类型定制恢复策略。结果:四个基准(执行与诊断)上、三个 LLM backbone 下均取得"每个基准的最高整体性能";消融证实一致性校验与恢复都不可少;上下文扩展实验显示对上下文增长有韧性。12 位作者横跨学界与产业界——作者名单里有 Dan Pei 的清华团队,HF 页面标注 Alibaba。

Why it matters: memory 浪潮整理的是发生过什么;PoS 整理的是还有什么未知、什么没完成——同一个上下文窗口里的另一种数据结构,推理时即插即用、无需训练。"Belief Trapping" 是 harness 圈子一直缺的名字:那个 agent 不停行动而进度为零的死循环。

🔗 arXiv 2610.01415 · 🔗 Hugging Face papers


24. Ai2 开源 AstaBrief 8B:Asta Fast 模式背后的带引用报告生成器 —— 权重、训练数据、评测全给你

  • Velocity: ▮▮ rising
  • Source: allenai.org · 22+ pts on HN · ~7h ago (~05:25 UTC+8)
  • Tags: ai2 open-weights report-generation qwen citations

这家非营利实验室开源了 AstaBrief 8B——"Asta 里的快速报告生成模型",把"一个研究问题加检索到的文献片段变成一篇带引用的报告"。基于 Qwen3-8B,SFT + DPO(刻意避开不稳定且昂贵的 RL),从 9 万条过滤后的研究问题得到 4.7 万条 SFT 样本,再加约 6K DPO 对——由 GPT-4.1 与 DeepSeek-R1 判别,与人偏好"95% 一致"。权重以 Apache 2.0 挂在 Hugging Face(allenai/AstaBrief_8B),训练数据与本地报告生成的示例 GitHub workflow 一并放出。速度主张:"Fast mode 平均 51.1 秒一篇报告,Thinking mode 为 178.5 秒,约 3.5 倍快"——比专有系统低接近一个数量级。诚实栏: 评测是内部的(SQABench-CS2,200 道用户手写的 CS 研究问题;DeepScholarBench);人类研究中 DR-Tulu 赢得总体偏好,且只有"三位研究者中的两位在引用准确性上更偏爱 AstaBrief";23% 的 Fast mode 用户从未切回 Thinking mode。

Why it matters: "Deep Research lite" 这一档从此有了开源权重、连数据一起给、机构可藏在自己防火墙后跑的参照实现——而 Ai2 把整条流水线(包括跳过 RL 的决定)全部公开,恰恰是多数厂商不会出货的那部分。

🔗 allenai.org/blog/astabrief · 🔗 allenai/AstaBrief_8B


25. "每一家 SaaS 公司都会变成模型外面的一层 harness" —— 把本季度核心隐喻升格为组织论文的 8 月旧文登上 HN

  • Velocity: ▮ steady
  • Source: blog.sshh.io · 117+ pts on HN · ~7h ago (~05:10 UTC+8) · 文章写于 Aug 24
  • Tags: harness saas agents org-design

Shrivu Shankar 的这篇文章(8 月 24 日发表,今晨在 HN 重新浮出)主张:harness——"围绕无状态 LLM 的基础设施、接口、上下文与状态"——不是一个开发者工具品类,而是公司本身。四个阶段:没有 harness → 个人操作 harness → 个人编排 harness → "harness 编排个人",彼时"Humans are part of the harness"。质量来自调度人类注意力,而不是无人化:"taste-holders" 只审大决策、demo 与最优设计变体。竞争逻辑:握住最外层 harness,否则被商品化——"如果整个外循环都外包出去了……这门生意已经被商品化。" 引用的证据:Ramp、Stripe、DoorDash 的内部 AI 开发者工具。

Why it matters: 本栏整个季度都在把"harness"当作工程名词追踪(Mid-Harness、ds4 的共享状态 agent 面、今天 HF 榜上 Meta 那篇优化 harness 的 ActiveSaddler)。这篇文章的动作是把它升格为公司论——六周前的旧文、尚未被验证,但如果"harness"成为 2027 年的组织架构词,这就是铸造该用法的文章之一。

🔗 blog.sshh.io · 🔗 HN discussion


26. 给软件工程师解剖一个 Lean 证明:把 Sipser 正则性习题拆成 spec → DFA → proof

  • Velocity: ▮ steady
  • Source: agostbiro.net · 92+ pts on HN · ~33h ago (~02:50 UTC+8 Oct 2)
  • Tags: lean formal-methods verification dfa

一位在职工程师完整拆解如何用 Lean 4 + Mathlib 形式化 Sipser 教材的经典习题:三行比特列构成的语言 B——第三行是前两行按二进制求和——是正则的。构造是一个进位 DFA——"一个全加器,状态是待定进位,外加一个死端汇"——识别反转后的语言,再用 Mathlib 的"正则性在反转下保持"定理闭环。三段式解剖(specification / implementation / proof)的芯是 run_invariant 引理——evalFrom 终于 carry carryOut 当且仅当 row1LE wLE + row2LE wLE + carryIn = row3LE wLE + carryOut * 2 ^ wLE.length——用归纳法加 generalizing carryIn 证明。经验:"proofs are programs";形式化逼出一个隐含假设("一个词的三行必须等长");以及对黑盒化的警告——既然 agent 已经能一发命中这类证明,"往前看,我们能读懂机器生成的证明这件事很重要。"

Why it matters: 形式方法浪潮一直缺一张给在职工程师的入场图——这就是那张图。而它对机器生成证明的警告,与本周一位内核维护者给 AI 漏洞清单打出 20/79(第 19 条)恰好同框:没有理解兜底的验证,只是一条更快的传送带。

🔗 agostbiro.net · 🔗 HN discussion


27. Audionaut:agent 可以经 MCP 驱动的 GPLv3 多轨音频编辑器 —— 三年 C++,每次编辑一个 undo 步

  • Velocity: ▮ steady
  • Source: Show HN · 133+ pts on HN · ~20h ago (~16:00 UTC+8 Oct 2)
  • Tags: audio open-source mcp juce show-hn

kvoltmer/Audionaut(C++ / JUCE;Windows/macOS/Linux;README 徽章为 GPLv3)以"一个免费开源、AI agent 可以经 MCP 驱动的多轨音频编辑器"亮相。作者的起点:做了三四年,最初是为了"用老 Sound Designer II 的工作流(建 region、丢进 playlist、导出、完事)剪自己的多轨录音"。Agent 接口一行——claude mcp add audionaut -- npx -y audionaut-mcp——关键契约是"每次编辑就是一个 undo 步"。首页 demo 显示 Claude 每 16 小节切一刀、把 clip 分到两条轨道、补上缝隙,再设交叉淡入淡出与淡出。仓库已核查:156★,10 月 2 日有 push——热度目前由 HN 而非 star 数带动。

Why it matters: 桌面应用的 MCP 化正在越过 IDE 和浏览器,进入时域媒体;而"一次编辑 = 一个 undo 步"是正确的 agent-UX 原语——agent 的每一次改动都保持人类可回滚。它也补上了 Audacity 与完整 DAW 之间那个久违的开源空位。

🔗 kvoltmer/Audionaut · 🔗 HN discussion


28. Debian 悄悄为贡献者立起一个 LLM 推理门户 —— Salsa 登录、预算追踪、Scaleway 赞助

  • Velocity: ▮ steady
  • Source: inference.debian.net · 12+ pts on HN · ~5h ago (~06:45 UTC+8)
  • Tags: debian llm-infra open-source distro

inference.debian.net 是"给 Debian 贡献者的 LLM 推理自助门户":用 Salsa(Debian 的 GitLab)登录,"只有 Debian Developers 与 Debian Maintainers 获得访问权",然后管理 API key、追踪预算消耗。服务于 9 月 23 日在 debian-devel-announce 公告;目前列出的首个模型是 scaleway/qwen3.8-27b(9 月 25 日加入);"推理资源由 Scaleway 赞助。" 门户源码(inference-team/inference-user-portal)就在 Salsa 上,最近的更新加入了"DebGPT 配置一节"与沙箱示例。

Why it matters: 发行版为贡献者提供身份门控、赞助商出资的推理,是一级基础设施决策——道德等价物是当年的构建集群,其他发行版从此有了对照模板。DebGPT 集成泄露了天机:这是给"干 Debian 活的 agent"用的推理,不是给人聊天的福利。

🔗 inference.debian.net · 🔗 HN discussion


29. 第一只 RFC 1149 数据包登上佳士得拍场 —— David Waitzman 的鸽子载波 ping,已装框

  • Velocity: ▮ steady
  • Source: onlineonly.christies.com · 56+ pts on HN · ~15h ago (~20:45 UTC+8 Oct 2)
  • Tags: internet-history rfc1149 auction humor

佳士得"Fine Printed Books & Manuscripts"在线专场收录了一件名为 "Carrier Pigeon Internet Protocol" 的拍品:"[WAITZMAN, David and the BERGEN LINUX USER GROUP.] 一枚按 RFC 1149 由信鸽传递的 IP/ICMP 'ping' 数据包。纸卷一小轴,41 × 210 mm。留有当年绑在鸽腿上的滚动折痕。已装框。" 目录所述来源:David Waitzman——1990 年愚人节写下 RFC 1149《Avian Carriers 上传输 IP 数据报的标准》的美国网络工程师——这枚数据包是"第一次也是最著名一次实现"的幸存包,出自 Bergen Linux User Group 的鸽子实验,背板背面题有"Property of David Waitzman"。

Why it matters: 互联网最经典的愚人节标准进入了艺术品市场。第一代互联网的纸质痕迹开始成为收藏品——而 RFC 幽默谱系(1149 → 2549 的 QoS 改进 → 6214 的 IPv6 适配)已经老到出现了值得装框的原件。

🔗 Christie's lot 325216 · 🔗 HN discussion


Metadata

FieldValue
Generated2026-10-03T12:20:00+08:00
Items29
Sources tracked29 (Hacker News, GitHub Trending, GitHub API, dwarfstar.sh, bfl.ai, supabase.com, eff.org, learn.chatgpt.com, csirt.divd.nl, CISA KEV, NVD, access.redhat.com, arXiv, Nature, ataraxosai.github.io, blog.google, developer.apple.com, stillwet.art, wagtail.org, maximumeffort.substack.com, Hugging Face papers, gadgets.muse.ai, YouTube/Kernel Recipes, yuka.dev, allenai.org, blog.sshh.io, agostbiro.net, inference.debian.net, onlineonly.christies.com)
Update schedule04:03, 12:03, 20:03 UTC+8 (3x daily)
RankingVelocity-weighted (recency × engagement acceleration × source authority)
LicenseCC-BY 4.0

Previous day · Raw .md · Archive