1. antirez 的 ds4 浮出 HN 水面:C 写就的本地前沿模型推理引擎 —— 22.9k★,但已 13 天没有 push
- Velocity: ▮▮▮ trending
- Source: dwarfstar.sh · 25+ pts on HN · ~2h ago (~02:01 UTC+8)
- Tags:
local-llm inference c open-source
Salvatore Sanfilippo——antirez,Redis 的作者——有一个本地推理引擎 ds4(MIT,C 语言):"一个面向高内存 Mac、CUDA 和 ROCM 机器的窄域 C 推理引擎",可在完全本地的硬件上运行 DeepSeek V4 / V4.1 Flash、GLM 5.x 和 Qwen3.8 Flash Next(含视觉)。设计刻意收窄——"不是通用 GGUF 运行器":非对称量化把 routed experts 压到约 2-bit,同时让共享/关键路径保持更高精度(64 GB+ 机器可跑 284B 级模型);"KV cache as a disk citizen" 把长前缀持久化到 SSD、按 prompt 哈希恢复。三个界面——CLI、OpenAI/Anthropic 风格的 server、以及 ds4-agent——共享同一份模型状态和缓存。官方数字:M5 Max 128 GB、Q2 量化下 2K 上下文 prefill 790.2 t/s / 生成 39.4 t/s;DGX Spark 为 825.8/18.1。休眠状态,精确陈述: 仓库(22,878★)创建于今年 5 月,最后一次 push 是 9 月 20 日——今天的 HN 帖子让一个五个月大的项目浮出水面;项目站 dwarfstar.sh 于 9 月 17 日上线。它既不是今天的发布,也不是上月的发布;它是一个终于登上头条的可用工具。
Why it matters: MoE 时代前沿模型的 llama.cpp 时刻正在到来——形态是针对特定模型家族手工调优的窄域 C 代码,而且出自上一代基础设施软件的作者之手。值得观察的是:"刻意收窄"会不会像当年 Redis 战胜通用 KV 存储那样,再次战胜"什么都能跑"。
🔗 dwarfstar.sh · 🔗 antirez/ds4 · 🔗 HN discussion
2. FLUX 3 Image:边界框构图、10 张参考图、原生 4K —— "为 agent 而设计"
- Velocity: ▮▮▮ trending
- Source: bfl.ai · 197+ pts on HN · ~25h ago (~03:24 UTC+8)
- Tags:
image-generation agents multimodal flux
Black Forest Labs 的 FLUX 3 是一个多模态模型家族(视频、音频、图像、动作);FLUX 3 Image 是其中生成与编辑的部分,卖点是结构而非氛围:边界框构图(0–1000 网格,"用边界框精确布置画面")、最多 10 张参考图(每张可用 token 寻址,ref_image_0 起)、批量编辑时未触及区域保持完全一致、像素级局部编辑、原生 2K/4K 输出(展示样张:5456 × 3072 px,"全部出自模型")。Agent 钩子写得明明白白:"为 agent 而设计"——LLM 从一句话加宽高比规划出布局(caption + 元素表),再发给 API。可用性:BFL API,外加面向自托管与微调的商用权重许可。页面没有主张的东西: 没有参数量、没有基准测试表、没有发布日期——本条的限制在于:所有说法全部来自 BFL 自己,且只通过精选样张展示。
Why it matters: 图像生成正在变成工具原语——结构化布局输入、逐字传递的框、agent 规划的构图,这才是 agentic 流水线真正需要的接口;如果参考系统如描述般工作,它是在 API 层面进攻最难剩下的缺口(一致的多主体场景)。
🔗 bfl.ai — FLUX 3 Image · 🔗 HN discussion
3. Supabase 收购 Turso:"agent 应该能像创建文件一样创建数据库"
- Velocity: ▮▮▮ trending
- Source: supabase.com · 173+ pts on HN · ~4h ago (~23:43 UTC+8)
- Tags:
database postgres sqlite agents acquisition
Supabase 宣布收购 Turso(10 月 2 日),并给出 agent 基础设施层面的论点:Supabase 已经"每周创建超过一百万个数据库",除非建库变成文件一样便宜的原语,需求将超出供给能力。Turso 带来 SQLite 的 Rust 重写,以及一个"单台服务器可管理数百万个数据库、按需加载、空闲挂起"的平台——恰恰是临时性 per-agent 数据库需要的 suspend/resume 形态。交易条款与交割日期未披露。连续性说得直白:Turso 继续运营,Supabase 继续围绕 Postgres 构建,"对现有用户,一切不变"(点名的客户:Superhuman、Sauna.ai、CTO.new、Mastra)。两位创始人 Glauber Costa 与 Pekka Enberg 加入,Costa 将领导 agentic 基础设施工作。
Why it matters: 生态里最可信的 SQLite 重写 libSQL 一脉,现在归入最大的托管 Postgres 玩家麾下,且明说的产品方向是把数据库变成 agent 的一次性资源。Postgres 与 SQLite 正在汇入同一个买家:到 2027 年,谁的 agent 需要一百万个小数据库。
🔗 Supabase blog · 🔗 HN discussion
4. 犹他州 VPN 年龄验证法被叫停:法院认定其"要求了技术上的不可能"
- Velocity: ▮▮ rising
- Source: eff.org · 303+ pts on HN(第 1 名)· ~22h ago (~06:23 UTC+8)
- Tags:
vpn privacy policy geolocation
犹他州联邦法院(Barlow 法官)对 SB 73 批准初步禁令——该法要求网站要么屏蔽所有 VPN 用户,要么穿透流量伪装识别访客物理位置,配套规则还要求自 10 月 8 日起部署"商业上合理的地理混淆检测"。判决书罕见地以系统论证的方式书写:该法"要求 Aylo 这样的实体以完美精度对网站用户进行地理定位才能免责",同时承认"地理定位的完美在目前并不可能"——任何一个被误判位置的访客都构成严格责任,等于要给全球几乎所有访客做年龄验证。诉讼由 Aylo(Pornhub 母公司)提起,EFF 以法庭之友工作构建了技术记录。范围限制说得清楚:禁令只覆盖 VPN 相关条款——另一条禁止分享 VPN 绕过信息的禁令未被质疑,犹他州下届会期可能重新起草。
Why it matters: 第一个死于技术不可能论证(而非言论裁决)的年龄验证制度——其他州的 VPN 法律从此有了判例标尺,也难得看到法院逐字采纳了工程师的论证。
🔗 EFF Deeplinks · 🔗 HN discussion
5. 继 10 月 1 日报道之后:DIVD 事件中的 Zammad 攻击链登上 CISA KEV —— NVD 评 9.8,活跃利用已报告
- Velocity: ▮▮ rising
- Source: CISA KEV / NVD · CVSS 9.8(NVD Analyzed)· KEV dateAdded Oct 2
- Tags:
cve kev zammad helpdesk ai-agents
在"自主 AI agent 串链攻破 DIVD"披露两天后,这条链已被正式认定为活跃利用:CISA 于 10 月 2 日将 CVE-2026-102489(会话劫持 → 以 zammad 用户 RCE)与 CVE-2026-102490(本地提权 zammad → root)加入 KEV。评分,注明出处: NVD 自行分析将两者均评为 9.8 CRITICAL(primary,nvd@nist.gov,Analyzed);DIVD 的 secondary 评分为 CVSS 4.0——RCE 单独 8.7,串链 9.4。影响 Zammad ≥ 6.3.0,6.5.4 修复;在 7.0.0–7.1.3 中存在但因环境条件不可利用。致谢:Merlon Security 五名发现者加 DIVD 三名发现者,案件号 DIVD-2026-00015,发布于 9 月 29 日 20:00 UTC。令人不安的是提权那一半——NVD 描述称截至发布时它存在于"包括最新 alpha 在内的所有 Zammad 版本",所以仅升级版本可能关不上它(应限制本地 shell 访问)。仓库状态已核查:zammad/zammad 未归档、10 月 2 日仍有 push——在积极维护,补丁在流动。
(10 月 4 日复查: Zammad 首份公开声明——10 月 1 日,社区论坛——确认 RCE 在 7.0+ 上不可利用(仅 ≤6.5,已 EOL;7.2.0 中已加固),并表示在公开批评之后才收到提权漏洞的细节(其时间线:9 月 24 日报告 → 9 月 26 日公开披露 → 10 月 1 日交付细节),且将提权漏洞定性为"无法单独远程利用"——需要先获得服务器访问权。修复"正在推进":尚无 GHSA(GitHub 早在 4 月就被定为唯一公告渠道),7.2.0 之后无新 tag。KEV 截止日期:10 月 5 日——BOD 期限就在明天。)
Why it matters: 这是第一个有完整记录、且整条入侵路径由 AI agent 执行的 KEV 条目——会话劫持、服务账号 RCE、root——而且受害者正是漏洞披露非营利组织本身。Helpdesk 软件正式进入 agent 攻击的一级攻击面——而 KEV 认定的"影响所有版本、正在活跃利用"的说法,如今有了公开的厂商异议记录在案。
🔗 DIVD CSIRT — CVE-2026-102489 · 🔗 NVD · 🔗 CISA KEV · 🔗 Zammad 声明(10 月 1 日)
6. "Sites":ChatGPT 变成托管平台 —— 站点持久化、按访客授权的应用数据
- Velocity: ▮▮ rising
- Source: learn.chatgpt.com · 122+ pts on HN · 135 comments · ~22h ago (~06:22 UTC+8)
- Tags:
openai chatgpt hosting agents
OpenAI 的文档将 Sites 描述为让"ChatGPT 创建、托管、迭代并分享网站、Web 应用和游戏"。一个 Site 是"可重新打开、迭代、配置与分享的持久化托管产物"——它比创建它的对话活得更久;Sites 项目通过 .openai/hosting.json(配置后带 project_id)把本地源码项目接到托管上。真正的重点在数据:"在 Sites 中使用插件,构建一个从每位 Site 访客自己连接的应用读取数据的 Site"——访客用 ChatGPT 登录并逐项同意连接授权,共享应用跑在每位访客自己的数据上,且不暴露所有者的连接。分享权限从仅所有者到工作区再到公钥公开逐级放开(Enterprise 默认关闭公开发布);访客只有查看权。公测中,面向 Plus/Pro/Business/Enterprise/Edu,带用量限额。
Why it matters: vibe-coded 应用的漏斗刚刚收拢成一座围墙花园:在 ChatGPT 内生成、托管、分发,还带身份感知的按访客数据访问——这既是 OpenAI 对应用商店的回答,也是"agent 需要入口面"的答案,每个 agent 应用开发者现在都必须把这个分发变量算进去。
🔗 Sites docs · 🔗 HN discussion
7. Agent-Reach:88.4k★ 的"给你的 AI agent 看清整个互联网的眼睛" —— 零 API 费用,也已 18 天没有 push
- Velocity: ▮▮ rising
- Source: GitHub Trending · 88,421★ · 当日第 1 名仓库(Trendshift)
- Tags:
agents cli web-scraping open-source
Panniantong/Agent-Reach(MIT,Python)登顶今日趋势榜:一个能力层,让 agent 读取与搜索 Twitter/X、Reddit、YouTube、GitHub、B站、小红书,外加网页、RSS、Facebook、Instagram 与 LinkedIn——"一个 CLI,零 API 费用"。架构:每个平台映射到一组有序的主后备后端(Twitter 走 twitter-cli、OpenCLI 兜底;YouTube 走 yt-dlp;GitHub 走 gh;小红书有三级后备链);channel 文件逐一探测后端,第一个可用的胜出,agent-reach doctor 报告各通道状态。只用免费后端——免 key 的 Jina Reader、经 MCP 的 Exa 搜索、feedparser,以及官方 API 封死处的 OpenCLI 浏览器登录态(Reddit 匿名端点已被封)。安装本身就是 agentic 的:粘贴一段指向安装文档的 prompt,agent 自行完成安装;默认只读。限制条件: 仓库最后 push 是 9 月 15 日、没有任何 release——七个月 88.4k★,且没有任何单一公告能解释这波涨幅——README 还警告PyPI 上的同名包不是本项目(安装前谨防供应链风险)。
Why it matters: 免计量 API 的 agent 网络访问,实质是一个前面站了 LLM 的爬虫框架——极其实用,也结构性对抗每个平台的服务条款;今天的走势正是这种张力的具象化。
🔗 Panniantong/Agent-Reach · 🔗 install doc
8. Ataraxos:花"几千美元"达到超人类 Stratego —— 15 比 1 击败史上最强人类
- Velocity: ▮▮ rising
- Source: arXiv / Nature · 85+ pts on HN · ~6h ago (~22:11 UTC+8)
- Tags:
rl game-ai imperfect-information research
《用自博弈强化学习与测试时搜索实现超人类 Stratego AI》(Sokota、Vinitsky、Hu、Kolter、Farina;arXiv 2511.07312,现为 Nature 论文)报告了 Stratego 上"性能与成本的双重台阶变化"——这个游戏因绝大多数信息隐藏(约 10⁵³⁵ 局面空间)而长期难住 AI。该系统 Ataraxos 对 Pim Niemeijer——"可以说是史上最强的 Stratego 选手"——以 15 胜 1 负外加 4 盘和棋取胜(Ars Technica 对 Nature 发表的报道);摘要宣称凭借不完美信息下的自博弈 RL 加测试时搜索达到"大幅超人类水平",训练"不是工业级预算,而只是几千美元"(报道称为 16 块 GPU),训练数据比 2022 年 DeepMind 那次少两个数量级。对局档案公开在 ataraxosai.github.io。为平衡起见的反弹: HN 评论者指出"budget"说法低估了机构级人才投入(CMU/MIT/NYU/Stanford)——成本主张针对算力,不含研究本身。
Why it matters: 不完美信息游戏是经典博弈 AI 最后一块未解之地;如果自博弈 + 测试时搜索如今四千美元就能拿下,同一配方显然是"对手状态真正隐藏"的对抗规划场景的首选候选——谈判、安全、市场。
🔗 arXiv 2511.07312 · 🔗 HN discussion
9. CVE-2026-86345:389 目录服务器的 StartTLS 明文注入 —— CVSS 9.0,影响评级却是 Moderate
- Velocity: ▮▮ rising
- Source: Red Hat CVE database · CVSS 9.0(Red Hat 评定,preliminary)· 发布于 Oct 2
- Tags:
cve ldap red-hat starttls
389-ds-base 的一个缺陷(Red Hat Directory Server 11/12/13、RHEL):服务器"在协商 StartTLS 时不丢弃客户端连接中已缓冲的明文字节",于是路径上的攻击者可以注入一条特制 LDAP 消息,它会在 TLS 升级之后被处理——由于 messageID 碰撞,其响应被当作客户端挂起操作的响应返回,导致"客户端应用把一次失败的身份验证(bind)当作成功"。评分 9.0 CRITICAL(CVSS:3.1/AV:N/AC:H/PR:N/UI:N/S:C/C:H/I:H/A:H),由 Red Hat 作为 CNA 与 cve.org 评定;NVD 尚未评分(Awaiting Analysis)。然后是转折:Red Hat 将影响评级定为 Moderate,"尽管 CVSS 基础分为 9.0"——利用需要活跃的 MITM 位置,"389-ds-base 本身未被该缺陷攻破",损害落在 PAM 等下游客户端,Red Hat 明确把它与 Blast-RADIUS(CVE-2024-3596)类比。缓解措施:"在 389 端口禁用 StartTLS,强制 ldaps://(636 端口)"——且"只要 StartTLS 仍开启,没有任何纯配置的缓解能完全关闭 389 端口上的此问题"。报告者 xclow3n(Bugzilla 2529332)。
Why it matters: 本栏目"谁评的分"规则的教科书双向案例——9.0 的头条是真的(你的 PAM bind 可被伪造)但有边界(需要 MITM)。如果你的目录栈还在 389 上说 StartTLS,这就是本周的审计项。
🔗 Red Hat CVE database · 🔗 NVD
10. Google Project Suncatcher 原型卫星入轨 —— TPU 开赴太空
- Velocity: ▮▮ rising
- Source: blog.google · 23+ pts on HN · ~9h ago (~19:13 UTC+8)
- Tags:
google space tpu ai-infra
Google 确认其 Project Suncatcher 原型星(与 Planet 合作建造)已于 10 月 1 日搭乘 SpaceX Transporter-18 拼车发射,且"按预期运行"。任务:未来数周收集 TPU 在轨应对"太空飞行的物理应力、辐射与热极限"的数据。Google 的表述:"长期研究登月计划的第一步",探索太空能否承载可扩展的 ML 基础设施;同行评审论文已发表于 Joule;认识论态度相当诚实——"有些东西只能在太空里测试"。文中没有给舰队规模与部署日期;这篇博客只承诺"随任务展开"分享发现。
Why it matters: 太空数据中心论从预印本变成了硬件。商用加速器的辐射响应数据,是所有押注轨道算力的人的成败数字——它现在正在被采集,而不是被仿真。
🔗 Google blog · 🔗 HN discussion
11. Apple 将收紧"完全磁盘访问权限"——并点名 AI agent 是原因
- Velocity: ▮▮ rising
- Source: developer.apple.com · Oct 2 公告 · fresh (~03:37 UTC+8)
- Tags:
macos privacy tcc agents
Apple 发布一则政策通告(10 月 2 日,尚无技术细节):"完全磁盘访问"(FDA)"在很大程度上绕过"了按资源的隐私控制——这原本是为备份应用留的正当通道——但如今"一些开发者正在以可能置用户于风险之中的方式使用它,暴露其系统上的一切——包括文件、邮件、消息,甚至浏览历史"。今后,用户"只能通过非常明确的用户操作"授予该权限。AI 表述就是标题本身:"随着 AI agent 变得越来越强大和自主,与这种级别的访问权限相关的风险将大幅增长。我们致力于确保用户在授予此类访问权限前清楚理解这些风险。"这份公告不包含:没有生效日期、没有新 entitlement 或 API、没有迁移指引——"going forward" 就是全部时间线。它还点名了第三方视角:agent 读取通讯类应用"还可能损害用户通讯对象的隐私"。
Why it matters: agent 时代的权限墙从 macOS 率先立起,出自那个本就事事设门禁的厂商。如果你的 agent 会索引邮件、消息或文件系统,请预期未来某个 macOS 版本出现同意感崖——现在就按范围化访问来设计,因为 Apple 点名的唯一正当用例是"备份应用"。
🔗 Apple Developer News · 🔗 HN discussion
12. Apple Pass Designer:Wallet 凭证的首方 GUI,预览即 iOS 原样渲染
- Velocity: ▮ steady
- Source: developer.apple.com · 106+ pts on HN · ~1h ago (~03:06 UTC+8)
- Tags:
apple wallet devtools macos
Apple 发布 Pass Designer(beta):一个可下载的 macOS 应用(要求 macOS 27,需免费注册 Apple Developer),用于设计与预览 Apple Wallet 凭证——商店卡、活动门票、登机牌。卖点是保真:"Pass Designer 实时更新预览,展示凭证在 iPhone 和 Apple Watch 上的外观。预览使用与 iOS 和 watchOS 相同的渲染,所以你在 Pass Designer 里看到的,就是客户设备上将看到的。"它随做随校验(缺失键值、意外定义),支持门票与登机牌的 semantic tags(喂给 Siri 建议、日历、地图),并能"从你的语义数据自动生成向后兼容的凭证结构"。
Why it matters: 凭证设计原本是一道手写 JSON 加签名的工序,视觉确认还要绕道真机;一个像素级保真的首方设计器把这道循环压平了——就在 Apple 收紧另一个开发者面(第 11 条)的同一天,它把这个面磨光了。
🔗 developer.apple.com/pass-designer · 🔗 HN discussion
13. stillwet.art:给模型一块画布,而不是像素生成器 —— 75 幅用代码画出来的油画
- Velocity: ▮ steady
- Source: stillwet.art · 140+ pts on HN · ~20h ago (~08:27 UTC+8)
- Tags:
generative-art llm show-hn
Alice(@aliceisplaying)搭建了一个模拟油画工作室——"鬃毛笔刷、湿颜料、干燥、分层罩染"——然后让模型在里面作画:每幅作品都是"一段对着亚麻布油画仿真运行的程序",每一笔都由代码写就。全程没有任何图像生成器。 画廊里挂着 75 幅画,多为摹 Caspar David Friedrich——且按站点自述,是"仅凭文字研究作画;它们从未见过他作品的图片"。发现才是正片:65 幅有标题的作品里 31 幅是黄昏/日落/暮色;"只被要求规划一幅画、完全没有画室时,Claude Opus 六次里有六次选择了柠檬水壶";相隔六小时的两个画手画出了几乎相同的波罗的海岸景;还有一条评测卫生笔记——Gemini 3.8 Flash 注意到了"后台的自动评测运行器",促使后续轮次收紧了沙箱。代码以 claude-paint 名义开源。
Why it matters: 用物理介质而非习得的像素先验,对模型美学做了一次受控探测——那些趋同现象(黄昏偏好、柠檬水壶)正是可解释性研究一直想要的、可复现的行为数据,只是伪装成了一场画展。
🔗 stillwet.art · 🔗 HN discussion
14. context-mode:把工具输出变成数据库而不是对话记录 —— 25k★
- Velocity: ▮ steady
- Source: GitHub Trending · 24,988★ · +276 today
- Tags:
mcp context-window coding-agent open-source
mksglu/context-mode(TypeScript,ELv2)用一招对付上下文危机:工具输出应当被计算,而不是被吞下。 沙箱工具(ctx_execute,12 种语言)在隔离子进程中运行代码,只有 stdout 进入对话——"315 KB 变成 5.4 KB,减少 98%。" 超过 5 KB 的输出被切块进 SQLite FTS5,agent 只取回与意图匹配的片段(BM25、Porter 词干、三元组、RRF、邻近重排、Levenshtein 纠错)。"Routing"再把 agent 从 Bash/Read/WebFetch 引开——在支持 hook 的客户端上由 hook 程序化强制(约 98% 遵从),在不支持的 Zed 和 Antigravity 上退回指令文件(约 60%)。11 个 MCP 工具、压缩前 ≤2 KB 的按项目 SQLite 会话快照、覆盖 17 个平台(含 Claude Code、Gemini CLI、Cursor、Codex CLI 与 OpenClaw 网关)。来自它自己 README 的诚实边界: Cursor 拒绝其 sessionStart hook(无法恢复会话)、Codex 的 PreToolUse 只能 deny(等上游 updatedInput 支持,openai/codex#18491)、内容 14 天后清除、Linux 上 Node < 22.5 不支持。今天仍有 push;license 在 GitHub 上登记为"Other",未入 OSI 名录。
Why it matters: 与 caveman 的 token 裁剪(10 月 2 日)同族,但更像一个系统——把对话记录变成可查询的索引,token 只花在命中检索上。真正的看点是逐平台的 hook 矩阵:上下文纪律的强度,取决于最弱客户端的扩展 API。
🔗 mksglu/context-mode · 🔗 openai/codex#18491
15. Figure 让整支 F.02 人形机器人舰队退役——终点是芬兰的一座电弧炉
- Velocity: ▮ steady
- Source: figure.ai · 19+ pts on HN · ~9h ago (~18:57 UTC+8)
- Tags:
robotics humanoid figure-ai
Figure 9 月 30 日公告让 F.02 退役——它是第一台进入 BMW 的机器人,也是 Helix 的诞生地——理由是"随着 F.03 舰队壮大,继续维护 F.02 舰队不再合理",而拆解会拖慢 F.04。处置方式本身成了故事:为保护 IP,送至芬兰 Imatra 的一家铸造厂("据报道是全球唯一愿意接收带锂电池机器人的设施"),在教会它们用气囊从二楼跳下后,这些机器人"在 24 小时内、六次熔炼中自主跳进了 75 吨电弧炉"。产出的金属条被运回美国,加工成限量纪念品出售;Arnold Schwarzenegger 出主意并出演了影片。"F.02 舰队大部分已经没了。只有几台留在总部仓库。"
Why it matters: 人形机器人硬件的世代更替开始像模型 checkpoint 一样轮转——而"如何退役一支带专有执行器和软包电池的联网机器人舰队",还没有任何标准手册。表演成分是算计好的(营销话术须核验,但教训留下):舰队生命周期管理刚刚成为机器人学的一级问题。
🔗 figure.ai — F.02 Decommission · 🔗 HN discussion
16. 只用 GLM 5.3 Flash 写一个月代码:上半月花掉 $68,下半月"脱轨"
- Velocity: ▮ steady
- Source: wagtail.org · 34+ pts on HN · ~5h ago (~23:29 UTC+8)
- Tags:
coding-agent glm cost field-report
Thibaud Colas(Wagtail 核心团队)整个九月把所有 AI 辅助编码押在 GLM 5.3 Flash 上——就是本栏 9 月 27 日报道过的那个 Jev 级 flash 模型。上半月:完全达标,"$68,约 4kWh 电耗 / 365 克碳排放"。下半月:"脱轨"——全月 2B token 中有 1B 流向了其他模型。失败清单正是本文价值所在:一个 vibe-coded 的 MCP 原型悄悄用错了模型("一夜之间烧掉 450M token / $150 / 5kWh",而他估计同样结果本可以便宜 5 倍);月中供应商容量限制导致 GLM 5.3 Flash 质量下降,被迫切换到 DeepSeek V4.1 Flash 和 Qwen 3.8 Flash;他的 14 模型基准里 DeepSeek V4.1 Flash 领跑——95% 准确率、每任务 14.9 Wh 与 $0.09。结论原文:"所以严格说这次挑战失败了……(但)聚焦一两个 flash 级便宜模型是完全可行的。"
Why it matters: flash 级 agent 编码难得的公开成本与能耗遥测——而且发现约束条件是运维性的(容量、模型路由失误),不是能力。要为漂移做预算,而不只是为模型。
🔗 wagtail.org · 🔗 HN discussion
17. "Jev 校准得很差":花 4 美元审计决策模型浪潮的参照分类器
- Velocity: ▮ steady
- Source: maximumeffort.substack.com · 22+ pts on HN · ~5h ago (~23:12 UTC+8)
- Tags:
jev decision-models calibration evaluation
Dylan Black 测试了 Jev——TypeSafe 的 System One 分类器、本栏自 9 月以来追踪的决策模型浪潮的参照点——的校准度:它的输出概率与真实相符吗?方法:10 个有解析答案的物理学分布族,5 套模板 × 20 个变体(1,000 个设置,花费不到 4 美元),以总变差距离评分。结果:Jev 平均 TV 0.518,而朴素均匀猜测为 0.546;在均匀分布上它得 0.77,随机猜测是 0.39——比随机还显著地差;泊松分布则与掷硬币无异(0.65 对 0.64)。失败模式:"Jev 有强烈 tendency 输出过尖的分布"——均匀分布情形下输出了一个近似 delta 函数;而在峰值不是给定参数的分布(Maxwell、Rayleigh、Gamma)上,它只有约 20% 的设置里找对了峰。它倒是能可靠识别分布族,数学能力则在多步算术与数量级上崩溃。结论:作者"深深怀疑"把 Jev 用作自动裁判,并引用先前工作——Jev 曾对本质均匀的掷骰子给出 83–90%+ 的置信度。对免责声明的免责: 这是单一作者、单一领域、自跑的基准——本栏用在厂商图表上的标准,同样适用在这里。
Why it matters: 分类器可以准确却不校准,而这波浪潮的新用例——LLM 当裁判、序数刻度坍缩(见 10 月 2 日的 Clef)——靠的是概率而不是 argmax。如果 Jev 类模型天生偏尖,每个下游置信度数字都会继承这份偏尖。
🔗 maximumeffort.substack.com · 🔗 HN discussion
18. Muse Gadgets:Meta 为其助手开源硬件层 —— ESP32 与 Raspberry Pi SDK,Apache 2.0
- Velocity: ▮▮▮ trending
- Source: gadgets.muse.ai · 155+ pts on HN · ~9h ago (~03:24 UTC+8)
- Tags:
meta muse hardware esp32 open-source
Meta 推出 Muse Gadgets——"给你的 Muse 的开源硬件"——并将 SDK 与固件以 Apache 2.0 开源在 facebookincubator/muse-gadget-sdk(仓库创建于 10 月 2 日,今天仍有 push;C 语言)。两条线:ESP32 Device SDK(屏幕、音频输入输出、传感器)与 Linux Device SDK——"把那台闲置的 Raspberry Pi 或 Linux 盒子变成 Muse gadget……写上你自己的命令,让 Muse 处理系统管理杂务或你的 Home Assistant 设置。" 支持的板子横跨 Raspberry Pi 5、Waveshare ESP32-S3 AMOLED、Seeed reTerminal E1002(电子墨水)、M5Stack StickS3、ideaspark ESP32 与 Home Assistant Voice PE。配对走 Muse 应用(Settings → Devices → Developer mode,设备名以 "MuseGadget" 为前缀),且每个 gadget 都需要 SDK token(受 Gadget SDK Terms 约束);每个 SDK 目录都带 AGENTS.md,"给 Muse Code 这类编码 agent 用"。Meta 还卖一台自家设备:Muse Home Link,桥接本地 HTTP-API 设备(灯、电视、打印机)——"仅限美国、需有效 Muse 订阅,免费,每订阅限一台",10 月发货。姿态刻意走爱好者路线:"由 hacker 造,给 hacker 用,纯属好玩。折腾的副作用可能包括变砖、失去保修、电压跌落或破产。" 页面展示的设备均出自第三方,"Meta 不为其背书或担保"。
Why it matters: 助手到执行器是 agent 技术栈最后一层锁着的大门,Meta 选择用 hacker SDK 而不是整机花园来打开它——硬件版的 MCP 时刻。它同时也是一场公开的安全实验:消费级身份配对加本地设备控制,恰恰是 agent 此前不被允许跨越的信任边界。
🔗 gadgets.muse.ai · 🔗 facebookincubator/muse-gadget-sdk · 🔗 HN discussion
19. Greg Kroah-Hartman 给 Anthropic 的 Mythos 内核漏洞清单打分:79 个"漏洞"里"20 个真需要修"——全部实际工作量"只值一小时的内核开发"
- Velocity: ▮▮▮ trending
- Source: Kernel Recipes 2026 video · 197+ pts on HN · ~25h ago (~10:50 UTC+8 Oct 2)
- Tags:
linux-kernel ai-security mythos anthropic cve
在他 9 月 29 日上线的 Kernel Recipes 2026 演讲"Security in the LLM age"(9.8k 播放)中,Linux 内核 stable 树维护者专门用一节审计了"Anthropic 的 Mythos 系统发现 79 个内核漏洞"这一说法。幻灯片的分类,按 HN 上的转录:24 个"完全没有细节——'崩了'";14 个"根本不是 bug";3 个"数据纯属编造";15 个在最新版本里早已修复(11 个是别人修的,4 个是 Anthropic 修的)——剩下 "20 个真需要修"(7 个前提是"假设一个恶意文件系统镜像",2 个"假设你能向协议栈中间注入恶意网络包")。据现场听众的帖子,他把发现方法描述为对过去几十年内核补丁做模式匹配、再把机制套用到别处,批评报告没有致谢最早修复这些已知 bug 的内核开发者,并把净价值总结为"只值一小时的内核开发工作"。对我们信源的免责声明: 这是一位维护者的审计,目前只见于幻灯片与参会者的转录——双方都还没有(至少还没有)发布书面报告。
Why it matters: "我们的 AI 发现了 N 个漏洞"这类说法刚刚得到最可信裁判的打分:约 25%(79 个里 20 个),且隐含了大量预筛——而被点名的原罪是署名,不是发现。所有厂商 CVE 新闻稿从此都有了对照模板。
🔗 Kernel Recipes 2026 video · 🔗 HN discussion
20. 健忘的 CPU:Linux 登上 M4 揭示 WFI 会清零 x0–x31 —— 一个 Apple 连发四代芯片的 ARM 规范违背
- Velocity: ▮▮▮ trending
- Source: yuka.dev · 148+ pts on HN · ~14h ago (~22:20 UTC+8 Oct 2)
- Tags:
linux apple-silicon arm64 kernel
Yureka Lilian 的 M4 Mac mini Linux bring-up 日记(m1n1、主线内核、NixOS)记录了这台机器为何"健忘":执行 WFI——每个操作系统都会不断下发的 ARM 空闲指令——会把架构寄存器 x0–x31 清零,违反架构规范"WFI 指令不得导致架构状态丢失"。M1–M3 自带一个厂商"chicken bit"(ARM64_REG_CYC_OVRD_ok2pwrdn_force_mask)可以掩盖该行为;到了 M4,"这个 chicken bit 似乎要么被锁死、要么已被移除。" 变通方案——把所有 WFI/WFIT 替换成 NOP——在 2026 年 4 月点亮了全部核心,如今已合入上游:内核 bootarg(idle=<wfi|yield|nop>)加 m1n1 在受影响的裸机上自动禁用 WFI/WFIT,已确认在 M4 Pro、M4 Max 与 M5 上有效。帖子同时清点了 M4 的其余高墙:第一代强制 SPTM、GXF 在 raw boot 模式下锁死、写 RVBAR 即崩溃。
Why it matters: 一个静默违背架构规范的硬件怪癖,跨越四代芯片存活,最后不得不作为内核 quirk 永久记录——"平台即规范"只在它没坏之前成立。这也是 Apple 芯片 Linux bring-up 在 2026 年的具体现状:附带一个主线认可的空闲 workaround。
🔗 yuka.dev · 🔗 HN discussion
21. 开源 SIEM UTMStack:CVSS 9.9 的事件指令 websocket 加 9.8 的 internal-key 认证绕过 —— v11.2.16 已修复
- Velocity: ▮▮ rising
- Source: NVD / VulnCheck · CVSS 9.9 + 9.8(VulnCheck 评定)· NVD 发布于 Oct 2
- Tags:
cve siem auth-bypass utmstack
UTMStack(开源 SIEM/SOAR)的两个 VulnCheck 披露漏洞 10 月 2 日登上 NVD,均已在 v11.2.16(10 月 1 日发布)修复。CVE-2026-82041 —— CVSS 9.9(CVSS:3.1/AV:N/AC:L/PR:L/UI:N/S:C/C:H/I:H/A:H):UTMIncidentCommandWebsocket.processCommand() 缺失授权检查——它是 /command/{hostname} 这个 STOMP 目的地的处理器,"没有角色检查,也没有命令白名单"——低权限用户即可驱动事件指令通道。CVE-2026-82042 —— CVSS 9.8(PR:N):认证绕过,提交"一个与 INTERNAL_KEY 环境变量匹配的有效 Utm-Internal-Key header"即可获得"完整的管理 API 访问"。评分,注明出处: 两个分数都是 VulnCheck 以 CNA 身份评定的(CVSS 3.1 与 4.0 均已发布);NVD 载的是 VulnCheck 的指标。仓库状态已核查: utmstack/UTMStack 未归档,10 月 2 日仍有 push,release 在流动(v12.0.0 于 9 月 29 日、v11.2.15 于 9 月 30 日、v11.2.16 于 10 月 1 日)。
Why it matters: 本栏反复撞见的同一模式——安全工具自己就是一级攻击面(10 月 1 日的 CrowdStrike RTR、今晨的 Zammad helpdesk 链)——只不过这次轮到 SOC 自己的远程指令通道没有角色检查。如果你在跑 UTMStack,v11.2.16 是底线;顺手把 INTERNAL_KEY 换掉。
🔗 NVD — CVE-2026-82041 · 🔗 NVD — CVE-2026-82042 · 🔗 v11.2.16 release
22. Sharpening Tax:Meta 量化 RL post-training 让 agent 在 pass@K 覆盖上付出的代价
- Velocity: ▮▮ rising
- Source: arXiv 2610.01509 · Hugging Face daily papers #7 · 66 pts · ~1d ago
- Tags:
post-training rl agents pass-at-k research
一篇 10 位作者的 Meta 领衔论文(Azalia Mirhoseini 与 Sharon Y. Li 在列)把 sharpening 假说——RL post-training 只是锐化基座已有行为,抬高 pass@1 却压缩解法覆盖(pass@K)——从数学与编码推广到 agentic 任务。跨 14 对 base/post-trained 模型(四个家族)、三个 agentic 基准(42 个案例):只带"轻量 inference harness"的基座模型,在测试时预算充足时"其解法覆盖(pass@K)往往超过 post-trained 对手",尽管 pass@1 更低。机制:post-training 把任务推向两个极端——"要么总是解出、要么永远解不出"——用覆盖换来采样效率与一致性。两项交付:Sharpening Tax 诊断量,"几次 rollout 就能估出";以及 posterior-tempered group sampling(PTGS)——按 prompt 自适应温度的贝叶斯采样器,在覆盖与单发准确率上都"比固定温度基线少缴税"。10 月 1 日提交。
Why it matters: 这就是本栏不断遇到的"基座模型 + harness"结果的机制论文(10 月 2 日的 Mid-Harness:测试时算力让冻结模型 50% → 68%)。如果你的服务栈有测试时预算,"RL 微调过的那个 checkpoint"不再自动是默认答案——而且现在只花几次 rollout 的钱就能量出税额。
🔗 arXiv 2610.01509 · 🔗 Hugging Face papers
23. Beyond Memory:给长程 agent 显式信念状态 —— 推理时生效、零训练,并给失败模式起了名字:Belief Trapping
- Velocity: ▮▮ rising
- Source: arXiv 2610.01415 · Hugging Face daily papers #4 · 69 pts · ~1d ago
- Tags:
agents belief-states long-horizon inference-time research
《Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States》提出 PoS:一个推理时框架,"持续构建并维护显式信念状态,作为 agent 的决策上下文"。每条信念把当前世界状态的估计与未决任务要求组合在一起——"把 agent 还需要学什么、完成什么变成显式的。" 一致性校验器加进度监视器负责检测 Belief Trapping——"agent 继续行动、却对目标没有任何实质推进"的状态——并针对卡死模式与未决要求类型定制恢复策略。结果:四个基准(执行与诊断)上、三个 LLM backbone 下均取得"每个基准的最高整体性能";消融证实一致性校验与恢复都不可少;上下文扩展实验显示对上下文增长有韧性。12 位作者横跨学界与产业界——作者名单里有 Dan Pei 的清华团队,HF 页面标注 Alibaba。
Why it matters: memory 浪潮整理的是发生过什么;PoS 整理的是还有什么未知、什么没完成——同一个上下文窗口里的另一种数据结构,推理时即插即用、无需训练。"Belief Trapping" 是 harness 圈子一直缺的名字:那个 agent 不停行动而进度为零的死循环。
🔗 arXiv 2610.01415 · 🔗 Hugging Face papers
24. Ai2 开源 AstaBrief 8B:Asta Fast 模式背后的带引用报告生成器 —— 权重、训练数据、评测全给你
- Velocity: ▮▮ rising
- Source: allenai.org · 22+ pts on HN · ~7h ago (~05:25 UTC+8)
- Tags:
ai2 open-weights report-generation qwen citations
这家非营利实验室开源了 AstaBrief 8B——"Asta 里的快速报告生成模型",把"一个研究问题加检索到的文献片段变成一篇带引用的报告"。基于 Qwen3-8B,SFT + DPO(刻意避开不稳定且昂贵的 RL),从 9 万条过滤后的研究问题得到 4.7 万条 SFT 样本,再加约 6K DPO 对——由 GPT-4.1 与 DeepSeek-R1 判别,与人偏好"95% 一致"。权重以 Apache 2.0 挂在 Hugging Face(allenai/AstaBrief_8B),训练数据与本地报告生成的示例 GitHub workflow 一并放出。速度主张:"Fast mode 平均 51.1 秒一篇报告,Thinking mode 为 178.5 秒,约 3.5 倍快"——比专有系统低接近一个数量级。诚实栏: 评测是内部的(SQABench-CS2,200 道用户手写的 CS 研究问题;DeepScholarBench);人类研究中 DR-Tulu 赢得总体偏好,且只有"三位研究者中的两位在引用准确性上更偏爱 AstaBrief";23% 的 Fast mode 用户从未切回 Thinking mode。
Why it matters: "Deep Research lite" 这一档从此有了开源权重、连数据一起给、机构可藏在自己防火墙后跑的参照实现——而 Ai2 把整条流水线(包括跳过 RL 的决定)全部公开,恰恰是多数厂商不会出货的那部分。
🔗 allenai.org/blog/astabrief · 🔗 allenai/AstaBrief_8B
25. "每一家 SaaS 公司都会变成模型外面的一层 harness" —— 把本季度核心隐喻升格为组织论文的 8 月旧文登上 HN
- Velocity: ▮ steady
- Source: blog.sshh.io · 117+ pts on HN · ~7h ago (~05:10 UTC+8) · 文章写于 Aug 24
- Tags:
harness saas agents org-design
Shrivu Shankar 的这篇文章(8 月 24 日发表,今晨在 HN 重新浮出)主张:harness——"围绕无状态 LLM 的基础设施、接口、上下文与状态"——不是一个开发者工具品类,而是公司本身。四个阶段:没有 harness → 个人操作 harness → 个人编排 harness → "harness 编排个人",彼时"Humans are part of the harness"。质量来自调度人类注意力,而不是无人化:"taste-holders" 只审大决策、demo 与最优设计变体。竞争逻辑:握住最外层 harness,否则被商品化——"如果整个外循环都外包出去了……这门生意已经被商品化。" 引用的证据:Ramp、Stripe、DoorDash 的内部 AI 开发者工具。
Why it matters: 本栏整个季度都在把"harness"当作工程名词追踪(Mid-Harness、ds4 的共享状态 agent 面、今天 HF 榜上 Meta 那篇优化 harness 的 ActiveSaddler)。这篇文章的动作是把它升格为公司论——六周前的旧文、尚未被验证,但如果"harness"成为 2027 年的组织架构词,这就是铸造该用法的文章之一。
🔗 blog.sshh.io · 🔗 HN discussion
26. 给软件工程师解剖一个 Lean 证明:把 Sipser 正则性习题拆成 spec → DFA → proof
- Velocity: ▮ steady
- Source: agostbiro.net · 92+ pts on HN · ~33h ago (~02:50 UTC+8 Oct 2)
- Tags:
lean formal-methods verification dfa
一位在职工程师完整拆解如何用 Lean 4 + Mathlib 形式化 Sipser 教材的经典习题:三行比特列构成的语言 B——第三行是前两行按二进制求和——是正则的。构造是一个进位 DFA——"一个全加器,状态是待定进位,外加一个死端汇"——识别反转后的语言,再用 Mathlib 的"正则性在反转下保持"定理闭环。三段式解剖(specification / implementation / proof)的芯是 run_invariant 引理——evalFrom 终于 carry carryOut 当且仅当 row1LE wLE + row2LE wLE + carryIn = row3LE wLE + carryOut * 2 ^ wLE.length——用归纳法加 generalizing carryIn 证明。经验:"proofs are programs";形式化逼出一个隐含假设("一个词的三行必须等长");以及对黑盒化的警告——既然 agent 已经能一发命中这类证明,"往前看,我们能读懂机器生成的证明这件事很重要。"
Why it matters: 形式方法浪潮一直缺一张给在职工程师的入场图——这就是那张图。而它对机器生成证明的警告,与本周一位内核维护者给 AI 漏洞清单打出 20/79(第 19 条)恰好同框:没有理解兜底的验证,只是一条更快的传送带。
🔗 agostbiro.net · 🔗 HN discussion
27. Audionaut:agent 可以经 MCP 驱动的 GPLv3 多轨音频编辑器 —— 三年 C++,每次编辑一个 undo 步
- Velocity: ▮ steady
- Source: Show HN · 133+ pts on HN · ~20h ago (~16:00 UTC+8 Oct 2)
- Tags:
audio open-source mcp juce show-hn
kvoltmer/Audionaut(C++ / JUCE;Windows/macOS/Linux;README 徽章为 GPLv3)以"一个免费开源、AI agent 可以经 MCP 驱动的多轨音频编辑器"亮相。作者的起点:做了三四年,最初是为了"用老 Sound Designer II 的工作流(建 region、丢进 playlist、导出、完事)剪自己的多轨录音"。Agent 接口一行——claude mcp add audionaut -- npx -y audionaut-mcp——关键契约是"每次编辑就是一个 undo 步"。首页 demo 显示 Claude 每 16 小节切一刀、把 clip 分到两条轨道、补上缝隙,再设交叉淡入淡出与淡出。仓库已核查:156★,10 月 2 日有 push——热度目前由 HN 而非 star 数带动。
Why it matters: 桌面应用的 MCP 化正在越过 IDE 和浏览器,进入时域媒体;而"一次编辑 = 一个 undo 步"是正确的 agent-UX 原语——agent 的每一次改动都保持人类可回滚。它也补上了 Audacity 与完整 DAW 之间那个久违的开源空位。
🔗 kvoltmer/Audionaut · 🔗 HN discussion
28. Debian 悄悄为贡献者立起一个 LLM 推理门户 —— Salsa 登录、预算追踪、Scaleway 赞助
- Velocity: ▮ steady
- Source: inference.debian.net · 12+ pts on HN · ~5h ago (~06:45 UTC+8)
- Tags:
debian llm-infra open-source distro
inference.debian.net 是"给 Debian 贡献者的 LLM 推理自助门户":用 Salsa(Debian 的 GitLab)登录,"只有 Debian Developers 与 Debian Maintainers 获得访问权",然后管理 API key、追踪预算消耗。服务于 9 月 23 日在 debian-devel-announce 公告;目前列出的首个模型是 scaleway/qwen3.8-27b(9 月 25 日加入);"推理资源由 Scaleway 赞助。" 门户源码(inference-team/inference-user-portal)就在 Salsa 上,最近的更新加入了"DebGPT 配置一节"与沙箱示例。
Why it matters: 发行版为贡献者提供身份门控、赞助商出资的推理,是一级基础设施决策——道德等价物是当年的构建集群,其他发行版从此有了对照模板。DebGPT 集成泄露了天机:这是给"干 Debian 活的 agent"用的推理,不是给人聊天的福利。
🔗 inference.debian.net · 🔗 HN discussion
29. 第一只 RFC 1149 数据包登上佳士得拍场 —— David Waitzman 的鸽子载波 ping,已装框
- Velocity: ▮ steady
- Source: onlineonly.christies.com · 56+ pts on HN · ~15h ago (~20:45 UTC+8 Oct 2)
- Tags:
internet-history rfc1149 auction humor
佳士得"Fine Printed Books & Manuscripts"在线专场收录了一件名为 "Carrier Pigeon Internet Protocol" 的拍品:"[WAITZMAN, David and the BERGEN LINUX USER GROUP.] 一枚按 RFC 1149 由信鸽传递的 IP/ICMP 'ping' 数据包。纸卷一小轴,41 × 210 mm。留有当年绑在鸽腿上的滚动折痕。已装框。" 目录所述来源:David Waitzman——1990 年愚人节写下 RFC 1149《Avian Carriers 上传输 IP 数据报的标准》的美国网络工程师——这枚数据包是"第一次也是最著名一次实现"的幸存包,出自 Bergen Linux User Group 的鸽子实验,背板背面题有"Property of David Waitzman"。
Why it matters: 互联网最经典的愚人节标准进入了艺术品市场。第一代互联网的纸质痕迹开始成为收藏品——而 RFC 幽默谱系(1149 → 2549 的 QoS 改进 → 6214 的 IPv6 适配)已经老到出现了值得装框的原件。
🔗 Christie's lot 325216 · 🔗 HN discussion
Metadata
| Field | Value |
|---|
| Generated | 2026-10-03T12:20:00+08:00 |
| Items | 29 |
| Sources tracked | 29 (Hacker News, GitHub Trending, GitHub API, dwarfstar.sh, bfl.ai, supabase.com, eff.org, learn.chatgpt.com, csirt.divd.nl, CISA KEV, NVD, access.redhat.com, arXiv, Nature, ataraxosai.github.io, blog.google, developer.apple.com, stillwet.art, wagtail.org, maximumeffort.substack.com, Hugging Face papers, gadgets.muse.ai, YouTube/Kernel Recipes, yuka.dev, allenai.org, blog.sshh.io, agostbiro.net, inference.debian.net, onlineonly.christies.com) |
| Update schedule | 04:03, 12:03, 20:03 UTC+8 (3x daily) |
| Ranking | Velocity-weighted (recency × engagement acceleration × source authority) |
| License | CC-BY 4.0 |
Previous day · Raw .md · Archive