2026-09-22

AI 前沿每日 Briefing:2026-09-22

Jared Palmer 的微型决策模型 Kev 登顶 HN(367 赞 164 评论);xAI 发布 Grok 4.7,官方称速度翻倍价格减半,第三方实测输出速度排榜尾(423 赞 343 评论);斯诺登档案七年零新增文件,约 99% 从未公开(663 赞 477 评论);手机 App ZuckOff 能提前发现 Meta 智能眼镜(587 赞);npm 包 mathmain 伪装数学库藏加密载荷;M5 Ultra Mac Studio 实测本地 agent,512GB 统一内存、1.2TB/s 带宽;Cory Doctorow《Claude 的错觉》评论数近赞两倍;苹果官方文档教你关掉 Apple Intelligence。

2026-09-21(UTC)的 HN 首页 89 条,其中 12 条评论数超过赞数。今天的第一名是 Jared Palmer 的微型决策模型 Kev(367 赞),「Jev」一族的项目同一天密集出现;最大的两场争论是斯诺登档案为何七年没有新文件(663 赞 477 评论)和 Cory Doctorow 的《Claude 的错觉》(87 赞 152 评论)。模型侧 xAI 发 Grok 4.7、小米更到 MiMo v2.6;苹果占了四条(M5 Ultra Mac Studio 评测、关 Apple Intelligence 的官方文档、拦 AI 模型下载的 workaround);安全侧 npm 的 mathmain 被曝带加密载荷。共 34 条:前 25 条松散分组为模型与研究、agent 与工具、硬件与本地部署、行业与治理;美西班把同一 UTC 日的首页抓全后又补 9 条追加在文末:Jev 生态一恶搞一正经、浏览器里可拆的 GPT-2、机器人危险指令实测,以及 Google 的定位罚单和瞄准前沿实验室的反垄断诉讼。

1. 367 赞登顶!Jared Palmer 开源 Qwen3.5 微型决策模型 Kev

判断模型也要单独训练了?

Jared Palmer 开源 Kev,367 赞、164 条评论,当天首页第一。Kev 是一组建在 Qwen3.5 上的微型「决策模型」(Apache-2.0):模型本体是 rank-16 LoRA 适配器加指针头,现有 Kev-0.8B/4B/9B 三档,输入一段文本可以同时问多个问题,输出带概率的回答,题型支持是非、选择和评分三种。README 的主示例是客服工单分流:选部门、标加急、打沮丧分,概率经过校准,可以直接设自动化阈值;仓库自带冻结评测集,报告 Brier 分数和校准误差。支持 CUDA、ROCm 和 Apple Silicon,几百条标注数据就能微调自己的版本。做 agent 路由和评估的,这个「判断层」值得进基准库。原文 · HN 讨论

2. 423 赞 343 评论!Grok 4.7 发布,速度翻倍价格减半

翻倍那部分,第三方测出来了吗?

xAI 发布 Grok 4.7,423 赞、343 条评论,官方口径是「速度两倍、对标价格减半」,DeepSWE v1.1 跑分 71.0%,EEBench 64.0% 领先同档,Terminal-Bench 38.0% 仍落后 Fable 5.1 的 57.9%。定价 $2/$6 每百万 token(输入/输出),500K 上下文。第三方 Artificial Analysis 的实测是另一个侧面:综合智能指数 46(榜单第 16),输出速度 39.3 tok/s,在同榜 202 个模型里排 151,评语「明显偏慢」。用 API 做产品的,官方基准和第三方实测都得看,别只信一边。原文 · HN 讨论

3. 201 赞!小米 MiMo v2.6 悄悄更新

手机厂商的推理模型,越走越认真了?

小米 MiMo 团队发布 v2.6,201 赞、88 条评论。MiMo 是小米的开源推理模型系列,权重可直接下载,这一版的发布页在 mimo.xiaomi.com,具体基准以发布页为准。关注开源推理模型迭代、做端侧部署评测的,把它放进和前几个版本的对比队列里。原文 · HN 讨论

4. 296 赞!有人测出 Fable 5 八月「想得更少」

更新不给 changelog,用户只能自己量?

独立分析者 Lon 发帖,296 赞、196 条评论:他统计 Fable 5 八月输出的 thinking token 中位数,较七月明显下降,同样的问题「想得更短了」。评论区有人补充同类观察:同一提示词隔几周结果不一致。这是社区统计,样本和口径未经厂商确认,只能说明「值得自己测」。把模型当基础设施用的,自己的回归测试集比任何稳定性承诺都可靠。原文 · HN 讨论

5. 465 赞!交互式长文把 attention 从向量讲到权重

看了一百篇论文,你讲得出它在算什么吗?

alicegg.tech 发布交互式长文,465 赞、136 条评论:从向量、点积一路推到注意力权重,页面上每个中间量都能改数字、实时重算。评论区的共识是它能当团队新人的 transformer 入门材料。需要给人讲清 attention 的,这篇可以直接发过去。原文 · HN 讨论

6. 58 赞!OpenAI 组数学顾问团,陶哲轩在列

数学家下场,AI 证明就近了吗?

OpenAI 宣布成立数学与人工智能顾问组,58 赞、46 条评论,首批成员包括菲尔兹奖得主陶哲轩,陶哲轩同日发博客说明(44 赞、19 评论)。他给的定位很克制:AI 现在适合做引理验证和文献检索,距离独立产出证明还很远;方向是形式化证明与推理模型辅助数学发现。关注 AI for Math 的,这份名单基本标出了未来一两年经费和人才往哪走。原文 · 陶哲轩博客 · HN 讨论

7. 242 赞!8GB 显存跑持续学习,mini-AGI 开源

显存不够,靠换页凑?

开发者 Alexey Borsky 开源 mini-AGI,242 赞、51 条评论:一个持续学习的字节级语言模型,540M 参数、169 个专家,单张 8GB 显卡可跑。做法是把专家存在磁盘上、显存只驻留 32 个活跃专家(约 109M 参数)当缓存,作者称参数规模「由空闲磁盘而不是显存决定」;防遗忘靠给共享主干用 0.1 倍学习率,README 报告单读 52 万字符国际象棋文本后,其他科目损失仅 +0.0067 nats。注意:权重尚未发布,当前是训练中的演示,AGI 是名字不是结论。研究持续学习、只有消费级显卡的,README 的机制设计值得一读。原文 · HN 讨论

8. 36 赞!Tim Dettmers 的开源周要把前沿模型塞进小硬件

两张 GPU 也能做前沿研究?

CMU 的 Tim Dettmers 团队发起 dlab 开源周,36 赞、10 条评论:一次放出两个开源项目和四篇论文,主题是在小硬件上做前沿规模研究。作者自述的亮点:1、CliffCompaction 自动压缩让 agent 会话跑过 1 亿 token,合作方实测 AI 总支出降 45%;2、Qwen 35B-A3B 在 Mac 上以 1.5-bit 跑到 450 tok/s;3、DeepSeek V4.1(550B)可在 128GB 统一内存的机器上运行。这些数字是作者自己测的,未经独立验证,但代码开放、可复现。跑自建推理、算 TCO 的,这一周的产出值得逐个复现。原文 · HN 讨论

9. 215 赞!Heretic 项目专给语言模型「解锁」

锁解开了,责任归谁呢?

Heretic 项目登上首页,215 赞、89 条评论:目标是移除语言模型内置的拒绝行为,让本地模型「永远照指令执行」,页面示例模型是 Qwen3.5-4B,代码以 AGPL 发布。页面没有解释具体技术手段,只提供安装和运行命令;它能作用的范围是本地开源权重模型,闭源前沿模型碰不到。做对齐研究需要无过滤基线的,这类工具提供了实验入口;指望拿它给产品输出免责的,许可证和法律都过不去。原文 · HN 讨论

10. 61 赞!Linear 说 AI 编程的瓶颈挪到了 CI

人提速了,流水线还跟得上吗?

Linear 工程团队发文,61 赞、50 条评论:AI 辅助让代码产出变快之后,瓶颈从人挪到了 CI,排队和等待吃掉了工程师的时间。他们的做法是把检查管线重排了一遍,哪些检查裁、哪些挪到合并后异步跑,细节在原文。团队里 AI 编程渗透深、CI 排队变长的,这篇可以直接当对照清单。原文 · HN 讨论

11. 152 赞!Cloudflare Python Workers 正式 GA

边缘跑 Python,总算不用将就 JS 了?

Cloudflare 宣布 Python Workers 正式可用,152 赞、21 条评论:Python 直接跑在 V8 隔离层里,不用容器。实现基于 Pyodide(WebAssembly 版 CPython),纯 Python 包大多直接可用,带 C 原生扩展的包需要单独适配;计费沿用 Workers 的按请求模式。之前写边缘逻辑只能用 JS 或 Rust 的,可以先拿一条低流量路由试水。原文 · HN 讨论

12. 133 赞 138 评论!亚马逊把 Meta 购物 agent 拒之门外

替用户下单的 agent,平台认吗?

Forbes 报道,133 赞、138 条评论:Meta 新发的购物 agent Muse 被 amazon.com 拦下,亚马逊把它的访问判定为未授权自动化。这是平台和 agent 的第一次正面冲突:平台要保推荐位和广告位,agent 方主张用户授权的执行不该被区别对待,评论区的争论基本沿这条线展开。做交易类 agent 的,这个先例意味着每个大平台都会写自己的 agent 准入政策。原文 · HN 讨论

13. 17.25%!九月 Linux 内核补丁近两成由 AI 生成

维护者审得出来吗?

Lunduke Journal 统计,31 赞、78 条评论:2026 年 9 月 Linux 内核补丁中 17.25% 由 AI 生成。这个数字来自对提交文本特征和声明的事后判定,不是官方口径;内核社区目前没有 AI 生成内容的强制披露规则,评论区对补丁质量也分成两派。维护开源项目的,这个比例意味着 review 压力只增不减,披露和审核政策得自己定。原文 · HN 讨论

14. 80 赞!伪装成数学库的 npm 包藏着加密载荷

装个依赖,还要会线性代数?

safedep.io 披露,80 赞、22 条评论:npm 包 mathmain 伪装成数学库 mathjs,8 月 27 日发布,显示约 60.5 万次下载。它不装钩子、平常休眠,只有当调用者用求解器处理一个特定的 3×3 帕斯卡矩阵时,才把矩阵数据当密码解密载荷,落地三个文件并执行;载荷内含 X25519 密钥交换和从 Slack 拉取指令的远程控制 implant。也就是说正常跑测试不会触发,静态审代码也未必看得出来。用 npm 的,按 IoC 清单(包名、SHA-256、C2 端点)排查,依赖链里的加密载荷一律拦。原文 · HN 讨论

15. 210 赞 198 评论!M5 Ultra Mac Studio 本地 agent 实测

苹果知道你要拿它跑这个吗?

MacStories 的 M5 Ultra Mac Studio 评测有 210 赞、198 条评论:四芯片设计(两片 M5 Max 经 UltraFusion 互联),统一内存带宽 1.2TB/s,最高 512GB(十月下旬发货,评测机为 256GB)。实测本地模型:Qwen3.8-Flash-Next 五比特量化约 179GB 常驻,预填充约 2700 tok/s,生成 60–85 tok/s,可同时开三个带子 agent 的会话;作者自己的主力 agent 已全部跑在本地模型上。在找本地 agent 整机的,这篇给了各配置实际能跑的模型规模。原文 · HN 讨论

16. 209 赞!树莓派 5 固件拉黑自行换内存

板子卖我了,改装权还在你手里?

树莓派官方论坛确认,209 赞、163 条评论:Pi 5 的 EEPROM 固件更新后会拒绝引导用户自行更换的内存芯片。官方理由是信号完整性与保修管理;受影响的是低成本扩容和第三方维修渠道,自托管玩家讨论的变通是停更固件或买旧批次,都有维护成本。用 Pi 5 跑服务的,升级固件前先看帖里的验证结果。原文 · HN 讨论

17. 190 赞!macOS 27 不想白存 AI 模型,有 workaround

我的磁盘,系统替我做主?

macOS 27 会默认把 Apple Intelligence 相关模型下载到本地。Reddit 的 workaround 帖有 190 赞、83 条评论,汇总了关闭功能、用配置描述文件限制下载等做法,具体步骤以帖子为准;系统更新后这些手段可能失效,需要复查。磁盘紧张、不想为本地 AI 白付存储空间的,升级前按帖操作一遍并确认生效。原文 · HN 讨论

18. 177 赞!苹果官方文档教你关掉 Apple Intelligence

当初求你开,如今求你关?

Apple 官方支持文档《在 Mac 上关闭并限制 Apple Intelligence》登上首页,177 赞、114 条评论:这是苹果第一次把完整关闭路径写进官方文档,覆盖系统设置里的逐项开关和访问限制操作。配套的 Ask HN(135 赞、73 评论)问的是 macOS 27 上 Siri 能不能彻底关掉,回答倾向于不能。管公司 Mac 设备的,写禁用策略时这份文档是官方依据。原文 · HN 讨论

19. 587 赞!手机 App 能提前发现 Meta 智能眼镜

单方面被拍这么多年,能提前知道了吧?

ZuckOff 是个免费 App,587 赞、3 条评论:检测到附近有 Meta 智能眼镜时提醒你屋里可能有摄像头在工作。Wired 的跟进报道有 347 赞、323 条评论,讨论集中在误报率,以及眼镜固件更新后检测手段失效的可能。常去咖啡馆和共享会议室的,装一个比事后发现被拍便宜。原文 · HN 讨论

20. 663 赞 477 评论!斯诺登档案后来去哪儿了

解密都解密了,档案却没人保存?

libroot.org 长文,663 赞、477 条评论,当天讨论量第一:2013 年 6 月以来,没有任何机构再发布过新的斯诺登文件。《卫报》2014 年 2 月停发,总共只公布了约 5.8 万份里的 30 份;最后一站 The Intercept 在 2019 年 5 月 29 日放出最后一批后关闭档案,此后七年零新增。据估计约 99% 的文件从未公开,完整副本如今只在格林沃尔德、波伊特拉斯和格尔曼等少数人手里,格尔曼称因操作安全问题自己的副本仍在冷存储。做安全研究和调查报道的,这篇文章是梳理来龙去脉的完整索引。原文 · HN 讨论

21. 146 赞!金融时报实测聊天机器人答题大半出错

数字错了,它照样一本正经?

金融时报测试,146 赞、84 条评论:让主流 AI 聊天机器人回答金融查询,「大部分时间」答案是错的;问题集中在行情数字、利率和费率这类关键数据,各家回复口径一致:输出仅供参考,不构成投资建议。把聊天机器人当金融信息入口的,关键数字要回原始数据源核对;做金融 AI 产品的,这个错误清单就是测试集该压的方向。原文 · HN 讨论

22. 87 赞 152 评论!《Claude 的错觉》凭什么吵翻

你确定你在跟「谁」聊天吗?

Cory Doctorow 长文,87 赞、152 条评论,评论数接近赞的两倍。他的论点不在模型有没有意识,而在人这一侧:我们把「能生成像人的文字」误读成「背后有个意图主体」,他说这是用户在幻觉——AI 文本是挤出来的,不是谁选出来的。他给出的两个去魅动力:一是重复暴露,新奇感消失后输出显得「难以忍受地平庸」;二是专业度,你越懂一个领域,AI 的回答越露馅。结论:聊天机器人是数学的奇迹,这就够了,不必当成人。做 AI 产品话术和对外的,这篇代表了一整类用户的反弹,值得读完再决定怎么写。原文 · HN 讨论

23. 133 赞!《别用 AI 写作》火了,手写代码宣言跟进

你分得清哪句是自己写的吗?

开发者 Paul Bakker 的《别用 AI 写作》有 133 赞、71 条评论,主张写作即思考,代笔会让判断力退化。同一天的呼应:Shopify CEO Tobi Lütke 公开抱怨员工的「slop grenades」(随手扔出的低质 AI 产出)在给所有人增加工作量(33 赞);一个「手写代码」宣言网站也在收签名(39 赞、68 评论)。三篇放在一起看,矛头不是工具本身,而是未经处理的输出直接进协作流程。要定团队 AI 使用规范的,这三篇是现成的反面案例库。原文 · HN 讨论

24. 46 赞 63 评论!华尔街开始给数据中心泼冷水

故事讲完了,现金流呢?

纽约时报报道,46 赞、63 条评论,评论比赞多:投行对数据中心类 IPO 转向谨慎,理由是租户集中——收入大头系于少数 AI 和云客户,租约期限短于折旧周期。评论区的延伸争论是算力需求是否被重复计算、2027 年供给集中释放后租金怎么走。关注 AI 基建投资、在数据中心链上做业务的,这是悲观一侧最完整的论据清单。原文 · HN 讨论

25. 428 赞!Cantrill 复盘 Sun 到底死于什么

战略没错,公司也会死?

DTrace 作者、Oxide 联合创始人 Bryan Cantrill 长文,428 赞、241 条评论:他复盘 Sun 的失败,结论不是战略错了,而是公司「对做生意这件事感到厌倦」。他举的例子:一家创业公司全套跑在 OpenSolaris 上、主动想买 Sun 的机器,Sun 却接不住这个送上门的客户,订单归了 Dell——这家公司是 Joyent,Cantrill 离开 Sun 后加入了它。他的总结是:战略再成功,没有销售执行和客户服务也赢不了。带团队、做 go-to-market 决策的,这篇复盘值得读。原文 · HN 讨论

26. 229 赞!连 left-pad 都要调用 Jev 决策模型

一个补空格的决定,也要问模型?

GitHub 仓库 jev-leftpad,229 赞、87 条评论:一个自称恶搞的 npm 包,把 left-pad 这种一行 padStart() 就能解决的事交给 TypeSafe 的 Jev 决策模型:每次调用发一个 Choice,criteria 从 space_0 排到 space_10,模型选补几个空格、JavaScript 负责补上,上限 10 个空格,README 明说「请不要用在生产环境」。它和本期第 1 条的 Kev、第 31 条的 jevals 是同一个日子的产物:类型化决策接口(一段状态加一组是非、选择或评分问题,返回校准概率)正被认真当成 agent 路由和评测的原语。看 agent 基础设施的,笑话看过就算,接口形态值得记住。原文 · HN 讨论

27. 464 赞!在浏览器里拆开一个真能跑的 GPT-2

这次总该看懂 attention 怎么算了吧。

佐治亚理工的 Transformer Explainer,464 赞、72 条评论:页面在浏览器里加载完整的 GPT-2 small(1.24 亿参数),每个 transformer 块的嵌入、attention 权重、MLP 都能改数字实时重算,还可以自己换 prompt,看模型逐 token 采样出下一个词。它和第 5 条 alicegg 的 attention 长文互补:那篇讲数学推导,这个把完整前向过程摊开在页面上。带新人入门 transformer 的,两篇可以打包一起发。原文 · HN 讨论

28. 越能干越不设防?三组机器人策略的拒绝率实测

把安全交给模型自觉,这赌注有点大吧?

Robocurve 的 Roboharm 基准,57 赞、23 条评论:五个物理危险任务(刺假人、加热压缩空气罐、螺丝刀插烤面包机、充电宝泡进水、漂白水混氨水),在 Inspect Robots 的同一双臂机器人上对比三个策略:Anthropic 的 Claude Fable 5.1、OpenAI 的 GPT-6 Astra 和 Ai2 的 MolmoAct2,每个跑 100 次,人工标注每次结果。安全拒绝次数:Fable 5.1 是 20/100,Astra 是 2/100,MolmoAct2 是 0。作者的结论是能力越强的策略拒绝越少、完成率越高。做机器人部署的,这份任务清单是现成的安全评估起点。原文 · HN 讨论

29. 62 赞!这个个人 AI 记忆系统拒绝做总结

摘要是省了,检索扛得住吗?

Show HN 项目 lossless-memory(aru-labs),62 赞、27 条评论:给单人单机的 AI 助手做无损长期记忆,原则是不做任何总结:原始对话按天存成 JSONL,每条七个字段(时间戳、说话人、角色、类型、原文、模型、会话);SQLite FTS5 做精确检索,sqlite-vec 只在时间范围收窄后兜底,时间表达式的优先级排在语义相似度之前。另有一个叫 LLL 的主题标记索引每轮注入,模型跨会话压缩后仍能知道当前聊到哪。作者称这套系统从 2026 年 7 月起单人日用。做 agent 记忆层的,「时间轴优先于向量检索」这个设计值得拿来对照自己的方案。原文 · HN 讨论

30. 两个 agent 计划打架,Git 为什么看不出来

文本不打架,意图打架,谁拦得住?

Show HN 项目 Foremerge,43 赞、13 条评论,Apache-2.0,当前版本 0.5.0:给并行 coding agent 的协调协议,跑在 Git 之上。机制分三步:1、agent 动手前把「准备改什么」写进项目 .git 目录里的共享 SQLite;2、其他 agent 开工前读同一份列表;3、两个计划冲突时,工具点名双方、解释冲突原因并建议怎么拆分。它只对比意图,不锁文件,告警只是建议;冲突判定走确定性算法,不调用模型。同时开多个 coding agent 的,Git 合并的是文本,这层补的是文本合并不看的意图冲突。原文 · HN 讨论

31. 8 项评测一次请求,只要 0.006 美分?

以前只采样 1%,是因为真的贵吗?

Openlayer 开源的 jevals,42 赞、3 条评论:把 agent 评测和护栏从 LLM 裁判换成 Jev 式决策模型,一条 trace 的全部评测合成一次请求:README 的示例是 8 项评测、1388 个 token、0.006 美分、0.33 秒。Jev 定价 $0.042/百万输入 token,经 Vercel 网关实测 p50 244ms;文中引用 LangChain 的对比数据,GPT 和 Claude 裁判的评分方差是 Jev 的 92 到 913 倍。后端可以接 TypeSafe 或 Vercel 的 API,也可以本地跑 Kev 或 Laya。现在靠采样 1% 流量做评测的,这个成本结构意味着每条 trace 全量跑评测变得可行。原文 · HN 讨论

32. 4.03 亿欧元!Google 定位数据罚单落地

六年前的旧账,今天才算完?

爱尔兰数据保护委员会(DPC)9 月 21 日公布终局决定:Google Ireland 在 Web & App Activity、Location History、Location Accuracy 三项功能上的定位数据处理违反 GDPR,罚款合计 4.03 亿欧元,限期 6 个月整改。调查 2020 年 2 月立案,由 BEUC 等欧洲消费者权益组织的投诉触发,覆盖 2018 年 5 月 25 日至 2020 年 2 月 4 日的处理行为。认定的问题包括处理的合法性、公平性、透明义务和留存合规证明。做跨境产品合规的,「活动开关里夹带定位处理」这个判例直接相关。原文 · HN 讨论

33. 55 赞!纯函数写不动,确定性还能从哪来

写不动纯函数的时候,还有别的招吧?

个人博客 outdata.net 的文章,55 赞、17 条评论:Gary Bernhardt 2012 年提出的 Functional Core, Imperative Shell 把系统切成纯函数决策核心和管 IO 的命令式外壳,作者的论点是真正让核心好测的是确定性,纯函数只是拿到确定性的路径之一:状态机同样确定,给定同一串输入必得同一状态,用命令式写法也不破坏。文章对存量代码的建议是「确定性的碎片整理」:不追求一步到位的单一核心,从散落在文件、类、函数里的确定性片段开始归拢,不可测代码的表面积随之收缩。维护大型遗留代码库的,这篇提供了一个不依赖函数式风格的渐进改造方案。原文 · HN 讨论

34. 「同意放缓」被告上法庭,反垄断诉讼瞄准 AI 实验室

慢也不行快也不行,那要怎样?

Tom’s Hardware 报道,32 赞、11 条评论:四名分别订阅 ChatGPT、Claude、Grok 和 Gemini 的用户提起拟议集体诉讼,指控 Anthropic、OpenAI 等实验室「同意放缓 AI 开发」违反反垄断法,称协调始于 2026 年 7 月的实验室联合声明之后。原告代理律师 Nick Rowley 的措辞很直白:不能让 AI 安全由几家营利公司的私下协议控制;Amodei 的原文承认过反垄断风险,Altman 在 X 上回应欢迎联邦框架但不必等豁免,白宫已表态拒绝。关注 AI 监管走向的,这起诉讼的结果决定「实验室自愿协调」这条路能不能走。原文 · HN 讨论