2026-09-17

AI 前沿每日 Briefing:2026-09-17

微软 AI CEO 发文批「模型福利」,400 条评论当天最吵;苹果给照片装上硬件级验真签名;Claude Cowork 与聊天合并成一个入口;OpenAI 把 Sponsored Agents 广告开进 ChatGPT;PS5 Linux 负责人因 LLM 涌入退场;DeepSeek v4.1 Flash 在 11 个靶机上全部拿到执行权;小米直播 Mimo 2.6 强化学习训练;Cloudflare 让站长拒绝 AI 训练又不丢搜索收录。

2026-09-16(UTC)的 HN 首页 86 条。今天最吵的是「模型福利」之争,吵到 400 条评论;大厂侧苹果给照片上了硬件级验真签名、Claude 把 Cowork 并进聊天;工具侧从 Postgres 同步到 Go CI 缓存都有可直接抄的作业;安全侧一台车牌摄像头被扒了个底掉。共 33 条,按模型与智能体、工程与工具、安全与行业大致分组。

1. 400 条评论吵翻 HN!微软 AI CEO 说模型福利是危险方向

连模型感受都要管,那训练它的人算谁?

微软 AI CEO Mustafa Suleyman 9 月 16 日发文《A Warning About ‘Model Welfare’》,158 赞、400 条评论,当天讨论量第一。他点名 Anthropic 1 月 21 日发布的 Claude’s Constitution,称其构成循环论证:模型被训练去表达道德立场,输出再被当作内在道德地位的证词。他的三条主张:1、当前 AI 只是「序列补全引擎」,不是道德主体。2、训练不应鼓励模型自称有感受、权利或福利需求。3、关于 AI 内在状态的推测应与训练分开发表,投入转向可解释性研究。微软把自己 9 月 14 日公开征求意见的行为准则定位为人本路线。做对齐研究和 AI 政策的,这是两家头部实验室公开路线分歧的正面交锋,值得通读。原文 · HN 讨论

2. Cowork 没了!Claude 合成一个入口,文档幻灯片一起上

以后不用先想好这件事该丢给哪个模式了?

Anthropic 9 月 16 日宣布 Cowork 与聊天合并为统一的 Claude,176 赞、183 条评论。Pro 和 Max 用户当天起在网页、桌面和移动端直接使用,Claude 自己判断任务需要什么能力,在同一段对话里调用文档、幻灯片和设计。新增两个产品:Claude Docs 是可协作编辑、可分享的文档,Claude Slides 可导出 PowerPoint 或 PDF;Design 能力并入对话,默认执行动作前先询问,也可放开让它自主完成。原 Cowork 用户的对话、项目、artifacts、connectors 和 skills 全部保留,Team 与 Free 版稍后跟进。做知识工作和内容产出的团队,值得今天就盘点哪些工作流可以搬进同一段对话。原文 · HN 讨论

3. 广告进 ChatGPT!OpenAI 上线 Sponsored Agents

2024 年说广告是最后手段,现在手段用上了?

OpenAI 9 月 16 日宣布在 ChatGPT 里扩展广告,新形态叫 Sponsored Agents:用户点击广告后可以直接和品牌的 AI 智能体对话,148 赞、160 条评论。广告以明确标注的横幅出现,与对话模型分离运行;Plus、Pro、Business、Enterprise 和 Edu 账号不展示广告,免费层可见。讨论里最集中的质疑是:点击「chat with us」之后,界面里不再有「广告」或「赞助」字样,只剩一行「learn more about business chats」;有评论者翻出 Sam Altman 2024 年「广告是最后手段」的说法。靠 ChatGPT 触达用户的品牌方多了一条新渠道,但给广告智能体写销售话术,意味着模型口径直接变成广告合规问题。原文 · HN 讨论

4. Mistral 牵手 Mozilla,AI 浏览器助手主打私密多语言

浏览器不该是单行道,这话轮到欧洲人说了?

Mistral 与 Mozilla 9 月 16 日宣布合作,492 赞、177 条评论。Mistral 的模型驱动 Firefox 的 AI 浏览助手 Smart Window(测试版),已在法国和北美上线,英国和德国预计今年内跟进。隐私设计是卖点:1、对话默认不保存在 Mozilla 服务器。2、Mistral 等合作方承诺零数据保留。3、模型按区域语言、方言和文化语境微调。演示场景包括复杂搜索、找回刚关掉的内容、从已打开的标签页里取信息。做浏览器插件和 AI 助手的,这是一套「本地模型+零留存」的可参考样本。原文 · HN 讨论

5. 485 赞!苹果给照片装上硬件级「验真」签名

以后这张图是不是直出,手机自己就能作证?

Apple 9 月 15 日发布 Reference Image,485 赞、326 条评论,首先在 iPhone 18 Pro 和 18 Pro Max 的主摄落地。机制分两段:1、拍摄瞬间传感器重启进安全捕获模式,像素数据在传感器内用出厂生成的 ECDSA P-256 私钥签名,变焦等机外元数据由 Secure Enclave 另签,时间戳上下界用 RFC 3161 令牌。2、底片传到 Private Cloud Compute 做证书链校验、神经网络真图置信度打分和冲洗,最终 JPEG 用混合后量子方案(MLDSA87-RSA-3072)签名。底片 30 天后自动清除,像素对 Apple 不可见。做内容可信、新闻图片和鉴伪工具的,这条从传感器到签名的链路是目前唯一同时防量子计算的方案。原文 · HN 讨论

6. 11 个靶机全破!DeepSeek v4.1 Flash 成了这家厂商最强的黑客模型

便宜模型能干的坏事,防御方跟得上吗?

安全厂商 Enclave 公布基准测试结果:DeepSeek v4.1 Flash 成为其榜单上最强的 AI 黑客模型,147 赞、58 条评论。测试把模型放进 Grafana、Jenkins、Nextcloud 的隔离副本,要求读代码、对比漏洞版与修复版、完成代码执行。DeepSeek 在 11 个有漏洞的靶机上全部拿到执行权,4 个已修复靶机全部未能攻破;单次成本 4.65 美元,全程 2349 条 Bash 命令,中位成功耗时 4 分 38 秒。攻击路径审计还发现 6 条计划外路径,包括 52 秒内经 Grafana 临时插件目录执行。做红队和 agent 安全的,这条的要点是基准要验证攻击路径,而不是只看成功标志。原文 · HN 讨论

7. 训练过程直播!小米把 Mimo 2.6 的强化学习仪表盘挂上了网

闭源厂不敢给看的,开源厂直接开直播了?

小米在 mimo.xiaomi.com/rl 挂出 Mimo 2.6 强化学习后训练的实时仪表盘,96 赞、27 条评论。仪表盘显示这次 run 于 9 月 15 日 10:32 UTC 启动,包含训练进度、数据构成和训练中的基准评测;评论者注意到约三分之二的训练数据是源代码,讨论认为这是后训练阶段的正常配比。社区反应集中在透明度上:有评论者称中国公司在这件事上比美国公司更开放,也有人猜测是回应蒸馏指控或抢发布前的公关。对做模型发布的,这个仪表盘回答了「模型发布前那段时间到底发生了什么」这个一直没人展示的问题。原文 · HN 讨论

8. 思考量砍掉 58.3%,速度快 1.95 倍,Swift-Qwen3.8-27B 发布

省下来的 token,可都是真金白银啊。

UkisAI 发布 Swift-Qwen3.8-27B,一个抑制过度思考的 Qwen3.8-27B 微调版,25 赞、9 条评论。做法是识别出触发冗长推理的标记 token,微调时对其施加惩罚:GPQA-Diamond 上思考 token 减少 58.3%,准确率损失不到 1 个百分点,多个任务速度约提升 1.95 倍。具体数字:GPQA 88.28%(基座 88.38%),平均 token 从 15014 降到 8855;LiveCodeBench v6 反而从 76.76% 升到 81.55%。权重采用 Swift Open License v1.0,年收入 100 万美元以下免费商用,另有 GGUF 版本可本地跑。跑推理服务的,这套「惩罚冗长推理」的做法值得在自己微调时试一遍。原文 · HN 讨论

9. 4B 小模型写出比 Postgres 快 81% 的查询计划

优化器几十年没解决的,被 RL 调出来了?

Rohan Bansal 把一个 4B 开源模型(Qwen3.8-4B-Distill)后训练成 Postgres 查询提示生成器,211 赞、33 条评论。方法两段:1、用 GPT-6 Astra 生成的约 420 条轨迹做监督微调,教会模型工具调用语法。2、在 CEB 基准查询上跑智能体强化学习,以 Postgres 实测执行时间作奖励信号,1200 次更新后在 Join Order Benchmark 113 条查询上达到 1.41 倍加速,取 15 个候选中最优达到 1.81 倍,且 best-of-3 设置下零回归。总成本约 1200 美元。一个关键工程结论:把 shared_buffers 调到 2GB,计时奖励被噪声欺骗的概率下降约 4 倍。做数据库内核和 RL 后训练的,这篇的方法论和踩坑都具体可复用。原文 · HN 讨论

10. Dream-RSI,让智能体在「重放模拟器」里自我改进

睡一觉醒来更会写代码,这剧本敢信吗?

arXiv 论文 Dream-RSI 提出递归自我改进框架,163 赞、48 条评论。思路是把探索策略本身变成可编程对象:智能体在线探索产生的发现树被存成「重放模拟器」,后续策略先在模拟器里离线评估和改进,再部署回线上继续扩大发现池;底层编码智能体不需要改动。论文报告在算法工程、数学优化和 GPU kernel 工程等多个场景下,发现质量持平或更好,成本明显下降。做 agent 框架和自动研究的,这是一条不改动智能体本体、只迭代探索策略的路线。原文 · HN 讨论

11. 本地模型已能吃掉 88.7% 的查询!斯坦福系团队量化「每瓦智能」

云厂商的电费生意,要被笔记本分走了?

arXiv 论文《Intelligence per Watt》提出用「每瓦智能」(任务准确率/功耗)衡量本地推理,155 赞、53 条评论。团队实测 20 多个本地模型、8 款加速器和 100 万条真实查询:本地模型已能处理 88.7% 的查询;2023 到 2025 年每瓦智能提升 5.3 倍,本地可服务查询覆盖率从 23.2% 升到 71.3%。结论分两面:1、本地推理确实能把相当一部分需求从云数据中心转移出来。2、本地加速器的每瓦智能仍比云端同款低至少 1.4 倍,硬件还有优化空间。做端侧部署和推理芯片选型的,这份数据可以直接当采购参考。原文 · HN 讨论

12. DeepMind 研究所上线,Hassabis 亲自写开篇

AGI 话题连发七篇,谷歌想抢回话语权的吧。

Google DeepMind 上线 DeepMind Institute 平台,101 赞、33 条评论,自我定位是发布和讨论「AGI 世界的创造性、深度见解」。首批文章包括成立宣言(Demis Hassabis、Shane Legg、James Manyika 联合署名)、推理透明度(监控思维链中的欺骗)、AGI 经济政策评估(评估十一条可能政策)和前沿能力测试框架;每篇都声明是作者个人观点,而非 Google 官方立场。做 AI 政策和战略研究的,这是一个比官方博客更正式的思想出口,值得加入订阅列表。原文 · HN 讨论

13. 用了 LLM 连自己写的 hack 都不懂?PS5 Linux 负责人不干了

最后一个 hypervisor 漏洞,被拿去换赏金了?

知名 PlayStation 黑客 Andy Nguyen(TheFlow0)宣布退出 PS5 场景并终止 PS5 Linux 项目,291 赞、203 条评论。直接导火索:一群用 LLM 辅助的新人也找到了他早先发现的 hypervisor 漏洞,却按悬赏计划报告给索尼,等于封死了新版本固件的破解路径;他原定的 PS5 Pro 支持(计划 2027 年发布)随之中止,最终版本 2.5 只支持固件 3.00–7.61 的 Phat 和 Slim 机型。这不是孤例,PS3 模拟器 RPCS3 近期也封禁了 vibe-coding 参与者。维护开源项目和安全社区的,这条说的是贡献者能力和责任边界,不是反对用 AI。原文 · HN 讨论

14. LLM 时代还怎么学编程?30 年老程序员给了个不讨喜的答案

学不会的那部分,以前靠书,现在靠谁呢?

Mark Seemann(30 多年开发经验)公开回复一位自学者的来信:对方用 AI 辅助搭起大型 TypeScript 系统,却发现自己看不懂自己写的代码,220 赞、169 条评论。他的核心观点:1、抽象层之上可以不理解的旧规则今天已经失效,瓶颈回到人脑吸收知识的速度。2、LLM 适合问可证伪的小问题(「这段 Haskell 还能更简洁吗」),不适合问「我该学什么」。3、对「AI 挤掉的岗位会被新岗位补上」他持怀疑态度,引用蒸汽机、中国冲击等先例,指出新岗位很少落到失业者头上。他承认自己也没有答案,只能建议回头补基础。教编程和带新人的,这篇的价值在于把「学会」和「交差」的区别说透了。原文 · HN 讨论

15. Google Play 审核普遍拖过一周!Signal、AnkiDroid 全中招

热修进不了商店,用户先扛着呢?

开发者 Daniel Gultsch 发文称 Google Play 的应用审核现在经常超过一周,329 赞、317 条评论。评论区多名维护者给出实例:Signal 团队称审核时长从 4 小时到 5 天不等,毫无规律;CoMaps 最近一次更新等了约 16 天,此前一个小热修也超过一周;一个 Android Auto 应用 9 月 4 日提交后仍在审核,往年只要 48–72 小时。高赞猜测是 AI 生成的应用提交量暴涨,拖垮了人工审核。发 Android 应用的团队,近期发布节奏要按「审核至少两周」排期,热修通道得另做预案。原文 · HN 讨论

16. 大会开到一半全球宕机!Salesforce 中断超 8 小时

客户大会上掉链子,这演示效果也太真实了。

Salesforce 9 月 16 日发生全球宕机,255 赞、164 条评论,时间点正撞 Dreamforce 大会(9 月 15–17 日)。故障始于太平洋时间凌晨 1 点左右,官方事故串称其为「旧版登录服务资源耗尽级联」;多个客户实例同时受影响,有评论者估算约 15 万个租户。中断 8 小时后,有评论者算出其当月可用性掉到约 98.9%,低于三个 9 的 SLA;修复方案在实例间缓慢滚动。按惯例,Dreamforce 期间本是变更冻结期。依赖 Salesforce 跑 CRM 流水线的团队,这条的主要启示是多租户平台的故障域比预想的大。原文 · HN 讨论

17. 给 AI 写的代码上「体脂秤」!ImpactGate 把结构腐烂挡在合并前

单看 diff 都挺干净,合进去就烂了?

OfficeFloor 开源项目发布 ImpactGate,一个给合并请求打「结构衰减」分的门禁工具,35 赞、44 条评论。打分公式是:改动文件数 × 被改函数所在类的已有复杂度 × 圈复杂度 × 改动行数——向已经很重的类里塞复杂代码代价最高,新建文件则几乎免费;函数级解析用开源工具 lizard,支持约 17 种语言。安装用 pip install impact-gate,支持本地打分、pre-commit 钩子和 GitHub Actions(以置顶评论输出结果,block 模式可直接失败流水线)。担心 AI 生成代码悄悄抬高代码库复杂度的团队,这个门禁补上了 diff 视角看不到的那一半。原文 · HN 讨论

18. Datamimic:别让编码智能体自己发明测试数据

它现编的数据,你敢拿来跑回归吗?

rapiddweller 开源 Datamimic 社区版(MIT 协议),一个面向 AI 编码智能体的模型驱动合成测试数据引擎,56 赞、8 条评论。设计逻辑:智能体随意发明的测试模型会破坏确定性和可审计性,所以引擎给智能体一套固定契约——capabilities JSON、渐进式参考查询、从 model.dm.json 生成脚手架和类型化修复诊断,并要求「永不重复调用同一个失败的请求」。同版本、同模型、同种子可复现字节级一致的结果;支持 PostgreSQL、MySQL、MongoDB、CSV、JSON 等输出,内置医疗、金融、保险等领域服务。让 agent 写测试的团队,这个契约思路可以直接搬进自己的脚手架。原文 · HN 讨论

19. 你的模型「过期」多久了?有人把 20 个模型的训练截止日排成榜

搜得到新闻,不代表它知道新闻啊。

独立开发者上线 stale.jock.pl,展示 20 个模型、8 家实验室的发布时间和训练截止日,66 赞、43 条评论。核心发现:只有一半实验室(Anthropic、Google DeepMind、Meta、OpenAI、xAI)至少公布一个模型的训练截止日,20 个模型里只有 10 个的截止日有据可查。例子:Llama 4 发布于 2025 年 4 月,训练截止在 2024 年 8 月;GPT-6 Astra 发布于 2026 年 9 月 3 日,截止在 2026 年 4 月 30 日。站点强调:联网搜索并不真正更新模型知识。做产品选型、要在对话里标数据来源的,这个榜可以直接当默认提示词的依据。原文 · HN 讨论

20. 测试 131 秒降到 41 秒,换掉官方 setup-go 就行

缓存键写错了,等于每次都在全量重跑?

cloudx.ai 发文介绍用开源分支 cloudx-io/setup-go 替换 GitHub 官方 actions/setup-go 的经验,62 赞、19 条评论。问题根源:官方缓存键只含系统、架构、Go 版本和 go.mod 哈希。改动三点:1、给每个 job 设独立的 cache-key-prefix,lint、test、build 各存各的。2、键里追加 run_id,让精确命中不可能,每次成功都保存新缓存。3、靠前缀匹配加 go.sum 哈希保证时效。结果:测试任务中位耗时从 131 秒降到 41 秒(提升 69%),对 4000 多个真实提交回测,不必要测试执行减少 86%。用 GitHub Actions 跑 Go 项目的,这是几乎零成本的改动。原文 · HN 讨论

21. 物理 WAL 直读!ClickHouse 把 Postgres 同步压进 200 毫秒

还要 Kafka 和逻辑复制槽干嘛呢?

ClickHouse 开源 WalShadow,直接读取 Postgres 物理 WAL 做复制,17 赞、2 条评论。架构四段:1、目录变更重放进一个只含 schema 的「影子」Postgres。2、堆记录交给 Rust 解码池并行处理。3、按表组装成 ClickHouse 原生块。4、独立插入池并行写入;靠每行的 _lsn 字段保证乱序正确性。实测(8 vCPU):提交到可见约 200 毫秒,持续 28.9 万行/秒,接近源库写入速度;对比 PeerDB 约 10 秒延迟和 12 万行/秒。限制是需要物理 WAL 访问权限,多数托管 Postgres 不给。自建 Postgres+ClickHouse 分析栈的,这是目前延迟最低的同步方案。原文 · HN 讨论

22. 一台摄像头 21 天拍 5 万辆车!Flock 车牌识别系统被扒开

装在家门口的监控,原来裸奔这么久了?

Wired 与 404 Media 联合报道:黑客拿到一台 Flock 车牌识别摄像机的系统权限,394 赞、193 条评论。Flock 是美国最大的车牌识别厂商,有评论者称其占美国市场超八成。被入侵设备运行 2017 年的 Linux 3.18 内核(2019 年起停止维护),未加密分区里存着媒体加密密钥;日志显示约 21 天内拍摄约 5.02 万辆车、生成约 160 万张图像,还拍到了人脸——而 Flock 一直声称其摄像机不做面部识别。DDoSecrets 已公布分区镜像。做安防采购和隐私合规的,这条的要点是「厂商声称不做人脸识别」和「摄像头实际拍到人脸」可以同时成立。原文 · HN 讨论

23. Cloudflare 新开关:拒绝 AI 训练,但保留搜索收录

不喂模型,就要失去搜索流量的日子到头了?

Cloudflare 9 月 15 日上线 Disallow AI Training 设置,84 赞、51 条评论,让站长只拒绝混合用途爬虫的 AI 训练用途、继续被搜索收录。机制按「可信」(Accountable)标准识别爬虫运营商:需在 robots.txt 提供训练退出、提供摘要退出、提供 URL 级别的训练用途透明度,并承诺退出训练不影响搜索排名。Apple(Applebot-Extended)、Google(Google-Extended)、Microsoft(NOARCHIVE)均已提供或承诺提供对应机制;Amazon、Anthropic、Meta、OpenAI 的训练专用爬虫则在不影响搜索的情况下被拦截。设置位于域名级 Security Settings,原有 Block AI Bots 开关自动迁移。靠搜索流量吃饭又怕被白嫖训练的站长,这个开关终于不用二选一了。原文 · HN 讨论

24. 改口了!苹果被曝要用用户数据训练 AI,「永不」后面加了除非

对话框里那个不起眼的「以后再说」,你点了吗?

heise 9 月 13 日报道:苹果修改「负责任 AI」准则,把「你的私密个人数据和交互永不被用于训练基础模型」改成「除非你明确选择帮助改进它们」,28 赞、5 条评论。iOS 27 的隐私条款显示,苹果可存储 Siri 和听写交互的音频与文字记录,不关联 Apple 账户;激活 Siri AI 时会弹出求助改进的对话,无法完全关闭,只能在「设置 > 分析与改进」里事后关掉。报道还指出,依赖 Private Cloud Compute 的模型现在也包括运行在 Google 服务器上的部分。升级 iOS 27 的用户,建议先去这个设置项里检查一遍自己的默认状态。原文 · HN 讨论

25. 三个可用区全在战区!AWS 承认部分中东数据无法恢复

11 个 9 的持久性,敌不过地理集中?

据《华尔街日报》报道,AWS 表示无法恢复伊朗打击中受损的中东设施里的部分数据,50 赞、11 条评论。讨论指向 Bahrain 区域(me-south-1):有评论者称提供冗余的三个数据中心全部被摧毁,三个可用区挤在同一小片地理区域、同属一个政府管辖,多可用区冗余因此失效。丢了什么、丢了多少,官方未确认,评论者猜测是单可用区的 EBS 或 RDS,而非 S3。做灾备设计的,这条的核心教训是多可用区不等于跨地域冗余,「战争」不在云厂商故障模型的默认参数里。原文 · HN 讨论

26. 562 赞登顶 HN!救时间的都是这些小编程技巧

你会的那几个,团队里还没人用过吧?

Will Keleher 的《Small Programming Tricks》当天排 HN 第一,562 赞、251 条评论。论点:工程效率的大头不在高深知识,而在一行就能说清的小技巧;公司内部的「找谁问、跑哪条命令」同样算数。例子:git log -S 按字符串搜改动提交、bash 开 shopt -s globstar 后用 **/*.md 替 find、Node 里复用 https.Agent 让 fetch 保持连接、用 Math.floor(Math.log10(x)) 给指标做对数分桶。他建议资深工程师每天给团队分享一条。带新人的团队,这个清单可以直接当 onboarding 素材。原文 · HN 讨论

27. 一个月!M4 Mac Mini 跑起 Linux GPU 驱动,Minecraft 212 帧

作者说这可能是第一个全程 LLM 写的 GPU 驱动?

Cody Ho 公布为 Apple M4 写的 Linux GPU 驱动,414 赞、275 条评论,约一个月完成,通过 OpenGL ES 3.0 一致性测试,M4 Mac Mini 上 Minecraft 跑到 212 帧。方法:1、内核驱动不直接碰硬件,只和 Apple 的 RTKit 固件通信,A18 Pro 的 ABI 比 M1/M2 时代多出约一半结构体。2、用自家 hypervisor 抓硬件轨迹做净室逆向,再让 LLM 智能体做「抓取-重放」,逐步用源码重建全部对象。3、着色器编译器把 Mesa 的 NIR 中间码翻成 AGX 私有指令集。OpenGL 4.6、Vulkan 1.4、OpenCL 在路线图里,还挖出了 Metal 没有的能力:原生 64 位加法、128 倍各向异性过滤。研究 GPU 驱动和逆向的,这篇的工程方法比结果更值得看。原文 · HN 讨论

28. 异步链体积砍半、分配归零!.NET 11 性能改进盘点

每年几百个微优化,.NET 性能组是真爱这份工吧。

微软 .NET 博客发布 .NET 11 性能改进长文,309 赞、82 条评论。要点:1、async lowering 从 C# 编译器移到 JIT,10 个方法的异步链二进制从 10752 字节降到 5632 字节,同步完成路径从 21.2 纳秒降到 6.2 纳秒且零分配。2、可空装箱和链式枚举器的条件逃逸分析消掉临时分配,EqualityComparer<T>.Default.Equals 从 3.9 纳秒降到 1.8 纳秒。3、边界检查消除覆盖列表模式、位运算范围合并、checked 算术消去等场景,每条都附 PR 编号和基准数据。跑 .NET 服务的,这篇值得逐条对一遍自己的热路径。原文 · HN 讨论

29. 1.58-bit 守不住了?新打包法把三值模型压到 1.485 bit

原来模型里有一半权重是零,以前都白存了?

arXiv 论文《Breaking the 1.58-bit Barrier for Ternary LLMs》提出 BITCOS 打包格式,215 赞、33 条评论。背景:三值 LLM 每个权重只取 −1/0/+1,理论成本 1.585 bit,但主流做法五个权重塞一个字节,实际 1.625 bit。作者测了 29 个三值模型,零权重占比最高 51.5%,远高于等概率假设;BITCOS 用「存在位图+压缩符号向量」按零密度自适应布局,29 个模型里 26 个比传统打包更小,最稀疏的模型达到 1.485 bit。配套给出 AVX-512、AVX2 和 Intel Xe2 GPU 的解包优化,真实零密度下矩阵乘最快提升 1.28 倍,端到端解码吞吐 CPU 最多提升 18%、GPU 最多 27%。在 CPU 上跑三值模型的,这篇直接给了可落地的压缩和解包路线。原文 · HN 讨论

30. 日备 14 份、周备 7 份!一篇把备份讲透的长文

备份脚本谁都会写,恢复测试你做过几次?

Aleksandar Filipovski 发文《Backups Aren’t Simple》,267 赞、169 条评论。主线:每加一层保护就暴露一层新的失败模式,最后连爱折腾的人也认输改用成熟工具。要点:1、RPO 从金融机构的 30 秒到小商家的 24 小时以上不等,快照粒度应随时间衰减,即日备 14 份、周备 7 份、月备 12 份。2、数据库按批刷盘,直接拷贝运行中的库文件可能拷到损坏状态,必须先做 dump。3、S3 丢文件元数据、小文件上传又贵,逼得你打 tar 包,而 tar 会破坏硬链接去重,自己造轮子在云存储这层断掉。结论:Borg 或 Restic 处理加密、块级去重和校验和,每 6 个月做一次恢复演练。管自己服务器数据的,这篇能帮你把方案里的洞一个个对上号。原文 · HN 讨论

31. 6.8 万星!OpenSpec 给 AI 编码加了一层 spec 流程

没有 spec,agent 改需求全靠猜吧?

Fission-AI 的 OpenSpec 是一个 MIT 协议的轻量 spec 框架,156 赞、72 条评论,GitHub 6.8 万星,自称每 2 秒产生一个新 spec、月活开发者 26.5 万。工作流五步:/opsx:explore 摸清问题和代码库、propose 产出 proposal.md 和 specs 目录、apply 按 spec 实现、verify 对照规格验收、archive 归档。每次变更以 specs 目录为对齐单位,支持 Claude Code、Codex、Cursor、GitHub Copilot 等主流编码工具。让 agent 动生产代码的团队,这套「改需求先改 spec」的流程可以直接抄。原文 · HN 讨论

32. 47.3% 原来是 78.7%?物理教授给前沿模型重新打分

是模型不行,还是题目和参考答案本身有错?

arXiv 论文《How good are frontier models at physics?》让物理系教师和研究生审计 HLE-Physics、CMT、CritPt、UGPhysics、PRISM、PHYBench 六个基准,94 赞、48 条评论。他们发现大量「模型答错」是题目歧义、参考答案错误或自动评分出错,修复后只在验证过的子集上重算:GPT-5.6-Sol 在 HLE-Physics 上从 47.3% 升到 78.7%,在 CMT 上从 61.0% 升到 87.2%,CritPt 保留的 54 题上 pass@4 达 94.4%。署名作者 51 人。拿基准分数做模型选型或写报道的,这篇的提醒很直接:先查题目质量,再谈模型能力。原文 · HN 讨论

33. 74 赞对 284 条评论!一张 AI 菜单海报逼哭咖啡馆老板

换成你,一天之内撤掉还是硬扛?

Business Insider 报道:一位咖啡馆老板在负责黑板菜单的员工离职后,用 AI 做了一张临时打印菜单,印刷花了约 150 美元,随后收到敌对私信,有人下最后通牒「给你一天考虑,不撤就告诉本地艺术家圈」,她回复「要发就发」,自称「被攻击得够了」。74 赞但 284 条评论,争议大致四派:1、AI 食物图涉嫌虚假广告,菜根本没长那样。2、小生意图快图省,AI 只是替代了过去同样低质量的菜单。3、艺术家丢的是真金白银的委托。4、消费者用脚投票可以,协调围攻和威胁越线。做 AI 工具和本地服务的,这个案例是「AI 使用透明度」在最小的商业单元里爆开的一次实录。原文 · HN 讨论