2026-09-19

AI 前沿每日 Briefing:2026-09-19

OpenAI 内部仓库被两个漏洞打穿,458 赞登顶;微软高管把 AI 抓取称为「人类史上最大的劳动盗窃」,826 赞 728 评论成当天最大争议;AI 生成的假情报差点让美军登上一艘中国船;Qwen 3.8 Omni Flash 发布,100 万 token 上下文吃进图文音视频;ZCode 被曝静默上传整个 Git 仓库;16GB 显存跑 27B 全长上下文;四大编程 agent 全中招的零点击 RCE;Telstra 全网以为自己活在 2006 年。

2026-09-18(UTC)的 HN 首页 86 条,其中 9 条评论数超过赞数。今天的头条是 Hacktron AI 用 libheif 堆溢出加 SSO 配置缺陷打穿 OpenAI 内部仓库(458 赞);最大的争议在微软高管把 AI 抓取称为「人类历史上最大的劳动盗窃」(826 赞 728 评论);模型侧阿里发布 Qwen 3.8 Omni Flash,100 万 token 上下文一次吃进图文音视频。共 40 条,覆盖安全与治理、模型与智能体、AI 编程工具、工程基础设施和行业动向。更新版新增 8 条:Cloudflare Quick Tunnels、RP2350 激光故障注入、C++26 平凡死循环、编码 agent harness 消融研究、x86 模拟在 ARM 上的性能悬崖、Ax-check、美国边境手机搜查裁定、美债的外国官方买盘。

1. 458 赞登顶!两个漏洞打穿 OpenAI 内网仓库

从论坛到内网仓库,一路都没人拦?

Hacktron AI 研究员 Harsh Jaiswal、Mohan Pedhapati、Rahul Maini 公布入侵 OpenAI 内部仓库的完整链条,458 赞、196 条评论,当天首页第一。链路分四段:1、OpenAI 社区论坛用的 Discourse 装在 Debian 上,libheif 1.19.8 有一个上游早修掉但没发 CVE 的堆溢出,图片经 ImageMagick 处理时触发远程代码执行;2、OpenAI 自身的 SSO 配置缺陷让被攻破的论坛账号升级为 ChatGPT、Codex 账号接管,全程无需用户交互;3、一名员工的 Codex 连着 GitHub 组织;4、他们直接在内部 monorepo openai/openai 提交编号 1186742 的 PR 作为证明,随即停手。整条利用链由 Claude 辅助写出:Opus 4.8 卡在地址随机化,Opus 5 发布几小时内交出可用 exploit,从发现到进仓库不到 72 小时。OpenAI 9 月 1 日发了 6500 美元赏金,且只覆盖 SSO 那一半。跑 Discourse 或用 ImageMagick 处理上传的,先查 libheif 版本(已修到 1.23.4)。原文 · HN 讨论

2. 826 赞 728 评论!微软高管:AI 抓取是「人类史上最大的劳动盗窃」

备忘录里敢写,发布会上怎么不见说?

《纽约时报》诉 OpenAI、微软案新解封文件显示,微软应用科学总监 Brent Hecht 在 2023 年 1 月的内部备忘录里把抓取训练数据称为「史无前例的惊人盗窃」和「人类历史上最大的劳动盗窃」,826 赞、728 条评论,当天评论量第一。同批文件里:微软内部数据称 Copilot 让《纽约时报》链接的点击通过率最多下降 93%,被内部叫作「doom loop」;OpenAI 的 Nick Turley 承认出版商面临「生存威胁」,因为产品「很大程度上是可替代的」;Nadella 作证说「任何付费墙内容,想用就该去取得授权」。原告律师的解读是:这些公司「明知自己在做什么」。做内容或靠搜索流量吃饭的,这几页证词值得读全文。原文 · HN 讨论

3. AI 编的假情报差点让美军登上一艘中国船

差一步就是战争,这稿谁来核?

CNN 独家:2026 年春美伊交战期间,一份由特种作战司令部分析师借助聊天机器人生成的情报报告在美军内部流转,称一艘中国船在中东运输核武器计划部件,298 赞、240 条评论。军方随即规划拦截:武装人员准备登船,军机已经升空;临行动前复查才发现报告「完全是假的」;聊天机器人把开源情报和信号情报拼在一起,错误识别了船上货物,消息源称此事「差点引发一场战争」。线索来自驻夏威夷的美国特种作战司令部太平洋司令部的原始舱单,分析师还用 AI 把结论包装成标准格式后分发。特种作战司令部和五角大楼未回应置评请求。用 LLM 做情报摘要的,「生成后由人核实」这条不能省。原文 · HN 讨论

4. 100 万 token 上下文!Qwen 3.8 Omni Flash 一口气吃下图文音视频

一小时视频喂进去,账单还降了?

阿里 Qwen 团队发布 Qwen 3.8 Omni Flash,325 赞、123 条评论。1、输入:文本、图片、音频、视频,单次调用可处理约一小时连续音视频,上下文 100 万 token,输出最长 13.1 万 token;2、官方称约 29 个基准上平均分比 Qwen 3.5 Omni Plus 高 25–26%,音频输入价格降 98% 以上,音视频输入降 93% 以上;3、只提供托管 API(QwenCloud、阿里云百炼),没有开放权重,思考模式默认开启,接口兼容 OpenAI API,另有一个走 WebSocket/WebRTC 的实时版。要处理长视频字幕、会议纪要的,今天就能在百炼控制台直接调。原文 · HN 讨论

5. 一份快照 4.2 万个文件!智谱 ZCode 被曝静默上传整个 Git 仓库

加密了,可钥匙不在你手里?

开发者 ferstar 9 月 18 日发文,逆向智谱官方 AI 编程桌面应用 ZCode 后发现:登录状态下客户端会把整个工作区打包上传阿里云 OSS,223 赞、86 条评论。一个快照含 42,411 个文件、压缩后 313MB,其中 .git 目录占 86.6%,真正源码只占 13%;数据用 AES-256 加密、密钥经 RSA 包裹,私钥只存在云端,用户自己解不开。作者是在清理磁盘时发现 ~/.zcode 超过 700MB、一个上传任务的重试计数到 564 才追查的;界面两个开关一个只管训练用途、一个只管服务端索引,都不拦截采集和上传,删掉待传快照还会立刻重新打包。macOS 用 chflags uchg、Linux 用 chattr +i 锁住 checkpoints 目录可挡住。用 ZCode 的,先锁目录再等官方回应。原文 · HN 讨论

6. 691 赞对 681 评论!一个华威学生把 passkey 的不满全列了出来

省了密码,换来把自己锁外面?

华威大学 CS 学生 Ethan Hawksley 的长文列出不喜欢 passkeys 的理由,691 赞、681 条评论,当天争议最大的条目之一。核心论点:passkey 防的是钓鱼,但个人账号更大的风险是永久锁死、自动封号和设备丢失。1、硬件密钥不能备份只能增删,一把 key 大约存 25–100 个账号,想备份要买两三把;2、Apple、Google 把 passkey 绑在自家账号上,账号被封会连带丢掉所有第三方登录;3、FIDO 的跨平台导出机制各家实现不一,密码至少是个能手抄的字符串。他自己的方案是密码管理器随机密码加独立 TOTP 应用;他也承认对复用密码的人来说 passkey 是大改进。企业管账号可以上 passkey,个人先把恢复路径想清楚再迁。原文 · HN 讨论

7. 497 赞首页第六!有人做了个网页,专测模型「选没选」靠不靠谱

模型嘴上选的,是它真想选的吗?

独立研究者发布 OpenJev(现更名 SemIf),497 赞、234 条评论。这个纯浏览器本地运行的 demo 让本地小模型做真实决策,再对比两种读法:1、直接读选项位置的 logits,只在给定选项内归一化;2、让模型把同一个概率分布逐 token 写成 JSON。测的三个模型(Qwen3 0.6B、MiniCPM5 2B、Qwen3.5 4B)自带题面得分分别为 44.0%、68.6%、81.3%,而 TypeSafe 的参考实现 Jev 是 88.3%,页面明确说小模型「没有一个达到 Jev 的水平」。权重从 Hugging Face 缓存,输入不出页面,无需注册。做 agent 决策链或评估工具调用可靠性的,这个对比思路可以直接搬。原文 · HN 讨论

8. 整个网络以为自己活在 2006 年!澳洲最大运营商瘫了一夜

导航卫星的日历,也能坑倒全国?

Netnod 复盘澳洲电信 7 月 8 日大故障,86 赞、32 条评论。一台墨尔本机框里的 GPS 接收卡固件过期,重启后把日期算回 1024 周(约 19.6 年)前;恰逢 2020 年设备升级把冗余的授时架构改成单源加对等互联模式,这台服务器被顶成 stratum 1 后,全网再没有任何独立信源能纠正它。时间一错,TDD 5G 小区的收发窗口对不上,网络等于自己干扰自己:语音、短信、报警电话、火车、支付终端全部受影响。独立调查的结论是「协议没问题,架构有问题」。授时要按关键基础设施管:留真正独立的冗余源、固件按周期升级(这个补丁六年前就发布了)、7×24 告警要有人认领。自建机房或运维运营商级网络的,这份整改清单值得逐项对。原文 · HN 讨论

9. 301 赞争议长文!一门 AI 时代的新语言,被同行拆了台

造了门新语言,没读过这行的书?

Liam Powell 发文质疑 Bend 2,301 赞、227 条评论。Bend 的设定是人写「法则」(规约)、AI 生成实现和证明、编译器验证证明;Powell 指出其主页和代码库里「形式化验证」这个词一次都没出现。他把 Bend 官方 demo「玩家永远碰不到旗子」重做了一遍:Bend 里法则要 58 行,AI 生成的证明有 442 行;换 SPARK 这套开源形式化验证方案,直接让 LLM 生成,GNATprove 跑出「12 项检查全部证明通过」,且不需要手写证明。他的结论不是 Bend 不行,而是 vibe coding 的通病:LLM 会照单实现一个有缺陷或在重复造轮子的设计,却不提醒你先看看领域内的既有地基。让 agent 起新项目的,先把领域内已有方案问一遍再动工。原文 · HN 讨论

10. 5 周 400 亿 token!「数学外行」拉着 AI 证明 Conway 50 年猜想

外行加 AI,要抢数学家的饭碗了?

Dan Abramov(React 作者)发文记录用 AI 证明 Conway 精化猜想的过程,182 赞、170 条评论。这个约 50 年前的猜想关乎超实数里的「全整数」:ab=cd 时,因子能否拆成公共部分。他自称数学外行,用约 5 周空闲时间搭了一个多 agent「实验室」:PM agent、数学 agent、专门唱反调的 Red、Lean 形式化 agent,前后两次推倒重来,只抢救回 10–15% 的有效工作;累计消耗约 400 亿 token(2.1 亿输出),API 花费约 4 万美元,Lean 机器验证已通过 Palomar 注册检查,证明建立在 2024 年 L’Innocente 与 Mantova 的论文之上。他自己强调:数学家尚未独立验证,欢迎反驳。想用 agent 啃硬问题的,这篇的复现路径和踩坑记录比结果本身值钱。原文 · HN 讨论

11. 287 赞!Android 17 首次闭源加新 API,GrapheneOS 怒发文

开源十几年,这就要收网了?

GrapheneOS 官方账号发文:Android 17 QPR1 是自 Android 3.x 时代以来第一个不随 AOSP 发布源码就新增 API 的版本,287 赞、128 条评论。此前 Google 虽经常延迟推送源码,但新 API 一直随 AOSP 公开;这次闭门加 API,意味着 LineageOS、GrapheneOS 这类衍生系统在源码落地前无法跟进对等实现。HN 讨论里不少人认为这是 Google 收紧 Android 开放性的又一步,也有人把动机指向 HarmonyOS 这类兼容 Android 的封闭系统带来的竞争压力。做 ROM 或依赖 AOSP 构建产品的,要把「源码延迟甚至不落地」当成常态风险排期。原文 · HN 讨论

12. 一次故障拦住 950 万次多余请求!Uber 的重试防风暴机制公开

重试谁不会,难的是知道该谁重试。

Uber 工程博客公布防重试风暴的机制,109 赞、49 条评论。问题是:下游故障时各级服务一起重试,一条 7 层调用链里每层重试一次,故障点的流量就是原来的 8 倍。解法分两步:1、重试预算,只允许一小部分请求触发重试,10% 的预算把同场景峰值从 8 倍压到 1.33 倍;2、错误归属,失败的服务若只是下游错误的「症状」就声明不拥有错误、告诉调用方别再重试,只有真正的源头才允许重试。效果:2025 年 11 月 18 日一次五层以下的核心服务故障中拦下 950 万次无谓请求;重试风暴的最大波及深度从 25 层降到 3 层,平均值从 20 层降到 2 层。写微服务的,「预算加归属」这两件套比加随机抖动更治本。原文 · HN 讨论

13. Waymo 进新加坡!2028 年目标公开运营,还是那批 I-PACE

出了北美第一城,规矩谈拢了吗?

Waymo 宣布进入新加坡,119 赞、143 条评论。计划分三步:1、明年起先以人工驾驶方式做地图绘制与验证,车辆为纯电捷豹 I-PACE、第五代 Waymo Driver;2、目标 2027 年拿到陆路交通管理局对自动驾驶系统的批准;3、2028 年面向公众开放服务。合作方包括新加坡交通部与 LTA,数据按新加坡 PDPA 处理。这是 Waymo 首次在北美以外落地。关注 Robotaxi 出海的,新加坡的审批节奏就是后续进其他亚洲市场的参照。原文 · HN 讨论

14. 570 个改动不发 PR!Zed 团队把工作流整个换了

PR 都取消了,评审去哪看?

Zed 发布 Delta 公测,129 赞、87 条评论。Delta 是「和 agent 一起写代码、一起评审」的多人环境:底层 DeltaDB 在 Git 版本之上记录增量编辑和人与 agent 的消息,保留代码是怎么一步步变过来的;Git commit 仍是推送和构建的检查点。评审方式变成直接把同事邀请进 agent 对话线程,评审子线程有隔离的 worktree 副本,试完可以合回。Zed 自己的 repo 已关掉 PR:33 名团队成员以来往 main 落地 570 个改动;不用 Delta 的人看到的仍是一个普通 Git 仓库。公测期免费,之后出付费版但承诺保留免费档。带 agent 做团队开发的,可以拿它对照一下现在的 PR 流程哪里开始碍事。原文 · HN 讨论

15. 数据泄露罚金提到营收 10%!Coupang 那单 6246 亿才刚开始

罚到肉疼,才算数?

韩国个人信息保护委员会修订《个人信息保护法》,9 月 11 日生效,161 赞、45 条评论。新规:因故意或重大过失泄露 1000 万人以上个人数据的企业,罚金上限从年销售额 3% 提高到 10%,三年内重复违规或拒不整改后再泄露同样适用。配套条款:高风险情形下即使未确认泄露也要 72 小时内通知用户;勒索软件损坏数据同样触发报告义务;有数据保护投入的最多可减罚 40%,主动发现并及时报告再减 40%。参照系:Coupang 6 月因 3755 万人信息泄露被罚 6246 亿韩元,按新标准上限会到数万亿韩元。出海韩国业务的,合规预算得按新上限重算。原文 · HN 讨论

16. 27B 压到 13.1GB!有人把 Qwen 3.8 做成了单卡甜点

显存不够的日子到头了?

多伦多团队 ByteShape 发布 Shapelearn 版 Qwen 3.8 27B GGUF,96 赞、38 条评论。默认档 GPU-5(IQ4_XS 量化)只要 13.1GB 显存,聚合跑分达 BF16 版的 99.63%;GPU-4(IQ3_S)压到 11.0GB,也有 98.72%。速度实测:RTX 5090 上 GPU-5 约 93.7 tok/s、GPU-4 约 103.6 tok/s,4090 上分别约 59.2 和 67.8,3090 约 45.8 和 49.5。开 MTP 投机解码再快 1.28–1.66 倍,DFlash2 可到 1.34–2.10 倍(多占约 1.1GB 显存、纯文本)。权重已传 Hugging Face(byteshape/Qwen3.8-27B-GGUF),测试卡覆盖 RTX Pro 6000 到 5060 Ti。想在 4090/5090 上本地跑 27B 的,这套量化是目前数得着的省心选项。原文 · HN 讨论

17. 8MB 模型追平 DeepSeek V4 Flash?Cactus Needle 3 做到了

小成这样,手机总带得动了吧?

Cactus Compute 发布 Cactus Needle 3,128 赞、66 条评论。整个模型是一个 8–29MB 的二进制:层数即体量,前 4 层是 8MB 模型、20 层全满是 29MB;底层是 2900 万到 1.21 亿参数的 Laddered Simple Attention 网络,CQ2 两比特量化,用 360B token 结构化数据训练。干三件事:1、工具调用,选对函数、填对参数、按序返回多次调用,不匹配时返回空列表;2、结构化抽取,把发票、订单这类乱文本按 schema 变成 JSON;3、文本 embedding 做本地检索和去重。DroidCall 基准上,经平台微调后的子网络从 2900 万参数起就超过 DeepSeek V4 Flash,微调能给子网络提升 18–36 个百分点;树莓派 5 上解码 400–4000 tok/s,Mac M 系列最高 4.2k tok/s。做端侧语音助手和穿戴设备的,GitHub 仓库已有 4.2k 星。原文 · HN 讨论

18. Claude Code 2.1.277:没有 CLAUDE.md 就读 AGENTS.md

一个文件名,也讲上兼容了?

Claude Code 更新 2.1.277,61 赞、27 条评论。项目里没有 CLAUDE.md 时,Claude Code 改读 AGENTS.md,可在 /config 的 Project instructions 里改回;Bedrock、Vertex、Foundry 部署上还没有。同一版还修了一个安全问题:子 agent 的结果现在带明确头部、以缩进格式交给主 agent,子 agent 输出里的文字没法再冒充会话本身的指令,这对防注入是实打实的一刀。另外删掉了废弃的 TaskOutput 工具,改用 Read 读后台任务输出;上一个版本 2.1.276 是同天发的热修,解决代理网关场景下请求报 400 的回归。同时维护两套说明文件的团队,现在可以只留 AGENTS.md 一份。原文 · HN 讨论

19. 四大 AI 编程 agent 全中招!一个分支名就能零点击 RCE

装插件那一刻,谁替你看过代码?

Air Security 实验室公开 Plugin4Shell,11 赞、3 条评论。问题出在 SHA 固定校验的绕过:agent 克隆插件仓库后 checkout 指定 commit,但从不验证 checkout 结果真落在那个 commit 上。1、Claude Code、Codex、Copilot:攻击者建一个与固定 SHA 同名的分支并设为默认分支,Git 优先解析引用名就绕过了固定;2、Gemini CLI:fetch 把目标 commit 放进 FETCH_HEAD,checkout 时被同名默认分支顶替。配合默认开启的后台插件自动更新,攻击者可以先 benign 上架、再换恶意代码,零点击感染所有装机用户。时间线:5 月发现,Claude Code 在 2.1.179(6 月 17 日)、Codex 在 0.146.0(8 月 12 日)修复;Gemini CLI 官方确认不修、建议迁移 Antigravity;Copilot 截至发文没有修复。修法也简单:checkout 后断言 git rev-parse HEAD 等于固定 SHA。用 agent 插件市场的,先确认自己的 agent 版本带这个校验。原文 · HN 讨论

20. jemalloc 5.4.0 发布!160 多个 commit,顺手收拾七个老开关

内存分配器也要定期大扫除?

jemalloc 发布 5.4.0,317 赞、85 条评论。这版以技术债清理为主:1、新增 mallctl 接口统计 HugeTLB 等 pinned 内存;2、free、free_sized、free_aligned_sized 现在保证不改动 errno,free_sized 接受 NULL 以对齐 C23 语义;3、tcache 的填充与保留目标改为按两次 GC 之间的实际需求自适应,七个旧调优参数被移除,设置后静默忽略,这是不兼容变更;4、前端代码模块化,PAI 虚表分发换成直接调用,并给 base block 增长加了上限防虚拟内存耗尽。修掉的毛病包括 arena_reset 死锁、size-class 溢出检查等。用 jemalloc 又调过 tcache 参数的,升级前先核对被删参数清单。原文 · HN 讨论

21. 近 8 万人实测!聊天机器人在说服这件事上越来越熟练

被说服的时候,你察觉得到吗?

《科学》杂志发文梳理聊天机器人说服研究的进展,74 赞、91 条评论。报道讨论的核心实验:近 7.7 万名英国参与者与 19 个模型就 700 多个政策议题对话。几个结论:1、最有效的策略是让机器人堆尽量多的事实和信息,平均说服位移约 11 个百分点,比单纯要求「有说服力」高约 3 个点;2、按说服优化的最强模型把初始反对者移动了 26.1 个百分点;3、工程手段比规模重要:微调对说服力的提升约 51%,提示工程约 27%,模型大小影响不大;4、代价是越会说服的机器人准确性越差,会生成更多虚假陈述。HN 讨论里一个反复出现的点:模型不占立场、不会「输」,人反而更容易被说动。做聊天产品和推荐系统的,「说服力和准确性」这条 trade-off 是设计红线。原文 · HN 讨论

22. 纯数学再省 100TB 内存!Cloudflare 公开一致性哈希瘦身法

连哈希点多少个都要算清楚?

Cloudflare 博客公布其负载均衡器 PBR 的省内存方案,101 赞、18 条评论。一致哈希给每台服务器分配多个哈希点来摊平负载,传统默认每服务器 160 个(NGINX 同款)。Cloudflare 推出误差随哈希点数的精确公式,发现最后约 9 万个点对误差的改善只有 0.7%,于是把点数砍掉 90%,误差几乎不变。再配合把 32 位索引压成 16 位(Rust 结构体对齐规则会把省下的空间又吃回去,最后改成裸 6 字节数组加 getter),单实例内存大降。迁移按数据中心灰度、新旧哈希环并行跑,留好回滚路径防缓存集体失效。全网推广后共回收超过 100TB 内存,和此前 DNS 团队省下的 100TB 是两次独立成果。新哈希环 v2 藏在 pingora-ketama crate 的 cargo feature 里。用一致哈希做分片的,这个误差公式可以直接套。原文 · HN 讨论

23. 一个不起眼的浮点值,Intel 芯片碰了慢 50 倍

你代码里的零头,就是这么贵?

Daniel Lemire 实测次正规浮点数(subnormal)在 Intel 上的代价,61 赞、45 条评论。IEEE 754 里比最小正规数还小的数走特殊编码,Intel 核心中凡乘法或除法碰到这类数,无论作输入还是输出,都走微码慢速路径:Granite Rapids、Emerald Rapids 上含次正规数的乘法约 8.4–9.3 纳秒/元素,正常数约 0.2 纳秒,慢 45–50 倍;相关依赖链的延迟从 4 拍涨到 128 拍。向量代码里哪怕只有 1% 的次正规数也会拖慢整个块。对照组:AMD Zen 5 几乎全速,Arm(Graviton 5、M4 Max)完全没有惩罚。在 Intel 上跑数值负载的,可以评估 FTZ/DAZ 模式把次正规数冲成零;游戏和 ML 代码早就在这么干,新数据说明这是 Intel 特有的问题。原文 · HN 讨论

24. 96 岁巴菲特卸任!长子接董事长,CEO 早已换人

一个时代翻篇了,然后呢?

巴菲特辞去伯克希尔·哈撒韦董事长职务,275 赞、189 条评论。他转任荣誉董事长并留在董事会;接任董事长的是长子霍华德·巴菲特,1993 年起就在董事会,现任霍华德·G·巴菲特基金会主席;公司日常经营自 2026 年 1 月 1 日起已由 CEO Greg Abel 执掌。巴菲特给两人分了工:「Greg 经营公司,霍华德守护文化和价值观。」他 1965 年接手伯克希尔,1970 年起任董事长,把公司做到约 1 万亿美元规模,外界也首次看到了约 1400 亿美元规模的 succession 安排全貌。关注全球资金面的,伯克希尔后续调仓比人事更值得盯。原文 · HN 讨论

25. AI 峰会场外,抗议者说梗图不值这些淡水

骂声到门口了,行业听见了吗?

9 月 16 日蒙特利尔,数千名 AI 行业人士与加拿大联邦 AI 部长 Evan Solomon 出席行业活动期间,反 AI 抗议者在场外游行,51 赞、82 条评论。标语矛头指向能耗和用水:AI 生成的传单和梗图「不值这个行业消耗的淡水」,部分抗议者宣称 AI 构成生存威胁。游行沿 René-Lévesque 大道行进,警方骑马维持秩序。做 AI 基础设施的,选址和沟通策略里,水电占用和社区反弹已经是绕不开的变量。原文 · HN 讨论

26. 错误率 20.6% 降到 6.8%!Grok 语音转写 2.0 发布

语音这块,xAI 也要挤进来了?

xAI 发布 Grok Voice Transcribe 2.0,22 赞、7 条评论。官方口径:准确度是 1.0 的两倍、价格不变;车内指令这类短语的词错误率从 20.6% 降到 6.8%,内部评测覆盖 19 种语言,支持录音中自动切换语言。在 Artificial Analysis 榜单上排 32 个流式模型的准确率第一,电话音频(8kHz)内部评测领先;对标 ElevenLabs Scribe v2、Deepgram Nova-3、Gemini 3.5 Transcribe Live、Azure STT。价格:批处理每小时音频 0.10 美元、流式 0.20 美元,说话人分离、时间戳、关键词偏置不另收费;API 向后兼容,1.0 几周内下线。Atlassian Loom 已用它替换原有转写并报告更准确。做语音产品的,这个价位值得拿自己的语料跑一遍。原文 · HN 讨论

27. 16GB 显存跑 27B 全长上下文!一键包把门槛打到地板上

本地跑大模型的门票又降价了?

MiaAI-Lab 发布 Qwen 3.8 27B 的单卡部署方案,24 赞、8 条评论。技术三件:1、EXL3 量化(ExLlamaV3),启动脚本按剩余显存自动选 2.0–6.0 bpw 位宽;2、int4 KV cache(与 fp16 的 KL 散度在 0.001 以内);3、MTP 投机解码。实测 16GB 卡上:3.0 bpw 跑 14.8 万 token 纯文本上下文(带图 11.8 万),2.5 bpw 到 21.2 万,4.0 bpw 能吃满 26.2 万全上下文;质量从 2.0 bpw 的「可用」(mean-KL 约 0.35)到 6.0 bpw 的近无损(0.007)。装完自带 OpenAI 兼容 API(8888 端口)和 DeepSeek Harness 聊天界面(3080 端口),支持工具调用和图片输入。模型 Apache-2.0、脚本 MIT,预编译 wheel 免装 CUDA 工具链,要求 12GB 以上 N 卡、驱动 570+。手里有 12–16GB N 卡的,这是最省事的一键路线。原文 · HN 讨论

28. Mickens 发问,靠模型自己汇报来管模型,走得通吗

靠 AI 汇报来管 AI,这路通吗?

哈佛的 James Mickens 在 arXiv 发表《语言不可读性对 LLM 安全的影响》,29 赞、12 条评论。论点:模型的外部语言产物(链式思考、自我批评)未必代表它内部的计算过程:内部是「激活空间上的数学」,到语言的映射是有损的。推论:依赖语言自我报告的防御,包括 CoT 监控、宪法式自我批判、按语言定义的特征向量做激活探测,在原理上就不完备;对足够不透明的模型,这种不完备不可避免。他给的底线是非语言机制:污点跟踪(标记绝不允许被模型输出影响的系统状态)、加固虚拟化、请第三方审计沙箱配置,并指出这些能缓解近期前沿模型的沙箱逃逸事件。做 agent 安全评估的,「语言监控只能当辅助」这条应该写进评估框架。原文 · HN 讨论

29. 关掉脑子让 AI 写代码?Dan Luu 说这条路走不通

真到那一步,老板还需要你吗?

Dan Luu 长文论证「肉代理」式开发(不核实输出、循环跑 agent)对个人是死路,167 赞、145 条评论。逻辑链:这种方法论现在「勉强能用」,随模型变好显得越来越划算;但模型好到能这么产软件的那天,公司直接把 LLM 挂进循环、把员工裁掉即可,不存在一个「关掉脑子也能行」的时间点。佐证:Gary Bernhardt 观察到人工评审把 agent 的 diff 砍到只剩 25%;他审过某意见领袖号称「编程已解决」的项目,要么跑不起来要么很糟;ChatGPT 给桌游 Dominion 新人的建议「对一半错一半」。他的建议:监督 agent、亲手处理分布外的情况、把模型能力提升用来抬高自己的交付标准。靠 agent 出货的,这篇值得收藏。原文 · HN 讨论

30. 编译 58.6 秒砍到 21 秒!Devin 新功能专扫这类问题

让 agent 自己找优化点,靠谱吗?

Cognition 给 Devin 上线 Code Scans,26 赞、9 条评论。用法是在 Devin 里输 /scan,给一个宽泛目标(「提升 SEO」「降低维护成本」「让编译更快」),它先调查整个代码库,给出带证据的优先级列表,你勾选后它开 PR。底层是 Agentic MapReduce 四阶段:Plan(研究仓库、定规则)、Shard(把匹配代码分片)、Map(并行 agent 逐片调查)、Reduce(汇总去重、统一排序)。官方公布的实测数据:Dioxus 仓库的 Rust 编译时间干净构建从 58.6 秒降到 21.0 秒,降幅 64%;对 devin.ai 和 cognition.com 做 SEO 扫描找出 44 个问题,修完 Ahrefs 健康分从 87 升到 92;飞利浦团队测试期报告 96% 的 PR 合并率、省下 700 多个工程小时。有积压技术债的,可以拿它先扫一轮编译时间和 dead code。原文 · HN 讨论

31. 8.75 亿美元买 AI 修空管!FAA 的新计划官宣

缺人的窟窿,软件补得上吗?

据《华尔街日报》报道、TechCrunch 转述,美国联邦航空管理局启动 SMART(Strategic Management of Airspace, Routes, and Trajectories)平台,12 年合同总价 8.75 亿美元,25 赞、17 条评论。系统由 Air Space Intelligence 开发,是部署在云上的 AI 平台:综合航司时刻、天气、机场容量、空域条件和运行限制,预测流量模式、提前发现潜在冲突,给空管员做决策支持; rollout 从华盛顿都会区开始,再扩展到其他地区。背景是美国空管员长期短缺,FAA 同时在推新的招聘计划。做 govtech 或安全关键 AI 的,政府愿意为这个品类出的价码,就是信号。原文 · HN 讨论

32. cp、mv、rm 全换 Rust!Ubuntu 完成 coreutils 切换

用了三十年的工具,说换就换?

Phoronix 报道,Ubuntu 26.10 把 cp、mv、rm 三个命令切到 Rust Coreutils(uutils),标志整个切换 100% 完成,24 赞、1 条评论。Ubuntu 从 25.10 开始用 Rust 版替换 GNU 版系统工具,25.10 和 26.04 LTS 都因兼容问题留下过这三个命令,现在上游 uutils 补齐了。26.10 beta 本月内发布,正式版定档 10 月 15 日。批处理脚本依赖 cp、mv、rm 具体行为(退出码、报错格式)的,升级前拿自己的脚本集过一遍回归。原文 · HN 讨论

33. 735 赞!一行命令 3 秒把本地服务暴露到公网,连账号都不用

本地调 webhook,再也不用先折腾端口映射了吧?

Cloudflare Quick Tunnels 735 赞、290 条评论。用法是一行 cloudflared tunnel --url http://localhost:8000:约 3 秒生成一个临时 HTTPS 域名,不需要账号、不碰 DNS、不开放任何入站端口,连接只朝外建,流量经 Cloudflare 边缘加密回传。这轮更新的重点是把 hostname、边缘节点、健康状态以 JSON 打到 stdout,明显是面向编码 agent 的场景:agent 在评测和联调里可以拿真实回调 URL 去跑 Stripe、GitHub 这类 webhook 集成,不用拿假数据顶替。隧道随进程结束即失效,没有要回收的东西。本地起服务要接第三方回调的,这比 ngrok 免费档顺手。原文 · HN 讨论

34. 198 赞安全长文!25 万美元的激光设备,打开了 RP2350 的「永久」调试锁

「永久禁用」四个字,敌不过一个寄存器?

Ledger Donjon 硬件安全实习生 Antoine Plin 于 7 月 28 日向树莓派披露:RP2350 的 DEBUG_DISABLE OTP 标志本该永久关闭调试,但数据手册允许 DEBUGEN 寄存器覆盖它,这个寄存器没有冗余编码、奇偶校验或多数表决,软件锁也拦不住激光改位。攻击分两步:1、芯片开封后做光子发射显微,让 Secure 代码循环翻转位掩模,每个掩模平均积 200 帧图像降噪,定位 4 个开关位;2、用 980nm、约 1.2W 的 100 纳秒激光脉冲经 50 倍物镜逐位翻转,凑出 DEBUGEN=0xc 的持久 Secure 调试权限,再从 OTP 读出 128 位秘密。门槛是开封加约 25 万美元实验设备,属实验室级攻击,安全启动和硬 OTP 锁不受影响。做嵌入式安全的,结论很直接:安全分析要覆盖整条执行路径,单个机制各自牢靠不算数。原文 · HN 讨论

35. 编译器连死循环都敢删!C++26 把这条 UB 修掉了

写了十年的 halt 循环,原来一直是定时炸弹?

P2809R3 进入 C++26,同时按缺陷报告处理、编译器可以回溯应用:平凡无限循环(循环体为空、条件是值为 true 的常量表达式)从此是良定义行为,循环体被替换为 std::this_thread::yield()。背景是 C++11 的前向进度规则假设线程终会终止、做 I/O 或同步,没有副作用的无限循环因此是未定义行为,Clang 可以整体删掉——原文的 Godbolt 例子里,循环被删后 main 直接 fall through,执行到本不可达的代码。嵌入式和内核代码用死循环做 halt-on-error,被优化掉等于设备带着损坏状态继续跑,是真实的安全隐患。freestanding 实现是否替换由实现定义,裸机上故意的 halt 不会被强行变成 yield。写嵌入式代码或维护语言运行时的,升级工具链后值得把这类循环复查一遍。原文 · HN 讨论

36. 176 组对照实验!编码 agent 的上限在 harness,不在模型

四个模型跑同一个循环,差距全在窗口管理?

arXiv 论文(Run-Ze Fan 等八人)固定一个执行循环,在 SWE-Bench Verified 和 Terminal-Bench 2.1 上测 4 个模型、176 组设置,覆盖 5 种上下文管理策略、4 档窗口预算和 planning、动作空间的消融。结论四条:1、窗口预算越紧,上下文管理越决定成败,主要收益来自防止 context-overflow 失败;2、最优做法是规则化 elision 在前、LLM 摘要在后,做成可恢复的 elision 只增加机制复杂度,模型很少用到,准确率也不涨;3、planning 对弱模型是准确率支架,对强模型主要是省成本;4、预定义工具帮 bash 弱的模型,bash 强的模型用纯 bash 接口成本明显更低。自研 agent 框架的,这份消融清单可以直接当调参起点。原文 · HN 讨论

37. 816 倍的性能悬崖!FEX 细数 x86 模拟在 ARM 上真正的坑

苹果一个硬件开关,顶十年软件优化?

FEX 团队长文,281 赞、91 条评论:x86 模拟在 ARM 上的核心矛盾,是把 x86 的 TSO 强内存序架到 ARM 的弱内存序上。实测:1、非对齐访问,Cortex-X4 读写各掉约 50%,Oryon-3 读掉约 70%;2、WC(uncached)内存走 TSO store,带宽最差差到 816 倍,《空洞骑士:丝之歌》《深海迷航 2》因此不到 1 FPS;3、跨缓存行的 split-lock 只能尽力模拟,可能撕裂数据,违反 x86 的原子性保证,文中给的修法是 128 位 CASP 加安全失败加重试。文章点名苹果的硬件 TSO 模式是最佳路径,普通 load/store 即获得 x86 一致性、开销近零;高通 Oryon-3 的缓存行内一致性也值得肯定。在 ARM 本子或掌机上跑 x86 游戏的,选型先看芯片有没有硬件 TSO。原文 · HN 讨论

38. Vercel 拿 100 分、有网站 0 分!Ax-check 给 agent 体验打分

你的文档,agent 读起来也这样吗?

Show HN:Gauge 团队做的 Ax-check,32 赞、38 条评论,测的是「一个编码 agent 能在你的产品里走多远」。输入域名就启动真实 agent 会话并全程留档,产出 agent 体验基础项的评分和证据:vercel.com 拿 A(100/100),attio.com 84 分,elastic.co 65 分,也有 0 分的网站。接口对 agent 开放:POST /api/checks 启动,/report.md、/report.json、/status 轮询,报告内容明确标记为证据而非指令,防注入写进了产品设计。没有 MCP、CLI 或 SDK 的项目记 unassessed,不计入扣分。做开发者产品的,把自己的域名丢进去测一遍,比猜 agent 能不能跑通强。原文 · HN 讨论

39. 210 赞争议裁定!入境美国,手机可以没有任何理由被翻

那指纹和 Face ID,到时候还按不按?

美国联邦第二巡回上诉法院(案号 24-960)裁定,边境执法人员搜查入境旅客的手机无需搜查令,也无需任何合理怀疑,210 赞、173 条评论。判决书给出的理由是,边境搜查「仅因发生在边境即属合理」,主权者有权控制「谁和什么可以进入这个国家」。从 HN 讨论看,裁定针对的是执法人员手动翻阅这类手动搜查,未覆盖取证式的全盘复制分析;本案最终以银行欺诈与洗钱定罪收尾。现实层面,美国公民拒绝解锁不会被拒绝入境,但设备可能被扣押。常带设备出入境的,用旅行设备、数据留在远端过境后再恢复,比指望司法救济现实。原文 · HN 讨论

40. 从 38% 跌到 12.8%!外国央行正在离开美债市场

钱不是不来了,是换了批人来?

Wolf Street 根据美国财政部 TIC 数据(2026 年 7 月):外国官方(央行与政府)美债持仓降到 3.77 万亿美元,约等于 2012 年水平,而同期美债总存量已膨胀两倍;占可流通美债的比例从 2012 年的 34%(2007–2009 年峰值超过 38%)掉到 12.8%,为 1993 年以来最低。日本 2 月到 7 月减持 1350 亿美元,中国大陆加香港 12 个月减持 670 亿、较 2015 年峰值少 5870 亿。接盘的是七个离岸金融中心(合计 3.28 万亿美元),其中夹着对冲基金约 2 万亿美元的杠杆基差交易。10 年期收益率已回到 5% 上方。做资产配置或关心 AI 资本开支融资成本的,外国官方买家缺席,意味着利率的底比过去高。原文 · HN 讨论