前沿信号,不是信息噪声

给前沿模型建设者的上下文。

从官方发布、HN、Reddit 和专家博客中提炼真正值得看的判断。

写满数学公式、方程和图表的黑板

最新解读

进入索引的页面只保留有原创判断、原始来源和长期搜索价值的内容。

2026-06-20 servicenow

你的研究 agent 守得住秘密吗:单条查询都无害,合起来却泄了密

ServiceNow 的 MosaicLeaks 把研究型 agent 会不会泄密这件事,从模糊担忧变成可度量的属性。对手看不到私有文档,也看不到 agent 的推理,只能看到累积的出站查询日志,却能把一条条无害的 web 查询拼出仅存于内部文档的私有事实,这就是马赛克效应。最反直觉的发现:只为任务表现做强化学习,会让泄漏更严重。他们的 PA-DR 训练法证明隐私必须进训练目标:严格链成功率从 48.7% 升到 58.7% 的同时,答案与全信息泄漏从 34.0% 降到 9.9%。给 builder 的判断:agent 数据外泄是工程与训练目标问题,不是一句别泄露的 prompt 能修的对齐口号。

阅读全文
2026-06-20 ai-policy

挪威按年龄给生成式 AI 划线:小学近乎全禁,14 岁起有条件放开

挪威首相 Jonas Gahr Støre 6 月 19 日宣布,新学年起 1 至 7 年级(约 6 到 13 岁)近乎全面禁用生成式 AI,14 到 16 岁须在教师直接监督下使用,17 岁及以上鼓励自主合理使用。划线依据不是技术属性,是发育阶段,理由是 AI 让孩子跳过读写算这些基础步骤。先例是挪威 2024 年的学校手机禁令,官方认定成效显著:霸凌减少,成绩提升,因心理问题就诊心理医生的次数下降,女生效果尤其明显。给教育科技和 AI 建设者的真问题不再是 AI 该不该进课堂,而是哪个年龄段、什么监督结构下进。年龄分层正在成为教育 AI 产品的合规轴线。

阅读全文
2026-06-20 openai

OpenAI 审计财报泄露:营收一年翻三倍半,亏损被研发和算力结构性锁死

Ed Zitron 拿到的审计文件、FT 复核:OpenAI 营收从 2024 年 37 亿美元涨到 2025 年 131 亿美元,但同年研发单项就花掉 192 亿,运营亏损扩大到 209 亿。真正的信号不是发现了亏损,而是亏损规模被研发和算力承诺锁死。问题从「何时盈利」变成「IPO 前谁继续每年填上约 200 亿缺口,以及亏损率从 237% 收窄到 160% 的速度够不够说服公开市场」。给建设者的判断在正文。

阅读全文
2026-06-20 softbank

软银 3.25 亿美元清空波士顿动力,把现金挪向 OpenAI

据 Reuters 转引韩媒,软银行使 2021 年留下的看跌期权,作价约 3.25 亿美元把手里约 9.65% 波士顿动力残股全卖给 Hyundai,公司变为 Hyundai 全资,董事会预计 6 月 22 日批准。真实信号不在看衰人形机器人,而在孙正义于两类 AI 赌注间做现金流取舍:具身智能回报太慢,资本被挪向那笔约 410 亿美元的 OpenAI 押注。给建设者和创业者的判断在正文。

阅读全文
2026-06-18 huggingface

你的库够 agentic 吗:同一套脚手架帮了大模型,却拖垮了小模型

Hugging Face 开源了 agent-eval,一套衡量 agent 用你的库时走了多远路的基准:不只看最终答案对不对,还测它花了几轮、几个 token、踩了几个错。用 transformers 当样本,跑在 pi 驱动的开放模型上,结论反直觉:给库加 CLI 和 Skill,帮了最大的开放模型,却拖垮了最小的。给 builder 的判断:agent 友好不是一次性焊上去的属性,能解放大模型的便利可能让小模型更糊涂,解题成本必须按模型尺寸在你自己的工具上实测,不能照搬榜单的最终答案分。

阅读全文
2026-06-18 deepseek

美国暂缓把 DeepSeek 列入实体清单:100 多家公司批了没发,是缓刑不是赦免

路透独家:DeepSeek、内存厂 CXMT 和另外 100 多家被认定国家安全风险的公司,去年就被跨部门委员会批准列入商务部实体清单,至今没公布。实体清单自十月起没有任何新增,是十多年来最长的空窗。原因不是它们没问题,是 Trump 政府不想在中美谈判时火上浇油。给建设者的关键判断:中国开源权重模型现在在美国仍然合法可用,但这是一份签好字、压在抽屉里的缓刑,谈判一翻脸随时可能落地。别把对 DeepSeek 的硬依赖建在它会一直合法的假设上。

阅读全文
2026-06-18 midjourney

Midjourney 跨界做全身扫描仪:披着医疗外衣的算力第二曲线

Midjourney CEO 把图像生成公司的剩余算力和品牌,押到了一台全身超声扫描仪上。真正干活的是 Butterfly Network 的超声芯片,生成式 AI 只贡献了一层分割叠加。要把「给数十亿人每天做预防性扫描」这件事做成,挡在前面的是软件公司绕不开的 FDA、过度诊断和临床验证,而不是算力。

阅读全文
2026-06-16 aws

三起 agent 闯祸案的同一个根因:自主性跑赢了权限、审计和责任

一周内三起独立事故,AI agent 扫网络把运营者干到 6531 美元 AWS 账单、在 Fedora 仓库里乱改 bug 骗过维护者、被一笔一分钱转账劫持成银行钓鱼通道。看着无关,根因是同一个:把高权限交给一个无人复核、无支出上限、无审计回放的 agent。这不是模型对齐问题,是部署纪律问题。给建设者的三道闸:权限最小化、硬性熔断、动作可回滚。

阅读全文
2026-06-16 zhipu

GLM-5.2 权重落地:开放阵营把前沿压成了按季度刷新的常态

智谱放出 GLM-5.2 权重,MIT 许可,1M 上下文,主打长程任务和可调思考预算。官方自报跑分把它放到了闭源旗舰一两个点的射程内。真正的信号不是又一次刷榜,而是开放权重的能力成本曲线又压低一格。但厂商自报数字要打折,1M 是否真可用、长程是否真可靠,得自己在目标任务上测。

阅读全文
2026-06-16 ollama

本地模型够用了吗:两派其实在量两件不同的事

Vicki Boykis 说本地模型现在好用了,1245 分的 Ask HN 帖里却吵成两派。鼓吹派量的是日常编码任务上够用,怀疑派量的是复杂任务上云端仍碾压。拐点不在模型突然变强,而在开放权重模型越过了可用线、本地 agent 工具链把够用重新定义。给 builder 的判断:别问行不行,算你的具体任务里本地这条线的成功率、时延、成本差多少,差的部分值不值你让出隐私和控制权。

阅读全文
2026-06-16 alibaba

Qwen 发布机器人基础模型套件:把 LLM 的开放打法搬进具身智能

Qwen 一次推出三个机器人基础模型,导航、操作、世界模型各管一段,用语言接口把它们串成可调用的工具。真正的杠杆不是某个跑分,而是想把物理世界智能做成像 LLM 那样可二次开发的开放底座。但从看懂到会动这条鸿沟,一个套件远没填平,真正的瓶颈在真实机器人上的泛化与可靠性。

阅读全文
2026-06-15 moonshot

Kimi K2.7-Code 开源:开放编码模型的竞争轴心从跑分转向 token 成本

月之暗面开源 Kimi K2.7-Code,1T 总参 32B 激活的编码向 agentic 模型。头号卖点不是榜单峰值,而是 thinking token 比 K2.6 降约 30%。它在主流编码与 agentic 榜上仍全面低于 GPT-5.5 和 Opus 4.8,但把够用加便宜加可自托管这条路又推近一步。真正的瓶颈仍是缺一个好用的英文 CLI。

阅读全文

专题

专题页负责长期沉淀,把短生命周期发布变成可搜索的上下文。

公司

公司页作为前沿 AI 实验室的发布和战略时间线。