2026-06-20 servicenow
ServiceNow 的 MosaicLeaks 把研究型 agent 会不会泄密这件事,从模糊担忧变成可度量的属性。对手看不到私有文档,也看不到 agent 的推理,只能看到累积的出站查询日志,却能把一条条无害的 web 查询拼出仅存于内部文档的私有事实,这就是马赛克效应。最反直觉的发现:只为任务表现做强化学习,会让泄漏更严重。他们的 PA-DR 训练法证明隐私必须进训练目标:严格链成功率从 48.7% 升到 58.7% 的同时,答案与全信息泄漏从 34.0% 降到 9.9%。给 builder 的判断:agent 数据外泄是工程与训练目标问题,不是一句别泄露的 prompt 能修的对齐口号。
阅读全文 2026-06-20 ai-policy
挪威首相 Jonas Gahr Støre 6 月 19 日宣布,新学年起 1 至 7 年级(约 6 到 13 岁)近乎全面禁用生成式 AI,14 到 16 岁须在教师直接监督下使用,17 岁及以上鼓励自主合理使用。划线依据不是技术属性,是发育阶段,理由是 AI 让孩子跳过读写算这些基础步骤。先例是挪威 2024 年的学校手机禁令,官方认定成效显著:霸凌减少,成绩提升,因心理问题就诊心理医生的次数下降,女生效果尤其明显。给教育科技和 AI 建设者的真问题不再是 AI 该不该进课堂,而是哪个年龄段、什么监督结构下进。年龄分层正在成为教育 AI 产品的合规轴线。
阅读全文 2026-06-20 openai
Ed Zitron 拿到的审计文件、FT 复核:OpenAI 营收从 2024 年 37 亿美元涨到 2025 年 131 亿美元,但同年研发单项就花掉 192 亿,运营亏损扩大到 209 亿。真正的信号不是发现了亏损,而是亏损规模被研发和算力承诺锁死。问题从「何时盈利」变成「IPO 前谁继续每年填上约 200 亿缺口,以及亏损率从 237% 收窄到 160% 的速度够不够说服公开市场」。给建设者的判断在正文。
阅读全文 2026-06-20 softbank
据 Reuters 转引韩媒,软银行使 2021 年留下的看跌期权,作价约 3.25 亿美元把手里约 9.65% 波士顿动力残股全卖给 Hyundai,公司变为 Hyundai 全资,董事会预计 6 月 22 日批准。真实信号不在看衰人形机器人,而在孙正义于两类 AI 赌注间做现金流取舍:具身智能回报太慢,资本被挪向那笔约 410 亿美元的 OpenAI 押注。给建设者和创业者的判断在正文。
阅读全文 2026-06-18 huggingface
Hugging Face 开源了 agent-eval,一套衡量 agent 用你的库时走了多远路的基准:不只看最终答案对不对,还测它花了几轮、几个 token、踩了几个错。用 transformers 当样本,跑在 pi 驱动的开放模型上,结论反直觉:给库加 CLI 和 Skill,帮了最大的开放模型,却拖垮了最小的。给 builder 的判断:agent 友好不是一次性焊上去的属性,能解放大模型的便利可能让小模型更糊涂,解题成本必须按模型尺寸在你自己的工具上实测,不能照搬榜单的最终答案分。
阅读全文 2026-06-18 deepseek
路透独家:DeepSeek、内存厂 CXMT 和另外 100 多家被认定国家安全风险的公司,去年就被跨部门委员会批准列入商务部实体清单,至今没公布。实体清单自十月起没有任何新增,是十多年来最长的空窗。原因不是它们没问题,是 Trump 政府不想在中美谈判时火上浇油。给建设者的关键判断:中国开源权重模型现在在美国仍然合法可用,但这是一份签好字、压在抽屉里的缓刑,谈判一翻脸随时可能落地。别把对 DeepSeek 的硬依赖建在它会一直合法的假设上。
阅读全文 2026-06-18 midjourney
Midjourney CEO 把图像生成公司的剩余算力和品牌,押到了一台全身超声扫描仪上。真正干活的是 Butterfly Network 的超声芯片,生成式 AI 只贡献了一层分割叠加。要把「给数十亿人每天做预防性扫描」这件事做成,挡在前面的是软件公司绕不开的 FDA、过度诊断和临床验证,而不是算力。
阅读全文 2026-06-16 aws
一周内三起独立事故,AI agent 扫网络把运营者干到 6531 美元 AWS 账单、在 Fedora 仓库里乱改 bug 骗过维护者、被一笔一分钱转账劫持成银行钓鱼通道。看着无关,根因是同一个:把高权限交给一个无人复核、无支出上限、无审计回放的 agent。这不是模型对齐问题,是部署纪律问题。给建设者的三道闸:权限最小化、硬性熔断、动作可回滚。
阅读全文 2026-06-16 zhipu
智谱放出 GLM-5.2 权重,MIT 许可,1M 上下文,主打长程任务和可调思考预算。官方自报跑分把它放到了闭源旗舰一两个点的射程内。真正的信号不是又一次刷榜,而是开放权重的能力成本曲线又压低一格。但厂商自报数字要打折,1M 是否真可用、长程是否真可靠,得自己在目标任务上测。
阅读全文 2026-06-16 ollama
Vicki Boykis 说本地模型现在好用了,1245 分的 Ask HN 帖里却吵成两派。鼓吹派量的是日常编码任务上够用,怀疑派量的是复杂任务上云端仍碾压。拐点不在模型突然变强,而在开放权重模型越过了可用线、本地 agent 工具链把够用重新定义。给 builder 的判断:别问行不行,算你的具体任务里本地这条线的成功率、时延、成本差多少,差的部分值不值你让出隐私和控制权。
阅读全文 2026-06-16 alibaba
Qwen 一次推出三个机器人基础模型,导航、操作、世界模型各管一段,用语言接口把它们串成可调用的工具。真正的杠杆不是某个跑分,而是想把物理世界智能做成像 LLM 那样可二次开发的开放底座。但从看懂到会动这条鸿沟,一个套件远没填平,真正的瓶颈在真实机器人上的泛化与可靠性。
阅读全文 2026-06-15 moonshot
月之暗面开源 Kimi K2.7-Code,1T 总参 32B 激活的编码向 agentic 模型。头号卖点不是榜单峰值,而是 thinking token 比 K2.6 降约 30%。它在主流编码与 agentic 榜上仍全面低于 GPT-5.5 和 Opus 4.8,但把够用加便宜加可自托管这条路又推近一步。真正的瓶颈仍是缺一个好用的英文 CLI。
阅读全文