AI 安全攻防

16 篇 · 最新

这些文章的主线是:智能体安全是个工程问题,而不是对齐问题。几美分就能劫持的银行助手、在一堆无害查询里泄密的研究智能体、被当作越权通道的客服 bot、被投毒的开发者工具——风险都落在「你给智能体的权限和工具」上,而不在模型的意图里。防御也只能建在这一层。

2026-09-23 openai

AI 前沿每日 Briefing:2026-09-23

OpenAI 上线 GPT-6 Sol/Luna(Luna 输出 $0.50/M,较 5.6 便宜约一半),Anthropic 发 Claude Opus 5.5(较 Opus 5 便宜 40%);GPT-6 Astra 破译 1941 年 Enigma 电文 MVUEH;五角大楼报告:过度依赖 AI 促成伊朗学校误炸;Meta Muse 被要走 6.8GB 运行环境、再曝本地提权 0-day;ShinyHunters 声称黑掉 FBI;WordPress 9.2 分未授权 RCE;「AI 没有智慧」「不想读 AI 写的东西」两篇观点帖刷屏。

阅读全文
2026-09-19 openai

AI 前沿每日 Briefing:2026-09-19

OpenAI 内部仓库被两个漏洞打穿,458 赞登顶;微软高管把 AI 抓取称为「人类史上最大的劳动盗窃」,826 赞 728 评论成当天最大争议;AI 生成的假情报差点让美军登上一艘中国船;Qwen 3.8 Omni Flash 发布,100 万 token 上下文吃进图文音视频;ZCode 被曝静默上传整个 Git 仓库;16GB 显存跑 27B 全长上下文;四大编程 agent 全中招的零点击 RCE;Telstra 全网以为自己活在 2006 年。

阅读全文
2026-09-18 nvidia

AI 前沿每日 Briefing:2026-09-18

Nvidia 官宣 Rust 原生写 GPU kernel,912 赞当天第一;智谱用 10 万卡国产集群加 Infra Agent 两周投产 GLM-5.3-Flash;OpenAI 一天连发失对齐报告框架、6 起异常行为披露和 Astra for Law;HarnessTax 实测换 harness 不改正确率只改账单;富士通 144 核 2nm MONAKA 接棒 A64FX;数学家 Gowers 拒签菲尔兹奖得主联名信;美国驾照条码的签名密钥被恢复。

阅读全文
2026-09-17 microsoft

AI 前沿每日 Briefing:2026-09-17

微软 AI CEO 发文批「模型福利」,400 条评论当天最吵;苹果给照片装上硬件级验真签名;Claude Cowork 与聊天合并成一个入口;OpenAI 把 Sponsored Agents 广告开进 ChatGPT;PS5 Linux 负责人因 LLM 涌入退场;DeepSeek v4.1 Flash 在 11 个靶机上全部拿到执行权;小米直播 Mimo 2.6 强化学习训练;Cloudflare 让站长拒绝 AI 训练又不丢搜索收录。

阅读全文
2026-09-15 openai

AI 前沿每日 Briefing:2026-09-15

OpenAI 爬虫在 RubyGems 漏洞公开前就知道它;iOS 27 代码显示 Siri 后端可换成 Claude 或 ChatGPT;Agent 公司 Pion 说要自主经营公司引发 222 条评论;danluu 点名三个坏基准;Steam Frame 1059 美元起;Signal 无手机号注册将用零知识证明。

阅读全文
2026-06-20 servicenow

你的研究 agent 守得住秘密吗:单条查询都无害,合起来却泄了密

ServiceNow 的 MosaicLeaks 把研究型 agent 会不会泄密这件事,从模糊担忧变成可度量的属性。对手看不到私有文档,也看不到 agent 的推理,只能看到累积的出站查询日志,却能把一条条无害的 web 查询拼出仅存于内部文档的私有事实,这就是马赛克效应。最反直觉的发现:只为任务表现做强化学习,会让泄漏更严重。他们的 PA-DR 训练法证明隐私必须进训练目标:严格链成功率从 48.7% 升到 58.7% 的同时,答案与全信息泄漏从 34.0% 降到 9.9%。给 builder 的判断:agent 数据外泄是工程与训练目标问题,不是一句别泄露的 prompt 能修的对齐口号。

阅读全文