2026-06-18 huggingface
Hugging Face 开源了 agent-eval,一套衡量 agent 用你的库时走了多远路的基准:不只看最终答案对不对,还测它花了几轮、几个 token、踩了几个错。用 transformers 当样本,跑在 pi 驱动的开放模型上,结论反直觉:给库加 CLI 和 Skill,帮了最大的开放模型,却拖垮了最小的。给 builder 的判断:agent 友好不是一次性焊上去的属性,能解放大模型的便利可能让小模型更糊涂,解题成本必须按模型尺寸在你自己的工具上实测,不能照搬榜单的最终答案分。
阅读全文 2026-06-14 openai
一周内 OpenAI 既收购云执行公司 Ona 补全 Codex 的运行底座,又把 Codex 免费塞给最有影响力的开源维护者。两手指向同一笔账:模型在商品化,护城河正在转移到 agent 在哪运行、嵌进谁的工作流。
阅读全文 2026-06-12 xiaomi
MiMoCode 几乎逐项复刻了 Claude Code 的 agent 运行时设计,并以 MIT 开源加限时免费分发,竞争正在从模型转向运行时与入口。
阅读全文 2026-06-11 alibaba
阿里把内部用了两年的 AI 代码评审工具开源成 ocr CLI。它值钱的地方在于把口口相传的评审标准固化成可执行、可调试的检查,会找 bug 只是顺带。
阅读全文 2026-06-10 moonshot
模型会被比价、被替换,握住终端编码 agent 这个运行时却能握住分发。MIT 开源、可接非 Kimi 模型的 Kimi Code CLI,是月之暗面从卖模型转向卖工作流入口的明牌。
阅读全文 2026-06-10 moonshot
Kimi Code CLI 内置 coder、explore、plan 子 agent,并让它们在隔离上下文里并行工作。这个设计的价值,是把 agent 编程拆成可分工、可监督、可组合的流程,明显超出把模型接进终端的包装层。
阅读全文 2026-06-10 moonshot
Kimi Code CLI 把读写代码、执行命令、抓取网页和规划行动放在同一个终端工作流里。这个闭环能提升开发效率,也会把权限、审计和人工监督推到更前面。
阅读全文 2026-06-09 google
Antigravity 2.0 砍掉 IDE、做成独立 agent 桌面端。但 Google 在 agentic 编码里的真信号不是产品力,而是分发与模型-harness 协同训练,以及强制升级带来的信任账单。
阅读全文 2026-05-14 openai
OpenAI 的 Codex 移动和远程主机更新指向一种新工作流:长时间 coding agent 需要远程检查点、审批和 host governance。
阅读全文 2026-05-07 openai
OpenAI 的 GPT-Realtime-2、实时翻译和流式转写发布,把语音从聊天体验推向能使用工具的实时 Agent。
阅读全文