open-weights

8 篇 · 最新

High-signal frontier AI context tagged with open-weights.

2026-06-18 huggingface

你的库够 agentic 吗:同一套脚手架帮了大模型,却拖垮了小模型

Hugging Face 开源了 agent-eval,一套衡量 agent 用你的库时走了多远路的基准:不只看最终答案对不对,还测它花了几轮、几个 token、踩了几个错。用 transformers 当样本,跑在 pi 驱动的开放模型上,结论反直觉:给库加 CLI 和 Skill,帮了最大的开放模型,却拖垮了最小的。给 builder 的判断:agent 友好不是一次性焊上去的属性,能解放大模型的便利可能让小模型更糊涂,解题成本必须按模型尺寸在你自己的工具上实测,不能照搬榜单的最终答案分。

阅读全文
2026-06-18 deepseek

美国暂缓把 DeepSeek 列入实体清单:100 多家公司批了没发,是缓刑不是赦免

路透独家:DeepSeek、内存厂 CXMT 和另外 100 多家被认定国家安全风险的公司,去年就被跨部门委员会批准列入商务部实体清单,至今没公布。实体清单自十月起没有任何新增,是十多年来最长的空窗。原因不是它们没问题,是 Trump 政府不想在中美谈判时火上浇油。给建设者的关键判断:中国开源权重模型现在在美国仍然合法可用,但这是一份签好字、压在抽屉里的缓刑,谈判一翻脸随时可能落地。别把对 DeepSeek 的硬依赖建在它会一直合法的假设上。

阅读全文
2026-06-16 zhipu

GLM-5.2 权重落地:开放阵营把前沿压成了按季度刷新的常态

智谱放出 GLM-5.2 权重,MIT 许可,1M 上下文,主打长程任务和可调思考预算。官方自报跑分把它放到了闭源旗舰一两个点的射程内。真正的信号不是又一次刷榜,而是开放权重的能力成本曲线又压低一格。但厂商自报数字要打折,1M 是否真可用、长程是否真可靠,得自己在目标任务上测。

阅读全文
2026-06-16 ollama

本地模型够用了吗:两派其实在量两件不同的事

Vicki Boykis 说本地模型现在好用了,1245 分的 Ask HN 帖里却吵成两派。鼓吹派量的是日常编码任务上够用,怀疑派量的是复杂任务上云端仍碾压。拐点不在模型突然变强,而在开放权重模型越过了可用线、本地 agent 工具链把够用重新定义。给 builder 的判断:别问行不行,算你的具体任务里本地这条线的成功率、时延、成本差多少,差的部分值不值你让出隐私和控制权。

阅读全文
2026-06-16 alibaba

Qwen 发布机器人基础模型套件:把 LLM 的开放打法搬进具身智能

Qwen 一次推出三个机器人基础模型,导航、操作、世界模型各管一段,用语言接口把它们串成可调用的工具。真正的杠杆不是某个跑分,而是想把物理世界智能做成像 LLM 那样可二次开发的开放底座。但从看懂到会动这条鸿沟,一个套件远没填平,真正的瓶颈在真实机器人上的泛化与可靠性。

阅读全文
2026-06-15 moonshot

Kimi K2.7-Code 开源:开放编码模型的竞争轴心从跑分转向 token 成本

月之暗面开源 Kimi K2.7-Code,1T 总参 32B 激活的编码向 agentic 模型。头号卖点不是榜单峰值,而是 thinking token 比 K2.6 降约 30%。它在主流编码与 agentic 榜上仍全面低于 GPT-5.5 和 Opus 4.8,但把够用加便宜加可自托管这条路又推近一步。真正的瓶颈仍是缺一个好用的英文 CLI。

阅读全文
2026-06-15 model-merging

里约「主权大模型」翻车:开放权重让谎报实验室能力第一次被数学证伪

里约政府 IT 公司发布 397B「巴西主权」开放模型并宣称自训练击败同级。Nex-AGI 用身份测试与权重共线性两套独立证据证明它只是 0.6 倍 Nex 加 0.4 倍 Qwen 的逐元素合并。要害不是没标引用,是对外谎报了自己实验室的能力,而权重张量这次成了无法抵赖的指纹。

阅读全文
2026-06-14 zhipu

GLM-5.2 完全开放发布:智谱把美国的封禁当成了卖点

智谱发布 GLM-5.2 并宣布完全开放,时间卡在 Anthropic Fable 被叫停的同一周。真正的新闻不是参数(没公开跑分),而是定位:当闭源 API 的访问能被非技术原因随时撤销,开放权重的价值从省钱可定制升级为供给确定性。这是开放阵营当下最锋利的卖点,但权重未上线、无独立 benchmark 前,别据此切换生产负载。

阅读全文