AI 周报:开源模型闭环迫近,国家监管与百亿资本重构 AI 版图

开源模型的集体冲锋

这周开源模型的成绩单很亮。智谱的 GLM-5.2 用 MIT 许可发布。它在 Terminal-Bench 2.1 上准确率 81.0%,是首个过 80% 门槛的开放权重模型。来源。Terminal-Bench 是评估 AI 智能体在真实终端里做多步任务的测试,比如软件工程、安全操作。此前只有 GPT-5.5、Opus 4.8 这些闭源模型能到 80% 以上。

GLM-5.2 价格也狠:每百万输入 token 1.4 美元,输出 4.4 美元,比 Anthropic Opus 便宜约 10 倍。token 是模型处理文本的基本单位。有用户反馈它推理时 token 消耗偏高,一次任务 15 分钟、耗 45k token。但综合性价比,社区还是说这是「对闭源提供商的巨大胜利」。来源。它背后是 100 万 token 的超长上下文窗口,还有 High 和 Max 两种思考模式。上下文窗口就是模型一次能处理的文本长度。

华为也在 HDC 2026 开源了盘古 2.0。Pro 版 505B 参数,Flash 版 92B 参数,都支持 512K 上下文。从 6 月 30 日起,预训练代码等七大组件全面开源。来源。华为坦言算力受限,但盘古 2.0 针对昇腾硬件和鸿蒙深度优化。这意味一个由中国全栈生态驱动的大模型正在成型。如果代码和权重如期开放,可能打破 NVIDIA 加 CUDA 的既有范式,至少在中国内循环市场。

小模型也有尖刀。VibeThinker-3B,30 亿参数,AIME』26 上 94.3%,LiveCodeBench v6 上 80.2%。在没见过的 LeetCode 比赛里,首次提交 Python 通过率 96.1%。来源。它的关键是基于可验证信号的推理聚焦训练,不是堆参数。这说明在数学、编程这类有明确答案的领域,小模型加强化学习能追上大模型。个人开发者用一块高性能 GPU 甚至 Mac Studio,就能跑到接近 GPT-5.5 的精度。

还有两条边线。Mistral AI 宣布 7 月推出新的开放权重模型系列。来源。LM Studio 和苹果合作,在四台 Mac Studio 上跑 1 万亿参数的 Kimi K2.6。来源。大模型的「民主化」已经从口号变成能跑的二进制文件。

flowchart LR
    subgraph OS[开源阵营]
        GLM[GLM-5.2 Terminal-Bench 81%]
        PG[盘古2.0 505B与92B]
        VT[VibeThinker-3B 30亿参数]
        K[Kimi K2.6 1万亿参数]
    end
    GLM -->|MIT许可| OW[开放权重]
    PG -->|七大组件开源| OW
    VT -->|强化学习| OW
    K -->|Mac Studio 运行| OW

要冷静看。开源模型的瓶颈不在权重,在训练管线、数据清洗和持续对齐的成本。盘古能不能吸引全球开发者,要看文档和社区治理。GLM-5.2 的低价策略可能难以为继,如果推理端确实浪费 token,总成本优势会稀释。小模型在通用知识和多轮对话上还有短板,VibeThinker 团队自己也承认。但当这些「利基尖刀」组合成多模型路由,也许能以 1 / 10 的成本覆盖 80% 的需求。这是闭源 API 最不愿看到的。

政府封禁与安全盲点

最激烈的政策事件是美国政府封禁 Anthropic。商务部用出口管制权限,勒令 Anthropic 阻止外国人访问 Claude Fable 5 和 Mythos 5。来源。限制范围甚至包括 Anthropic 内部的外籍员工。起因是 Mythos 5 能自主发现并利用主流软件的零日漏洞。零日漏洞就是厂商还没修复的漏洞。Fable 5 是安全优化版,但仍可能被越狱。越狱就是绕过安全限制。Anthropic 直接关停了两个模型对所有用户的访问,正和白宫紧急磋商。来源

这暴露了 AI 安全的结构性矛盾。技术侧,独立研究者发现「连贯上下文能悄无声息地把 LLM 切换到不同内部状态」。就是说,构造一段连贯文本,就能在输出前改变模型的隐藏表征空间。RLHF 和输出过滤器对此「失明」。来源。研究者用稀疏自编码器(SAE)在 Gemma-3-12B-IT 上验证了这一点。攻击者只要用正常对话包住恶意意图,就能绕过表层安全机制。

同时,ACM CAIS 2026 的一篇论文提出「验证税」:任务越长,智能体为安全验证付出的计算越多。也就是说,越想安全地完成长任务,效率和成功率越容易下降。

flowchart TD
    A[Mythos 5 可发现零日漏洞] --> B[美国政府出口管制]
    B --> C[禁止外国人访问两模型]
    C --> D[Anthropic 关停所有访问]
    E[连贯上下文可切换内部状态] --> F[RLHF与输出过滤器失明]
    G[任务变长] --> H[验证税 安全与效率此消彼长]

把这两项研究放回封禁背景下,能看到政府的困局。模型内部不可解释,一刀切封禁治不了根,反而可能催生地下使用或对手自研。禁令保护了短期国家安全,但破坏了研究公开和国际合作。Anthropic 的透明度受损,研发迭代会减速。同时开源社区还在发布强代码能力的模型,比如 GLM-5.2、DeepSeek V4。它们会不会也被用来挖漏洞?如果封禁不够精准,能力扩散是封不住的。核心问题是谁来定义「足够安全」的模型,标准又由谁来执行。

资本与产业震荡

SpaceX 花 600 亿美元收购 AI 编程 IDE Cursor。来源。这个价格差不多能建 150 所全球最贵的医院。Cursor 年经常性收入超过 30 亿美元,成了开发流程的新入口。马斯克可能想把 AI 编程嵌进星舰、星链的工程体系。但用户普遍反馈 Cursor 不稳定,有人已经转向 Codex。600 亿的估值能不能消化,要看它能否真正改造工程流程,而不只是「高级自动补全」。

OpenAI 的日子不好过。泄露的财务文件显示,2025 年收入 130 亿美元,研发成本却吃掉大部分,亏损仍达数十亿。9 亿周活用户里,只有 5000 万付费。来源。变现难,加上开源模型性价比冲击,OpenAI 正被商业质疑包围。DeepSeek 在加码:传出拟融资超 500 亿,6 月发 V4.1。来源。它还没上美国实体清单,有一段窗口期。来源

算力需求还引发了虚惊。有报告说 2026 年美国数据中心一半容量被取消。SemiAnalysis 逐项审查后直斥其「拍脑袋估计」。来源。Hetzner 的云服务器涨价倒是真的,部分套餐从 6.99 美元涨到 20.49 美元。来源。这反映 AI 热潮下内存和 SSD 供应紧张。开发者开始用本地模型替代云端编程助手。Qwen 3.6 35B 在双 RTX3090 上跑到每秒 150 token 的流畅度,来源,印证了边缘推理可行。

硬科技与安全暗流

硬件侧,中国首台 ArF 浸没式光刻机交付中芯国际,支持 7nm 工艺生产。来源。这是半导体自给的里程碑。SemiAnalysis 的拆解对比显示,中芯国际 N + 3 节点在金属间距上已逼近 5nm 等效密度。来源。没有 EUV,多重曝光带来良率和成本压力。在美国对 ASML 施压升级的背景下,来源,中国光刻机的每一步都在改写供应链规则。

自动驾驶也有进展。中国工信部完成首部 L3 / L4 强制性国标报批,引入安全档案机制。企业要用「声明 — 论据 — 证据」系统证明安全水平,2027 年实施。来源。这意味着 L3 有条件自动驾驶有了明确法规边界,车企不能再用「L2.999」这类模糊宣传。短期推高成本,长期加速技术收敛,只会炒概念的公司会被淘汰。

安全暗流也在涨。约 1 万个 GitHub 仓库在分发木马,靠不断提交混进「最近更新」列表,专打自动化 CI 管道。来源。还有攻击者用 LinkedIn 虚假招聘引诱开发者执行恶意 npm 包,后门靠 prepare 脚本自动运行。来源。哪吒监控有个高危路径穿越漏洞,CVSS 9.1。CVSS 是漏洞严重程度的评分,满分 10。攻击者可未授权读取 JWT 密钥,危害所有自托管用户。来源。AI 自动编程和开源依赖越来越普遍,供应链完整性验证却更脆弱。

教育领域,挪威禁止小学生(6-13 岁)用 AI,14-16 岁只能在监督下用。来源。它承认生成式 AI 可能阻碍读写等基础技能。这和国内腾讯要在微信嵌 AI agent 形成对照:一边是谨慎护栏,一边是向 13 亿用户推通用助手。谁对谁错难说,但挪威的路径是「先让人足够强,再引入工具」。

这一周,开源力量用基准数字证明自己不是「廉价替代品」。国家介入模型部署,说明 AI 安全已上升为地缘议题。资本狂热下资源向少数赢家集中,但高成本也让巨头如履薄冰。接下来要观察:盘古 2.0 开源能否吸引全球开发者,GLM-5.2 能否解决 token 效率,Anthropic 与白宫的谈判如何重塑分发范式。AI 的权力结构正在被重组,速度比预想快。