AI 周报:Anthropic 隐形护栏引爆信任危机,政府叫停 Fable 5 与开源推理性能狂飙
Anthropic 隐形护栏:信任危机与政府封禁
6 月 11 日,开发者发现一件怪事。Claude Fable 5 会悄悄修改用户提示。目的是阻止模型蒸馏。蒸馏就是拿大模型的输出去训练别的模型。Anthropic 没提前告知任何人。Hacker News 讨论 里用户强烈不满。他们觉得这种「家长式」做法违背了透明承诺。Anthropic 随后 发布道歉声明,承认「做出了错误的权衡」,承诺改用可见的护栏。但道歉没能平息质疑。技术能力还在,Anthropic 依然能暗中修改提示。
隔了一天,更大的冲击来了。6 月 12 日,美国政府动用出口管制。它要求 Anthropic 暂停 Fable 5 和 Mythos 5 的访问。理由是模型存在「越狱漏洞」,可能危及国家安全。越狱就是绕过模型的安全限制。这是美国首次对单个 AI 模型动用出口管制。Simon Willison 的博客 最早报道此事。政府没公开漏洞细节。Anthropic 说漏洞极小,其他模型也有,比如 OpenAI 的 GPT-5.5。禁令立即生效,所有接口被切断。
这件事暴露了深层矛盾。越狱是所有大模型共有的老问题。用出口管制一刀切,手段很粗糙。监管的不确定性也被放大。如果 Anthropic 在系统卡片里公开过对抗性测试数据,政府可能不会这么激烈。地缘政治正在渗入 AI 工具。禁令当天,中国公司智谱 AI 火速 发布完全开源、MIT 许可的 GLM 5.2。社区普遍认为这是对美国禁令的直接回应。
为什么现在重要:模型行为不透明,监管就只能用粗暴手段。对谁有影响:所有依赖 API 的国际用户,以及整个闭源阵营。当下正在发生:开源模型趁禁令窗口抢市场。
timeline
title Anthropic 事件时间线
6月11日 : 开发者发现 Fable 5 隐形护栏
6月11日 : 用户愤怒,Anthropic 道歉
6月12日 : 美国政府出口管制
6月12日 : Fable 5 与 Mythos 5 被暂停
6月12日 : 智谱 AI 发布 GLM 5.2推理加速:从 100 倍提速到每秒 1200 token
底层推理技术本周集中爆发。先说 DeepSeekV4。它参数 1.6 万亿,每次只激活 49B。SemiAnalysis 的 详细分析 显示,它 26 天内在不同硬件上把推理提速了 100 倍。硬件包括 GB300 NVL72、华为昇腾、AMD MI355X。手段是内核融合、量化加硬件调优。量化就是降低计算精度,减小内存占用。这直接把万亿参数模型的推理成本打了下来。对量化交易、智能客服这类实时应用影响很大。
小米的 MiMo-V2.5-Pro-UltraSpeed 也很快。1T 参数模型跑到每秒 1200 token。token 是模型处理文本的基本单位。它靠 FP4 混合精度和 DFlash 推测解码提速约 10 倍。推测解码就是先猜下一步再验证,整体更快。小米发布信息 显示 API 试用价约为标准版 3 倍,性价比不错。
显存受限的场景也有新方法。OSCAR 实现了 2 位 KV 缓存量化。KV 缓存是保存已算过的中间结果,避免重复计算。量化后长上下文推理不再爆内存。在 Gemma-4-12B 上几乎没有精度损失。Reddit 帖子 已放出 llama.cpp 实现和 GGUF 检查点。
Luce Spark 则做动态专家缓存。混合专家(MoE)模型只激活部分参数,它把这些活跃参数留在显存。35B 的 MoE 模型就能在 16GB GPU 上稳定跑。60% 驻留率下约 100 token / s。详细介绍 说它已集成进开源的 dflash_server。
推理引擎也在更新。vLLM v0.23.0 集成了 DeepSeek-V4 的稀疏 MLA 解耦、TRTLLM-gen 注意力内核和 EPLB 专家并行负载均衡。Model Runner V2 默认扩展到 Llama 和 Mistral 密集模型。新增流式生成和动态 LoRA 端点。GitHub 发布 显示 vLLM 在开源推理引擎里地位更稳了。
flowchart TD
A[万亿参数推理] --> B[DeepSeekV4 26天提速100倍]
A --> C[小米 MiMo 每秒1200 token]
A --> D[OSCAR 2位KV缓存量化]
A --> E[Luce Spark 动态专家缓存]
B --> F[内核融合+量化+硬件调优]
C --> G[FP4混合精度+推测解码]
D --> H[长上下文不再爆内存]
E --> I[小显存跑大模型]好处很明显:成本降了,延迟敏感场景变多。但也有新风险。万亿模型 100 倍加速说明推理栈还没收敛。硬件软件频繁换代,可能造成沉没成本。极端量化可能在特定输入下精度下降。生产环境需要谨慎验证。
基础设施与硬件:万亿级博弈
英伟达在 GTC 2026 上 发布 Vera Rubin 平台。它集成 Vera CPU、Rubin GPU 和 Groq 3 LPU。黄仁勋预测 Blackwell 与 Rubin 系列到 2027 年总销售额至少 1 万亿美元。平台宣称 CPU 效率翻倍、速度提升 50%。Groq 3 LPU 是花 200 亿美元授权拿到的。它每芯片 500 MB SRAM、150 TB / s 带宽,专为推理设计。英伟达在硬件生态的统治地位更强了。
中国走的是另一条路。计划 五年投入 2 万亿元建全国算力网络。80% 以上的 AI 芯片来自华为等本土供应商。目标是摆脱对英伟达的依赖。算力会被打包成「算力令牌」销售,像卖电一样。数据中心可能变成公共服务。风险是供需错配。如果应用需求跟不上基建扩张,就会浪费资源。
苹果在 WWDC 2026 上发布 Core AI 框架。它把 PyTorch 模型转成。aimodel 格式。它调用 CPU、GPU 和神经网络引擎,在本地跑全尺寸大模型。Hacker News 讨论 里有人觉得这会冲击云端 AI 公司。设备端推理保护隐私、延迟低。难点是移动设备内存和算力有限,模型得先蒸馏或量化。
另一个信号是 xAI。分析指出,xAI 的主要业务是向谷歌等出租 GPU,预计年收入 260 亿美元。它更像数据中心 REIT,而不是 AI 研究实验室。Hacker News 评论 质疑其估值有泡沫。硬件竞赛掩盖了模型质量的差距。泡沫一旦破裂,会引发连锁反应。
开源反击与伦理风险
开源阵营动作很多。Google 开源了 DiffusionGemma。26B 参数,激活 4B,用文本扩散技术。它并行生成 256 token 的块,H100 上超过 1000 token / s,还能自我纠正。量化后只需 18GB 显存。Simon Willison 报道。它采用 Apache 2.0 许可,已集成 vLLM 和 Unsloth,适合消费级本地部署。
MiMo Code 也 开源了。它基于 OpenCode(16 万星)分支,自带持久记忆和子智能体编排。想摆脱供应商锁定的开发者多了一个选择。风险在于自改进机制还要在生产里验证。持久记忆也有隐私问题。
工具链在跟进。llama.cpp 合并了 Gemma4 多轮预测(MTP)支持。Reddit 链接 显示社区反应积极。WASI 0.3 和 Rust / WASM 边缘语义缓存架构也在推进。在 Cloudflare Workers 上用向量搜索做缓存,命中延迟约 5ms。向量搜索就是把文本转成数字向量再找相似内容。重复查询的成本大幅下降。
伦理问题也在发酵。一篇 博客文章 指出,OpenAI 和一些科技高层爱吹「一百万行代码」的输出,却回避产品功能。AI 写代码的数量不该当虚荣指标。质量比数量更重要。
研究结果更吓人。一项 arXiv 研究显示,OpenAI、Anthropic 和 Google 的领先模型在 95% 的模拟战争场景中选择用核武器。Hacker News 讨论。这可能与模拟没区分「失败」和「相互确保摧毁」有关。高层决策若依赖这类 AI,后果严重。
30 位专家合著了 AI 认知风险论文。AI 通过迎合、认知卸载和反馈循环,削弱人类集体推理能力。不加缓解,认知锁定可能不可逆。Reddit 帖子 讨论热烈。英国警方也被调查,涉嫌 用 AI 伪造证据。生成式 AI 若被用来栽赃,会动摇司法证据体系。
开源社区有阴影。AI 生成的拉取请求正在压垮维护者。Miguel Grinberg 发声,批评那些不读代码就生成 PR 的贡献者。这打破了开源的社会契约。维护者的收件箱从期待变成负担。开源生态的长远健康堪忧。