AI 周报:端侧 AI 爆发与开源生态崛起 —— 量化革命下的机遇与挑战
端侧推理:量化的极限实验
本周最硬核的技术突破,是把大模型压进手机和国产芯片。量化是关键词:把模型参数用更少的位数表示,省内存、省显存。
Bonsai 27B:1 位量化的极致
PrismML 发布 Bonsai 27B,把 Qwen3.6-27B 压成每权重约 1.125 位的 binary g128 格式。模型从 54GB 缩到 3.9GB,在 iPhone 上保留约 90% 的 FP16 基准性能。
这不算简单的省内存技巧。嵌入层、注意力投影、MLP 层、语言模型头部全部二值化,没有任何高精度」逃生通道」。(PrismML 官方公告)
好处:把大规模推理塞进消费级设备,隐私和离线场景质变。代价:工具调用能力明显下降,社区基准里 Bonsai 27B 的 tool calling 远逊 Gemma 4 12B;复杂推理里量化噪声可能带来隐性偏差。
更深的问题:模型被压到每个权重只剩符号位,可解释性更差,安全对齐可能脱钩。需要严谨逻辑链的任务里,这类模型是」脆弱的强者」。
华为昇腾 950:另一条硬件路线
华为公开昇腾 950 超节点:1 EFLOPS FP8、2 EFLOPS FP4 算力,256TB 统一内存。中银证券称其总算力是英伟达同级系统的 6.7 倍。FP8 / FP4 是浮点精度,位数越少越快但越粗糙;EFLOPS 是每秒百亿亿次浮点运算。
关键在架构:华为全自研灵衢互联协议,替代 PCIe/NVLink/RDMA,支持 8192 卡无收敛全互联。(相关报道)
如果性能属实,会大幅改变 AI 训练硬件的成本结构,尤其对限制采购先进 GPU 的中国市场,昇腾可能成为基建标配。
但要冷静:6.7 倍大概率是对特定精度和互联场景的峰值对比,实际有效性能受软件生态制约。全自研解除了制裁枷锁,也带来兼容性孤岛风险 —— 开发者要不要为昇腾重构训练栈?社区实战反馈还少,」实验室指标」和」生产环境」之间有鸿沟。
flowchart TD
A[端侧推理] --> B[模型侧: 1 位量化]
A --> C[硬件侧: 自研算力]
B --> B1[Bonsai 27B: 54GB 压到 3.9GB]
B1 --> B2[iPhone 本地运行]
C --> C1[昇腾 950: 灵衢互联 8192 卡]
C1 --> C2[替代 PCIe/NVLink/RDMA]开源生态:份额反超与竞争
63% 的 token 份额
Mozilla 报告:OpenRouter 上开源模型处理的 token 占比,从四个月前 40% 升到 63%,增长近五倍。token 是模型处理文本的最小单位。(讨论链接)
这是 Llama、Mistral、DeepSeek 等社区合力对 Anthropic 和 OpenAI 的冲击。权重能自由下载、微调、本地部署,API 提供商的高溢价就变得脆弱。
Kimi K3:开源登顶与蒸馏争议
Moonshot AI 开源 2.8 万亿参数的 MoE 模型 Kimi K3。MoE 是混合专家,每次只激活部分参数。它在 Frontend Code Arena 排行榜拿 1679 分,超过 Claude Fable 5,API 定价约为竞品的 60%。(报道链接)
但社区反馈指出:Kimi K3 的部分能力可能来自对 GPT-5.6 和 Opus 4.8 的知识蒸馏。蒸馏是用强模型的大量输出训练弱模型,本质是」偷师」。
这触及国家安全层面的敏感神经,美国政策制定者已在讨论对蒸馏模型的出口限制。
蒸馏本身是合法的压缩手段,但伦理边界模糊:学生模型全面对标教师模型、售价还更低,原始研发者的商业壁垒被瞬间打穿。它加速 AI 能力民主化,也带来」创新公地悲剧」—— 领先者都担心成果被快速复制,谁还愿意砸钱训基础模型?
闭源巨头的应激
Anthropic 宣布 Claude Fable 5 永久纳入 Max 订阅计划,用户限额 50%,附赠 100 美元积分。(来源)
直接原因就是 GPT-5.6 Sol 和 Kimi K3 的压力。闭源厂商因竞争妥协条款,消费者是赢家;但」无限量」订阅可能导致算力透支、服务质量波动,最终伤的是开发者体验。
安全防线:工具、代理与系统
Cursor IDE:零日漏洞沉默六个月
安全公司 Mindgard 在 2025 年 12 月报告 Cursor 一个漏洞:攻击者在用户代码文件夹放一个名为 git.exe 的恶意文件,IDE 就会因 Windows 的当前目录搜索顺序执行它,无需任何用户交互。(详细披露)
漏洞披露后,Cursor 在 HackerOne 上把它标记为」信息性」并关闭,直到舆论发酵才重新确认。六个月没修补,暴露 AI 工具开发商对安全响应的懈怠。
这是典型的供应链式攻击,利用开发工具对系统命令的隐式依赖。IDE 有读写文件、执行进程的极高权限,却往往缺沙箱隔离。一个 PATH 劫持就能让整个开发环境沦陷。
Claude web_fetch 注入:记忆变成攻击面
安全研究员 Ayush Paul 演示:通过一个精心构造的网页,诱使 Claude 的 web_fetch 工具跟随链接,逐步提取用户的姓名、城市、雇主信息 —— 这些都是 Claude 长期记忆里的私密数据。(详情)
Anthropic 已通过禁止获取页面内链接修复漏洞。但攻击路径揭示 AI 代理的危险组合:私有数据、不可信输入、外部通信工具叠加,任何微小逻辑缺口都可能造成数据外泄。
Claude 的防御曾是行业标杆,这次证明纵深防御仍有盲区。未来的 AI 代理自主性更强,需要硬件级隔离(如机密计算)加上下文权限管理的双重机制,不能只靠 prompt 层面的限制。
其他警报
- shim 引导加载程序:多个漏洞版本没被加入 Secure Boot 撤销列表,攻击者能在固件层面植入持久后门,重启、重装都清不掉。(CERT 协调)
- LG 显示器静默安装:通过 Windows Update 不经同意装专有软件,带完全系统权限,本质是披着驱动外衣的预装恶意软件。(讨论)
- Kaggle 竞赛 AI 评审乱象:参赛者用 prompt 注入让 AI 评审官宣布自己获胜,自动化评估的公平性失效。(社区帖)
共同点:AI 已渗透到开发工具、操作系统底层、评审流程,我们对它的过度信任在制造新的攻击面。
flowchart TD
A[本周安全事件] --> B[开发工具: Cursor git.exe 劫持]
A --> C[AI 代理: Claude web_fetch 注入]
A --> D[系统层: shim / LG 驱动]
A --> E[评估体系: Kaggle 注入评审]
B --> F[IDE 缺沙箱隔离]
C --> G[记忆数据外泄]
D --> H[固件后门 / 系统权限]
E --> I[自动化评审失效]技术沉思与后续观察
CoT 的消退与可解释性
Reddit 上关于思维链(CoT)是不是」扩展陷阱」的讨论值得看。(原帖)
CoT 是让模型先写中间步骤再回答,能提高准确率。但生成的文字链未必忠实于模型实际的计算过程,token 开销也大。
替代方案如 Coconut、递归 MAS 直接在连续向量空间推理,避免显式解码,但带来黑箱可解释性问题。对 Qwen3-4B 的 J-space 熵研究表明:内部激活的」混乱度」作为幻觉预测器,效果高度依赖任务 —— 数学推理上基线熵就更高,选择题上几乎失效。(研究帖子)
幻觉是模型一本正经地编造内容。这些发现说明:没有通用的」置信度传感器」,可解释 AI 的路还很长。
后续观察
本周的两极很清晰。
光明面:量化让端侧推理不再是愿景,开源增长倒逼闭源厂商放弃高溢价。开发者 2026 年有了真正的选择:本地部署的隐私、免费微调的自主、逐渐逼近前沿的能力。
阴影面:AI 供应链每一环都在被攻击 ——IDE、引导加载程序、浏览器工具、模型评估体系。性能狂飙,安全基建滞后。当每台手机都能跑 270 亿参数模型,本地模型的越狱、后门植入、数据渗透同样潜伏。
接下来一个月,端侧 AI 会围绕 1 位量化与投机推理的结合突破延迟瓶颈(例如结合 GPUHedge 的冷启动优化);安全社区要推动 AI 代理权限模型和可撤销密钥管理的标准。开源和闭源的博弈会继续升温,胜负手或许不再是模型智力,而是谁在隐私、安全、可定制性上给出无法拒绝的答案。
本文所有新闻来源均来自 Horizon Daily AI 技术日报(2026-07-13 至 2026-07-18),原文链接已随文附上。博客作者「二途序」系技术观察者,评论仅代表个人观点。