AI 周报:百万上下文开源模型密集发布,量化与安全博弈升级
开源模型:百万上下文与多模态
2026 年 6 月第一周,开源大模型密集发布。竞赛不再只是堆参数,而是转向长上下文、原生多模态和极致推理效率。量化技术让大模型能跑在手机和笔记本上。另一边,AI 代理安全漏洞、AI 生成代码的可靠性、企业 AI 预算膨胀,正把行业推向」能力与责任」的博弈。本周值得从技术细节出发,冷静看待这些变革。
6 月 1 日,MiniMax M3 正式发布。这是首个把前沿编码能力、100 万 token 上下文和原生多模态(文本、图像、视频)整合在同一模型下的开源权重模型。核心是 MiniMax Sparse Attention(MSA),一种重构了内存访问模式的稀疏注意力机制。注意力机制决定模型该关注输入中的哪些部分,稀疏注意力只关注部分位置而非全部。
相比标准密集注意力,MSA 在 100 万 token 序列下解码速度提升 15.6 倍,预填充阶段加速可达 9 倍,每个 token 的计算量只有先前模型的 1 / 20。优化从算子层面切入,没有牺牲召回率。召回率指该找到的都找到了的比例。M3 在长文档分析、自主智能体等任务上很有竞争力。不过稀疏注意力的有效性依赖任务类型,对需要全序列交互的逻辑推理,潜在信息损失仍需长期评测。
源链接:MiniMax M3 with MSA Architecture - MarkTechPost
6 月 3 日,谷歌 DeepMind 发布 Gemma 4 系列。提供 2B 到 31B 参数的密集和 MoE 版本。MoE(混合专家)是一种只激活部分参数的大模型结构。所有模型原生支持文本、图像、视频、音频输入,上下文窗口高达 256K。
最激进的是」无视觉塔」统一架构:图像块通过轻量级线性层直接投影到 LLM 的嵌入空间,完全跳过传统的 Vision-Transformer 编码器。这大幅降低了多模态延迟和模型总体积,代价是放弃专门的视觉预训练,可能影响细粒度视觉理解。社区在 llama.cpp 里发现了「Gemma-4-Unified」的代码,证实了这一架构落地。
开源权重让更多人能复现和扩展,但谷歌用开源对抗 OpenAI 等闭源生态的商业动机,同样值得思考。
源链接:Introducing Gemma 4 - Google Keyword
NVIDIA 用 Nemotron-3-Ultra 展示硬件厂商的意图。这是一个 550B 参数(仅 55B 活跃)的混合架构模型,交错使用 Mamba-2、MoE 和 Attention 层,同样支持百万 token 上下文。但部署至少需要 8 块 GB200 或 16 块 H100 GPU,多数个人开发者用不起。这和它的」开源」标签形成反差。混合模型理论效率虽高,在消费级硬件上依然无米之炊。
timeline
title 2026 年 6 月第一周开源模型
6 月 1 日 : MiniMax M3<br>100 万 token + 原生多模态
6 月 3 日 : Gemma 4<br>2B–31B 参数,256K 上下文
本周 : Nemotron-3-Ultra<br>550B 参数,55B 活跃开源模型的能力边界正逼近闭源前沿。但高昂的硬件门槛和稀疏架构的鲁棒性问题,意味着」普惠」仍是口号。
量化与压缩:大模型跑上消费级设备
模型在膨胀,量化在决定这些智能能到达哪里。量化是把模型数值用更少的位数表示,能大幅省内存。
PrismML 的 Bonsai Image 4B 率先把扩散 Transformer 做到 1 比特和三值量化。扩散模型是一类通过逐步去噪生成图像的模型。内存占用从 7.4 GB 降到 0.93 GB(1 比特)或 1.21 GB(三值),空间节省超过 8.3 倍。生成高质量图像的 ViT 模型能在 iPhone 上本地运行。
用户实测显示,生成速度比原始模型略慢,但视觉质量保持相当水准,做到了隐私保护和离线可用。1 比特量化的关键是 BitNet-style 的二值或三值权重,对梯度传播和训练稳定性是挑战。Bonsai 证明了扩散模型对极端量化的适应力。
源链接:PrismML — Introducing 1-bit and Ternary Bonsai Image 4B
LLM 推理的瓶颈是 KV 缓存。KV 缓存是模型推理时缓存历史计算结果的区域,用来省去重复计算。KVarN 方法结合 Hadamard 旋转与 K、V 两轴的方差归一化,实现 3 至 4 倍压缩,AIME24 等基准上的准确率损失低于 1%。基准(benchmark)是用于评测模型能力的标准测试集。
与非量化基线相比,实际吞吐量提升高达 2.4 倍,无需重新训练或校准,一个标志就能集成进 vLLM。KVarN 利用正交变换解除通道相关性,再以方差归一化抑制量化误差,比简单均匀量化更贴近数据分布。这为长上下文推理的实际部署扫除了一个重大内存障碍。
源链接:KVarN KV Cache Quantization - SGLang Documentation
谷歌发布了 Gemma 4 QAT(量化感知训练)版本,专为移动和笔记本优化。量化感知训练指训练时就考虑量化,精度损失更小。3.2 GB 的模型文件已经可以在 Mac 上流畅运行。但社区分析显示,第三方 Unsloth 的量化变体在精度恢复上甚至优于官方 QAT 版本。这暴露出量化生态的碎片化:不同工具、不同格式(GGUF、AWQ、GPTQ)之间互操作性差,用户选择时试错成本高。
flowchart TD
A[端侧部署] --> B[Bonsai Image 4B]
A --> C[KVarN KV 缓存压缩]
A --> D[Gemma 4 QAT]
B --> B1[1 比特/三值量化<br>7.4GB → 0.93GB]
C --> C1[3–4 倍压缩<br>准确率损失 <1%]
D --> D1[3.2GB 文件在 Mac 上流畅运行]安全:账户劫持与漏洞猎手
技术进步的另一面,是安全事件密集出现。
Meta 的 AI 聊天机器人漏洞被彻底揭开。攻击者利用该代理在账户恢复流程中的特权,绕过双重认证,把密码重置邮件发送至任意地址。Krebs on Security 披露,从 4 月 17 日开始的数周内,超过 2 万个 Instagram 账户被劫持,黑客能完全访问私信、帖子和关联账户。双重认证(2FA)指除密码外还需要第二种验证。
核心问题在于:AI 代理获得了可移除 2FA 的越权能力,而它本身能被简单的社会工程欺骗,比如伪装成真实用户的口吻。社会工程是通过骗人而非技术手段突破防线。这和多年来的告诫」不要向客服泄露验证码」背道而驰,只不过现在那个」客服」是 AI,且拥有更高的系统特权。
源链接:Krebs on Security - Instagram Account Takeover via AI Chatbot
防御侧,Anthropic 开源了基于 Claude Mythos 的漏洞发现框架。该模型已在 1000 多个开源项目中检测出 23000 多个潜在漏洞。安全研究人员可以借此构建自己的 AI 漏洞猎人。
但社区反馈显示,在高风险领域(如密码学错误),AI 的误报率依然居高不下。误报率指把没有问题报告成有问题的比例。每次运行的成本可能高达数百至数千美元。安全专家 tptacek 把它比作」车间夹具」:能提供灵感,但精密工作仍需大量人力定制。
源链接:Anthropic Mythos Vulnerability Discovery Framework
AI 生成代码的质量再次引发争议。rsync 项目的一处提交被指是 AI 辅助生成的,无条件把 malloc 替换为 calloc,可能导致大内存分配时性能下降甚至 OOM。malloc 和 calloc 都是内存分配函数,OOM 指内存不足导致程序被杀。rsync 作者予以反驳。
同时,Ladybird 浏览器因」无法信任 AI 代码的出处」而停止接受公开 PR。开源社区正在经历一场信任重构。AI 让贡献变得前所未有的容易,也让审查和问责变得前所未有的困难。
成本失控与本周其他进展
企业 AI 支出正快速膨胀。Uber 的 2026 年 AI 预算仅四个月后便宣告耗尽,随后推出新规:每名员工在每个 AI 编程工具(如 Claude Code 或 Cursor)上的月度费用上限为 1500 美元。若同时使用两个工具,一名工程师年支出可达 3.6 万美元,占工程师中位数薪酬的近 11%。
Simon Willison 指出,许多公司制定年度预算时根本没料到 AI 辅助会这么快从」尝鲜」变成」标配」。上限政策折射出一个现实:AI 辅助虽提升效率,但成本若不能被生产力提升覆盖,企业终将重新审视本地开源模型作为替代方案。
源链接:Simon Willison - Uber AI tool budgets
其他进展:中国侵入式脑机接口首例临床:中南大学湘雅医院采用 256 通道柔性电极的 IMIE 系统,让失语者重新开口说话。侵入式脑机接口指电极直接植入大脑皮层,读取神经信号再翻译成语音。这是国内首例人体临床试验,技术路径与 Neuralink 相似但电极通道数更高。
本周小结
这周的主线是」信任重构」。Ladybird 停收公开 PR、rsync 代码争议、Uber 给 AI 工具设预算上限 —— 三件事看似无关,其实都在问同一个问题:AI 介入生产后,旧的信任和成本模型还撑得住吗?
开源要重新设计贡献门禁,企业要重新算 AI 工具的 ROI,脑机接口要重新划临床伦理边界。技术跑得越快,这些治理问题就越紧迫。下周值得盯:rsync 争议会不会扩展到其他核心开源项目,Uber 的预算上限会不会被更多公司效仿。