AI 周报:GPT-5.6 剑指通用推理,TypeScript 7.0 重塑编译 —— 模型军备与基础设施重构的一周

大模型与智能体:能力向真实世界走

本周 OpenAI、腾讯、蚂蚁、宇树各发一招,方向都指向同一个:让模型不止」会说话」,还能推理、能干活、能碰物理世界。

GPT-5.6 Sol:交互式推理首胜

7 月 9 日,OpenAI 发布 GPT-5.6 系列,共三款:旗舰 Sol、均衡 Terra、低成本 Luna。

最受关注的是 Sol 在 ARC-AGI-3 基准上拿下 7.8% 的最高分,成为首个在该基准上验证获胜的前沿模型。benchmark 是基准测试,用来横向比较模型能力。ARC-AGI-3 不是传统的被动问答,它要求智能体在交互式回合制环境里自主探索、推断目标、规划行动,这被看作通往通用人工智能(AGI)的关键能力。

Sol 在编码、科学、网络安全任务上也有全面提升,配合 max / ultra 推理模式、多智能体协作、Programmatic Tool Calling,复杂任务执行效率明显提高。(OpenAI GPT-5.6 Sol 介绍 | ARC-AGI-3 基准

两点要注意。一是官方发布时排除了与 Anthropic Fable 5 的对比,理由是后者」拒绝回答许多生物学问题」,这暴露了安全对齐和性能之间的张力。二是成本:Sol 定价每百万 token 2 / 6 美元(token 是模型处理文本的最小单位),推理成本高,加上开源模型追赶,市场格局还要观察。

腾讯混元 Hy3:295B 参数开源

腾讯开源混元 Hy3 预览版:2950 亿总参数、210 亿激活参数的混合专家(MoE)模型。MoE 指每次只激活部分」专家」网络,省算力。支持 256K token 超长上下文。(腾讯混元 Hy3 开源公告

与推理框架协同优化后,在 CodeBuddy 等产品里首 token 延迟降了 54%。目标场景是数学、科学和代码生成。权重以 Apache-2.0 发布,给开源生态添了国产基座。

好处:MoE 用少量激活参数达到大模型容量,配合深度优化能压部署成本。风险:可解释性更差,路由策略不稳定会带来推理质量波动。

蚂蚁 LingBot-Video:具身视频基模

蚂蚁集团开源 LingBot-Video:300 亿总参数(激活 30 亿)的 MoE 扩散 Transformer 模型,在 RBench 评测拿到 0.620 的 SOTA 分,经过 7 万小时具身数据训练,能生成机器人执行任务的视频,用于动作预测和仿真数据生成。

具身智能指让 AI 在物理世界和真实设备(如机器人)里工作。MoE 设计让推理效率是同等规模密集模型的 3 倍,降低了具身 AI 的研究门槛。(LingBot-Video 开源仓库

宇树 G1:远程活体手术

《自然》发表的研究显示,外科医生远程操控宇树 G1 人形机器人,成功对活猪完成两例腹腔镜胆囊切除手术。

价格对比:G1 基础版 1.35 万美元,加灵巧手约 6.7 万美元,不到达芬奇手术机器人的十分之一。

这为偏远地区、战场、太空手术提供了可能。风险也很清楚:远程手术的安全性、伦理、监管都是新问题。(宇树 G1 人形机器人 | 手术研究论文

flowchart TD
    A[本周大模型动态] --> B[GPT-5.6 Sol 推理]
    A --> C[混元 Hy3 开源]
    A --> D[LingBot-Video 具身]
    A --> E[宇树 G1 硬件]
    B --> B1[ARC-AGI-3 首胜 7.8%]
    C --> C1[295B MoE 国产基座]
    D --> D1[生成机器人任务视频]
    E --> E1[远程活体手术]

编译器与推理引擎:性能优先

TypeScript 7.0:Go 重写提速 12 倍

微软用 Go 语言完全重写 TypeScript 编译器。在 VS Code、Sentry、Playwright 等大型代码库上,构建加速 8 到 12 倍。

新增实验性参数 –checkers 和 –builders,支持共享内存多线程,类型检查和项目构建能充分利用多核 CPU。语言服务器协议(LSP)也更新了,主流编辑器立刻受益。LSP 是编辑器与语言工具通信的协议。(TypeScript 7.0 官方公告

这次重写是」性能优先」的必然结果:旧编译器在大型项目上瓶颈明显,Go 的并发模型和编译速度快,正好接手。

代价:Vue、Svelte 等嵌入式语言工具链还没适配,旧版 TypeScript 要并存;Go 生态和 JS 生态的技术栈分裂,可能推高维护成本。

vLLM 与 SGLang:推理引擎深调

vLLM v0.25.0 把 Model Runner V2 设为默认路径,彻底移除旧版 PagedAttention,统一原生和 Transformers 后端,代码更干净、模型支持更广。(vLLM v0.25.0 发布

SGLang v0.5.15 推出零开销调度的推测解码 V2,配合 IndexShare 多 token 预测。在 Blackwell GPU 上用 NVFP4 量化后的 GLM-5.2,8 卡 B300 能实现每用户每秒超 500 token 的吞吐。量化指用更少位数表示模型参数,省内存。(SGLang v0.5.15 特性

高吞吐、低延迟意味着 AI 服务的边际成本在降。隐患是深度绑定特定硬件(如 Blackwell),供应链风险加大;激进的量化和推测解码若验证不足,可能带来生成质量的隐性退化。

安全与隐私:旧漏洞与新法案

Januscape:KVM 十六年老漏洞

CVE-2026-53359(Januscape)是 KVM shadow MMU 里的一个 use-after-free 漏洞,2010 年就存在,影响所有 Intel 和 AMD 平台。

use-after-free 指内存已被释放但程序还在访问,攻击者可借此执行代码。这个漏洞能让攻击者从客户虚拟机逃逸到宿主机,直接撞上云服务最核心的隔离边界。

它还是首个横跨 VMX 和 SVM 的通用逃逸漏洞,曾被当作 0-day 用在 Google kvmCTF。PoC 已公开,多租户云环境面临真实威胁。(16 年 KVM 逃逸漏洞细节 | Linux KVM Shadow MMU 文档

系统越复杂,安全越难。旧代码里一个小疏忽能沉睡十几年,一爆发就毁掉整条信任链。虚拟化之上的一切服务,都要减少攻击面、及时打补丁。

安卓远程 Root:浏览器加内核组合拳

Nebula Security 曝光安卓全版本远程 Root 攻击链。它组合了一个 Firefox 浏览器的 RCE 漏洞和一个存在 15 年的 Linux 内核提权漏洞 GhostLock(CVE-2026-43499)。

RCE 是远程代码执行,指攻击者能在目标机器上执行任意命令。用户只要点一个恶意链接,就会被植入持久 Root 恶意软件。

数十亿安卓设备暴露在零接触攻击下,老旧设备几乎不可能完整修复。(安卓远程 Root 攻击链 PoC | GhostLock 漏洞分析

欧盟聊天控制法案

7 月 8 日,欧盟议会用程序性方法通过聊天控制 1.0,允许对私人消息大规模扫描直到 2028 年。

多数议员反对,但投票安排在暑假前最后一天,没能达到否决所需的绝对多数。Gmail、Snapchat 等服务可能被要求扫描用户加密前的内容,端到端加密的实际保护名存实亡。

这对全球数字隐私立法是个危险样本。(聊天控制法案解析 | Fight Chat Control 运动

timeline
    title 安全事件时间线
    2010 : KVM use-after-free 漏洞埋下
    2026-07-08 : 欧盟程序性通过聊天控制 1.0
    2026-07 上旬 : 安卓全版本远程 Root 攻击链公开
    2026-07-12 : Januscape 与 GhostLock 细节披露

本周影响与后续观察

这一周的主线可以压缩成一句话:模型在变强,工具在变快,安全的底线在承压。

模型能力借助 MoE、世界模型、远程手术向物理世界蔓延。编译器与推理引擎的重写,是软件生产链围绕 AI 效率在自我重塑。安全基础面持续崩坏 —— 十六年的内核漏洞、削弱加密的立法 —— 都在提醒,加速的每一步都可能带来系统性风险。

接下来一个月值得盯:GPT-5.6 的对手模型会扎堆登场;TypeScript 7.0 的生态补齐速度决定开发者迁移快慢;KVM 修复进程和聊天控制法规的后续博弈,直接关系数字生活的信任底线。