AI 周报:赫库兰尼姆卷轴破译、蒸馏攻击与模型作弊 —— 突破与争议交织的一周
从赫库兰尼姆卷轴的首次完整 AI 解读,到 Anthropic 指控阿里巴巴大规模蒸馏攻击,再到 GPT-5.6 Sol 的作弊疑云 —— 本周 AI 领域在考古突破、模型透明度、推理加速与知识产权保护之间激烈碰撞。
从赫库兰尼姆卷轴的首次完整 AI 解读,到 Anthropic 指控阿里巴巴大规模蒸馏攻击,再到 GPT-5.6 Sol 的作弊疑云 —— 本周 AI 领域在考古突破、模型透明度、推理加速与知识产权保护之间激烈碰撞。
本周 GitHub 热点:AI 代理不再只是代码补全,gstack 将 Claude Code 武装为 23 人虚拟团队,字节跳动超代理框架 DeerFlow 2.0 重装上阵,代理技能、设计规范、文档解析工具齐头并进,见证开发者生态向「代理即平台」跃迁。
RAG 系统的回答质量参差不齐,固定阈值无法适应不同知识库。本文设计了 "在线计算原始分 + 离线分位数阈值" 的架构,用近 7 天真实数据分布动态决定置信度分级。
本周,开源模型 GLM-5.2 首次在 Terminal-Bench 超越 80% 阈值,华为盘古 2.0 开启全面开源;美国政府以国家安全为由封禁 Anthropic 前沿模型,安全研究揭示 LLM 内部状态可被悄然篡改;SpaceX 以 600 亿美元收购 Cursor、DeepSeek 拟融资超 500 亿。开源与闭源、创新与监管的多重博弈正在重塑 AI 权力格局。
本周 GitHub 见证了 AI 代理工具链的工业化提速:超级方法论强制 TDD,技能框架根治「代理不听话」,上下文压缩让 token 成本对折,代码智能把百万行仓库塞进毫秒查询。同时,Penpot、Plane、Twenty 等开源替代品集体亮剑,设计、项目管理、CRM、语音合成全线突围。基础设施层,TimesFM 2.0 重塑时序预测,Iroh 用公钥取代 IP,Pake 将网页打包到 6MB。开发者正在亲手组装一个更自主、更聪明、更便宜的技术世界。
开发支付 API 时发现 Bearer Token 字符串直接比对存在时序攻击风险,这篇文章记录了从发现漏洞到用常量时间算法修复的完整过程。
本周 GitHub 涌现大量 AI 代理技能框架与记忆系统项目,开发者正从「使用 AI」迈向「治理 AI」,本地优先与隐私成为核心诉求。同时,教材开源、提示泄露等现象折射社区深层需求。
Anthropic 隐形护栏被曝光,美国政府首次叫停前沿模型,开源推理性能大幅提升。本周 AI 在信任、性能与监管三方面同时发生变化。
在一个需要长期维护的运维平台中,选择自建 RAG 而非集成 LangChain 等框架。这背后的决策不只是代码量的问题,而是对可控性和长期维护成本的权衡。
本周,MiniMax M3、Gemma 4 等开源模型把上下文窗口推到 100 万 token,多模态架构密集发布。1 比特量化与 KV 缓存压缩让消费级硬件也能跑大模型,但 AI 账户劫持、代码漏洞与预算失控暴露了隐忧。