GitHub 趋势周报:Agent 补上流程纪律,大模型往本地搬

这周的 GitHub Trending 看下来,主线很清楚。

一边是 AI 编程 Agent 在补课。补流程、补验证、补安全边界,不再比谁更全能。

另一边是本地化。大模型推理、语音、知识库、企业管理系统,都在往你自己机器上搬。

两条线其实是一回事:控制权和成本。

一、AI 编程 Agent:从「更聪明」转向「更守规矩」

这周几乎每天都有 Agent 工具上榜,但没一个在吹模型能力。

大家都在解决同一个问题:Agent 出的活儿怎么验。

alibaba/open-code-review:只报确定的问题

https://github.com/alibaba/open-code-review

阿里把内部用了两年的代码审查 CLI 开源了,一周涨了上万星。

Go 写的,读 git diff 之后出精确到行的评审意见。

它的做法是拆分。选文件、分组、匹配规则这些不能出错的环节,全用工程代码写死。

只有判断上下文这种活交给 LLM Agent。

好处是稳。官方 benchmark 说同款模型下,token 只花通用 Agent 的约 1 / 9。

代价是漏报更多。它故意压低召回率,换低误报。

说白了,少报几条也别天天让人划掉假告警。

还自带一个公开数据集 AACR-Bench,50 个仓库、200 个真实 PR、1505 条人工标注缺陷,放在 Hugging Face 上。

适合已经用 Claude Code、Cursor 但嫌贵、嫌吵的团队,接进 CI 就能用。

cloudflare/security-audit-skill:让另一个 Agent 来反驳

https://github.com/cloudflare/security-audit-skill

Cloudflare 开源的编码 Agent 技能,一天涨 3600 星。

把安全审计拆成六个阶段,产出机器可读的漏洞清单。

关键设计是对抗式验证。找漏洞的 Agent 和验漏洞的 Agent 不是同一个。

验证者拿到全新上下文,任务是试着证伪。

有个细节值得看:默认不执行被审计的代码。

没有 OS 级沙箱,所有需要跑构建、跑测试的线索一律标成 needs_validation,不给「已确认」。

这句话翻译过来就是:没把握的事,别装成有把握。

适合发版前或者接外部代码时,让 Agent 系统过一遍自家仓库。

affaan-m/ECC 和 system_prompts_leaks:配置层在变成公共情报

https://github.com/affaan-m/ECC

ECC 想做跨工具的统一层,同一套技能和记忆配置能跑在 7 种 Agent 客户端上。

还带了安全审查模块,防止 Agent 乱跑危险命令。

不过它标着 26 万星,明显跟项目体量不匹配,这个数字别当真。

倒是另一个仓库更实在:

https://github.com/asgeirtj/system_prompts_leaks

有人把各家 AI 产品的系统提示词按厂商和版本扒下来归档,6.6 万星。

模型迭代太快,提示词反而成了能对比、能考古的公开情报。

做 Agent 的人想知道「模型开口之前被灌了什么规则」,去这儿翻就行。

二、本地推理:把云端拉回自己机器

这周另一半热度,全在「不租 API」这件事上。

graph TD
    A[AI 能力] --> B[云端 API<br/>按量付费]
    A --> C[本地自托管<br/>自己持有]
    C --> D[colibri<br/>MoE 推理]
    C --> E[VoiceStudio<br/>语音]
    C --> F[WeKnora<br/>知识库]
    C --> G[Ever Gauzy<br/>企业管理]
    A --> H[Agent 脚手架]
    H --> I[open-code-review<br/>代码审查]
    H --> J[security-audit-skill<br/>安全审计]
    H --> K[BrowserSkill<br/>操作浏览器]
    H --> L[ECC<br/>统一配置层]

JustVugg / colibri:把 SSD 当成显存的一层

https://github.com/JustVugg/colibri

纯 C、零依赖的推理引擎,一周稳定在两三千星一天。

MoE 先解释一下:模型里塞了很多个「专家」子网络,每次推理只叫醒其中几个。

colibri 干的事,是把显存、内存、NVMe 当成同一套内存层级。

专家按需从磁盘流式加载,744B 到 2.8T 的模型能在消费级机器上跑。

它的取舍写得很克制:快内存不够只掉速度,不改精度、不动路由逻辑。

作者自己说「不保证速度、只保证语义正确」,几个优化还标着待验证。

网页面板把 19546 个专家画成一张图,颜色是存在哪层,亮度是路由热度,挺直观。

适合手里有一两张显卡加大内存的开发者,想私有跑 GLM、Kimi 这类开放 MoE。

对比 llama.cpp 和 ktransformers,它下沉到单个专家粒度,把磁盘真当一级缓存调度。

debpalash / VoiceStudio:本地版 ElevenLabs

https://github.com/debpalash/VoiceStudio

3 万多星的桌面应用,把 16 个 TTS 和 11 个 ASR 引擎装进一个壳里。

卖点就一句:声音素材不出本机,不用账号,不按字符计费。

引擎可以热切换,同一段文本换模型对比,不用重装环境。

对外的接口有三种:本地 REST、OpenAI 兼容的音频接口、还有一个 MCP Server。

MCP 就是让 Agent 调外部工具的一套通用接口,配上之后 Claude 这类客户端能直接把它当语音后端。

还在 beta,Electron 版正在重写,建议只用 release 版本。

Tencent / WeKnora:企业文档变成能问答的知识库

https://github.com/Tencent/WeKnora

腾讯开源的 LLM 知识平台,Go 写的,可以私有化部署。

它解决的是 RAG 的老毛病:检索出来的块不对,但你改不了。

WeKnora 让检索块能像文档一样编辑、看 diff、回滚,改完自动重建索引。

RAG 就是从你自己的文档里先捞相关段落,再让模型照着回答。

技能沙箱那块做了个明确取舍:去掉本地宿主进程后端,只留 Docker / E2B / Cube。

宁可部署麻烦一点,也不让 Agent 代码直接跑在宿主机上。

对标 Dify、RAGFlow,但它更偏企业治理,四级权限加审计日志。

ever-co/ever-gauzy:一套开源软件替掉一堆 SaaS

https://github.com/ever-co/ever-gauzy

TypeScript 写的企业管理全家桶,ERP、CRM、人事、招聘、项目管理、工时追踪全塞一起。

桌面版能内嵌 API 加 SQLite,装完就用,不用运维数据库。

工时监控是内置模块:定时截屏、记录键鼠活跃度,直接写回工时表。

这块对标 HubStaff,但 HubStaff 没 ERP,Odoo 又没这种级别的工时监控。

AGPL 授权,官方 SaaS 还标着 Alpha,生产用建议先自己搭一套验证。

三、Agent 的手脚:借用你的浏览器

https://github.com/Tencent/BrowserSkill

腾讯这个工具一天涨 1300 星,解决的是让 Agent 上网最难的一步。

真实登录态。

别的方案要么另起一个浏览器实例,要么通过 MCP 绑死客户端,登录态全丢。

BrowserSkill 的做法是显式「借标签页、还标签页」。

Agent 借你已登录的那个标签页干活,任务结束归还,其他标签页不碰。

自己的活儿跑在独立的 Agent Window 里,你能一边让 Agent 操作网页一边继续上网。

碰到验证码或者二次确认,控制权交回给你,处理完它接着跑。

只暴露一个 shell CLI,不绑模型,bsk install-skill 能往 8 种以上 harness 写技能。

四、还有两个值得看一眼的

https://github.com/NationalSecurityAgency/ghidra

NSA 开源的反汇编反编译框架,7.7 万星,这周因为构建链升到 JDK 25 重新上榜。

免费内置反编译器是它和 IDA 最大的差别,IDA 那个得单独再买一份。

现在主推 PyGhidra,用 Python 3 直接调 Java API,替掉了停在 Python 2 的 Jython。

做样本分析、漏洞挖掘、CTF 的都能用。

https://github.com/abue-ammar/tinycast

纯 Swift 写的 macOS 启动器,常驻内存压在 100MB 以内。

它最聪明的一点是能直接跑现成的 Raycast 扩展。

换客户端不用换插件,老用户整包导过来就行,这是真能拉走人的钩子。

缺点是只支持 macOS 26 以上。

这周到底说明什么

三件事。

第一,Agent 拼的不再是模型,是流程。确定性代码管硬约束,模型管判断,分工越来越清楚。

第二,验证成了标配。Cloudflare 让另一个 Agent 来证伪,阿里把可能出错的行号定位单独拆成模块。AI 说的话不能直接信。

第三,本地优先从口号变成了能用的东西。一个月前「在自己机器上跑 744B」还是笑话,现在有人把 SSD 当显存写出来了。

对开发者的实际意义很简单:可以开始算账了。

哪些活必须花钱买 API,哪些活搬到本地更划算、更合规,这周的项目基本把选项摆齐了。