32 个 AI 编排器,用七个维度的数据重新测一遍
本文数据口径:GitHub API 快照拉取于 2026 年 10 月 5 日;功能、平台、协议、价格以当日各项目官网与文档为准;性能对比引用 Databricks 2026 年 7 月 8 日发布的内部基准。这个品类迭代以周为单位,阅读时请注意时效。
从一张天梯榜说起
十月初,X 上流传一张 AI 编排器天梯榜,三十二个工具从 SS 排到 E。那份排名是作者的个人体验,标准只有三条:界面清楚、少盯着、流程别断。主观排名没有对错,但也没法复用。
名单本身有价值。它基本覆盖了 2026 年这个品类的主流项目,可以当成一个现成的样本池。所以我做了一件笨事:把三十二个项目挨个找出来,拉 GitHub 数据,查官网文档,翻第三方基准,用同一套客观维度重新过一遍。不参考任何人的主观排名,只看数据。
评测维度一共七个:社区影响力、增长速度、能力广度、开放程度、自动化能力、安全与可持续、成本。
先对齐口径:这份名单混了三类东西
比数据之前,有一个前置发现必须先摆上桌:这三十二个项目不是同一类东西。
第一类是编排器,负责任务分派、worktree 隔离、进度跟踪,比如 Orca、T3 Code、Paseo。第二类是 harness,包裹模型的那层执行壳,比如 Pi 和它的分叉 Oh My Pi,编排器要接管的正是这一层。第三类是 agent 本体,比如 Hermes Agent,一个能自己干活的通用 agent,编排只是它的能力之一。
原榜单把三类混排在一起,热度数字直接对比会失真。下面的所有数据都保留原样,但类型会逐一标注,比较时请记住这一点。
维度一:社区影响力
按 GitHub 星数排名(2026 年 10 月 5 日快照),前十名的座次和很多人的直觉对不上:
| 排名 | 项目 | 类型 | 星数 |
|---|---|---|---|
| 1 | Hermes Agent | agent 本体 | 251,430 |
| 2 | Pi | harness | 112,709 |
| 3 | Orca | 编排器 | 85,006 |
| 4 | Herdr | 终端复用器 | 42,493 |
| 5 | Oh My Pi | harness 分叉 | 34,297 |
| 6 | T3 Code | 编排器 | 25,175 |
| 7 | Paseo | 编排器 | 19,504 |
| 8 | OpenCodeX | 编排器 | 16,975 |
| 9 | Superset | 编排器 | 14,870 |
| 10 | Agent Orchestrator | 编排器 | 12,788 |
星数第一名的 Hermes Agent,主业是通用 agent runtime,编排是副业。严格意义的编排器里,第一名是 Orca,八万五千星。第四名 Herdr 值得单独说一句:它是个纯 Rust 写的终端复用器,功能极简,四万二千星说明「把多个终端 agent 聚在一个屏幕里」这个需求真实存在,而且比很多人想象的大。
三十二个项目里,二十四个有公开仓库数据,其余多为闭源商业产品,以官网信息为准。fork 数与星数基本同向。要提醒一句:星数和 fork 是关注度指标,不等同真实活跃用户。
维度二:增长速度
总量会骗人,因为项目年龄差太多。Traycer 2024 年 5 月就存在,是这个名单里资历最老的;Orca 2026 年 3 月才创建。直接比星数,等于让长跑选手和短跑选手比累计里程。
公平的算法是月均增星:星数除以存活月数。重算之后的排名:
| 项目 | 月均增星 |
|---|---|
| Hermes Agent | 约 17,400 |
| Orca | 约 12,800 |
| Pi | 约 8,100 |
| Herdr | 约 6,700 |
| OpenCodeX | 约 4,700 |
| Oh My Pi | 约 3,800 |
| T3 Code | 约 3,200 |
| Omnigent | 约 2,800 |
| Traycer | 约 55 |
两个结论。第一,原榜单作者的日常体验排序,和 GitHub 关注度排名明显错位,体验好坏与社区热度是两组独立信号。第二,Traycer 总量看着还行,摊到二十九个月,每月只有五十五星,动能基本停了。反过来说,增速只反映当下动能,三个月的新项目也可能明年停更,这个指标预测不了寿命。
维度三:能力广度
能力广度先对齐口径:数的是各项目官方内置和明确支持的 agent 或 harness 数量。
- Agentastic 内置五十五个 agent 定义,其中三十个支持结构化 Chat
- Paseo 官方目录四十多个(6 个原生加 36 个 ACP catalog),另可接任意 ACP agent
- Orca 官方列出三十多个常见 agent,并支持任意能在终端运行的 CLI
- Agent Orchestrator 二十七个上下
- Emdash 二十五个
- Superset 二十二个内置,加自定义 CLI
- Synara 十个,Waku 八个
- T3 Code 稳定版六个,10 月 2 日的 V2 nightly 又加入 Pi 和 ACP Registry
有一处口径要特别标注:Pi 官网写的「15+」是模型 provider 数量,跟可编排的 agent 数不是一回事,不能混进这张表。
比具体数字更要紧的是趋势。这些数字按周在变,而且 Orca、Superset、Paseo 都在从「固定支持 N 个 agent」转向「任意 CLI / ACP 开放扩展」。Orca 的说法很直白:能在终端跑,就能在 Orca 里跑。一旦开放扩展成为标配,「谁多两个、谁少三个」的排行榜就失去意义了,扩展机制本身才是这个维度的分水岭。
平台覆盖的差距同样实在。桌面、Web、移动端全端覆盖的只有三家:Orca、T3 Code、Paseo。只做 Mac 的有五个,只做终端的有四个。自动化能力的差距更大:带定时任务的至少七家,能在 CI 挂了之后自己修的,只有 Agent Orchestrator 一家。
维度四:开放程度
开放程度看开源协议,这一条直接决定二次开发和商用集成的空间。
宽松协议占多数。MIT 或 Apache 阵营二十个上下,Orca、T3 Code、Paseo、Herdr、OpenCodeX 都在列。带传染性条款的有三家:Kandev 是 AGPL,Waku 是 GPL,CodexHost 是 LGPL,商用集成之前建议让法务看一眼。Superset 是 ELv2,源码可见,商用有限制。Reliant 是 BSL 1.1,每个版本发布四年后自动转 Apache。完全闭源的三个:Conductor、Maestri、super.engineering。Clor 比较特殊,控制平面闭源,容器和技能部分开源。
对想基于这些工具做二次开发的人来说,这一个维度就能直接筛掉一半候选。
维度五:安全与可持续
两个容易被忽略的维度,放在一起说。
安全上,Hermes Agent 是个典型案例。它功能强,能自己沉淀技能,能挂各种消息平台,代价写在公开记录里:CVE 数据库收录了四十四个,4 月 11 日一名社区研究者提交的独立安全审计,列出四个严重级别加九个高危级别。这不是针对 Hermes 的指控,是通用规律:agent 的权限越大,攻击面越大。选型时要把权限模型和安全记录一起查。
可持续先看一组口径修正。GitHub API 返回的 open_issues_count 字段,实际是 open issues 与 open PR 的合计值,本文统一按「open 合计」标注。按这个口径,Hermes 的合计是四万八,社区最大,待处理量也最大;Orca 七千五,T3 Code 两千二。
维护结构是另一种风险。Paseo 各项数据都很好,但单人维护,团队采购要把巴士因子算进去。闭源项目的风险在另一头:公司方向一变,你的工作流就得跟着迁移。
维度六:成本结构
成本分三层,翻车的往往是第三层。
第一层是工具费用。多数免费。收费的里面:Traycer 每月八美元起,Maestri 十九美元,Superset 远程功能每人二十美元,Conductor Pro 五十美元含云工作区配额,Solo Pro 每年九十九美元。
第二层是模型费用。多数编排器要求自备模型账号、API 额度或已有订阅,这笔钱通常远大于工具费。
第三层是 token 消耗,最容易被忽略,也最容易失控。Databricks 7 月 8 日发布的内部基准有硬数据:在他们自己的数百万行生产代码库上,用真实合并过的 PR 当任务,同一模型、同一思考强度,只换 harness,任务通过率基本持平,但单任务成本在部分场景相差两倍以上。差距主要来自每层壳每轮喂给模型的上下文量,Pi 每轮发送的上下文约为对照组的三分之一,这也让简单 harness 多次站上性价比前沿。
结论很朴素:工具免费,token 不免费。壳的设计直接影响每月账单。
维度七:按数据分组
七个维度过完,三十二个项目按数据特征分成五组:
- 全功能桌面组:Orca、Superset、T3 Code。功能完整、社区规模大
- 自托管移动组:Paseo、Kandev。daemon 架构,手机可用(Kandev 无原生 App,手机 Web 可访问)
- 终端原生组:Pi、Oh My Pi、Herdr、Sidecar
- 治理企业组:Omnigent、HarnessRouter、Traycer
- 专用场景组:Conductor 绑 Claude 生态,Maestri 画布交互,CodexHost 寄生 Codex Desktop,Agent Orchestrator 管 PR 全流程,Emdash 接工单,Clor 做容器隔离
OpenCodeX 公开资料不足,不归入任何组。五组没有谁碾压谁,服务的是不同的工作流。
按场景选型
数据最终要落到选择上。按四类典型人群给出清单。
个人开发者,每天在桌前写代码,偶尔并行两三个任务,看三组数据就够:平台覆盖、接入数量、协议。T3 Code 全端、免费、MIT,上手成本最低。要更多 agent 选择就上 Orca。终端党重点看 Pi,Databricks 基准里它多次站上性价比前沿,但这份基准只测了 Pi,没有测 Oh My Pi,结论不能自动外推到分叉版。想把一台机器常开、从手机远程盯任务,Paseo 和 T3 Code 都能做到:Paseo 强在 daemon 自托管加端到端加密中继,T3 Code 提供 T3 Connect、局域网和 Tailscale 直连,权限请求在手机上就能批。
团队和企业场景,筛选条件换成另外三个:协议、治理能力、可持续结构。协议先刷掉 AGPL、GPL、BSL 和闭源,剩 MIT 和 Apache 阵营。治理需求看 Omnigent,策略引擎、预算熔断、云沙箱隔离都有,能让不同厂商的 agent 互相审查产出。要把 agent 能力嵌进自家产品,HarnessRouter 提供统一 API 和单容器自托管。工单驱动的团队看 Emdash,Linear 和 Jira 的工单直接派给 agent。要全流程托管的看 Agent Orchestrator,官方口径覆盖桌面、网页、移动端和云端 agent,CI 挂了它自己修。团队采购还要把维护结构算进去,单人项目数据再好看,也要有备份方案。
特殊需求对号入座:只用 Mac 且深度用 Claude Code,Conductor 的 worktree 流程打磨得最早。喜欢可视化编排,Maestri 用画布和连线代替 API。已经在用 Codex Desktop,CodexHost 能把其他十几个 agent 装进同一个窗口。苹果芯片且追求启动速度,super.engineering 冷启动五十毫秒以内,代价是闭源。想要最小化的东西,Herdr 是纯 Rust 终端复用器。同时付着 Claude 和 Codex 两份订阅的,Clor 能把两个官方 CLI 装进隔离容器里统一调度。成本敏感、仓库又大的,优先看上下文效率,Pi 在 Databricks 基准里的表现就是冲这个场景来的。
完整对照表:
| 场景 | 硬筛选条件 | 数据匹配的候选 |
|---|---|---|
| 个人开发者(桌前为主) | 免费、上手快、协议宽松 | T3 Code、Orca;终端党选 Pi |
| 手机审批+常开机器 | 移动端可控制、远程连接 | Paseo、T3 Code |
| 团队协作、工单驱动 | 工单集成、PR 自动化 | Emdash、Agent Orchestrator |
| 企业治理、合规 | 宽松协议、策略与审计 | Omnigent、HarnessRouter |
| Mac+Claude Code 深度用户 | 生态绑定 | Conductor |
| Codex Desktop 用户 | 不换界面扩 agent | CodexHost |
| 可视化偏好 | 画布交互 | Maestri |
| 极简终端党 | 无 GUI、低开销 | Herdr、Pi、Sidecar |
| Claude+Codex 双订阅 | 容器隔离、凭证同步 | Clor |
| 成本敏感、大仓库 | 上下文效率 | Pi |
两条边界
收尾前,把这份数据的边界说清楚。
第一,星数和增速是关注度指标,跟质量是两回事。热度高的项目照样可以有半成品的功能,而且这份名单把 agent、harness 和编排器混在了一起,任何跨类型比较都要先对齐口径。
第二,这份快照是 10 月 5 日的。这个品类的迭代以周为单位:Paseo 八月底还在换协议,Orca 半年从零涨到八万五千星,Agentastic 的内置数一周内就能多出三个。任何固定排名都有保质期,这篇文章也不例外。
所以正确的用法不是抄排名,是把这七个维度当成自己的筛选器:输入你的场景,输出候选名单,然后亲手试两天。数据负责缩小范围,体验负责最终决定。
附录:社区影响力完整矩阵
| 项目 | 类型 | 星数 | fork | 创建时间 | 月均增星 |
|---|---|---|---|---|---|
| Hermes Agent | agent 本体 | 251,430 | 53,997 | 2025-07 | 约17,400 |
| Pi | harness | 112,709 | 14,301 | 2025-08 | 约8,100 |
| Orca | 编排器 | 85,006 | 5,483 | 2026-03 | 约12,800 |
| Herdr | 终端复用器 | 42,493 | 3,312 | 2026-03 | 约6,700 |
| Oh My Pi | harness 分叉 | 34,297 | 3,707 | 2025-12 | 约3,800 |
| T3 Code | 编排器 | 25,175 | 6,516 | 2026-02 | 约3,200 |
| Paseo | 编排器 | 19,504 | 2,290 | 2025-10 | 约1,700 |
| OpenCodeX | 编排器 | 16,975 | 1,280 | 2026-06 | 约4,700 |
| Superset | 编排器 | 14,870 | 1,328 | 2025-10 | 约1,300 |
| Agent Orchestrator | 编排器 | 12,788 | 1,766 | 2026-02 | 约1,700 |
| Omnigent | 元编排器 | 10,600 | — | 2026-06 | 约2,800 |
| Emdash | 编排器 | 5,914 | — | 2025-08 | 约450 |
| bb | agentic IDE | 4,129 | — | 2026-02 | 约560 |
| CodexHost | 宿生扩展 | 2,721 | 240 | 2026-07 | 约1,100 |
| MonoCode | GUI | 2,586 | 259 | 2026-08 | 约1,700 |
| Synara | 编排器 | 2,007 | 312 | 2026-03 | 约320 |
| Traycer | 编排器 | 1,584 | 213 | 2024-05 | 约55 |
| Waku | 编排器 | 1,564 | 184 | 2026-07 | 约720 |
| Sidecar | 终端工作台 | 1,086 | 82 | 2025-12 | 约120 |
| Kandev | 看板编排 | 900 | — | 2026-01 | 约100 |
| Ghostex | 终端整合 | 892 | — | 2026-04 | 约170 |
| Reliant | 工作流编排 | 74 | 8 | 2025-12 | 约7 |
| Silo | 多项目切换 | 59 | — | 2026-06 | 约15 |
| Tortie | — | 0 | 0 | 2026-08 | — |
闭源或未公开仓库(Conductor、Maestri、super.engineering、Solo、Jean、Agentastic、HarnessRouter、Clor)无公开数据,以官网信息为准。
数据来源说明:星数、fork、创建时间为 2026-10-05 GitHub API 快照;月均增星为派生计算值;功能、协议、价格以各项目官网与文档当日状态为准;Databricks 基准发布于 2026-07-08。