32 个 AI 编排器,用七个维度的数据重新测一遍

十月初,X 上流传一张 AI 编排器天梯榜,三十二个工具从 SS 排到 E。那份排名是作者的个人体验,标准只有三条:界面清楚、少盯着、流程别断。主观排名没有对错,但也没法复用。 名单本身有价值。它基本覆盖了 2026 年这个品类的主流项目,可以当成一个现成的样本池。所以我做了一件笨事:把三十二个项目挨个找出来,拉 GitHub 数据,查官网文档,翻第三方基准,用同一套客观维度重新过一遍。不参考任何人的主观排名,只看数据。 评测维度一共七个:社区影响力、增长速度、能力广度、开放程度、自动化能力、安全与可持续、成本

32 个 AI 编排器,用七个维度的数据重新测一遍
本文数据口径:GitHub API 快照拉取于 2026 年 10 月 5 日;功能、平台、协议、价格以当日各项目官网与文档为准;性能对比引用 Databricks 2026 年 7 月 8 日发布的内部基准。这个品类迭代以周为单位,阅读时请注意时效。

从一张天梯榜说起

十月初,X 上流传一张 AI 编排器天梯榜,三十二个工具从 SS 排到 E。那份排名是作者的个人体验,标准只有三条:界面清楚、少盯着、流程别断。主观排名没有对错,但也没法复用。

名单本身有价值。它基本覆盖了 2026 年这个品类的主流项目,可以当成一个现成的样本池。所以我做了一件笨事:把三十二个项目挨个找出来,拉 GitHub 数据,查官网文档,翻第三方基准,用同一套客观维度重新过一遍。不参考任何人的主观排名,只看数据。

评测维度一共七个:社区影响力、增长速度、能力广度、开放程度、自动化能力、安全与可持续、成本。

先对齐口径:这份名单混了三类东西

比数据之前,有一个前置发现必须先摆上桌:这三十二个项目不是同一类东西。

第一类是编排器,负责任务分派、worktree 隔离、进度跟踪,比如 Orca、T3 Code、Paseo。第二类是 harness,包裹模型的那层执行壳,比如 Pi 和它的分叉 Oh My Pi,编排器要接管的正是这一层。第三类是 agent 本体,比如 Hermes Agent,一个能自己干活的通用 agent,编排只是它的能力之一。

原榜单把三类混排在一起,热度数字直接对比会失真。下面的所有数据都保留原样,但类型会逐一标注,比较时请记住这一点。

维度一:社区影响力

按 GitHub 星数排名(2026 年 10 月 5 日快照),前十名的座次和很多人的直觉对不上:

排名项目类型星数
1Hermes Agentagent 本体251,430
2Piharness112,709
3Orca编排器85,006
4Herdr终端复用器42,493
5Oh My Piharness 分叉34,297
6T3 Code编排器25,175
7Paseo编排器19,504
8OpenCodeX编排器16,975
9Superset编排器14,870
10Agent Orchestrator编排器12,788

星数第一名的 Hermes Agent,主业是通用 agent runtime,编排是副业。严格意义的编排器里,第一名是 Orca,八万五千星。第四名 Herdr 值得单独说一句:它是个纯 Rust 写的终端复用器,功能极简,四万二千星说明「把多个终端 agent 聚在一个屏幕里」这个需求真实存在,而且比很多人想象的大。

三十二个项目里,二十四个有公开仓库数据,其余多为闭源商业产品,以官网信息为准。fork 数与星数基本同向。要提醒一句:星数和 fork 是关注度指标,不等同真实活跃用户。

维度二:增长速度

总量会骗人,因为项目年龄差太多。Traycer 2024 年 5 月就存在,是这个名单里资历最老的;Orca 2026 年 3 月才创建。直接比星数,等于让长跑选手和短跑选手比累计里程。

公平的算法是月均增星:星数除以存活月数。重算之后的排名:

项目月均增星
Hermes Agent约 17,400
Orca约 12,800
Pi约 8,100
Herdr约 6,700
OpenCodeX约 4,700
Oh My Pi约 3,800
T3 Code约 3,200
Omnigent约 2,800
Traycer约 55

两个结论。第一,原榜单作者的日常体验排序,和 GitHub 关注度排名明显错位,体验好坏与社区热度是两组独立信号。第二,Traycer 总量看着还行,摊到二十九个月,每月只有五十五星,动能基本停了。反过来说,增速只反映当下动能,三个月的新项目也可能明年停更,这个指标预测不了寿命。

维度三:能力广度

能力广度先对齐口径:数的是各项目官方内置和明确支持的 agent 或 harness 数量。

  • Agentastic 内置五十五个 agent 定义,其中三十个支持结构化 Chat
  • Paseo 官方目录四十多个(6 个原生加 36 个 ACP catalog),另可接任意 ACP agent
  • Orca 官方列出三十多个常见 agent,并支持任意能在终端运行的 CLI
  • Agent Orchestrator 二十七个上下
  • Emdash 二十五个
  • Superset 二十二个内置,加自定义 CLI
  • Synara 十个,Waku 八个
  • T3 Code 稳定版六个,10 月 2 日的 V2 nightly 又加入 Pi 和 ACP Registry

有一处口径要特别标注:Pi 官网写的「15+」是模型 provider 数量,跟可编排的 agent 数不是一回事,不能混进这张表。

比具体数字更要紧的是趋势。这些数字按周在变,而且 Orca、Superset、Paseo 都在从「固定支持 N 个 agent」转向「任意 CLI / ACP 开放扩展」。Orca 的说法很直白:能在终端跑,就能在 Orca 里跑。一旦开放扩展成为标配,「谁多两个、谁少三个」的排行榜就失去意义了,扩展机制本身才是这个维度的分水岭。

平台覆盖的差距同样实在。桌面、Web、移动端全端覆盖的只有三家:Orca、T3 Code、Paseo。只做 Mac 的有五个,只做终端的有四个。自动化能力的差距更大:带定时任务的至少七家,能在 CI 挂了之后自己修的,只有 Agent Orchestrator 一家。

维度四:开放程度

开放程度看开源协议,这一条直接决定二次开发和商用集成的空间。

宽松协议占多数。MIT 或 Apache 阵营二十个上下,Orca、T3 Code、Paseo、Herdr、OpenCodeX 都在列。带传染性条款的有三家:Kandev 是 AGPL,Waku 是 GPL,CodexHost 是 LGPL,商用集成之前建议让法务看一眼。Superset 是 ELv2,源码可见,商用有限制。Reliant 是 BSL 1.1,每个版本发布四年后自动转 Apache。完全闭源的三个:Conductor、Maestri、super.engineering。Clor 比较特殊,控制平面闭源,容器和技能部分开源。

对想基于这些工具做二次开发的人来说,这一个维度就能直接筛掉一半候选。

维度五:安全与可持续

两个容易被忽略的维度,放在一起说。

安全上,Hermes Agent 是个典型案例。它功能强,能自己沉淀技能,能挂各种消息平台,代价写在公开记录里:CVE 数据库收录了四十四个,4 月 11 日一名社区研究者提交的独立安全审计,列出四个严重级别加九个高危级别。这不是针对 Hermes 的指控,是通用规律:agent 的权限越大,攻击面越大。选型时要把权限模型和安全记录一起查。

可持续先看一组口径修正。GitHub API 返回的 open_issues_count 字段,实际是 open issues 与 open PR 的合计值,本文统一按「open 合计」标注。按这个口径,Hermes 的合计是四万八,社区最大,待处理量也最大;Orca 七千五,T3 Code 两千二。

维护结构是另一种风险。Paseo 各项数据都很好,但单人维护,团队采购要把巴士因子算进去。闭源项目的风险在另一头:公司方向一变,你的工作流就得跟着迁移。

维度六:成本结构

成本分三层,翻车的往往是第三层。

第一层是工具费用。多数免费。收费的里面:Traycer 每月八美元起,Maestri 十九美元,Superset 远程功能每人二十美元,Conductor Pro 五十美元含云工作区配额,Solo Pro 每年九十九美元。

第二层是模型费用。多数编排器要求自备模型账号、API 额度或已有订阅,这笔钱通常远大于工具费。

第三层是 token 消耗,最容易被忽略,也最容易失控。Databricks 7 月 8 日发布的内部基准有硬数据:在他们自己的数百万行生产代码库上,用真实合并过的 PR 当任务,同一模型、同一思考强度,只换 harness,任务通过率基本持平,但单任务成本在部分场景相差两倍以上。差距主要来自每层壳每轮喂给模型的上下文量,Pi 每轮发送的上下文约为对照组的三分之一,这也让简单 harness 多次站上性价比前沿。

结论很朴素:工具免费,token 不免费。壳的设计直接影响每月账单。

维度七:按数据分组

七个维度过完,三十二个项目按数据特征分成五组:

  • 全功能桌面组:Orca、Superset、T3 Code。功能完整、社区规模大
  • 自托管移动组:Paseo、Kandev。daemon 架构,手机可用(Kandev 无原生 App,手机 Web 可访问)
  • 终端原生组:Pi、Oh My Pi、Herdr、Sidecar
  • 治理企业组:Omnigent、HarnessRouter、Traycer
  • 专用场景组:Conductor 绑 Claude 生态,Maestri 画布交互,CodexHost 寄生 Codex Desktop,Agent Orchestrator 管 PR 全流程,Emdash 接工单,Clor 做容器隔离

OpenCodeX 公开资料不足,不归入任何组。五组没有谁碾压谁,服务的是不同的工作流。

按场景选型

数据最终要落到选择上。按四类典型人群给出清单。

个人开发者,每天在桌前写代码,偶尔并行两三个任务,看三组数据就够:平台覆盖、接入数量、协议。T3 Code 全端、免费、MIT,上手成本最低。要更多 agent 选择就上 Orca。终端党重点看 Pi,Databricks 基准里它多次站上性价比前沿,但这份基准只测了 Pi,没有测 Oh My Pi,结论不能自动外推到分叉版。想把一台机器常开、从手机远程盯任务,Paseo 和 T3 Code 都能做到:Paseo 强在 daemon 自托管加端到端加密中继,T3 Code 提供 T3 Connect、局域网和 Tailscale 直连,权限请求在手机上就能批。

团队和企业场景,筛选条件换成另外三个:协议、治理能力、可持续结构。协议先刷掉 AGPL、GPL、BSL 和闭源,剩 MIT 和 Apache 阵营。治理需求看 Omnigent,策略引擎、预算熔断、云沙箱隔离都有,能让不同厂商的 agent 互相审查产出。要把 agent 能力嵌进自家产品,HarnessRouter 提供统一 API 和单容器自托管。工单驱动的团队看 Emdash,Linear 和 Jira 的工单直接派给 agent。要全流程托管的看 Agent Orchestrator,官方口径覆盖桌面、网页、移动端和云端 agent,CI 挂了它自己修。团队采购还要把维护结构算进去,单人项目数据再好看,也要有备份方案。

特殊需求对号入座:只用 Mac 且深度用 Claude Code,Conductor 的 worktree 流程打磨得最早。喜欢可视化编排,Maestri 用画布和连线代替 API。已经在用 Codex Desktop,CodexHost 能把其他十几个 agent 装进同一个窗口。苹果芯片且追求启动速度,super.engineering 冷启动五十毫秒以内,代价是闭源。想要最小化的东西,Herdr 是纯 Rust 终端复用器。同时付着 Claude 和 Codex 两份订阅的,Clor 能把两个官方 CLI 装进隔离容器里统一调度。成本敏感、仓库又大的,优先看上下文效率,Pi 在 Databricks 基准里的表现就是冲这个场景来的。

完整对照表:

场景硬筛选条件数据匹配的候选
个人开发者(桌前为主)免费、上手快、协议宽松T3 Code、Orca;终端党选 Pi
手机审批+常开机器移动端可控制、远程连接Paseo、T3 Code
团队协作、工单驱动工单集成、PR 自动化Emdash、Agent Orchestrator
企业治理、合规宽松协议、策略与审计Omnigent、HarnessRouter
Mac+Claude Code 深度用户生态绑定Conductor
Codex Desktop 用户不换界面扩 agentCodexHost
可视化偏好画布交互Maestri
极简终端党无 GUI、低开销Herdr、Pi、Sidecar
Claude+Codex 双订阅容器隔离、凭证同步Clor
成本敏感、大仓库上下文效率Pi

两条边界

收尾前,把这份数据的边界说清楚。

第一,星数和增速是关注度指标,跟质量是两回事。热度高的项目照样可以有半成品的功能,而且这份名单把 agent、harness 和编排器混在了一起,任何跨类型比较都要先对齐口径。

第二,这份快照是 10 月 5 日的。这个品类的迭代以周为单位:Paseo 八月底还在换协议,Orca 半年从零涨到八万五千星,Agentastic 的内置数一周内就能多出三个。任何固定排名都有保质期,这篇文章也不例外。

所以正确的用法不是抄排名,是把这七个维度当成自己的筛选器:输入你的场景,输出候选名单,然后亲手试两天。数据负责缩小范围,体验负责最终决定。

附录:社区影响力完整矩阵

项目类型星数fork创建时间月均增星
Hermes Agentagent 本体251,43053,9972025-07约17,400
Piharness112,70914,3012025-08约8,100
Orca编排器85,0065,4832026-03约12,800
Herdr终端复用器42,4933,3122026-03约6,700
Oh My Piharness 分叉34,2973,7072025-12约3,800
T3 Code编排器25,1756,5162026-02约3,200
Paseo编排器19,5042,2902025-10约1,700
OpenCodeX编排器16,9751,2802026-06约4,700
Superset编排器14,8701,3282025-10约1,300
Agent Orchestrator编排器12,7881,7662026-02约1,700
Omnigent元编排器10,600—2026-06约2,800
Emdash编排器5,914—2025-08约450
bbagentic IDE4,129—2026-02约560
CodexHost宿生扩展2,7212402026-07约1,100
MonoCodeGUI2,5862592026-08约1,700
Synara编排器2,0073122026-03约320
Traycer编排器1,5842132024-05约55
Waku编排器1,5641842026-07约720
Sidecar终端工作台1,086822025-12约120
Kandev看板编排900—2026-01约100
Ghostex终端整合892—2026-04约170
Reliant工作流编排7482025-12约7
Silo多项目切换59—2026-06约15
Tortie—002026-08—

闭源或未公开仓库(Conductor、Maestri、super.engineering、Solo、Jean、Agentastic、HarnessRouter、Clor)无公开数据,以官网信息为准。

数据来源说明:星数、fork、创建时间为 2026-10-05 GitHub API 快照;月均增星为派生计算值;功能、协议、价格以各项目官网与文档当日状态为准;Databricks 基准发布于 2026-07-08。