上个月,一个刚拿到 A 轮的朋友给我发了张截图。Fivetran 的月账单:$7,800。他们团队 25 个人,数据源不过十来个,Stripe、HubSpot、PostgreSQL、几个 Google Sheets。三个月前这个数字还是 $1,200。
他问我:「到底发生了什么?」
答案很简单。他们的用户量涨了,Fivetran 按 Monthly Active Rows 计费,每一行被同步的数据都在烧钱。用户增长本来是好事,但数据集成的账单跟着一起涨,这笔钱花得让人肉疼。更让他崩溃的是,他根本没法预估下个月的账单会是多少,因为 MAR 的增长和业务增长是绑定的,而业务增长本身就不可预测。
这不是个例。几乎每个我认识的早期创业团队,都在某个阶段撞上同一面墙:数据集成工具到底怎么选?选贵的怕浪费,选便宜的怕踩坑,选开源的怕维护成本吃掉省下来的钱。而且这个决定一旦做了,迁移的惰性会让你在一个不合适的工具上待很久。
手写脚本的日子
先说说为什么需要这类工具。如果你的数据团队还在用 Python 脚本从各个 SaaS 拉数据灌进数据库,你大概已经体会过这种痛苦:某天 Shopify 悄悄改了 API 的分页逻辑,你的脚本静悄悄地失败了,没有报错,只是不再返回完整数据。等你两周后发现的时候,数据仓库里已经缺了十四天的订单数据,而营销团队基于这些残缺数据做出的投放决策已经执行了。
我见过一个种子轮的团队,CTO 亲手写了 8 个数据同步脚本,跑在一台 EC2 上。头三个月没问题,第四个月 Google Ads API 升级到 v15,脚本挂了。第五个月 Intercom 的 webhook 格式变了,又挂了。第六个月那台 EC2 磁盘满了,所有脚本一起挂了。他花了一整个周末修这些东西,然后周一开了个会说:「我们买个工具吧。」
数据集成工具做的事情本质上很直接:把散落在几十个 SaaS、数据库、文件系统里的数据,按照固定节奏自动同步到你的数据仓库。它帮你处理 API 版本升级、增量同步、schema 映射、限流重试、错误告警这些脏活累活。你不用关心 Stripe 的 API 是不是又改了,工具的维护团队会帮你跟进。
对创业公司来说,选型的核心诉求归结起来就三个:别太贵、别老出问题、能覆盖我正在用的那些数据源。听起来简单,但市面上主流的四个选手,走的是完全不同的路。
Fivetran:贵有贵的道理
Fivetran 是这个品类的定义者。2012 年成立,比大多数竞争对手早了好几年,2021 年拿到 $565M 的 D 轮融资,估值一度达到 $5.6B。它的 connector 数量最多,据官方披露超过 500 个,几乎你能想到的主流 SaaS 都有现成的对接,而且质量普遍比较高。
用 Fivetran 的体验确实丝滑。配置一个新数据源,通常十分钟内就能看到数据流入仓库。schema 变更自动处理,上游加了一个字段,下游自动出现。监控和告警开箱即用,哪个同步任务失败了、延迟了,都会第一时间通知你。对于数据工程师来说,这意味着他们可以把时间花在建模和分析上,而不是维护管道。
但 Fivetran 的计费模型是它最大的争议点。MAR 计费意味着你同步的数据越多,花的钱越多。一个电商公司,订单表每天新增几千行,用户行为表每天新增几十万行,MAR 会迅速累积。很多团队在产品起量的那个阶段,突然发现 Fivetran 的账单从每月几百美元跳到了几千甚至上万美元。而这个时间点往往也是公司最需要控制 burn rate 的时候。
Fivetran 自己也意识到了这个问题,2024 年之后推出了一些定价优化方案,比如承诺用量换折扣。但本质没变:它适合那些数据预算充裕、追求零运维的团队。
Airbyte:开源搅局者
Airbyte 2020 年才成立,但增长速度惊人。它选了一条跟 Fivetran 完全对立的路:开源。核心引擎完全开放,任何人都可以免费部署在自己的服务器上。
这个策略直接击中了两类人的痛点。第一类是预算紧的早期团队,他们付不起 Fivetran 的钱,但有工程师愿意花时间搞定部署和运维。第二类是对数据安全要求高的公司,他们不想让第三方 SaaS 碰自己的数据库凭证,自托管意味着所有数据流转都在自己的基础设施内完成。
Airbyte 的 connector 数量增长得很快,官方加社区贡献加起来超过 350 个。它还提供了一套 Connector Development Kit,让你可以相对快速地给自己用的小众工具写一个自定义 connector。我见过有团队在半天内就用 CDK 写出了一个能用的 connector,虽然粗糙,但能跑。
自托管版本的问题也很现实。Airbyte 的架构不轻,早期版本用 Docker Compose 部署还好,但数据量上来之后,你可能需要迁移到 Kubernetes,这对没有专职 DevOps 的小团队来说是个坎。升级版本偶尔会遇到 breaking change,某些社区贡献的 connector 质量参差不齐,出了问题你只能自己翻源码排查。
如果不想操心运维,Airbyte Cloud 是托管版本,按数据量计费,起价大约每月几十美元。比 Fivetran 便宜不少,但也失去了「免费」这个最大卖点。
Hevo:安静但好用
Hevo 的存在感不如前两家高,但在用过的人里口碑不错。印度团队打造,2017 年成立,融资规模不大,走的是精打细磨产品体验的路线。
它最吸引人的地方是定价模型:按事件数计费。一个事件就是一条数据记录的一次同步。这意味着你的月费和数据同步频率直接相关,而不是和数据总量相关。如果你只需要每天同步一次,成本就很可控;如果你需要实时同步,成本会上去,但至少你能提前算出来大概是多少。
Hevo 的 UI 设计得确实比较用心。配置数据流的过程很直观,拖拽式的操作,不需要写代码。数据转换可以在同步过程中完成,不用另外搞一个 dbt 项目。对于那些没有专职数据工程师、由分析师兼任管道维护的团队来说,这种低门槛很有吸引力。
短板在于 connector 覆盖度。大约 150 个左右的 connector,覆盖了主流的 CRM、广告平台、支付系统和数据库,但如果你用了一些比较新或者比较小众的工具,可能就没有现成的对接。另一个问题是它在中国市场的知名度和本地化支持都偏弱,如果你的数据源里有很多国内的 SaaS(飞书、有赞、微盟),Hevo 基本帮不上忙。
起价大约 $299/月,对 A 轮之后的团队来说是个可以接受的数字。免费试用期给得也比较大方,足够你评估它是否适合自己的场景。
Stitch:被收购后的沉寂
Stitch 的背景很有意思。它脱胎于 Singer 项目,Singer 是一套开源的数据抽取规范,定义了 tap 和 target 的概念,让不同数据源的抽取逻辑可以标准化复用。Stitch 把这套东西包装成了一个商业产品,面向小团队,定价亲民。
然后 Talend 收购了 Stitch,Qlik 又收购了 Talend。两轮收购之后,Stitch 的产品更新节奏明显放缓。新 connector 的上线速度慢了,已有 connector 的 bug 修复也不如以前及时。社区里有不少声音在讨论 Stitch 是不是已经进入了维护模式。
但如果你的需求很简单,数据源就那么三五个主流的 SaaS,数据量也不大,Stitch 起价大约 $100/月,依然是成本最低的托管方案。它的 connector 虽然不多,大约 130 个,但 Salesforce、Google Analytics、Facebook Ads 这些高频需求都有,而且配置起来非常简单。
我对 Stitch 的建议是:如果你现在已经在用,而且没遇到什么问题,不必急着迁走。但如果你是新选型,很难推荐一个更新节奏存疑的产品作为长期方案。
放到一起看
| 维度 | Fivetran | Airbyte | Hevo | Stitch |
|---|---|---|---|---|
| 计费模型 | MAR(按活跃行数) | 自托管免费 / Cloud 按用量 | 按事件数 | 按数据行数 |
| 入门月费 | 几百美元起,易膨胀 | 自托管 $0 / Cloud 几十美元起 | ~$299 | ~$100 |
| Connector 数量 | 500+ | 350+(含社区) | ~150 | ~130 |
| 自托管选项 | 无 | 有(开源核心) | 无 | 无 |
| 运维负担 | 零 | 自托管需要运维能力 | 零 | 零 |
| Schema 变更处理 | 自动适应 | 手动或半自动 | 自动适应 | 有限支持 |
| 数据转换能力 | 内置基础转换 | 需配合 dbt | 内置拖拽转换 | 无 |
| 适合阶段 | B 轮+ / 数据源复杂 | 种子期 DIY / A 轮起步 | A 轮中小团队 | 超早期低预算 |
这张表给了一个大致轮廓,但真正做选型的时候,你需要回到自己团队的具体情况。
三种创业公司,三个选法
种子期,5 个人,有个全栈工程师愿意折腾。 这种团队的典型状态是:月数据预算能省则省,但有个技术好手什么都愿意试。Airbyte 自托管几乎是天然匹配。花半天时间用 Docker Compose 在一台便宜的云主机上部署起来,配好三五个 connector,设置每日同步,搞定。整个方案的硬件成本可能就 $30-50/月。
代价是那个工程师得兼顾 Airbyte 的日常维护。版本升级、connector 偶尔报错、磁盘空间监控,这些零碎事加起来每周可能要花两三个小时。如果这个人离职了,或者公司进入快速招人期他的时间变得更值钱了,你就需要重新评估这个方案的真实成本。
A 轮之后,20-50 人,开始有专职数据角色。 这个阶段的团队通常已经有了数据分析师,业务决策开始依赖日报和看板。数据同步的可靠性变得比价格更重要,因为一次同步失败可能导致整个管理层看到错误的数字。
Hevo 在这个阶段很有竞争力。定价可预测,不会被突然飙升的账单打乱财务计划。UI 友好,分析师自己就能配置新数据源,不用排队等工程师。如果 connector 覆盖度满足你的需求,Hevo 可能是性价比最优的方案。
Airbyte Cloud 也是好选择,尤其当你用了一些小众 SaaS 的时候。它的 connector 生态比 Hevo 大得多,社区活跃度也高,遇到问题更容易找到解决方案。
B 轮之后,100 人以上,数据源又多又杂。 这时候你可能同时在用 Salesforce、NetSuite、Marketo、Snowplow、自建 event tracking,再加几个行业垂直的 SaaS。数据源数量超过二十个,每个都有自己的 API 怪癖。
Fivetran 在这个阶段的价值才真正体现。它那五百多个高质量 connector 不是噱头,当你的 NetSuite 突然更新了 API 版本,Fivetran 的团队会在几天内跟进适配,你什么都不用做。企业级的 SLA、SOC 2 认证、HIPAA 合规,这些对接大客户或者准备上市的公司来说是硬需求。
但即便到了这个规模,很多数据团队也不会只用一个工具。核心商业系统走 Fivetran 保证稳定,长尾的、小众的、或者自建系统的数据用 Airbyte 补上,中间用 Dagster 或 Prefect 做统一调度。这种混合架构在 2026 年已经非常普遍。
那些不在月费里的钱
选型的时候只看月费报价是不够的。有几笔隐藏成本容易被忽略。
第一笔是 MAR 的非线性增长。你的产品如果有病毒式传播的潜力,用户量可能在某个月突然翻倍。MAR 跟着翻,Fivetran 的账单也跟着翻。很多团队是在融资间隔期遇到这种情况的,现金流本来就紧,突然多出一笔意料之外的开支。
第二笔是工程师时间的机会成本。Airbyte 自托管省了软件费,但你的工程师每周花在运维上的时间,折算成薪资可能比 Hevo 的月费还贵。更关键的是,这些时间如果花在产品迭代上,创造的商业价值远不止这个数字。
第三笔是 connector 缺失的代价。当你发现自己用的某个工具没有现成 connector 的时候,你面临三个选择:自己写一个(Airbyte CDK 让这件事可行但仍需投入)、找个付费的中间件(又多一笔开支)、或者手动导出 CSV 再导入(回到原始时代)。这笔成本在选型时很难预估,但几乎每个团队都会遇到。
第四笔是迁移成本。虽然我前面说了迁移没有想象中那么难,但也不是零成本。重新配置 connector、验证数据完整性、做一次历史全量回灌、更新下游的 dbt 模型和报表,整个过程可能要一个数据工程师投入一到两周的时间。
组合比单选更现实
2026 年的数据栈生态,越来越像一个乐高组合而不是一个整体解决方案。数据集成层也不例外。
一个比较典型的组合是:Fivetran 负责核心 SaaS 数据源(CRM、ERP、支付)的高可靠同步,Airbyte 负责长尾数据源和自定义需求,上面加一层编排工具统一管理调度和监控。这样既保证了关键数据管道的稳定性,又有足够的灵活性应对各种边角场景,总成本也比全部用 Fivetran 低不少。
对于还在早期的创业团队,我的建议很实际:先从能满足当前需求的最简方案开始。种子期用 Airbyte 自托管或者 Stitch,A 轮之后评估要不要换成 Hevo 或 Airbyte Cloud,等数据团队扩展到五人以上、数据源超过二十个的时候,再考虑引入 Fivetran 处理核心管道。
别在种子期就绑死在最贵的方案上。也别在团队已经五十个人的时候,还让高薪工程师花时间维护手写脚本。找到当前阶段的平衡点,比找到「最好的工具」更重要。数据集成这个品类还在快速演化,你今天做的选择不需要是永久的,只需要是当下最合理的。



