周一早上九点,小李打开邮箱,看到了 Datadog 的月度账单。他揉了揉眼睛,确认自己没看错那个数字。上个月团队刚加了几台服务器做压测,账单直接翻了一倍多。他截图发到技术群里,CTO 回了一句:”调研一下替代方案吧。”
这个场景,过去两年在无数中小团队里重演。Datadog 的产品力毋庸置疑,但它按主机计费加上各模块独立收费的定价模型,让很多团队在业务扩张时感受到了明显的成本压力。尤其是当你同时用了 APM、日志管理和基础设施监控,账单的增长速度往往快过业务本身。
问题不在于 Datadog 不好用。恰恰相反,正因为它太好用了,团队容易不知不觉地开启更多功能、接入更多数据源,然后在月底被账单吓一跳。这种”温水煮青蛙”的体验,推动了大量团队开始认真评估替代方案。
替代方案的选型逻辑
在聊具体工具之前,有必要先理清一个思路:你到底在找什么?
如果你的核心诉求是”便宜”,那答案很简单,选开源自托管就行。但现实往往更复杂。有些团队缺乏运维人力来维护一套可观测性基础设施;有些团队需要开箱即用的 APM 能力;还有些团队虽然想省钱,但不愿意在告警可靠性上妥协。
所以真正的选型维度是这几个:你的团队有没有能力自己运维可观测性平台?你需要的是全栈可观测还是只需要日志和指标?你的数据量级是什么水平?你能接受多大的迁移成本?
带着这些问题,我们来逐个看看当下最值得关注的五个替代方案。
SigNoz:开源全栈可观测的扛旗者
SigNoz 是这几年开源可观测领域最受关注的项目之一。它的定位很明确:做一个开源的、基于 OpenTelemetry 的全栈可观测平台,直接对标 Datadog 的核心功能集。
什么叫”基于 OpenTelemetry”?简单说,OpenTelemetry 是 CNCF 下的开源标准,定义了 traces、metrics、logs 的采集规范。SigNoz 原生支持这套标准,意味着你不会被锁定在任何一个厂商的私有 agent 上。今天用 SigNoz,明天想换别的,数据采集层不用动。
回到小李的场景。他的团队有五六个后端工程师,跑着二十多个微服务,部署在自建的 Kubernetes 集群上。团队里有一个比较懂运维的同事,能搞定 Helm chart 部署。对这样的团队来说,SigNoz 几乎是量身定制的选择。
SigNoz 提供了统一的界面来看 traces、metrics 和 logs,不需要在三个不同的工具之间跳转。它的查询语言比较直观,告警配置也在同一个平台里完成。整体体验上,它确实在努力做到”一个平台解决所有可观测性问题”。
当然,自托管意味着你要自己搞定存储扩容、版本升级和高可用。SigNoz 底层用 ClickHouse 做存储,数据量大的时候 ClickHouse 的运维本身就是个活儿。如果团队没有这方面的经验,可能需要预留一些学习成本。
SigNoz 也提供了云托管版本,按数据量计费,价格比 Datadog 低不少,适合想用开源方案但不想自己运维的团队。
Grafana Cloud:生态最成熟的中间路线
如果说 SigNoz 是”新势力”,Grafana Cloud 就是”老牌劲旅”。Grafana 这个名字在运维圈几乎无人不知,它的仪表盘能力至今仍然是行业标杆。而 Grafana Cloud 把 Grafana、Loki(日志)、Tempo(链路追踪)、Mimir(指标)这些组件打包成了一个托管服务。
Grafana Cloud 的免费层相当慷慨:每月一万个活跃指标序列、50GB 日志和 50GB 链路追踪数据。对于早期创业团队或者小规模项目,这个免费额度可能就够用了。
一个真实的使用场景是这样的:某个十人左右的后端团队,之前用 Prometheus 加自建 Grafana 来看指标,日志靠 ELK。随着服务越来越多,维护这两套系统本身就消耗了大量精力。迁移到 Grafana Cloud 之后,他们保留了熟悉的 Grafana 仪表盘,日志换成了 Loki 的 LogQL 查询,链路追踪接入了 Tempo。整体运维负担减轻了,同时又没有完全失去对数据的掌控感。
Grafana Cloud 的优势在于生态成熟。几乎所有主流的开源监控组件都能和 Grafana 对接,社区 dashboard 模板数以千计。如果你的团队已经在用 Prometheus 和 Grafana,迁移到 Grafana Cloud 几乎是无缝的。
不过,Grafana Cloud 的 APM 能力相对于 Datadog 来说还是弱一些。如果你特别依赖深度的应用性能分析,比如代码级别的火焰图、数据库查询分析这些,可能需要额外评估。
New Relic:老牌玩家的免费层策略
New Relic 是可观测性领域的老前辈了,和 Datadog 属于同一梯队的商业产品。但近几年 New Relic 做了一个大胆的策略调整:推出了非常激进的免费层。
每月 100GB 的免费数据摄入量,一个免费的全权限用户,这在商业可观测性产品里是相当罕见的。New Relic 的逻辑很清楚:先让你用起来,等团队规模扩大、需要更多席位的时候再收费。
对于一个只有两三个开发者的小团队来说,New Relic 的免费层可能就完全够用了。你能用到完整的 APM、日志管理、基础设施监控、合成监控,功能上和付费版没有区别。这一点很关键,因为很多工具的免费版会阉割核心功能,但 New Relic 不会。
New Relic 的挑战在于,一旦团队超过免费层的限制,它的定价模型是按用户数加数据量双重计费的。对于大团队来说,成本未必比 Datadog 低多少。所以 New Relic 更适合的是”团队小但需要企业级功能”的场景,而不是”团队大想省钱”的场景。
还有一点,New Relic 这两年在 AI 方向投入很大,加入了不少智能告警和异常检测的能力。如果你的团队对 AIOps 感兴趣,New Relic 在这方面的成熟度比开源方案高出不少。
Better Stack:现代化体验的日志和监控
Better Stack 的前身是 Logtail 和 Better Uptime,后来合并成了一个统一的平台。它的定位和前面几个稍有不同,更侧重于日志管理和运行时间监控,而不是全栈 APM。
Better Stack 给人的第一印象是界面干净、交互现代。这听起来像是个小事,但在可观测性工具这个领域,UI 体验直接影响工程师的排障效率。当凌晨三点被告警叫醒,你打开一个清爽直观的界面和打开一个密密麻麻的旧式控制台,心态是完全不同的。
Better Stack 的日志搜索速度很快,告警配置流程也比较简洁。它支持主流的日志源接入,从 Docker 到 Kubernetes 到各种云服务的日志,都能比较方便地对接。
适合 Better Stack 的场景是:你的团队主要需要的是日志集中管理和可靠的告警通知,不太需要深度的 APM 链路追踪。比如一个跑着几个单体应用的团队,业务逻辑不算太复杂,但需要确保服务可用性和日志可查询。Better Stack 在这种场景下提供的性价比很高。
如果你需要完整的分布式链路追踪和代码级性能分析,Better Stack 不是最合适的选择。它更像是可观测性拼图里的一块,而不是一站式解决方案。
OpenObserve:为成本敏感型团队而生
OpenObserve 是一个比较新的开源项目,它的核心卖点简单直接:极低的存储成本。官方宣称相比 Elasticsearch 可以降低数十倍的存储开销,这得益于它底层使用了列式存储和高效的压缩算法。
对于那些日志量特别大的团队来说,存储成本往往是最大的开销。一个日均产生几百 GB 日志的平台,用 Elasticsearch 可能需要一个不小的集群来承载,而 OpenObserve 用少得多的资源就能处理同等数据量。
OpenObserve 支持日志、指标和链路追踪,提供了一个统一的查询界面。它的部署也相对简单,单节点部署只需要一个二进制文件就能跑起来。对于想快速验证的团队,这种低门槛很有吸引力。
不过 OpenObserve 作为较新的项目,社区规模和插件生态还在成长期。如果你需要丰富的集成和久经验证的稳定性,可能需要权衡一下。它更适合那些技术判断力强、愿意尝试新工具、并且对存储成本特别敏感的团队。
核心维度对比
聊了这么多场景和故事,我们用一张表来做个全局对比。这张表不是为了让你直接”看表选工具”,而是帮你在脑子里建立一个快速索引,知道每个方案的强项和短板在哪里。
| 维度 | SigNoz | Grafana Cloud | New Relic | Better Stack | OpenObserve |
|---|---|---|---|---|---|
| 开源 | ✅ 完全开源 | 部分开源(组件) | ❌ 商业 | ❌ 商业 | ✅ 完全开源 |
| 自托管 | ✅ 支持 | ✅ 可自建组件 | ❌ 仅 SaaS | ❌ 仅 SaaS | ✅ 支持 |
| 定价模型 | 按数据量 | 按数据量+序列 | 按用户+数据量 | 按数据量 | 按存储量 |
| APM/链路追踪 | ✅ 完整 | ✅ Tempo | ✅ 深度 APM | ⚠️ 基础 | ✅ 支持 |
| 日志管理 | ✅ 内置 | ✅ Loki | ✅ 内置 | ✅ 核心强项 | ✅ 核心强项 |
| 告警能力 | ✅ 内置 | ✅ 成熟 | ✅ 智能告警 | ✅ 现代化 | ✅ 基础 |
| 免费层 | 社区版免费 | 慷慨免费层 | 100GB/月 | 有限免费 | 社区版免费 |
| 上手难度 | 中等 | 低(生态熟悉) | 低 | 低 | 低 |
| 适合团队规模 | 5-50 人 | 任意 | 1-20 人最优 | 3-30 人 | 5-50 人 |
这张表里有几个规律。第一,开源方案(SigNoz、OpenObserve)在成本控制上有天然优势,但需要团队具备一定的运维能力。第二,商业方案的免费层(New Relic、Grafana Cloud)对小团队非常友好,是”用别人的钱学习”的好机会。第三,没有一个方案在所有维度上都碾压其他方案,选型本质上是在做取舍。
迁移成本不可忽视
很多团队在评估替代方案时,只看功能和价格,忽略了迁移成本。这是一个容易踩的坑。
从 Datadog 迁出,你需要考虑几个层面的工作:agent 替换(把 Datadog agent 换成 OpenTelemetry Collector 或者目标平台的 agent)、仪表盘重建(你在 Datadog 里精心搭建的 dashboard,换个平台要重新做)、告警规则迁移(每一条告警的阈值、通知渠道、分组逻辑都要重新配)、以及团队习惯的适应期。
如果你选了 OpenTelemetry 兼容的方案(SigNoz、Grafana Cloud 的 Tempo 和 Mimir 都支持 OTLP),那么将来再换工具的成本会低很多。这也是为什么 OpenTelemetry 正在成为行业事实标准的原因,它让你的可观测性数据不被任何单一平台锁定,将来换工具的自由度也就留住了。
那么,你的团队该选哪个?
回到最开始小李的故事。他最终选了什么?答案是 SigNoz 云托管版。原因很现实:团队有微服务架构,需要链路追踪;有一定技术能力但不想自己维护 ClickHouse 集群;预算有限但不是零;最重要的是,他们想保留将来迁移的灵活性。
但这只是他的答案,不一定是你的。
如果你是一个三五人的创业团队,还在快速迭代产品,不想花精力在运维工具上,New Relic 的免费层可能是最省心的起点。功能全、不用运维、免费额度够用,等团队长大了再说。
如果你的团队已经在用 Prometheus 和 Grafana,对这套生态很熟悉,Grafana Cloud 是阻力最小的选择。你保留了所有现有知识和习惯,只是把运维负担交给了托管服务。
如果你是一个对成本极度敏感的团队,日志量大但不需要太深的 APM,OpenObserve 值得认真评估。它的存储效率优势在大数据量场景下会非常明显。
如果你的核心需求是日志和告警的现代化体验,不需要复杂的链路追踪,Better Stack 的简洁和高效会让你眼前一亮。
没有完美的工具,只有适合当下的选择。最重要的是,无论选哪个,尽量让你的数据采集层基于 OpenTelemetry 标准。这样即使将来需求变了、团队长大了、预算调整了,你都有底气说”换就换”,而不是被锁在一个越来越贵的平台上动弹不得。



