MLflow 之外还能选谁:2026 年 ML 实验跟踪工具怎么挑

MLflow 之外还能选谁:2026 年 ML 实验跟踪工具怎么挑

上周和一个做推荐算法的朋友聊天,他吐槽自己团队的实验记录乱成一锅粥。三个人各跑各的训练脚本,超参数写在 Excel 里,模型文件堆在网盘的不同文件夹,谁也说不清上线的那个模型对应的是哪次训练、用了哪份数据。直到有一次线上出问题回溯不出训练配置,团队才咬牙决定上一套实验跟踪工具。

这种场景太常见了。做机器学习的人都知道,写模型代码不难,难的是记住自己到底跑了什么。参数改了几次,哪次效果最好,用的哪个数据版本,谁也不敢保证脑子里记得住。于是这几年冒出一批工具,专门干这件事:把每次训练的参数、指标、产出模型都记下来,方便对比和复现。

选哪个工具,这几年的答案其实一直在变。2026 年初发生了几件事,直接改变了这个赛道的格局,值得先说说。

这个赛道今年不太平

Neptune.ai 曾经是这个领域里口碑很好的一个选择,专门盯着大规模基础模型训练场景,能扛住动辄几个月的训练任务和海量的实验数据。今年它被 OpenAI 收购了,官方公告写得挺直接:收购完成后,托管服务将在三个月的过渡期后彻底关停,时间点定在 2026 年 3 月 5 日。过了这个日子,所有剩余数据都会被删除,不可恢复。这意味着如果你现在还在用 Neptune,得赶紧把数据导出来,另找一个落脚的地方。

Weights & Biases(常被简称 W&B)也没闲着,被 CoreWeave 收购了。对日常使用者来说,短期内界面和功能没什么变化,但如果你正准备签一份多年期的企业合同,官方建议你最好先问清楚定价和部署方式在新东家手里会不会调整。

再往前数几个月,做数据版本管理的 DVC 项目被 lakeFS 收购。DVC 本身还是开源的,还在正常维护,只是这次收购说明了一个道理:哪怕开源协议写着 Apache 2.0,项目背后的公司说没就没,你是通过公告才知道消息的。

这几件事拼在一起,其实指向同一个问题:你选的这个工具,如果背后是一家创业公司,那这家公司随时可能被收购、被关停,或者调整商业策略。选型的时候光看功能和价格已经不够了,还得看看这个项目的治理结构够不够稳。

这也是为什么 MLflow 这几年反而越来越像一个”安全选项”。它早在 2020 年就被捐给了 Linux Foundation,治理权不在任何一家商业公司手里。你可以不喜欢它的界面,但至少不用担心某天早上醒来收到一封”服务将于三个月后关闭”的邮件。

MLflow 本身是什么样子

先说清楚 MLflow 到底提供什么。它是 Databricks 早年发起、后来捐给 Linux Foundation 的开源项目,协议是 Apache 2.0,完全免费,没有功能阉割版和收费版的区分。实验跟踪、模型注册、评估、面向大模型应用的链路追踪(tracing)、提示词管理,这些核心能力在开源版里全都能用,不存在”付费才能解锁”的情况。

它的部署方式很直接:自己起一个服务,连上数据库和对象存储,就能用。官方仓库里带了一份现成的 Docker Compose 配置,拉下来改改环境变量,几分钟就能跑起来一套带 PostgreSQL 和存储后端的完整实例。如果你用 Databricks、AWS、Azure、GCP,这些平台也都提供托管版 MLflow,不想自己维护服务器的话可以直接用云厂商的版本,省掉运维环节,同时保留开源版本的数据格式,不锁定在某个厂商身上。

MLflow 的短板也很明显:界面做得比较朴素,功能齐全但不算好看,同时对比大量实验的时候,交互体验不如后面要说的几个商业工具流畅。而且自己托管就要自己管数据库、管存储、管升级,这些运维活儿不是零成本的,团队里得有人愿意接这个盘。

需要花钱买省心的时候,W&B 是什么价位

Weights & Biases 走的是完全不同的路子:界面做得漂亮,团队协作功能齐全,超参数搜索(Sweeps)做得比大多数竞品更顺手,很多做研究的团队图的就是这份”上手就能用”的体验。

代价体现在账单上。免费版给到 5 个项目、1 个团队成员,基本只够个人练手。真要拉团队协作,起步的 Pro 档位定价在每月 60 美元左右(按团队规模浮动),企业版则是按合同谈,不同渠道报出来的企业价差异挺大,从几百到数千美元每月都有人提到过,具体要看谈判和用量。

有意思的是,曾经有第三方做过一个粗算:如果团队自己搭一套 MLflow,一台不大的虚拟机加上托管数据库和对象存储,月成本经常能压到 100 美元以内;但这笔账没算的是维护这套服务器需要花掉的工程师时间:修补服务器、管数据库、处理备份,这些活儿本身不是免费的。换句话说,MLflow 省下来的是订阅费,换来的是团队自己的运维投入;W&B 反过来,花订阅费买的是不用自己操心这些事。团队规模越大、买的席位越多,这笔账才越值得认真算一次。

ClearML:把整条流水线都塞进同一套系统

如果说 MLflow 专注在”记录实验”这一件事上,ClearML 想做的事情更大,它把实验跟踪、任务调度、数据版本管理、模型仓库、流水线编排全部揉进一个系统里,类似”MLOps 全家桶”的思路。

ClearML 的开源部分同样是 Apache 2.0,免费的 Community 版本可以自己部署,不限用户数,核心的实验跟踪、模型仓库、流水线这些功能都在里面;它也提供托管的免费服务器,不过限定 3 个用户和一定的用量上限。往上走是 Pro 档,每用户每月 15 美元起,再加上按存储和调用量计费的部分,适合团队规模扩大之后需要更细的权限管理和自动化调度的场景。

选 ClearML 的团队通常图的是”一个系统管到底”,不想在实验跟踪、任务调度、数据版本各挑一个工具再自己拼起来。代价是学习曲线更陡一些,如果你只是想简单记录实验参数,ClearML 提供的很多能力可能根本用不上,属于”杀鸡用牛刀”。

Comet:从实验跟踪延伸到大模型可观测性

Comet 这几年的重心明显在往大模型方向偏移。它开源了一个叫 Opik 的子项目,专门做面向 LLM 应用的链路追踪和评估,协议同样是 Apache 2.0,自托管版本功能齐全,不存在阉割。截至今年 9 月初,这个项目在 GitHub 上已经攒了两万多颗星,增长速度不慢。

商业版的价格结构和 Comet ML 主站保持一致:免费版给到每月 2.5 万次调用追踪(span)、60 天数据保留、最多 10 个团队成员,超出之后 Pro 档每月 19 美元起,支持到 50 人团队并把追踪量提到 10 万次。企业版加上单点登录、权限管理和一系列合规认证,价格需要单独谈。

它跟 MLflow 的分工挺清晰:如果你做的是传统的模型训练实验,MLflow 或者前面提到的几个工具已经够用;如果你的团队正在往 LLM 应用和 Agent 方向转型,需要追踪一整条调用链路里每一步的输入输出,Comet/Opik 这类专门针对大模型可观测性设计的工具,能省下不少自己拼可观测性方案的时间。

用一张表把这几个选项摆在一起

工具 开源协议 自托管 免费版限制 付费起步价 定位侧重
MLflow Apache 2.0(Linux Foundation) 首选部署方式,完全免费 无限制(自托管无功能墙) 无付费版,云厂商托管另计 全生命周期,治理最稳
Weights & Biases 闭源 SaaS 支持但非重点 5 项目 / 1 成员 约 60 美元/月起 团队协作与可视化体验
ClearML Apache 2.0 核心 + 付费层 是,免费 Community 版 3 用户(托管版) 15 美元/用户/月起 全流水线一体化
Comet(Opik) Apache 2.0 是,功能完整 2.5 万次追踪/月,10 成员 19 美元/月起 LLM 可观测性
DVC Apache 2.0(现属 lakeFS) 无限制 免费 数据版本控制,非实验跟踪

这张表里特别要说明一下 DVC,它其实不是同一类工具,它管的是数据和模型文件的版本,类似”给数据文件加上 Git”,跟前面几个记录训练过程的工具是互补关系,不是替代关系。很多团队会同时用 MLflow 记录实验、用 DVC 管理数据版本,两者配合而不是二选一。

到底怎么选

回到开头那个朋友的场景。如果团队里已经有人能维护服务器,又不想为工具本身付订阅费,MLflow 基本是默认选项,尤其是治理结构稳定这一条,在今年这几起收购关停事件之后,分量比以前更重了。如果团队更看重开箱即用的体验,不想自己操心运维,预算也允许按人头付费,W&B 的可视化和协作体验目前还是同类里最顺手的一个,只是新东家 CoreWeave 接手后的长期定价策略值得留意。

如果你要管的不只是模型训练,还想把数据流水线、任务调度、多人协作全部收进一套系统,ClearML 的一体化思路值得看看;如果你的工作重心已经转向大模型应用和 Agent,需要追踪的是一整条调用链路而不是几个训练指标,Comet 的 Opik 更贴合场景。

至于 Neptune,现在已经不是一个可以纳入新选型的选项了,它的托管服务即将关停,继续基于它做新项目意味着几个月后还要再迁移一次。这也是这轮盘点里最直接的一条提醒:选型的时候,工具背后是谁在维护、这家公司靠什么赚钱、治理结构是不是稳定,和功能列表本身一样重要。工具会不断迭代,但没人想在项目跑到一半的时候,突然被通知”三个月后请自行迁移”。

延伸阅读

查看完整选型指南 →

Stay updated with our latest AI insights

Follow FuturePicker on Google
滚动至顶部