0


Synthefy Nori:6M 参数的表格基础模型,可以替代 XGBoost 和TabPFN-3

十多年任何表格机器学习 (Tabular Machine Learning) 问题的处理流程都大同小异地停留在同一个步骤上:收集数据、打标签、用几百棵树的 XGBoost 或 CatBoost、网格搜索超参数、交叉验证、部署上线,流程都已经固定了。

但是在部署之后,你在生产环境中看到性能漂移。需要每月重训练,做版本管理,再次部署。对每个新数据集、每个新业务问题、每个外部变量都如此循环。

今天介绍一个新的模型Nori,在零训练 (zero training) 条件下处理回归任务的表格基础模型。把带标签的行作为上下文传入,它返回未标签行的预测——没有梯度更新,没有超参数扫描,也不需要重新训练。

在96个真实 Kaggle 数据集上,Synthefy Nori 表现优于所有同类表格模型,体积却只有最近邻的十分之一。Prior Labs 的 TabPFN-3 是目前最强的表格基础模型,被 Synthefy Nori 超过。

什么是表格基础模型

机器学习每个领域都经历过基础模型 (Foundation Model) 的窗口期。视觉领域先有了 ImageNet 和 VLMs,语言领域先有了 BERT 和 GPT。但表格数据仍在等属于它的时刻。目前最先进的方案依然是在每个问题上从头训练与调优的 XGBoost。

表格基础模型 (Tabular Foundation Model) 是一个预训练神经网络,能在不调用 .fit() 的条件下处理全新表格的回归任务。你把带标签的行作为示例展示给它,让它预测其余行——就像向语言模型 (Language Model) 的提示 (Prompt) 中喂入少量示例那样。这就是上下文学习 (in-context learning, ICL) 搬到表格上的应用。

这个高层机制与 LLM 相同:一个在大量多样化任务分布上训练过的 Transformer。不同之处在于训练对象。LLM 在真实文本上预训练,表格基础模型则在数百万个合成数据集上预训练。每个数据集都由随机过程生成,比如因果图 (causal graph) 或回归树 (regression tree)。尽管可能依赖同一生成过程,每个生成的训练样本都是唯一的,模型以预测各数据集中被保留的行来获取评分。不过没有哪张表格会重复出现,所以记忆毫无用处;唯一可行的策略就是在推理时从上下文行推断该表自身的规则。表格基础模型学到的不只是如何做回归,它学会从上下文进行学习。

Prior Labs 已经用 TabPFN 证明了这一点,其最新的 TabPFN-3 达到了最先进的性能。Synthefy Nori 凭借更强的合成训练数据和更强的架构,在96个数据集的回归基准测试中领跑。

Synthefy Nori 有什么特别之处

Synthefy Nori 拥有 6M 参数,通过上下文学习处理回归任务,性能优于同类最先进 (SOTA) 表格模型,但体积只有后者的十分之一。

你给它一张表格,内部它把带标签的行当作上下文、未标签的行当作查询,通过一次推理调用返回结果,附带经过校准的不确定性。所有能力来自预训练而非你的数据。Synthefy 的合成预训练数据由结构因果模型 (structural causal models)、专用回归先验 (regression priors) 以及广泛但刻意设计的真实世界噪声构建而成——包括类别不平衡 (class imbalance)、标签噪声 (label noise)、缺失值 (missingness)、相关或冗余列 (correlated/redundant columns)、重尾 (heavy tails)、以类别为主的表格 (categorical-heavy tables)。这种数据混合比其他主流模型训练过的东西更难也更杂。

他的架构专门为表格数据设计。每个模块交替使用两种注意力机制。样本注意力 (Sample attention) 在行之间运作:查询行与上下文行对齐,精确查找相似的带标签样本是如何被标注的。特征注意力 (Feature attention) 在列之间运作:模型借此关联各个特征、发现隐性交互,忽略不相关的特征。堆叠多层之后,模型对每个数据集形成特定的"实时拟合" (fit on the fly),完全靠注意力完成。

它输出的不是单一数值,而是一组完整的分位数 (quantiles),再经分位数分布解码器 (quantile-distribution decoder) 转换成点估计加上经校准的预测区间,同时对重尾进行正确处理。

其最终结果是一个记住了零、却预测一切的模型:一个冻结的网络 (frozen network),一次前向传播 (forward pass),完成回归并提供不确定性。

Benchmark

作者在三个独立来源的96个回归数据集上评估了 Synthefy Nori V1:TabArena(现代表格排行榜)、TALENT(72个数据集的多样性套件)以及 OpenML-Reg(经典开放数据基准)。所有模型共享相同的训练/测试划分、预处理流程和硬件配置。

与替代模型的对比

TabArena 上有13个回归数据集,我们让 XGBoost 和 LightGBM 与 Synthefy Nori V1 进行正面对抗。使用零训练 (zero training) 和零调优 (zero tuning),表格基础模型赢了其中9个。TabArena 偏向更大更现代的数据集,那也正是梯度提升 (gradient boosting) 最强的领域,所以这个对比偏保守不算偏袒。

与当前最先进水平的对比

Prior Labs 的 TabPFN-3 是目前可用的最强表格基础模型。

96个数据集综合来看,Synthefy Nori V1 以平均 R² 排名第一,三个基准里直接赢下两个,TabArena 上小幅落后。当前的训练策略 (training curriculum) 已经针对性调整,准备缩小这个差距。

速度、体积

没有任何模型能同时更快且更准。Synthefy Nori V1 6M参数,约 22 MB,比许多 XGBoost 集成模型 (ensembles) 体积更小,而其他对手拥有 2–10 倍的参数量换来的 R² 相同或更低。单 GPU 即可运行:≥ 8 GB VRAM 足以处理典型工作负载(大约 10K 行 × 100 列),只有最大的上下文(50K 行 × 1K 列)才需要 A100 级显卡。推理以秒计,而非以小时计。比如一台 H100 上,diamonds 回归(16K 行,9 列)端到端约 2.8 秒,最重的基准数据集(4K 行,1,024 列)大约 14 秒。等效的 XGBoost 循环——训练、调优、验证、再加数据漂移驱动的重新训练——每次迭代数小时,还会在模型整个生命周期内反复执行。又因为它以预训练形式提供,无需搭建任何基础设施:没有集群,没有训练流水线 (pipeline),没有实验跟踪 (experiment tracking)。一台机器,一次库调用足矣。

Thinking Mode

上面的基准数字仅来自基础模型,而且并不是上限。思考模式 (Thinking Mode) 是一项推理时 (inference-time) 的能力,负责在预测之前就决定如何处理每个独立的数据集——动态选取合适的增强 (augmentations)、归一化 (normalizations) 和预处理,全程无需人工干预。模型针对每个数据集自动调校推理流水线 (pipeline)。

这个收益在大型和困难数据集上显现得更明显,汇总后呈复合增长。放到尺度上看:Synthefy Nori V1 对 TabPFN-3 的领先幅度已超过 TabPFN-2.6 到 TabPFN-3 整体改善幅度的五倍以上,思考模式 (Thinking Mode) 还在此基础上继续拉大差距。

作者目前还没透露架构细节 (architectural details),后续版本会披露更多内容。

总结

以前每个任务都要微调一个独立模型:命名实体识别 (named entity recognition) 一个,意图检测 (intent detection) 一个,问答 (question answering) 一个。今天调用一个 LLM API 便可零样本 (zero-shot) 处理全部。我们把同样的思路搬到结构化数据上。对工作流每一阶段的影响如下:

  1. 你不再需要清洗数据以迎合模型:缺失值 (missing values)、类别不平衡 (imbalanced classes)、噪声标签 (noisy labels)、冗余列 (redundant columns)、重尾目标 (heavy-tailed targets)、缠绕的非线性交互 (tangled nonlinear interactions)。Synthefy 的合成预训练数据刻意包含了所有这些问题,所以它容忍 XGBoost 正常运作前通常要花好几天去处理的数据混乱——输入、编码、特征工程 (feature-engineering)。交给 Synthefy,直接提供原始行即可。
  2. 训练与调优流程消失了:无需 model.fit(),无需学习率扫描 (learning-rate sweeps),无需提前停止回调 (early-stopping callbacks)。调用 .predict(X_train, y_train, X_test),带标签的行变成上下文示例 (in-context examples),未标签的行数秒内返回预测结果,在单块 GPU 上完成。没有可旋转的旋钮 (knobs):模型自行检测高维数据并做降维,目标偏斜时应用正确的转换,并针对每个数据集配置预处理。XGBoost 项目中的超参数搜索工作就此消失。
  3. 数据漂移 (Data drift) 不再是问题:以前漂移意味着启动训练运行,现在意味着把新行作为上下文发送。无须重新训练,无须重访超参数,没有离线/在线差,没有模型版本蔓延。

数据科学项目的大头时间一直花在探索性分析 (exploratory analysis)、清洗数据、超参数搜索与无尽交叉验证上——这些都是为了让传统模型能跑起来的前置工作。Synthefy Nori省去数据整理 (data wrangling)、获得不确定性、零调优,全靠一个 6M 参数的模型。

代码和模型:

https://github.com/Synthefy/synthefy-nori

https://huggingface.co/Synthefy/Nori

by Synthefy

“Synthefy Nori:6M 参数的表格基础模型,可以替代 XGBoost 和TabPFN-3”的评论:

还没有评论