启动 TabU-lab:一座公开建造表格基座模型的实验室

为什么现在打开训练过程,第一批 gate 要求什么,以及我们目前明确不声称什么。

WeHub ResearchTabU-lab

表格无处不在。科学实验、医院记录、推荐日志、经营台账,最后往往都落成一张表。可是,从表里做通用学习,至今仍然别扭。

一张表可以同时装连续量、类别、缺失、标识符、处理、结局、时间戳,以及人定义出来的角色。存储类型相同的两列,语义可以完全不同;schema 不同的两张表,却可能描述相近的机制。常见做法是:每个数据集重新走一遍流水线——清洗、造特征、选模型、调参;schema 一变,再来一次。

表格基座模型问的是更难的问题:模型能不能先在许多表、许多任务上学会可复用的结构,再以很少甚至无需任务特化训练,适应一张新表?

TabPFN、LimiX 这类系统说明,这条路是认真的研究方向。它们也把未决问题问得更清楚:模型该把什么当作 context?什么样的训练分布带来的是可迁移结构,而不是对基准的熟悉?值、特征角色、缺失、行与行之间的关系,该如何表示?增益里有多少来自预训练,有多少来自架构、调参或评测选择?

我们开办 TabU-lab,就是要在开放条件下做这些问题。

TabU-lab 是什么

TabU-lab 是 WeHub 的开放研究实验室,从零建造表格基座模型。它既是在训练模型,也是在公开记录模型是怎么被造出来的。

仓库里会留下代码、配置、实验预注册、run receipt、曲线、失败,以及据此写成的综合报告。我们不想只发布最后活下来的那个 checkpoint,而希望通向它的路径仍然可被检查。

眼下的目标很小:先做出一个小规模训练闭环,可复现、可证伪,并且强到足以告诉我们某个想法已经不行。放大规模是后面的事。

实验室从一份空账本开始。我们还没有接受任何公开模型结果或 benchmark 声明。第一项结果只会在假设、对照、预算和通过/淘汰标准已经提交之后才出现。

实验契约

每一项正式实验都走同一条基本序列:

  1. 预注册。 执行前写明假设、baseline、算力预算、目标指标,以及通过/淘汰标准。
  2. 实现。 提交跑这次对照所需的准确代码和配置。
  3. 运行。 记录 command、git revision、配置哈希、数据版本、划分、seed、环境、机器和所用算力。
  4. 公布 receipt。 保留原始指标、曲线、日志、产物、失败,以及对解释的限制。
  5. 给出裁决。 将实验标为 passkillrevise。综合报告只能声称 receipt 支撑得住的内容。

失败会留在账本里。一次协议干净的失败,可以替后来者省时间;一次没有来源的成功,支撑不了多少东西。

第一批门

我们会先切一条很窄的纵切片,而不是铺开一轮大基准战役:一个数据源、一个模型族、一个目标、一小批数据集、多个 seed。

  • Gate 0:健全性。 实现必须能在大约 100 条样本的小数据集上过拟合。做不到,更大的 run 还太早。
  • Gate 1:可复现。 在干净环境里,一条命令必须产出 checkpoint 和完整 receipt。
  • Gate 2:预训练归因。 预训练模型必须在相同微调预算下,打赢同一架构的随机初始化。否则所谓预训练增益,可能只是来自架构或协议。
  • Gate 3:baseline 对照。 在固定协议和匹配预算下,对照 XGBoost、CatBoost、FT-Transformer 等强表格 baseline。报告多种子均值和波动,而不是一次好看的 run。

通过这些门,并不证明我们已经造出通用表格基座模型。它只说明训练系统能跑、证据链能闭合,并且第一项被声称的迁移效应经得住基本对照。

我们希望模型学到什么

TabU-lab 长在更广的 TabU 研究纲领里。TabU 问的是:Unit 应不应该被当作原语,而不是样本 token 的另一个名字。这个视角会带出标准表格预测不会自动回答的问题:

  • 一行、一组行、或一段任务上下文,代表的学习单元是什么?
  • 表里哪些部分是观测值,哪些部分是角色或机制?
  • 缺失、未知状态、结构上的空,应当如何分开?
  • schema、任务或观测上下文改变时,什么应当保持不变?

这些是研究问题,不是当前能力。基准分数再高,也不能单独验证 Unit 语义、因果识别,或更广的 TabU 理论。每一条理论声称都需要自己的形式假设和证伪检验。

起步时的数学纪律很简单:新的架构部件,应当对应模型对 unit、机制或噪声的明确对象。我们不想加一套能抬基准、却说不清模型在学什么的机关。

我们宣布什么,以及没有宣布什么

在数据许可、隐私约束和基础设施安全允许的范围内,我们会公开实验预注册、模型与数据处理代码、版本化配置、数据和 split provenance、command、seed、环境、算力预算、原始指标、曲线、日志、许可范围内的 checkpoint、裁决,以及连回 receipt 的报告。

这不是成品模型发布。我们不声称达到 state-of-the-art,不声称预训练已经改进了表格预测,也不声称具备因果推理、通用 schema 理解或广泛任务泛化。那些声称需要证据,而公开账本里现在还没有。

我们宣布的是:工作已经开始,而且证据标准会设在第一项公开训练结果之前。

最有用的贡献不是宏大的承诺,而是一个有可信失败方式的假设,再加上一份让下一个人接得住的 receipt。