面向金融、医疗、制造和物流等表格数据场景,该模型采用一次预训练后统一配置即可运行,减少逐数据集建模,并在多个公开评测榜单的分类与回归项目中位居前列。
9月5日,小米推出并开源通用表格数据基础大模型 Xiaomi-TabLDM。该模型面向金融、医疗、制造、物流等领域广泛存在的结构化表格任务,主张以同一套预训练模型和统一默认配置接入不同数据集,直接完成分类与回归预测,而不必针对每个新数据源重复训练、调整参数或组织模型集成。
技术路径有三条。第一条是预训练:全部使用由结构因果模型生成的合成表格数据,覆盖不同数据规模、变量类型、依赖关系和函数关系,以扩大可学习的任务分布。第二条是模型架构:引入双流特征分组、轻量级注意力残差和稀疏混合专家模块,在多粒度层面刻画特征之间的关系,并借助稀疏专家扩展容量。第三条是推理优化:在预训练参数保持不变的情况下,通过 Test-Time Scaling 增加推理阶段的计算投入,以提升预测效果。现有表格处理流程往往围绕 XGBoost、LightGBM 等工具展开,每当遇到新的业务表格就需要重建训练管线、重新调参并维护多套模型,部署和维护压力较高;Xiaomi-TabLDM 的目的正是把先做统一预训练、再服务多类任务的思路带入结构化数据领域。
公开评测结果显示,Xiaomi-TabLDM 在四个基准测试中进入第一梯队。具体排名中,OpenML-CTR23 回归榜位于第一,TALENT、TabArena 与 BCCO 的回归任务均位于第二,TALENT 二分类任务也位于第一。从应用角度看,此类基础模型将原本更常见于语言和视觉领域的迁移式训练模式延伸到表格数据场景;对于持续新增业务表格的机构而言,关注点会从为每张表单独训练模型,转向围绕统一基础模型进行适配、调用和维护。