今日正式发布了一款通用表格数据处理基础方案。该方案的核心优势在于,仅需完成一次前期训练,之后面对新的数据集无需重新进行专门的训练、参数调节或系统组合,即可直接执行分类与回归预测任务。这一能力使得金融、医疗、制造、物流等行业广泛存在的表格结构化数据场景都能得到快速处理。
此前,表格数据处理大多依赖XGBoost、LightGBM等传统统计分析工具。每获取一份新的业务表格,都需要重新开展训练和参数调节,多套独立系统的维护带来了沉重的部署成本。Xiaomi-TabLDM的目标正是打破“一份表格对应一个专用系统”的行业现状,实现单一方案跨数据集直接使用。
该方案的技术路线围绕大规模合成数据离线训练、高效的系统容量扩展以及推理阶段资源动态调配三大方向展开。整套前期训练全部依靠人工生成的表格数据完成,覆盖了多样化的数据规模、变量类型与函数关系,从而扩大了任务分布的覆盖范围。
架构层面引入了双流特征分组、轻量级注意力残差结构以及稀疏专家混合机制,在扩大系统容量的同时避免了计算量同步激增。同时,方案支持在不改动内部参数的前提下,通过增加推理阶段的计算资源,进一步拉高预测结果的准确度。
在TALENT、OpenML-CTR23、BCCO、TabArena四项公开基准测试中,Xiaomi-TabLDM整体表现位居第一梯队。
回归任务的表现尤为突出,拿下TALENT二分类第一名、OpenML-CTR23回归榜单第一名,BCCO总体第二名、TabArena回归任务第二名,多项指标超过了TabPFN-3、AutoGluon1.5 extreme等主流基线方案。同时兼顾预测性能与推理效率,在TabArena回归任务上取得1900 Elo得分,每1000个样本的验证耗时仅3.12秒。
工业真实场景测试进一步验证了该方案的价值。在材料性能预测场景中,无需进行额外微调,预测精度即提升130%,减少了九成无效试模测试;零件重量预测相比XGBoost,失误样本占比下降31%;生产组分预测的平均误差降低54%。
遇到工况发生变化时,仅补充大约三十条新样本作为上下文参考,系统平均误差即可下降62%。相比之下,传统算法通常需要约两百条样本才能接近同等效果,小样本快速适配的优势十分突出。
(举报)