用一棵随机森林实现预测、相似性、解释、异常检测等全功能,替代多个工具。
RFX-Fuse: Breiman and Cutler's Unified ML Engine + Native Explainable Similarity
- 一棵树统一处理分类、回归、相似性、异常检测等任务。
- 通过邻近重要性实现可解释的样本相似性度量。
- 无需真实标签即可评估数据填补方法的真实性,适合表格数据。
Breiman 和 Cutler 的原始随机森林设计为统一的机器学习引擎,而不仅限于集成预测。其原生实现包含分类、回归、无监督学习、基于邻近性的相似性度量、异常检测、缺失值插补和可视化等功能,这些现代库如 scikit-learn 均未完整实现。RFX-Fuse(Random Forests X -- Forest Unified Learning and Similarity Engine)在支持原生 GPU/CPU 的前提下,完整实现了 Breiman 与 Cutler 的原始愿景。现代机器学习流程通常需要五种以上独立工具:XGBoost 用于预测,FAISS 用于相似性,SHAP 用于解释,孤立森林用于异常检测,自定义代码用于重要性计算。RFX-Fuse 提供一个至两个模型对象的替代方案——仅需构建一次决策树集合。主要创新点:(1) 邻近重要性——原生可解释的相似性度量:邻近度反映样本间相似程度,邻近重要性揭示原因;(2) 针对特定数据集的插补验证方法,适用于通用表格数据,无需真实标签即可根据生成数据的真实感对插补方法进行排序。
原文摘要 · Abstract (English)
Breiman and Cutler's original Random Forest was designed as a unified ML engine -- not merely an ensemble predictor. Their implementation included classification, regression, unsupervised learning, proximity-based similarity, outlier detection, missing value imputation, and visualization -- capabilities that modern libraries like scikit-learn never implemented. RFX-Fuse (Random Forests X [X=compression] -- Forest Unified Learning and Similarity Engine) delivers Breiman and Cutler's complete vision with native GPU/CPU support. Modern ML pipelines require 5+ separate tools -- XGBoost for prediction, FAISS for similarity, SHAP for explanations, Isolation Forest for outliers, custom code for importance. RFX-Fuse provides a 1 to 2 model object alternative -- a single set of trees grown once. Novel Contributions: (1) Proximity Importance -- native explainable similarity: proximity measures that samples are similar; proximity importance explains why. (2) Dataset-specific imputation validation for general tabular data -- ranking imputation methods by how real the imputed data looks, without ground truth labels.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。