XGBoost结果解读:学习率与正则化参数的调优
2026/9/4 17:00:26 网站建设 项目流程

XGBoost分类模型结果解读

一、方法概述

XGBoost(eXtreme Gradient Boosting)是一种高效的梯度提升算法,通过迭代训练弱分类器(通常为决策树)并集成它们的预测结果来构建强大的分类模型。该算法引入了正则化项(包括L1和L2正则化)以控制模型复杂度,有效防止过拟合,同时提供了灵活的特征重要性评估机制。本研究利用SPSSAU软件对欺诈检测数据进行XGBoost分类建模分析,旨在通过用户行为特征变量预测欺诈行为,为风险识别提供科学依据。

在SPSSAU【机器学习】模块选择【XGBoost】,将变量拖拽至右侧对应分析框,操作如下图:

二、数据概览

本研究共纳入1000个样本,以换设备次数、支付失败次数、换IP次数、换IP国次数、交易金额5项指标作为自变量,以欺诈标签(0=非欺诈,1=欺诈)作为因变量进行分类建模。因变量分布如下表所示:

由表1可知,1000个样本中非欺诈样本(标签=0)为600例,占比60.00%;欺诈样本(标签=1)为400例,占比40.00%。数据无缺失值,全部纳入分析。

由表2可知,按照8:2的比例将数据划分为训练集(800个样本,占80.00%)和测试集(200个样本,占20.00%),用于模型训练与泛化能力评估。

三、特征权重分析

由表3可知,XGBoost模型的特征权重分布呈现出高度集中于行为特征的模式。换设备次数的权重最高,为0.379(37.85%),对模型构建起关键作用。换IP国次数位居第二,权重为0.344(34.40%)。两项特征合计权重达72.25%,构成了模型判别的核心依据。支付失败次数的权重为0.169(16.91%),位居第三。以上三项特征的权重合计达到89.16%。换IP次数(0.070,6.97%)和交易金额(0.039,3.88%)的贡献较小。值得注意的是,交易金额在XGBoost模型中的权重仅为3.88%,为所有模型中最低,而换设备次数和换IP国次数两项行为特征合计权重高达72.25%,表明XGBoost高度依赖用户行为模式的变化进行欺诈判别。

图1 XGBoost特征权重分布图

由图1可知,XGBoost的特征权重分布呈现极度不均衡的格局。换设备次数(37.85%)和换IP国次数(34.40%)两项特征占据绝对主导地位,合计权重72.25%。支付失败次数(16.91%)构成第三层次。换IP次数(6.97%)和交易金额(3.88%)的贡献微乎其微。与其他模型相比,XGBoost对交易金额的依赖程度最低(仅3.88%),而对设备更换和IP国家变更等行为特征的依赖程度最高。

四、训练集模型评估

由表4可知,XGBoost模型在训练集上的整体准确率为93.50%,综合f1-score为0.934。相较于LightGBM(99.80%)和GBDT(99.80%)等模型,XGBoost在训练集上的拟合程度相对较低,这与模型引入L2正则化(lambda=1.0)以控制复杂度有关。非欺诈类(0.0)的精确率为0.901,召回率为1.000,f1-score为0.948;欺诈类(1.0)的精确率为1.000,召回率为0.840,f1-score为0.913。训练集上欺诈类的召回率为84.0%,高于多数模型在测试集上的表现,说明模型在训练阶段对欺诈样本有较好的识别能力。

五、测试集模型评估

由表5可知,XGBoost模型在测试集上的整体准确率为90.00%,综合精确率为91.37%,综合召回率为90.00%,综合f1-score为0.896。在六类模型中,XGBoost的测试集准确率(90.00%)和f1-score(0.896)均为最高,表现出最佳的泛化能力。

从各类别看:非欺诈类(0.0)的精确率为0.863,召回率为1.000,f1-score为0.926,召回率达到100%,为所有模型中最高,表明模型对非欺诈样本实现了完全覆盖。欺诈类(1.0)的精确率为1.000,召回率为0.730,f1-score为0.844。欺诈类的精确率达到100%,为所有模型中最高,说明模型预测为欺诈的样本全部确为欺诈,误判率为零;但召回率为73.0%,仍有约27%的欺诈样本未能被识别。

六、模型参数汇总

由表6可知,XGBoost模型采用gbtree提升器类型,构建100棵学习器,学习率为0.1,树最大深度为6。样本采样率和特征采样率均为1.0。L2正则化系数为1.0,L1正则化为0.0,分裂收益阈值为0.0。模型在测试集上取得90.00%的准确率和0.896的f1-score,为六类模型中表现最优。

七、结论

本研究基于SPSSAU平台,利用XGBoost算法对1000个欺诈检测样本进行分类建模分析。结果表明,换设备次数(37.85%)和换IP国次数(34.40%)是最重要的欺诈判别特征,两者权重合计72.25%。模型在测试集上的准确率为90.00%,综合f1-score为0.896,在六类模型中表现最优。XGBoost对交易金额的依赖程度最低(仅3.88%),而欺诈类精确率达到100%,非欺诈类召回率达到100%,展现出优秀的分类性能。但欺诈样本的召回率(73.0%)仍有提升空间,可考虑通过参数调优或数据增强策略加以改善。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询