☰
决策树算法五实验:文本树可视化、特征重要性与剪枝扫描(sklearn 实测)
2026/10/6 3:19:10 网站建设 项目流程

决策树算法五实验:文本树可视化、特征重要性与剪枝扫描(sklearn 实测)

决策树是机器学习入门第一棵树,但多数教程止步于 fit + score。本文五个实验覆盖训练、可解释性、调参、交叉验证全流程,sklearn 真实数据集(酒瘾+乳腺癌)真实运行。

一、五实验总览

实验内容实测
E1酒瘾 max_depth=4测试 0.9630,export_text 可视化
E2特征重要性 Top5flavanoids 0.4049 / color_intensity 0.3968
E3max_depth 扫描depth≥3 稳定 0.9630
E4乳腺癌 5 折 CV0.9173±0.0242
E5min_samples_split 扫描波动 <0.7%

二、max_depth=3 是甜蜜点

depth=2 欠拟合(0.889),depth=3 首次达 0.9630,继续加深训练集到 1.0 但测试不动——过拟合的特征是训练/测试分离。决策树调参第一步就是扫 max_depth。

三、特征重要性:可解释是决策树的核心竞争力

Top5 中 flavanoids(0.40)+ color_intensity(0.40)合计 80%。export_text 输出的文本树可直接贴技术文档——这是黑盒模型无法替代的。

四、min_samples_split 不敏感

2→50 扫描 CV 波动 <0.7%——决策树的这个参数很鲁棒,默认值即可。

五、复现指南

pip install scikit-learn 后 python tree_lab.py 一条命令复现。源码约 60 行注释详尽。

tree_lab.py 一条命令复现。源码约 60 行注释详尽。

📦配套完整资源已整理上传:点击查看资源包(含决策树五实验源码与运行留档,开箱即跑)

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询