决策树算法五实验:文本树可视化、特征重要性与剪枝扫描(sklearn 实测)
决策树是机器学习入门第一棵树,但多数教程止步于 fit + score。本文五个实验覆盖训练、可解释性、调参、交叉验证全流程,sklearn 真实数据集(酒瘾+乳腺癌)真实运行。
一、五实验总览
| 实验 | 内容 | 实测 |
|---|---|---|
| E1 | 酒瘾 max_depth=4 | 测试 0.9630,export_text 可视化 |
| E2 | 特征重要性 Top5 | flavanoids 0.4049 / color_intensity 0.3968 |
| E3 | max_depth 扫描 | depth≥3 稳定 0.9630 |
| E4 | 乳腺癌 5 折 CV | 0.9173±0.0242 |
| E5 | min_samples_split 扫描 | 波动 <0.7% |
二、max_depth=3 是甜蜜点
depth=2 欠拟合(0.889),depth=3 首次达 0.9630,继续加深训练集到 1.0 但测试不动——过拟合的特征是训练/测试分离。决策树调参第一步就是扫 max_depth。
三、特征重要性:可解释是决策树的核心竞争力
Top5 中 flavanoids(0.40)+ color_intensity(0.40)合计 80%。export_text 输出的文本树可直接贴技术文档——这是黑盒模型无法替代的。
四、min_samples_split 不敏感
2→50 扫描 CV 波动 <0.7%——决策树的这个参数很鲁棒,默认值即可。
五、复现指南
pip install scikit-learn 后 python tree_lab.py 一条命令复现。源码约 60 行注释详尽。
tree_lab.py 一条命令复现。源码约 60 行注释详尽。
📦配套完整资源已整理上传:点击查看资源包(含决策树五实验源码与运行留档,开箱即跑)