从Neo4j迁到FalkorDB:实时智能体知识图谱性能跃迁实践
2026/10/8 3:02:33
决策树是一种树形结构的分类/回归方法,通过一系列的是/否决策来对数据进行分类或预测:
决策树的核心思想:从根节点开始,选择最有特征进行分裂,直到叶节点。
为了选择“用什么特性进行分裂”,因此需要先进行“量化数据纯度”。
熵衡量数据的“不确定性”或“混乱程度”:
import numpy as np def entropy(probs): """计算熵: H = -Σ p_i × log2(p_i)""" return -np.sum(probs * np.log2(probs + 1e-10)) # 1e-10防⽌log(0) # ⽰例1:扔硬币(最不确定) # 正反各50% probs = np.array([0.5, 0.5]) print(f'硬币(50%正,50%反): 熵 = {entropy(probs):.4f}') #