用例示例
让我们看看这些决策树是如何工作的。
在实践中,您可能会在大型数据集上使用决策树。这既包括员工人数,也包括建模变量的数量。然而,一个小例子有助于说明其内部运作。
我们使用表 1 中显示的 HR 数据集。它包含您可以在HR 信息系统中找到的典型信息,涉及 18 名员工。
我们的数据包含三个自变量:工作类型、潜在评估以及员工上一次升职以来已经过去了多少年。
我们的目标是预测因变量营业额,表明员工是否离开了组织。这代表了一个分类问题,因为我们想要预测员工的营业额是否应该被分类为“是”或“否”。
表 1:来自典型 HRIS 的员工信息示例数据集
决策树的主要目标是将这些员工分成具有“最纯粹”类别分离的子组。这意味着它的叶节点应该主要包含在目标变量营业额上要么全部为“是”,要么全部为“否”的员工。
构建决策树
树的构建过程从我们树根节点的 18 名员工的完整数据集开始。在这里,尚未考虑拆分。因此,该节点现在包含 100% 的数据集。此节点中的员工在目标变量上的平均值为 0.22,或者换句话说,22% 的员工流失值为“是”并离开了公司。这意味着该根节点的大部分属于非流动类别(“否”),因此这是我们的决策树为该节点中的所有员工预测的值。
图 2:包含单个根节点的树
决策树算法现在需要找到最能区分这两个类的决策规则。因此,它会迭代以所有可能的方式将这些员工分成子组。检查和评估我们数据集中三个自变量中每一个的所有可能的截止值。
从变量Job type开始,该算法遇到两个唯一值 - Manager和Individual Contributor。这提供了两种相同的数据拆分方法,将所有经理与非经理分开,或将所有个人贡献者与非个人贡献者分开。
对于变量Potential,可以进行三个拆分,将具有低、中或高潜力的员工与其同事隔离开来。
对于数值变量,决策树首先提取一组唯一值。接下来,它计算每对两个后续值的平均值。这些平均值用作截止值,其中决策树将得分较低的员工与得分高于截止值的员工分开。因此,对于变量Years since Promotion,决策树针对 2、5、7 和 9 的截止值检查总共 7 个拆分。
总体而言,表 2 显示了在根节点拆分 HR 数据集的总共九种方法。
表 2:根节点处所有可能的拆分,按 Gini 杂质排序(见下文)。
决策树算法需要量化这些拆分中的每一个在找到和使用最佳拆分方面的效果。有多种标准指标可以确定二元拆分的优劣,但最常用的是Gini impurity。
基尼杂质测量使用从当前标签集中抽取的随机标签时错误标记观察的平均概率。这听起来可能很复杂,但实际上非常直观。
当所有随机抽取的标签都正确时,基尼杂质为 0。这是可能的最小基尼值,它只出现在纯节点中——就像员工的子组在营业额上都得分“是”。在这些纯节点中,从此类同质子组中随机抽取的任何标签都是正确的。
在属于流动类别“是”和属于“否”的员工数量一样多的子组中,您将得到 0.5 的基尼杂质。在这里,您随机绘制的标签中只有一半是正确的。总之,低基尼杂质反映了更同质的子组,这就是决策树所寻找的。它试图找到导致准确预测的决策规则。
树通过使用导致最低基尼杂质的决策规则找到最佳分割。潜力 == 高拆分产生最低的基尼杂质 (0.190),因此离职案例与保留员工的最佳分离。因此,此决策规则在图 3 中的根节点处执行,尽管我们的程序对其命名不同。
图 3. 深度为 1 的决策树,区分高、低和中等潜在员工。
这会产生两个具有关联节点的分支。所有具有中低潜力 的员工都被分配到左侧节点,占总数据集的 61%。没有一个翻过来,所以这是一个纯节点。除其他外,这导致该决策规则的低基尼杂质。由于该节点的营业额比例为 0.00,因此决策树对所有观察结果都预测为“否”。
右侧节点现在包含所有 具有高潜力的员工。这代表了数据集的 39%。这里的营业额比例为 0.57 或 57%,因此决策树预测该组的营业额为“是”。
作为纯节点,决策树不再考虑左侧节点的进一步拆分。这个左节点因此可以被认为是叶节点。
决策树算法对右侧节点重复相同的过程。它计算所有可能拆分的 Gini 杂质(表 3)并选择产生最低 Gini 杂质的决策规则(参见图 4)。
表 3:节点 3 的所有可能拆分——包含所有高潜力员工——按 Gini 杂质排序
图 4:深度为 2 的决策树,进一步区分距离上一次晋升不到两年或超过两年的高潜力员工。
在这一点上,小于 2 的晋升以来的年限分割最能将剩余的离职案例与留下的员工区分开来。同样,一个纯叶节点出现在左侧(节点 4),包含过去两年晋升的所有高潜力员工。这两名员工(占样本的 11%)的离职概率为 0%。
右侧的节点 5 包含所有等待晋升两年或更长时间的高潜力员工(占样本的 28%)。它们显示出 80% 的营业额概率。
因为节点 5 还不是纯节点,所以决策树可能会考虑进一步的拆分。我们现在将跳过 Gini 详细信息,但图 5 演示了下一个最佳分离,基于Job Type是否为Manager。如果是这样,它们最终会出现在左侧节点 6 中,这又是一个营业额为 0% 的纯节点。同样的,右边的节点 7 也是纯的,个人贡献者都翻了。
我们的决策树现在已经完成,所有最终节点都被视为叶节点。通过三个简单的规则,我们的决策树能够将所有离职案例与其保留的同事区分开来。此外,它能够捕捉到两个有趣的非线性模式。任职时间(即晋升后的年限)仅与高潜力员工的流动率有关,并且仅与个人贡献者有关,与经理无关。
总结
您见证了决策树算法如何成为 HR 分析师工具箱的重要补充。它们允许灵活、轻松地发现复杂的模式。此外,输出模型可以直观地理解和解释给其他人——甚至是非技术利益相关者。
虽然决策树肯定有局限性,但我们认为 HR 领域可以从这些“机器学习”算法的更广泛使用中获益良多。返回搜狐,查看更多