🌳 阶段1:一个小专家的判断
💡 决策树就像一个小专家,它只看一个特征(大小或甜度),画一条"分界线"来区分水果。试试看,一个专家能分得多准?
拖动滑块移动分界线
5.0
👆 选择一个特征,拖动阈值滑块,观察分界线如何移动。看看一个专家的最高正确率能达到多少?
🌳 这棵树的判断结果
选择特征并拖动阈值后,这里会显示分类结果...
🤔 动动脑筋
1. 只用一个特征分类三种水果,正确率最高大约能到多少?
2. 为什么一棵决策树容易判断错误?
📝 本阶段要点
- 决策树通过选择一个特征和一个阈值来进行分类判断
- 单棵树只能看到部分信息,无法完美区分多个类别
- 一个特征的分界线是一条直线,无法处理复杂的类别重叠区域
- 这就是为什么我们需要"更多专家"——随机森林的灵感来源
🌲 阶段2:组建专家团
💡 一棵树不够用,那就种一片森林!每棵树随机选择不同的特征和阈值,形成各自的判断。调整树的数量,观察森林的变化。
森林里有多少棵"小专家"
5 棵树
🌲 每棵小树自动随机选择一个特征和阈值。左侧是数据散点图(叠加了每棵树的分界线),右侧是森林全景。增加树的数量看看有什么变化!
🌲 森林概况
调整树的数量后,这里会显示森林的统计信息...
🤔 动动脑筋
1. 为什么每棵树要看不同的特征和阈值?
2. 树的数量越多,分类一定越好吗?
📝 本阶段要点
- 随机森林由多棵决策树组成,每棵树是一个"小专家"
- 每棵树随机选择不同的特征和阈值,保证多样性
- 树的多样性是随机森林成功的关键——大家看法不同,才能互相补充
- 增加树的数量通常能提升效果,但提升会逐渐变缓(边际递减)
🗳️ 阶段3:集体智慧
💡 森林建好了,现在来投票!拖动测试点(问号标记),看看每棵树怎么判断,最终投票结果是什么。对比单棵树和森林的准确率!
🖱️ 用鼠标拖动画布中的问号标记,移动到不同位置。每棵树会用彩色箭头指向它认为的类别,右侧显示投票柱状图!
🗳️ 投票结果
拖动测试点后,这里会显示投票结果...
🤔 动动脑筋
1. 投票时如果有10棵树,4票苹果、3票橙子、3票葡萄,最终结果是什么?
2. 集体投票为什么比单个判断更可靠?
📝 本阶段要点
- 投票机制:每棵树给出自己的预测,取票数最多的类别作为最终结果
- 集体投票比单个判断更可靠——个别树的错误被多数正确判断"淹没"
- 即使每棵树只有60%准确率,多棵树投票后准确率可以大幅提升
- 这就是"三个臭皮匠,顶个诸葛亮"的数学原理!
🏆 阶段4:森林鉴定大赛
💡 随机森林不只是鉴定水果!它还能分类花朵、预测成绩、判断运动类型。选择一个场景,点击画布添加测试点,看森林如何鉴定!
森林中决策树的数量
10 棵树
👆 点击画布任意位置添加测试点,森林会自动鉴定它的类别并显示置信度。切换不同场景体验随机森林的广泛应用!
🏆 鉴定结果
点击画布添加测试点后,这里会显示鉴定结果...
🤔 动动脑筋
1. 随机森林适合处理什么类型的数据?
2.(开放题)随机森林和单棵决策树相比,最大的优势是什么?
随机森林最大的优势是降低过拟合风险和提高稳定性。单棵决策树容易记住训练数据中的噪声(过拟合),在新数据上表现差;而随机森林通过多棵树投票,个体树的错误被纠正,整体预测更准确、更稳定。此外,随机森林对特征选择不敏感,适合处理高维数据,还能评估特征重要性,是实际应用中最常用的机器学习算法之一。
📝 本阶段要点
- 随机森林适用于各种分类问题:花朵识别、成绩预测、运动分类等
- 真实应用中需要选择合适的特征来描述数据
- 置信度(投票比例)反映了分类结果的可靠程度
- 随机森林是目前最常用的机器学习算法之一,广泛应用于医疗诊断、金融风控、推荐系统等领域