• 交叉验证如何防止过拟合


    1、过拟合与欠拟合定义

    过拟合指的是模型在训练集上表现很好,在验证集和测试集上表现很差;
    欠拟合指的是模型在训练集、测试集、验证集上表现都很差。

    2、过拟合与欠拟合出现的原因分析

    2.1 样本数量

    我们知道,样本数量对于机器学习算法来说,假如模型适用于大数据集,那么样本数量必然是越多越好。当样本数量不足时,会出现欠拟合情况,模型在三个数据集上表现都非常差。

    2.2 模型复杂度

    通常来说,当我们选定模型后,例如逻辑回归,线性回归,使用的特征数量越多,模型复杂度通常就会越高。我们可以利用特征选择算法,例如MRMR、卡方检验,将特征重要性进行排序。然后依次增加特征,计算训练集和测试集的准确率和损失函数。我们一般会发现,随着特征数量的增加,训练集的准确率会逐渐趋于100%,测试集的准确率会逐渐下降。训练集的损失会逐渐下降为0,测试集的损失会逐渐增加。例如说,当训练集损失为0,而测试集损失不为0时,我们知道模型必然发生了过拟合。这样,我们就能大致判断当前模型是否发生了过拟合情况。

    3、为何交叉验证可以防止过拟合

    首先要说明的一点是,并不是交叉验证会使得模型复杂度降低或者怎么样而防止模型过拟合,而是说交叉验证这种行为可以让我们在训练过程中评估模型是否出现了过拟合情况。
    我们知道,5折交叉验证是随机用80%的数据进行训练,20%的数据进行验证。这种情况下,如果模型发生了过拟合,

  • 相关阅读:
    Xavier MAC与PHY自适应速率分析-代码分析
    CSS 常用样式——定位属性类型及特点
    [附源码]JAVA毕业设计列车票务信息管理系统(系统+LW)
    STC4054锂电池充电IC
    保护你的网站:了解5种常见网络攻击类型及其防御方法
    数据挖掘与分析课程笔记(Chapter 2)
    01 HTTP协议相关
    docker部署clickhouse-server
    leetcode算法之前缀和
    Java老人护理上门服务类型系统小程序APP源码
  • 原文地址:https://blog.csdn.net/weixin_43249038/article/details/125629912