Python-sklearn包中StratifiedKFold和KFold生成交叉验证数据集的区别

原创

于 2018-11-25 00:25:09 发布 · 2.7w 阅读

104 ·

CC 4.0 BY-SA版权

文章标签：

#StratifiedKFold #KFold #sklearn #采样 #交叉

一、StratifiedKFold及KFold主要区别及函数参数
KFold交叉采样：将训练/测试数据集划分n_splits个互斥子集，每次只用其中一个子集当做测试集，剩下的（n_splits-1）作为训练集，进行n_splits次实验并得到n_splits个结果。
注：对于不能均等分的数据集，前n_samples%n_spllits子集拥有n_samples//n_spllits+1个样本，其余子集都只有n_samples//n_spllits个样本。（例10行数据分3份，只有一份可分4行，其他均为3行）

sklearn.model_selection.KFold(n_splits=3,shuffle=False,random_state=None)

n_splits：表示将数据划分几等份
shuffle：在每次划分时，是否进行洗牌
若为False，其效果相当于random_state为整数(含零)，每次划分的结果相同
若为True，每次划分的结果不一样，表示经过洗牌，随机取样的
random_state：随机种子数，当设定值(一般为0)后可方便调参，因为每次生成的数据集相同

StratifiedKFold分层采样，用于交叉验证：与KFold最大的差异在于，StratifiedKFold方法是根据标签中不同类别占比来进行拆分数据的。

sklearn.model_selection.StratifiedKFold(n_splits=3,shuffle=False,random_state=None)

参数含义同KFold。

二、实例分析两者差别
首先生成8行数据(含特征和标签数据)

import numpy as np
from sklearn.model_selection import StratifiedKFold,KFold

X=np.array([
    [1,2,3,4]

最低0.47元/天解锁文章

6 条评论

wangyuyang08 2020.10.28
如果用机器学习做回归，自变量有8列，其中一列为花的种类，因变量一列，这样的话怎样进行分层划分训练集和测试集然后用GrdisearchCV的方法进行网格搜索优化参数，谢谢

wangyuyang08 2020.10.27
您好，怎样在GridsearchCV时候使用StratifiedKFold方法分层采样，进行交叉验证，谢谢

Forever Jacky 2020.10.12
讲得很好点赞

szl_ 2019.12.10
请问为什么test是两个值啊？
- Java技术大联盟回复szl_ 2020.03.13
  [reply]weixin_43783505[/reply]分成4份啊
- 岳麓山炒粉回复szl_ 2020.03.05
  [reply]weixin_43783505[/reply]8个样本数据，每次取6个训练，2个测试，返回的是index