基于Stacking的序列后向搜索特征选择方法

Download PDF
王海荣,  徐贞顺,  林淑飞

北方民族大学, 计算机科学与工程学院, 宁夏银川 750021

摘     要: 针对数据处理中存在的噪音以及不相关特征过滤问题,提出了一种基于Stacking框架的序列后向搜索特征选择方法。使用K-Fold交叉验证方式训练并保存DNN、SVM基学习器,基学习器预测结果作为元学习器输入,训练并保存逻辑回归学习模型;综合分析全连接神经网络权重矩阵、支持向量机相关系数,根据元学习器模型学习结果为各基学习器赋予不同权重,计算各特征影响因子并调用序列后向搜索算法(SBS)生成最优特征子集。实验阶段,基于Kaggle网站上心脏病研究公开数据集构建了一个疾病诊断模型,调用Stacking-SBS生成特征空间中最优特征子集,进行特征选择前后诊断模型性能对比实验,将该方法与信息增益(IG)、卡方检验(Chi)和基于相关性的特征选择方法(CFS)进行对比,结果表明应用该方法不仅能够减少模型训练时间,模型的召回率、F1值也得到明显提升。此外,该方法在性能提升方面明显优于其他三种特征选择方法。最后使用Kaggle网站上心血管研究公开数据集来验证Stacking-SBS的泛化能力,实验结果表明该方法也可显著提升疾病诊断模型性能。
关 键 词: 特征选择; Stacking框架; K-Fold交叉验证; 序列后向搜索
DOI: 10.57237/j.cst.2022.01.001
联系咨询

欢迎添加编辑微信,
了解期刊信息及投稿要求:

微信:18601600891(手机同号)

加入编委会

诚邀优秀学者加入期刊的编委会,共同推动学术成果的传播,并引领科研的发展方向。

加入编委会
成为审稿人

诚邀对审稿工作有浓厚兴趣的学者加入我们的审稿人团队,共同确保期刊的学术质量,展示高水平的科研成果。

成为审稿人