基于不均衡数据的风险因素筛选与Nomogram预测模型构建研究
周学超1
郝保兵2
刘成友3
1.南京市第二医院/南京中医药大学附属南京医院 肿瘤和血管疾病介入科,南京 2100032.南京市鼓楼医院肝胆及移植外科,南京 2100083.南京市第一医院/南京医科大学附属南京医院 临床医学工程处,南京 210006
摘要:为解决并优化模式识别过程中因数据不均衡导致分类结果偏向多数类的问题,本研究以加利福尼亚大学尔湾分校(UCI)心肌梗死数据集为研究对象,构建了Nomogram预测模型.首先,采用K折交叉抽样投票法(K-CSV)、合成少数过采样技术_标准连续(SMOTE_NC)和随机欠采样(RUS)3 种不均衡数据处理方法,结合互信息、支持向量机权重、Spearman相关分析与方差膨胀因子,去除多重共线性特征;其次,使用单因素及多因素Logistic回归筛选独立风险因素,并构建Nomogram预测模型.结果表明:在原始不平衡数据下,模型受试者工作特征曲线下面积(AUC)值为0.85,平均精确率(AP)值为0.64;RUS处理后,AUC值为0.87,AP值为0.86,Ⅱ型错误率为11.54%;SMOTE_NC处理后,AUC与AP为0.96,但准确率降至79.89%,Ⅱ型错误率增至 29.73%;K-CSV的AUC与AP值均为 0.90,Ⅱ型错误率为 10.53%.Cox回归分析结果显示,选定特征与患者预后显著相关(P<0.01),表明所建模型在生存风险预测中具有较高的可靠性.
关键词:Nomogram不均衡数据合成少数过采样技术_标准连续K折交叉抽样投票法方差膨胀因子逻辑回归
分类号:R318(医用一般科学)TP181(自动化基础理论)
资助基金:医疗装备综合价值评估研究项目(20250412)
论文发表日期:2025-08-30
在线出版日期:2026-09-11(本平台首次上网日期,不代表文献的发表时间)
页数:11( 245-255 )
英文信息展开
生物医学工程研究

生物医学工程研究

CSTPCD
ISSN:1672-6278
年,卷(期):2025,44(4)
所属栏目:论著