在这项为期10年的以人群为基础的回顾性队列研究中,纳入了2008年在公共初级保健门诊管理的年龄≥18岁、无CVD或终末期肾病病史的中国T2DM患者141 516例,并随访至2017年12月
随机选取2 / 3的患者建立性别特异性的CVD风险预测模型
剩余三分之一的患者作为验证样本,用于评估模型的区分度和校准度
基于ML的方法被应用于缺失数据填补、预测因子选择、风险预测建模、模型解释和模型评估
一种新的基于ML的填补方法- -生成对抗填补网( GAIN )比链式方程多重填补( MICE )和缺失森林插补法(基于随机森林的插补方法)更加准确、有效和高效,并且可以容忍高达50 %的缺失率
本研究采用GAIN对缺失值进行填补,具体步骤见附录A
由于在女性和男性受试者中危险因素和这些因素的影响都存在差异,因此分别为这两种性别建立模型
在代入缺失值后,将研究数据以2∶1的比例随机拆分为两部分,即推导样本和验证样本,以开发和验证分性别的风险预测模型
对于每个结局,使用极端梯度提升( extreme gradient boosting,XGB )建立性别特异性风险预测模型
Shapley Additive Explanations ( SHAP )用于评估ML模型中预测变量的重要性
有初级糖尿病护理经验的临床医生回顾了所选预测因子的非线性和交互效应的临床相关性,以确保其临床意义
排除具有可疑或不确定非线性效应的预测因子,开发第二个模型( ML模型2)
作为比较,Cox比例风险回归(向后法)也被用作使用相同原始数据建立风险预测模型的标准统计方法。缺失值使用MICE ( n = 5)进行插补
模型2纳入了模型1纳入的所有可能的预测因素,将e GFR和尿ACR修改为连续变量,并加入了变异性
模型3包含了模型2的所有显著预测因子,并加入了药物治疗模式