第479章 实验方案
第479章 实验方案 (第3/3页)
据结合起来,理论上可以提高预测能力。”
她的投影里展示了完整的数据处理流程。
从缺失值填补、特征筛选,到训练集和验证集划分,再到不同算法之间的性能比较,图表做得很漂亮。
研究还设置了模型解释模块,方便医生了解哪些变量对预测结果影响最大。
陈雨虽然不太懂算法,但看到模型结构也觉得很厉害。
林峰翻了翻纸质方案:“你准备收多少病例?”
“先用本院近五年的介入数据库,预计能纳入一万两千例。如果数据质量可以,再联系两家合作医院进行外部验证。”
“一万多例,够用了。”林峰说道。
赵思思点头:“按照初步估算,主要终点事件数量也能满足建模需要。”
周成看着投影上的流程图,问道:“三家医院的数据一样吗?”
“变量大部分一致。”
“我问的是数据分布。”
赵思思停了一下。
周成把鼠标移到其中一组特征上:
“我们医院复杂冠脉患者比例高,腔内影像使用率也高,很多患者是外院处理困难后转过来的。”
“你联系的第二家医院以常规择期介入为主,第三家医院承担大量急诊PCI。”
“三家医院的患者来源、病变复杂程度和治疗习惯都不同,模型在本院表现很好,放到另外两家医院会怎么样?”
“可以通过外部验证判断。”
“如果验证效果很差呢?”
赵思思想了想:“重新校准模型。”
“校准以后,换一家医院还要重新做吗?”
赵思思没有立即回答。
周成皱了皱眉头,继续说道:“不同医院的检查习惯也不一样。有的医院常规做IVUS,有的医院很少使用。某个变量在我们这里缺失率只有百分之十,到了外院可能缺失百分之七十。你准备怎么处理?”
投影上的模型依旧很漂亮,问题却开始从细节里冒出来。
赵思思原本把多中心数据看成扩大样本量的办法,却没有认真考虑各医院患者构成和诊疗流程之间的差异。
算法可以把数据放进同一个表格,临床实际却不会因为表格统一就变得一致!
“我回去重新分析各中心的数据分布。”赵思思说道。
周成没有继续追问,让陈雨开始。
……