第479章 实验方案

    第479章 实验方案 (第3/3页)

据结合起来,理论上可以提高预测能力。”

    她的投影里展示了完整的数据处理流程。

    从缺失值填补、特征筛选,到训练集和验证集划分,再到不同算法之间的性能比较,图表做得很漂亮。

    研究还设置了模型解释模块,方便医生了解哪些变量对预测结果影响最大。

    陈雨虽然不太懂算法,但看到模型结构也觉得很厉害。

    林峰翻了翻纸质方案:“你准备收多少病例?”

    “先用本院近五年的介入数据库,预计能纳入一万两千例。如果数据质量可以,再联系两家合作医院进行外部验证。”

    “一万多例,够用了。”林峰说道。

    赵思思点头:“按照初步估算,主要终点事件数量也能满足建模需要。”

    周成看着投影上的流程图,问道:“三家医院的数据一样吗?”

    “变量大部分一致。”

    “我问的是数据分布。”

    赵思思停了一下。

    周成把鼠标移到其中一组特征上:

    “我们医院复杂冠脉患者比例高,腔内影像使用率也高,很多患者是外院处理困难后转过来的。”

    “你联系的第二家医院以常规择期介入为主,第三家医院承担大量急诊PCI。”

    “三家医院的患者来源、病变复杂程度和治疗习惯都不同,模型在本院表现很好,放到另外两家医院会怎么样?”

    “可以通过外部验证判断。”

    “如果验证效果很差呢?”

    赵思思想了想:“重新校准模型。”

    “校准以后,换一家医院还要重新做吗?”

    赵思思没有立即回答。

    周成皱了皱眉头,继续说道:“不同医院的检查习惯也不一样。有的医院常规做IVUS,有的医院很少使用。某个变量在我们这里缺失率只有百分之十,到了外院可能缺失百分之七十。你准备怎么处理?”

    投影上的模型依旧很漂亮,问题却开始从细节里冒出来。

    赵思思原本把多中心数据看成扩大样本量的办法,却没有认真考虑各医院患者构成和诊疗流程之间的差异。

    算法可以把数据放进同一个表格,临床实际却不会因为表格统一就变得一致!

    “我回去重新分析各中心的数据分布。”赵思思说道。

    周成没有继续追问,让陈雨开始。

    ……