基于人工智能的全肝细分培训数据集的质量与数量对比
medRxiv : the preprint server for health sciences
|February 27, 2026
概括
高质量,更小的数据集用于医疗成像中的AI模型培训,可以匹配更大,质量混合的数据集的性能. 数据集策划影响人工智能细分的概括性,显示质量和数量之间的微妙权衡.
科学领域:
- 医疗成像和人工智能的人工智能
- 计算病理学和放射学.
- 机器学习用于医学图像分析.
背景情况:
- 人工智能 (AI) 分段模型需要大型,精心策划的数据集来进行有效的培训,而这些数据集在医疗应用中通常是有限的.
- 标注数据的质量和数量显著影响AI模型在医疗图像细分中的性能和通用性.
研究的目的:
- 为了比较数据集注释质量与数量的对全肝AI细分性能的影响.
- 评估不同的数据集策划策略如何影响子相似系数 (DSC),表面 DSC (SD),豪斯多夫距离 (HD) 和切片 DSC (Slice DSC).
主要方法:
- 训练有素的3D nnU-Net细分模型使用具有不同策划级别 (混合与高度策划) 和大小的数据集.
- 使用了3089个腹部CT扫描,保留了249个用于测试和外部验证.
- 通过使用DSC,SD 2mm,HD95和Slice DSC指标评估模型性能.
主要成果:
- 一个精心策划的244扫描数据集实现了在统计学上与2840扫描混合策划数据集在3D指标上无法区分的性能.
- 在外部验证扫描中,710扫描混合策划数据集显著优于高度策划的244扫描模型 (切片DSC:0.929与0.923).
- 高度策划的数据集表现出相当于数量级更大的数据集的性能,更大的混合策划数据集显示了概括性的好处.
结论:
- 在人工智能模型培训中,数据集质量和数量之间的权衡是微妙的,取决于具体的目标.
- 高质量的注释可以为某些细分任务提供与较大,较少策划的数据集相匹配的性能.
- 较大的混合策划数据集可能在模型通用性和局部性能改进方面提供优势.


