使用ChatGPT模型评估核酸测试报告中的错误检测和处理建议
Wenzheng Han1, Chao Wan1, Rui Shan2
1The First Affiliated Hospital, Wannan Medical College, Wuhu, Anhui, China.
Clinical chemistry and laboratory medicine
|April 18, 2025
概括
像GPT-4o,GPT-o1和GPT-o1 mini这样的先进AI模型可以检测医学实验室报告中的错误并建议治疗方法. 这些人工智能工具在提高医疗保健效率和准确性方面表现有前途,尽管性能因错误类型而异.
科学领域:
- 医疗保健中的人工智能
- 医学实验室科学 医学实验室科学
- 临床决策支持系统 临床决策支持系统
背景情况:
- 准确的医学实验室报告对于高质量的患者护理至关重要.
- 先进的AI模型,包括ChatGPT系列,在医疗应用中展示了潜力.
- 该研究的重点是评估用于实验室报告分析的特定GPT模型 (4o,o1,o1 mini).
研究的目的:
- 评估GPT-4o,GPT-o1和GPT-o1 mini在医学实验室报告中识别错误方面的性能.
- 评估这些GPT模型在基于测试结果生成治疗建议方面的能力.
- 将人工智能模型的性能与人类专家 (高级医学实验室科学家和实习生) 进行比较.
主要方法:
- 对 86 份核酸检测报告进行了回顾性分析,以检测上呼吸道病原体.
- 在86份报告中引入四个类别的285个错误,以创建不正确的样本.
- 对比GPT模型的错误检测和治疗建议生成与高级医学实验室科学家和医学实验室实习生.
主要成果:
- 对于遗漏,时间序列和审查员错误 (88.9%-91.7%),GPT模型的检测率很高,但对于结果输入格式错误 (51.9%) 的检测率较低.
- GPT模型显示了与高级科学家 (kappa 0.778-0.837) 的实质性或几乎完美一致,以及与实习生 (kappa 0.632-0.696) 的中度一致.
- 与GPT-4o和GPT-o1相比,GPT-o1 mini表现出更高的稳定性和更快的处理时间,而GPT-o1在提供准确的治疗建议方面表现出色.
结论:
- GPT模型证明了在检测特定医学实验室报告错误和生成可靠的治疗建议方面有能力.
- 人工智能模型有可能显著减少工作量,并提高实验室环境中的临床决策过程.
- 对特定的GPT模型性能和在临床工作流程中的应用进行进一步的研究是有必要的.


