在耳,耳,耳,耳,耳,耳,耳,耳,耳,耳,耳,耳,耳,耳,耳,耳,耳
Sholem Hack1, Rebecca Attal1, Armin Farzad1
1City St. Georges University London School of Medicine, Program Delivered by University of Nicosia at the Chaim Sheba Medical Center, Ramat Gan, Israel.
Auris, nasus, larynx
|September 5, 2025
概括
人工智能在耳鼻喉教育和沟通任务方面表现有前途. 然而,其在临床推理中的不一致性需要进一步的研究,以便将其安全地纳入实践.
科学领域:
- 耳鼻喉科
- 人工智能
- 医疗信息学
背景情况:
- 生成型人工智能,特别是大型语言模型 (LLM),越来越多地被用于医学应用.
- 评估LLM在耳鼻喉科等专业领域的有效性对于了解其潜力和局限性至关重要.
研究的目的:
- 系统地评估耳鼻喉科中生成性AI的诊断准确性,教育实用性和沟通能力.
- 分析不同LLM版本 (例如GPT-4与GPT-3.5) 在耳鼻喉科相关任务中的性能变化.
主要方法:
- 在主要的科学数据库 (PubMed,Embase,Scopus,Web of Science,IEEE Xplore) 进行了全面的文献搜索,查找2022年1月至2025年3月期间发表的研究.
- 使用JBI和QUADAS-2工具对基于文本的生成AI进行了选和评估.
- 对诊断准确性数据进行了随机效应元分析,根据任务类型和AI模型版本进行了子组分析.
主要成果:
- 包括91项研究,其中43项提供了59个模型任务对的定量诊断准确性数据.
- 与临床决策支持 (67.1%) 相比,在耳鼻喉学中生成性AI的综合诊断准确率为72.7%,在教育 (83.0%) 和诊断成像 (84.9%) 任务中准确率更高.
- 尽管在复杂的临床推理中观察到幻觉和性能变化等挑战,但GPT-4表现优于GPT-3.
结论:
- 人工智能在结构化耳鼻喉科任务中表现出强的表现,特别是在教育和沟通方面.
- 目前临床推理的不一致性限制了生成AI在患者护理中的独立应用.
- 未来的研究应优先考虑缓解人工智能幻觉,建立标准化评估指标,并进行前性验证研究以确保安全的临床整合.

