生成型人工智能方法报告在耳鼻喉科:一个范围审查
Isaac L Alter1, Karly Chan1, Katerina Andreadis2
1Department of Otolaryngology-Head and Neck Surgery, Sean Parker Institute for the Voice, Weill Cornell Medical College, New York, New York, USA.
The Laryngoscope
|September 25, 2025
概括
耳鼻喉学中大型语言模型 (LLM) 方法的报告不一致,阻碍了可重现性. 研究往往忽略了有关提示工程和模型参数的关键细节,影响了LLM应用在OHNS研究中的概括性.
科学领域:
- 耳鼻喉科 - 头部和部外科 (OHNS)
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 在OHNS研究中表现有前途.
- 对LLM方法的不一致报告,特别是提示工程和模型参数,对研究可重现性构成挑战.
- 需要评估LLM专注的OHNS文献中方法报告的质量.
研究的目的:
- 批判性地审查在OHNS领域使用LLMs的方法报告和研究质量.
- 识别报告中存在的漏洞,对基本的LLM实施细节进行报告.
主要方法:
- 在多个数据库 (PubMed,Embase,Web of Science等) 中进行系统搜索. 在2024年10月进行.
- 两个独立的审查员进行了抽象和全文审查,包括对所有使用LLM在OHNS的初级研究的数据提取.
- 从925份获取的摘要中,包括了117项研究.
主要成果:
- 所有包括的研究都使用了ChatGPT;只有16.2%纳入了额外的LLMs.
- 快速报告是不完整的:46.2%提供了快速报价,76.9%报告了快速的数字,但很少有人合理化了它们 (6.8%),23.9%报告每次快速运行.
- 虽然73.5%的人描述了快速开发,但只有11.1%的人解释了设计决定,6.0%的人报告了快速测试. 报告质量没有随着时间的推移而改善.
结论:
- 在OHNS的法学士文献正在探索有价值的领域,但由于方法报告的完整性变化而受到影响.
- 不完整的报告显著限制了这些研究结果的概括性.
- 建议研究人员和期刊传播和执行LLM报告的最佳实践.


