评估ChatGPT作为额外的工具用于垂体腺瘤:基于模拟咨询的观察性研究
Yuhui Chen1, Yuyang Chen, Li Chen
1Department of Neurosurgery, Fuzong Clinical Medical College of Fujian Medical University, Fuzhou, Fujian, China.
Medicine
|November 15, 2025
概括
聊天生成预训练变压器 (ChatGPT) 在回答一般患者关于垂体腺瘤 (PAs) 的问题方面表现出高可靠性. 然而,对于专门的临床查询,它的准确性会降低,这凸显了专业医疗咨询的必要性.
科学领域:
- 人工智能在医学中的应用
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
背景情况:
- 像ChatGPT这样的大型语言模型在医疗保健沟通中显示出希望.
- 对于专业医疗领域,如垂体腺瘤 (PAs),ChatGPT的可靠性尚未得到充分证实.
- 评估人工智能工具对于安全有效地整合到患者教育中至关重要.
研究的目的:
- 评估ChatGPT (GPT-4) 的可靠性和一致性,以回答与垂体腺瘤 (PA) 相关的问题.
- 为了比较ChatGPT在一般患者查询和专业临床问题上的表现.
- 评估人工智能生成的医疗信息的准确性,用于患者教育.
主要方法:
- 收集了来自患者,指南和问题库的256个PA相关问题.
- 在ChatGPT中输入问题 (GPT-4,2025年3月版本).
- 答案由2名高级神经外科医生审查,其中的差异由第三位经验丰富的神经外科医生解决. 可靠性分类为正确,部分正确但可用,部分正确或不正确.
主要成果:
- 总的来说,82.4%的ChatGPT响应被认为是可靠的 (完全正确或部分正确但可用).
- 一般问题 (95.0%) 的可靠性明显高于专业问题 (78.6%).
- 与银行问题问题 (75.7%) 相比,指导方针衍生的问题显示出更高的可靠性 (100.0%). 稳定性是中度的,为68.4%.
结论:
- 聊天GPT在垂体腺瘤信息方面表现出高可靠性和中等一致性,特别是在一般和基于指南的内容方面.
- 人工智能工具可以补充患者信息,但不应取代专业医疗咨询,特别是在复杂的情况下.
- 结果基于人工测试环境,限制了对现实世界的临床咨询的概括性.


