大型语言模型生成的医疗信息对异常性肺纤维化症的评估
Iván Cherrez-Ojeda1,2,3, Björn Christian Frye4,5, Andreas Hoheisel4,5
1Universidad Espíritu Santo, Samborondon, Ecuador.
Frontiers in artificial intelligence
|October 10, 2025
概括
像ChatGPT-4和Gemini 1.5 Pro这样的大型语言模型 (LLM) 提供了部分可靠的关于异形性肺纤维化 (IPF) 的信息,但可读性是一个挑战. 双子1.5 Pro显示了IPF内容的更高质量和指导方针一致性.
科学领域:
- 人工智能在医学中的应用
- 医疗保健的自然语言处理.
- 医疗信息质量评估 医疗信息质量评估
背景情况:
- 从人工智能驱动的大型语言模型 (LLM) 获得的异形性肺纤维化 (IPF) 信息质量在很大程度上尚未被探索.
- 评估LLM生成的IPF内容的可靠性,可读性和临床指南一致性至关重要.
研究的目的:
- 评估ChatGPT-4和Gemini 1.5 Pro关于IPF的响应的质量,可靠性,可读性和临床指南一致性.
- 为了比较两个领先的LLM在提供IPF相关的医疗信息方面的表现.
主要方法:
- 来自ChatGPT-4和Gemini 1.5 Pro对23个IPF指南问题的答案由6名评级人员评估.
- 评估使用DISCERN以质量,JAMA基准标准以可靠性,Flesch-Kincaid以可读性,以及0-4尺度以准则一致性.
- 统计分析包括描述性统计,类内相关系数和威尔科克森签名等级测试.
主要成果:
- 这两种LLM都提供了部分可靠的信息,但可读性对两者来说都是具有挑战性的.
- 双子1.5 Pro显示治疗信息质量明显提高 (DISCERN评分56比43,p<0.001).
- 与ChatGPT-4相比,Gemini 1.5 Pro与国际IPF指南的一致性更高 (中位数为3.0对3.0,p = 0.0029).
结论:
- LLM为IPF提供了有价值的医学见解,但在可靠性和可读性方面存在局限性.
- 双子1.5 Pro在IPF治疗信息质量和遵守指南方面表现优于ChatGPT-4.
- 完善LLM是必要的,以提高AI生成的医疗信息的准确性和可理解性,用于临床决策.


