大型语言模型在干眼疾病中使用:困惑性AI与ChatGPT4对比
Sowmya V Kothandan1, Stephanie L Watson2, Sayan Basu3
1Brien Holden Eye Research Centre (BHERC), LV Prasad Eye Institute, Hyderabad, India.
Seminars in ophthalmology
|August 19, 2025
概括
像ChatGPT和PerplexityAI这样的大型语言模型 (LLM) 在干眼疾病 (DED) 中对患者查询表现相似,可以帮助患者教育. 然而,它们还不适合在DED中产生研究想法或进行文献搜索.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 干眼病 (DED) 是一种普遍的疾病,影响全球数百万人.
- 人工智能 (AI) 在医疗保健中的整合,特别是大型语言模型 (LLM),为临床和研究应用提供了潜力.
- 评估LLM在DED等专业医疗领域的有效性和局限性至关重要.
研究的目的:
- 为了比较两个著名的LLM,ChatGPT4和PerplexityAI的实用性,在临床和研究背景下解决与干眼病 (DED) 相关的查询.
- 评估LLM在为DED.产生以患者为中心的信息和研究想法方面的表现.
主要方法:
- 眼皮表面专家开发了12个提示,包括10个以患者为中心的问题和2个DED.的研究想法.
- 来自ChatGPT4和PerplexityAI的响应被专家使用标准化评分系统 (1-4) 评估准确性,同情心,全面性,专业性,人性和整体质量的评估.
- 两个LLM之间对每个响应特征的平均得分进行了比较.
主要成果:
- 聊天GPT4和Perplexity AI在患者相关的DED查询中获得了可比的整体质量分数 (平均分数分别为2.6和2.7).
- 与困惑性AI相比,ChatGPT4在生成与DED相关的研究想法方面表现优越 (平均得分为3.4比2.6).
- 困惑性AI的引用是基于网络而不是基于证据的,对于两个模型来说,对响应特征的评级者之间的可靠性都很低.
结论:
- 像ChatGPT和PerplexityAI这样的LLM在DED中的患者相关查询中显示出相似的实用性,这表明在监督下患者教育和咨询中可能发挥作用.
- 这些LLM目前还不够先进,无法产生新的研究想法或在DED领域进行全面的文献审查.
- 需要进一步开发和验证,以提高专业医疗领域LLM响应的可靠性和基于证据的性质.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
575
05:49Author Spotlight: Deciphering Electrical Networks Behind Complex Brain Activities and Disorders
Published on: November 1, 2024
964
