由人工智能驱动的大型语言模型提供的前列腺癌预防和查建议的充分性
Giuseppe Chiarelli1,2, Alex Stephens3, Marco Finati1,4
1VUI Center for Outcomes Research, Analysis, and Evaluation, Henry Ford Health System, 2799 W Grand Blvd, Detroit, MI, 48202, USA.
International urology and nephrology
|April 2, 2024
概括
与GPT-3.5.5相比,GPT-4在前列腺癌查信息中表现出更高的准确性,清晰性和简洁性. 提示显著影响清晰度,GPT-4为患者教育提供了更可读和更准确的响应.
科学领域:
- 医疗保健中的人工智能
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
背景情况:
- 像ChatGPT这样的大型语言模型 (LLM) 越来越多地用于健康信息.
- 评估LLM产生的医学内容的准确性和适当性至关重要.
- 前列腺癌 (PCa) 查是一个复杂的话题,需要清晰准确的信息.
研究的目的:
- 评估ChatGPT (GPT-3.5和GPT-4) 在回答有关前列腺癌查问题的适当性.
- 在准确性,清晰性和简洁性方面比较GPT-3.5和GPT-4的性能.
- 评估两种模型生成的响应的可读性.
主要方法:
- 一个由五名审核员组成的小组制定了30个前列腺癌查问题,分别分三个难度级别.
- 通过使用各种提示,向GPT-3.5和GPT-4提出问题.
- 评论员对回复的准确性,清晰性和简洁性进行了评分.
- 使用弗莱什金凯德等级 (FKG) 和弗莱什阅读易度 (FRE) 评分来测量可读性.
主要成果:
- 在所有难度级别中,GPT-4在准确性,清晰性和简洁性方面始终超过了GPT-3.5.
- GPT-4生成了更易读的内容,比GPT-3.5.5.更低的FKG和更高的FRE得分,而不是GPT-3.5.5.
- 第二个提示变化显著改善了两个模型的响应清晰度.
结论:
- 对于提供前列腺癌查信息,GPT-4是一个比GPT-3.5更合适的工具.
- 快速工程可以提高LLM产生的响应的清晰度.
- 需要进一步的研究来优化LLM在复杂的医疗主题的患者教育中的使用.
更多相关视频
07:25A Bioluminescent and Fluorescent Orthotopic Syngeneic Murine Model of Androgen-dependent and Castration-resistant Prostate Cancer
Published on: March 6, 2018
13.1K
13:19Microarray-based Identification of Individual HERV Loci Expression: Application to Biomarker Discovery in Prostate Cancer
Published on: November 2, 2013
16.6K
