优化ChatGPT的妄评估结果的解释和报告:探索性研究
Yong K Choi1, Shih-Yin Lin2, Donna Marie Fick3
1Department of Health Information Management, School of Health and Rehabilitation Sciences, University of Pittsburgh, Pittsburgh, PA, United States.
JMIR formative research
|October 1, 2024
概括
像ChatGPT这样的生成人工智能 (AI) 模型在临床评估中显示出潜力. 快速工程改善了他们管理和解释妄检测酸七问卷的能力.
科学领域:
- 医疗保健中的人工智能
- 自然语言处理自然语言处理.
- 临床评估工具 临床评估工具
背景情况:
- 生成型人工智能和大型语言模型 (LLM) 为医学教育和临床决策提供了潜力.
- ChatGPT是一种通用AI,可以在没有特殊培训的情况下执行差分诊断等任务.
- 在专业的,特定的环境评估工作流程中应用ChatGPT,包括评分和解释,需要进一步研究.
研究的目的:
- 评估和优化ChatGPT-3.5和ChatGPT-4用于管理和解释Sour Seven问卷.
- 通过使用快速工程来训练人工智能模型,以准确地将Sour Seven调查问卷应用于临床细节.
- 评估人工智能在痴呆症症状识别和评分方面的表现,与人类专家对比,完善解释准确性.
主要方法:
- 快速工程被用来训练ChatGPT-3.5和ChatGPT-4使用Sour Seven问卷.
- 具体的,结构化的提示指导人工智能模型理解和应用评估标准到临床细节.
- 提示程序旨在确保与临床文档一致的标准化响应格式.
主要成果:
- 两种ChatGPT模型都在应用Sour Seven问卷时表现出熟练,最初的不一致性随着时间的推移而得到改善.
- 代提示工程提高了AI在检测妄想症状和分配分数方面的性能.
- 优化包括完善评分方法,强制表格响应格式,并确保遵守推行动.
结论:
- 初步发现支持像ChatGPT这样的人工智能模型的实用性,用于管理标准化的临床评估.
- 在医疗保健中最大限度地发挥人工智能的潜力,特定环境的培训和快速工程至关重要.
- 需要进一步的研究来验证这些发现在现实世界中设置和评估概括性.


