在酒精和物质使用障碍的大型语言模型中对语言进行耻辱化:多模型评估和快速工程方法
Yichen Wang1, Kelly Hsu, Christopher Brokus
1Division of Hospital Medicine, Department of Medicine, Perelman School of Medicine at the University of Pennsylvania, Philadelphia, PA (YW); Gastroenterology Unit, Department of Medicine, Massachusetts General Hospital, Boston, MA (YW, NU, WZ); Tufts University School of Medicine, Boston, MA (KH); Harvard Medical School, Boston, MA (CB, NU, WZ); Division of Gastroenterology and Hepatology, Department of Medicine, Mayo Clinic, Jacksonville, FL (YH); Program for Substance Use and Addiction Services, Massachusetts General Hospital, Boston, MA (SW); Department of Biomedical Data Science, Stanford University, Stanford, CA (JZ); Department of Electrical Engineering, Stanford University, Stanford, CA (JZ); Department of Computer Science, Stanford University, Stanford, CA (JZ).
大型语言模型 (LLM) 在医疗保健讨论中经常使用关于酒精和物质使用障碍的污名化语言. 快速工程显著减少了这个问题,改善了以患者为中心的沟通.
科学领域:
- 医疗保健中的人工智能
- 自然语言处理自然语言处理.
- 医学沟通 医学沟通
背景情况:
- 大型语言模型 (LLM) 越来越多地被整合到医疗保健沟通中.
- LLM可能会无意中延续对酒精和物质使用障碍 (AUD/SUD) 患者的污名化语言 (SL).
- 缺乏对LLM倾向于SL和缓解策略的专注评估.
研究的目的:
- 评估14个大型语言模型 (LLM) 在响应有关酒精使用障碍 (AUD),酒精相关肝病 (ALD) 和物质使用障碍 (SUD) 的提示时产生污名化语言 (SL) 的倾向.
- 评估代提示工程 (PE) 在减少LLM产生的SL方面的有效性.
- 为了比较SL在对本地和工程提示的响应中的患病率.
主要方法:
- 产生了60个临床相关提示 (20个AUD,ALD,SUD) 14个LLMs.
- 两个医生独立评估了840个SL的响应,使用NIDA和NIAAA的指导方针.
- 采用代提示工程 (PE) 通过结合特定术语来避免和识别特定模型的陷来减少SL.
主要成果:
- 基线反应 (n=840) 显示35.4%包含SL (592项).
- 在快速工程之后,只有6.3%的答案包含SL (104个术语),减少了88%.
- 与AUD提示相比,ALD提示的SL概率更高 (aOR=2.11).
结论:
- 在讨论与酒精和物质使用有关的疾病时,LLM经常产生污名化的语言,这可能会影响以患者为中心的护理.
- 有针对性的提示工程显著减少了SL在各种LLM的发生.
- 持续的模型改进和结构化的提示策略对于确保无耻感的医疗保健沟通至关重要.
相关概念视频
Modeling in Therapy
Participant Modeling
Participant modeling involves therapists demonstrating calm and effective behaviors in...
Stereotype Content Model
Substance Use Disorders Affecting Sleep
Understanding the concepts of physical dependence,...
Self-Presentation: Self-Monitoring and Self-Handicapping


