揭开先进的人工智能语言模型背后的秘密,用于识别中英混合临床文本:开发和验证研究
You-Qian Lee1,2, Ching-Tai Chen3,4, Chien-Chang Chen5
1Dialogue System Technical Department, Intelligent Robot, Asustek Computer Inc, Taipei, Taiwan.
Journal of medical Internet research
|January 25, 2024
概括
这项研究表明,微调的语言模型可以在代码混合的临床文本中识别受保护的健康信息 (PHI). 大型语言模型 (LLM) 也提供了一种可行的方法,可以通过仔细提示来消除身份.
科学领域:
- 自然语言处理自然语言处理.
- 临床信息学 临床信息学
- 人工智能的人工智能
背景情况:
- 电子健康记录 (EHR) 需要删除受保护的健康信息 (PHI) 以保护隐私.
- 在多语言环境中,非结构化的临床文本和代码混合带来了识别挑战.
- 现有的临床NLP方法往往缺乏对代码混合语言的支持.
研究的目的:
- 研究微调预训练语言模型 (PLM) 在代码混合临床文本中用于PHI识别.
- 分析PLM实现无标识性能的机制.
- 使用提示评估大型语言模型 (LLM) 的零射击PHI识别能力.
主要方法:
- 编制了第一个临床代码混合的非识别数据集 (中英文).
- 探索了为PHI认可微调的PLM,探讨了他们的决策过程.
- 调查了基于提示的上下文学习与LLMs用于去识别.
主要成果:
- PLM有效地通过利用代码混合文本中的学名规律来识别PHI.
- 模型性能取决于代码混合训练数据的可用性.
- 基于LLM的去识别是可行的,可以通过自然语言提示来控制,但需要仔细的提示工程.
结论:
- 代码混合培训实例对于有效的基于PLM的去识别至关重要.
- 基于LLM的去标识是一种有前途的方法,即时质量至关重要.
- 未来的工作应该考虑数据安全和增强模型与罕见PHI的外部知识.
相关概念视频
Improving Translational Accuracy
2.6K
2.6K
Language and Cognition
346
Language serves as a bridge between ideas and communication, influencing how individuals perceive and interact with the world. Psychologists have long debated whether language shapes thought or vice versa. This discussion gained grip with Edward Sapir and Benjamin Lee Whorf in the 1940s, who proposed that language determines thought, a concept known as linguistic determinism. They suggested that the vocabulary and structure of a language influence how its speakers think and perceive reality.
346


