使用大型语言模型进行临床审查的自动化论文选:数据分析研究研究
Eddie Guo1, Mehul Gupta1, Jiawen Deng2
1Cumming School of Medicine, University of Calgary, Calgary, AB, Canada.
Journal of medical Internet research
|January 12, 2024
概括
像GPT-4这样的大型语言模型可以通过有效选标题和摘要来显著改善临床研究,帮助研究人员并提高审查准确性. 这种基于人工智能的方法简化了系统审查,节省了时间和资源.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 临床研究方法论 临床研究方法论
背景情况:
- 临床研究的系统审查是耗时的,依赖于手动选数千个标题和摘要.
- 这一过程中的准确性和效率对于高质量的审查和明智的医疗保健决策至关重要.
- 传统的人力驱动查需要大量的时间和资源.
研究的目的:
- 评估OpenAI的生成预训练变压器 (GPT) 和GPT-4 API的性能,以确定相关的临床研究标题和摘要.
- 为了比较人工智能模型的准确性和效率与使用真实世界的临床审查数据集的人类审查员.
- 评估大型语言模型在简化系统审查过程中的潜力.
主要方法:
- 使用Chat GPT和GPT-4 API开发了一种新的工作流程,用于选临床评论标题和摘要.
- 一个Python脚本的自动化API调用具有自然语言选标准和人为过的数据集.
- 在6篇评论论文中,与人类评论员进行了性能比较,选了超过24,000个标题和摘要.
主要成果:
- 人工智能模型的准确度为0.91,宏观F1得分为0.60.
- 排除论文的敏感度为0.91,包括论文的敏感度为0.76.
- 人工智能表现出与人类共识 (κ=0.96) 的强烈一致,并且可以为其分类提供和正确的推理.
结论:
- 大型语言模型,如GPT-4,显示出显著的潜力,以提高临床审查过程的效率.
- 这些人工智能模型可以作为研究人员的宝贵辅助工具,简化工作流程并节省时间.
- 通过提高效率和准确性,人工智能可以在医学研究中作出更可靠的结论.
关键词:
聊天 GPT 的 聊天 .在 GPT 中,GPT 必须是 GPT.在 GPT-4 中使用.在法学士 (LLM) 课程中.在NLP中,我们使用了NLP.抽象的选抽象的选这是分类分类的分类.提取物 提取物提取物提取 提取 提取 提取这是一个自由文本.语言模型语言模型大型语言模型.自然语言处理自然语言处理.非阿片类止痛药 止痛药审查方法论 审查方法论审查方法 审查方法.查检查 查检查 查检查 查检查这是一个系统的系统的系统的系统.系统性审查 系统性审查非结构化数据是非结构化数据.更多相关视频
07:50A Metadata Extraction Approach for Clinical Case Reports to Enable Advanced Understanding of Biomedical Concepts
Published on: September 20, 2018
15.9K
09:20Cloud-Based Phrase Mining and Analysis of User-Defined Phrase-Category Association in Biomedical Publications
Published on: February 23, 2019
8.7K
