GPT-4 查询科学出版物的性能:说明书的可复制性,准确性和影响
Kaiming Tao1, Zachary A Osman1, Philip L Tzou1
1Division of Infectious Diseases, Department of Medicine, Stanford University, Stanford, CA, USA.
BMC medical research methodology
|June 25, 2024
概括
大型语言模型 (LLM) 在回答有关HIV耐药性论文的问题时表现出高准确度. 然而,使用说明书并没有提高性能,这表明需要先进的方法来进行专门的科学文献审查.
科学领域:
- 人工智能的人工智能
- 生物医学信息学 生物医学信息学
- 计算生物学 计算生物学
背景情况:
- 大型语言模型 (LLM) 可以通过选研究和提取数据来简化文献评论.
- 自动化这些过程可以减少人类研究人员的负担.
研究的目的:
- 评估OpenAI的GPT-4在回答有关HIV抗药性 (HIVDR) 论文的查询中的准确性.
- 评估包含专业知识的说明书对GPT-4性能的影响.
主要方法:
- 使用GPT-4 API开发了一个自动化管道来测试准确性.
- 使用了60篇HIVDR论文和60个相关问题,呈现在四个配置中.
- 绩效被评估有和没有指令表,以及通过单独或同时提交问题.
主要成果:
- GPT-4的平均准确率为86.9%,显著超过了交替答案.
- 总体召回率为72.5%,精度为87.4%.
- 指令表没有显著提高准确性,回忆力或精度;个别问题提交增加了假阳性.
结论:
- GPT-4可复制地回答了许多关于专门的HIVDR论文的问题,准确度中等至高.
- 指令表的故障表明需要更先进的技术.
- 增强的快速工程或微调开源模型可能会进一步提高LLM在专业领域的性能.
更多相关视频
08:52Improving Reproducibility to Meet Minimal Information for Studies of Extracellular Vesicles 2018 Guidelines in Nanoparticle Tracking Analysis
Published on: November 17, 2021
2.4K
10:17Improving Student Outcomes with an Adaptable Molecular Cloning Course-Based Undergraduate Research Experience
Published on: November 15, 2024
1.0K
