PGxQA:用于评估LLM绩效的资源,用于药物遗传学QA任务.
Karl Keat1, Rasika Venkatesh1, Yidi Huang1
1Genomics and Computational Biology Graduate Program, University of Pennsylvania, Philadelphia, PA, USA.
Pacific Symposium on Biocomputing. Pacific Symposium on Biocomputing
|December 13, 2024
概括
大型语言模型 (LLM) 对药物遗传学 (PGx) 信息传递有希望. 然而,目前的AI模型,包括GPT-4o,仍然提供不准确的临床信息,阻碍了医疗保健的广泛采用.
科学领域:
- 药物遗传学 药物遗传学
- 人工智能的人工智能
- 精准医学是一门精准的医学.
背景情况:
- 药物遗传学 (PGx) 对精准医学至关重要,但由于临床医生和患者教育有限,临床实施速度缓慢.
- 大型语言模型 (LLM) 提供了传播PGx信息的潜力,但有可能在临床环境中提供危险的不准确性.
研究的目的:
- 评估基于LLM的聊天机器人的准确性,以回答临床医生,患者和研究人员的药物遗传学问题.
- 量化当前LLM与药物遗传学信息临床标准的性能差距.
主要方法:
- 开发了自动化和专家评分的测试,以评估聊天机器人对药物遗传学查询的性能.
- 应用基准测试来评估最先进的LLM,包括GPT-4o.
主要成果:
- 像GPT-4o这样的新型LLM显示出比前者更好的性能.
- 尽管取得了进展,但目前的LLM并不符合临床药物遗传学应用所需的准确性标准.
结论:
- 医学博士学位显示出药物遗传学教育的潜力,但需要进一步发展以确保临床安全性和可靠性.
- 开发的基准作为公共资源,推动药物遗传学临床AI的进展.
更多相关视频
13:24Integration of Wet and Dry Bench Processes Optimizes Targeted Next-generation Sequencing of Low-quality and Low-quantity Tumor Biopsies
Published on: April 11, 2016
11.8K
05:53Candidate Gene Testing in Clinical Cohort Studies with Multiplexed Genotyping and Mass Spectrometry
Published on: June 21, 2018
10.1K
