大型语言模型可以生成高质量的病理学多选择题,可与人类专家撰写的问题相比较
Michael J Borowitz1, Amanda L Blackford2, Suman Nagelia3
1Department of Pathology, Sol Goldman Pancreatic Cancer Research Center, Johns Hopkins University School of Medicine, Baltimore, Maryland; Sidney Kimmel Comprehensive Cancer Center, Johns Hopkins University School of Medicine, Baltimore, Maryland.
概括
大型语言模型 (LLM) 可以生成病理学测试问题,但仍然需要人类专家来实现最佳质量. 虽然LLM生成的问题显示质量较差的例子略多,但它们的整体好或优秀评分与人类撰写的问题相似.
科学领域:
- 医学教育 医学教育
- 人工智能在病理学中的应用
- 问题世代问题世代
背景情况:
- 为病理学评估创建高质量的多选择题是耗时的,需要专业知识.
- 大型语言模型 (LLM) 为高效的问题生成提供了潜在的解决方案.
研究的目的:
- 为了评估由大型语言模型 (LLM) 产生的病理学测试问题的质量,与人类专家相比.
- 评估LLM产生的胰腺病理学问题的表现和感知.
主要方法:
- 100个胰腺病理学问题是由人类专家撰写的.
- 每个问题由ChatGPT-4.0和Gemini 2.5 Flash生成50个问题.
- 190名志愿者评估了人类撰写和LLM生成问题的质量,难度和临床现实性.
主要成果:
- 由LLM生成的问题需要修改,而ChatGPT生成的问题被评为比人类撰写的问题更容易.
- 在LLM产生的问题中,不良/不可接受项目的比例略高 (11.7%),而不是人类撰写的 (10.1%),但在好/优秀评级上没有差异.
- 在人类撰写和LLM生成的问题之间的平均点 biserial相关性中没有发现显著差异.
结论:
- 在有效生成病理学测试问题方面,LLM表现有前途,尽管人类监督仍然至关重要.
- 随着LLM的发展,预计它们将成为创造高质量的病理学教育评估的越来越有价值的工具.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
05:33Introduction of an Integrated Pathology Image Management, Artificial Intelligence, and Reporting System
Published on: July 11, 2025
763
