人工智能与人类对麻醉教育视频的评估:使用验证的质量尺度进行比较分析
Kubra Taskin1, Hulya Yilmaz Ak1
1Department of Anesthesiology and Reanimation, Kartal Dr. Lütfi Kırdar City Hospital, University of Health Sciences, Istanbul, Türkiye.
Frontiers in medicine
|February 25, 2026
概括
人类创建的麻醉教育视频在YouTube上得分高于人工智能产生的. 然而,ChatGPT-5在评估视频质量方面与人类专家强烈一致,这表明AI在内容评估方面的潜力.
科学领域:
- 医学教育 医学教育
- 人工智能的人工智能
- 麻醉学 麻醉学
背景情况:
- YouTube是医学教育的热门平台,但视频质量和准确性是令人担忧的.
- 传统的质量评估依赖于人类专家使用像DISCERN,JAMA和GQS这样的尺度.
- 大型语言模型 (LLM) 为可扩展和客观的内容评估提供了新的可能性.
研究的目的:
- 为了比较由人类和人工智能制作的麻醉视频的教育质量.
- 评估人类专家评级和ChatGPT-5视频质量评估之间的一致性.
主要方法:
- 一项横截面研究分析了40个YouTube麻醉视频 (20个由人类生成,20个由人工智能生成).
- 两个麻醉师和ChatGPT-5使用DISCERN,JAMA和GQS标准评估视频.
- 计算了评价者之间的可靠性 (ICC) 和相关性 (斯皮尔曼的rho).
主要成果:
- 人类生成的视频在DISCERN和JAMA分数中显著超过AI视频 (p <0.05).
- 全球质量表 (GQS) 评分没有发现显著差异.
- 在所有尺度上,ChatGPT-5与人类专家的评分有很强的一致性 (ρ > 0.76,p < 0.001).
结论:
- 像ChatGPT-5这样的人工智能模型在教育内容评估中接近人类专家判断方面表现有希望.
- 虽然人类生成的内容在透明度方面表现出色,但人工智能生成的内容在结构和流性方面相似.
- 人工智能辅助评估可以为选医学教育视频档案提供标准化和高效的工具.
关键词:
聊天GPT-5 聊天GPT-5 聊天在DISCERN尺度上,你会看到一个尺度.在YouTube上播放YouTube的视频.麻醉教育 麻醉教育人工智能的人工智能是人工智能.医疗视频质量 医疗视频质量更多相关视频
06:19Integration of Animal Behavioral Assessment and Convolutional Neural Network to Study Wasabi-Alcohol Taste-Smell Interaction
Published on: August 16, 2024
07:28Web-based Clinician Guide to Record Compatible Video of Standardized Drinking Task Kinematics for Computer Vision Analysis
Published on: November 28, 2025
