药理学MCQ中的四种AI工具的诊断性能:准确性,敏感性和特异性
Ayah J Al-Rahahleh1, Mai Z Rizik2, Fahmi Y Al-Ashwal3,4
1Clinical Pharmacy and Therapeutics Department, Faculty of Pharmacy, Applied Science Private University, Amman, Jordan.
微软Copilot在药理学教育中评估的四个AI工具中显示出最高的准确性. 虽然所有人工智能工具都有潜力,但由于性能差异,建议谨慎使用学术和临床应用.
科学领域:
- 医疗教育中的人工智能
- 药理学 教育 技术 技术 药理学 教育 技术
- 在医疗保健中的自然语言处理.
背景情况:
- 人工智能在医学和制药教育中的应用越来越感兴趣.
- 在学术环境中评估人工智能工具性能时存在的知识差距.
- 需要对药理学中的AI语言模型进行客观评估.
研究的目的:
- 为了比较四种AI语言工具的性能:微软Copilot,ChatGPT-3.5,谷歌Gemini和DeepSeek AI.
- 根据准确性,灵敏性,特异性和可重复性来评估药理学中人工智能表现的多选择题 (MCQ).
- 在关键的学术背景下评估AI在诊断准确性的能力.
主要方法:
- 在心血管,呼吸道,胃肠道和内分泌系统中生成和验证80个药理学MCQ.
- 包括四个药理学领域:作用机制,副作用,药理动力学和药物相互作用.
- 两轮测试用于计算准确度,灵敏度,特异性,并评估答案的可重复性.
主要成果:
- 微软Copilot实现了最高的整体准确度 (87.5%),灵敏度 (94.6%) 和特异性 (70.8%).
- 聊天GPT-3.5和谷歌双子显示了可比的准确性 (76.3%和75.0%),在灵敏度和特异性方面存在差异.
- DeepSeek AI的准确性最低 (68.8%),可再生性最高 (97.5%);所有工具的性能都随着问题难度的下降而下降.
结论:
- 微软Copilot成为药理学教育中最准确和最一致的AI工具.
- 所有评估的AI工具都具有教育价值,但性能限制需要仔细考虑.
- 性能的变化,特别是ChatGPT-3.5,在学术和临床应用中需要谨慎.
更多相关视频
09:00Author Spotlight: Validation of SICOLE-R for Assessing Cognitive and Reading Skills in Spanish-Speaking Children and Its Role in Personalized Education
Published on: August 16, 2024
04:57Comparative Analysis of Automatic Fecal Analyzer versus Direct Wet Smear Microscopy for Detecting Parasitic Infections in Stool Samples
Published on: April 25, 2025
相关概念视频
Sensitivity, Specificity, and Predicted Value
Sensitivity is the...
Receiver Operating Characteristic Plot
Measurement of Bioavailability: Pharmacodynamic Methods
Drug Product Performance: In Vitro–In Vivo Correlation
Therapeutic Drug Monitoring: Drug Analysis Methods
Effect of Hepatic Disease on Pharmacokinetics: Pathophysiologic Assessment and Liver Function Test
