大型语言模型在辅助生殖技术数据分析和医学教育中的应用:比较研究
Noriyuki Okuyama1, Mika Ishii1, Yuriko Fukuoka1
1Kyono ART Clinic Takanawa, Takanawa Court 5F, 3-13-1 Takanawa, Minato-ku, Tokyo, 108-0074, Japan, 81 364084708, 81 364084702.
JMIR formative research
|October 1, 2025
概括
先进的人工智能模型在分析生殖医学数据和回答不孕问题方面表现有前途,比人类专家快得多. 然而,目前的模型在准确的医学图像诊断方面遇到了困难.
科学领域:
- 人工智能在医学中的应用
- 生殖医学数据分析 生殖医学数据分析
- 医学知识评估 医学知识评估
背景情况:
- 大型语言模型 (LLM) 在医学考试中表现出很高的表现,但它们在生殖医学和实际数据分析等特定领域的应用仍未得到充分探索.
- 缺乏针对专业医疗任务的不同LLM的比较分析.
- 本研究解决了了解LLM对生殖医学数据分析和知识评估能力的差距.
研究的目的:
- 评估先进的人工智能模型的数据分析和生殖医学知识能力.
- 为了比较GPT-4,GPT-4o,Claude 3.5 Sonnet和Gemini Pro 1.5在分析基于模板的生殖数据和回答专家级别问题的性能.
- 评估AI作为数据密集型任务和生殖医学决策支持工具的潜力.
主要方法:
- 四个人工智能模型被测试了他们使用胚胎细胞分级数据进行怀孕率分析和图形染的能力.
- 通过10个专家开发的考试问题,对模型的不孕症治疗知识进行了评估.
- 基于输出精度,处理时间和诊断能力来评估性能,每个模型重复所有程序10次.
主要成果:
- GPT-4o在数据分析方面表现出色,在90%的试验中获得A级,平均处理时间为26.8秒,比胚胎学家快得多.
- 在多项选择知识问题上,GPT-4o,Claude 3.5 Sonnet和Gemini Pro 1.5获得了完美的分数,而GPT-4的成功率为60%.
- 没有人工智能模型可以从型图像中可靠地诊断染色体异常,克劳德和双子座达到70%的最高准确率.
结论:
- 人工智能模型可以快速处理生殖医学数据,提供教育工具或决策支持系统的潜力.
- 尽管在数据分析和知识回忆方面表现强,但当前的人工智能模型缺乏准确的医学图像解释和诊断的能力.
- 需要进一步开发,以提高AI在临床应用中的医学成像诊断精度.


