手术中的Dall-E:探索ChatGPT图像生成的实用性
Daniel Soroudi1, Daniel S Rouhani1, Alap Patel2
1University of California San Francisco, School of Medicine, San Francisco, CA, USA.
Surgery open science
|June 9, 2025
概括
像ChatGPT-4.5和GPT-4o这样的人工智能 (AI) 工具显示出手术教育的前景,提供准确的文本和视觉效果. 然而,在这些人工智能技术被广泛采用临床应用之前,还需要进一步的改进.
科学领域:
- 医疗教育 医学教育
- 在外科手术中使用人工智能
- 手术手术手术手术手术
背景情况:
- 人工智能 (AI) 正在越来越多地影响医疗领域,包括塑料和手术.
- 像ChatGPT这样的大型语言模型 (LLM) 和文本到图像生成器 (例如DALL-E,GPT-4o) 正在变得越来越普遍.
- 这项研究调查了这些人工智能工具在手术中的患者和医疗教育中的实用性.
研究的目的:
- 评估人工智能聊天机器人 (ChatGPT-4.5,ChatGPT-3.5) 和文字转图像生成器 (GPT-4o,DALL-E 3,DALL-E 2) 在手术教育中的能力和局限性.
- 评估人工智能产生的内容的准确性,可理解性和可操作性.
- 为了比较不同的人工智能模型在生成教育材料方面的性能.
主要方法:
- 利用谷歌趋势数据,在五个类别中识别常见的手术搜索术语.
- 使用DISCERN,PEMAT和Flesch-Kincaid等级水平查询了ChatGPT-4.5和ChatGPT-3.5与识别的术语,并评估了使用DISCERN,PEMAT和Flesch-Kincaid等级水平的响应.
- 评估了由GPT-4o,DALL-E 3和DALL-E 2生成的视觉表示,这些视觉表示基于精选的ChatGPT响应.
主要成果:
- 在所有指标上,ChatGPT-4.5表现优于ChatGPT-3.5,DISCERN得分为3.80,PEMAT可理解性为91.67%,准确度为4.47.
- 人工智能生成的文本平均Flesch-Kincaid等级水平为9.26,表明高中阅读水平.
- 与DALL-E 3和DALL-E 2相比,GPT-4o产生了更准确的视觉效果.
结论:
- 聊天GPT-4.5和GPT-4o显示了通过结合文本和图像生成来增强手术教育的潜力.
- 当前的人工智能工具具有优点和弱点,需要进一步开发以获得可靠的临床应用.
- 在它们被广泛纳入外科教育和实践之前,需要对人工智能技术进行额外的改进.


