关于眼内透镜的ChatGPT-4的回应:不断发展的人工智能评估
Fahri Onur Aydin1, Serhat Ermis1
1Department of Ophthalmology, Basaksehir Cam and Sakura City Hospital, University of Health Sciences, Istanbul, Turkey.
Clinical & experimental optometry
|June 26, 2025
概括
在6个月内,ChatGPT-4.0显示了眼内透镜 (IOL) 查询的准确性和响应长度的提高. 复制性在容易的问题上很高,但随着难度的增加而下降,这表明医疗信息的潜力,但需要进一步的可靠性研究.
科学领域:
- 人工智能在眼科中的应用
- 医疗保健中的大型语言模型 (LLM)
- 眼科设备信息系统 眼科设备信息系统
背景情况:
- 大型语言模型 (LLM) 越来越多地被使用,使其准确性和可重复性变得至关重要.
- 评估像ChatGPT-4.0这样的先进AI在专业医疗领域的性能是必不可少的.
- 眼内透镜 (IOL) 是人工智能驱动的信息可能影响临床实践的一个关键领域.
研究的目的:
- 评估关于眼内透镜 (IOL) 的ChatGPT-4.0反应的准确性和可重复性.
- 在六个月的时间内评估响应质量的变化.
- 为了确定问题难度对AI性能的影响.
主要方法:
- 一项观察性,横截面研究利用了45个开放式的IOL相关问题,跨越了容易,中等和困难的类别.
- 两位独立评估人员两次查询了ChatGPT-4.0 (2024年4月和10月),分析了90个响应.
- 答案被评估为单词/字符数量,抄袭,和利克特尺度评分 (准确性,相关性,一致性).
主要成果:
- 轻松,中等和困难问题的准确率分别为93.3%,86.7%和80%.
- 随着时间的推移,观察到响应长度 (单词/字符数) 和利克特分数的显著增加 (p < 0.0001 和 p = 0.046).
- 总体一致性是中等的 (ICC=0.639),对于容易问题 (1.00) 有很好的可重复性,对于中等问题 (0.788) 有可接受性,对于困难问题 (0.550) 有中等性.
结论:
- 聊天GPT-4.0显示,随着时间的推移,对IOL查询的准确性和响应长度有所改善.
- 可复制性因难度而异,对于简单的问题高,对于复杂问题下降.
- 虽然对医疗信息传播有希望,但需要进一步的研究来提高ChatGPT-4.0在眼科中的可靠性.


