聊天GPT与深度搜索用于乳腺癌信息检索:定量比较研究
Rima Hajjo1, Dima A Sabbah1, Sanaa K Bardaweel2
1Department of Pharmacy, Faculty of Pharmacy, Al-Zaytoonah University of Jordan, Airport Street, P.O. Box 130, Amman, 11733, Jordan, 962 64291511.
JMIR cancer
|March 3, 2026
概括
像ChatGPT-4.0和DeepSeek-V3这样的人工智能 (AI) 模型可以生成可读的乳腺癌信息. DeepSeek-V3显示出更高的准确性和更好的引用与专家对齐,而ChatGPT-4.0提供了更一致的可读性.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 瘤学内容生成系统
背景情况:
- 人工智能 (AI) 越来越多地用于医学内容创建.
- 人工智能产生的医疗信息的临床相关性和可靠性,特别是在乳腺癌等复杂领域,需要进一步调查.
- 评估人工智能在生成患者教育材料方面的表现对于安全的临床整合至关重要.
研究的目的:
- 为了比较ChatGPT-4.0和DeepSeek-V3在生成乳腺癌信息方面的性能.
- 根据可读性,临床准确性,完整性,清晰性,深度和引用可靠性来评估AI产生的内容.
- 评估人工智能产生的信息与专家验证的答案和参考资料的协调程度.
主要方法:
- 从患者教育材料中选择了关于乳腺癌的十个常见问题.
- 聊天GPT-4.0和DeepSeek-V3每个为所选问题产生了60个答案.
- 专家评审人员在五个维度的7点利克特级别上对答案进行了评分;可读性使用弗莱什-金凯德等级水平进行了评估;引用可靠性使用科恩 κ和弗莱斯 κ统计数据进行了评估.
主要成果:
- 人工智能生成的内容明显比专家参考更容易阅读 (平均弗莱什-金凯德等级水平差异 -2.60,P<.001).
- 与ChatGPT-4.0 (平均值6.01) 相比,DeepSeek-V3获得了更高的内容质量得分 (平均值6.22),并且在准确度方面表现出了统计学上显著的优势 (P=.041).
- 两种模型都表现出引用可靠性的高interrater协议 (Fleiss κ=0.842为ChatGPT,0.935为DeepSeek),而DeepSeek-V3显示出与专家评级的更强的协议 (Cohen κ=0.782对比0.665为ChatGPT).
结论:
- 聊天GPT-4.0和DeepSeek-V3都能产生可读和临床相关的乳腺癌信息,整体性能可比.
- DeepSeek-V3表现出更高的准确性和更好的对齐与专家验证的引用,而ChatGPT-4.0提供了更一致的可读性.
- 持续严格的评估和质量保证对于人工智能产生的医疗内容的负责任的临床应用至关重要.
关键词:
在这里,我们可以看到AIAIAI.聊天GPT 聊天GPT 聊天在DeepSeek搜索中深入搜索.在法学士 (LLM) 课程中.人工智能的人工智能是人工智能.乳腺癌 乳腺癌 乳腺癌大型语言模型.更多相关视频
07:32Author Spotlight: Investigating Immune Cell Dynamics in the Tumor Microenvironment — Challenges and Innovations in Cancer Prognosis
Published on: April 12, 2024
2.1K
07:13Comparison of Predictive Performance of Three Lymph Node Staging Systems in Colorectal Signet Ring Cell Carcinoma Based on Machine Learning Model
Published on: April 18, 2025
892
