人工智能聊天机器人在回答临床问题的表现 基于植入物进行乳腺重建的日本实践指南
Makoto Shiraishi1, Yoshihiro Sowa2, Koichi Tomita3
1Department of Plastic and Reconstructive Surgery, The University of Tokyo Hospital, Tokyo, Japan.
Aesthetic plastic surgery
|November 26, 2024
概括
聊天GPT-4和Grok AI聊天机器人显示了整形手术的潜力,GPT-4在乳房重建指南中展示了卓越的准确性和信息性. 需要进一步的研究来评估AI.
科学领域:
- 整形和重建手术 整形和重建手术
- 人工智能在医学中的应用
- 医学指导方针 医学指导方针
背景情况:
- 像ChatGPT-4 (GPT-4) 和Grok-1 (Grok) 这样的AI聊天机器人在医学上表现有前途,但在整形外科缺乏评估.
- 这项研究评估了AI聊天机器人的性能,根据日本塑料和重建手术学会 (JSPRS) 2021年关于植入式乳房重建 (IBBR) 的指南.
研究的目的:
- 评估关于IBBR指南的临床问题 (CQ) 的 GPT-4 和 Grok 答案的准确性,信息性和可读性.
- 为了比较GPT-4和Grok在解释和应用已建立的整形外科指南方面的表现.
主要方法:
- 使用了JSPRS IBBR指南中的临床问题.
- 5名乳房重建专家和5名整形外科研究员评估了GPT-4和Grok的反应.
- 评估标准包括准确性,信息性和可读性.
主要成果:
- 根据整形外科研究员的评价,GPT-4在准确性,信息性和可读性 (p < 0.001) 方面明显优于Grok.
- 在所有指标上,Grok的答案得分明显低于原始指南 (p < 0.001).
- 研究人员对GPT-4的准确性评价高于专家 (p = 0.012),而Grok没有显著差异.
结论:
- GPT-4显示了在塑性手术中帮助解释IBBR临床指南的潜力.
- 人工智能聊天机器人存在错误信息的风险,需要谨慎和进一步调查.
- 需要进一步的研究来定义AI聊天机器人在乳房重建手术中的作用.


