概括
人气的人工智能驱动的手机应用程序用于诊断皮肤病变的准确性较低,特别是在不同的皮肤色调. 这些人工智能工具对于独立的皮肤癌检测或诊断是不可靠的.
科学领域:
- 皮肤病学 皮肤病学
- 人工智能的人工智能
- 移动健康服务提供者
背景情况:
- 利用人工智能 (AI) 的移动应用程序正在出现,用于皮肤病变诊断.
- 评估这些人工智能驱动的应用程序的诊断能力至关重要.
研究的目的:
- 评估受欢迎的智能手机应用程序对皮肤病变的诊断准确度.
- 测量这些应用程序在检测不同肤色皮肤癌症中的灵敏度和特异性.
主要方法:
- 一个系统的搜索确定了流行的皮肤病变诊断应用程序.
- 斯坦福多样性皮肤病图像 (DDI) 数据库被用于测试.
- 四个应用程序 (ChatGPT,皮疹检测器,皮疹ID,皮肤扫描器) 使用102种不同的皮肤病变图像进行了评估.
主要成果:
- 应用程序的整体诊断准确度低至22%.
- 检测恶性瘤的平均灵敏度为46.57%,平均特异性为72.06%.
- 对额外数据进行ChatGPT培训并没有提高其诊断性能.
结论:
- 评估的AI皮肤诊断应用程序在不同的皮肤色调下表现不佳.
- 这些移动应用程序不建议作为独立工具来诊断皮肤病变或癌症.


