提高可访问性:在糖尿病视网膜病变中为残疾人提供视觉问题解答的多层次平台
Sarah Alotaibi1, Suheer Al-Hadhrami1,2, Saad Al-Ahmadi1
1Department of Computer Science, College of Computer and Information Sciences, King Saud University, Riyadh, Saudi Arabia.
Frontiers in artificial intelligence
|November 19, 2025
概括
本研究引入了一种新的多层次视觉问题答案 (VQA) 框架,以帮助视觉障碍者. 双层架构通过将问题路由到专门的VQA模型来提高准确性.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 人与计算机的交互
背景情况:
- 视觉障碍影响全球22亿人,影响视觉信息的感知.
- 现有的视觉问题答案 (VQA) 系统在准确解释视觉障碍用户的各种视觉查询方面面临挑战.
研究的目的:
- 引入一个新的多层次视觉问答 (VQA) 框架,旨在提高视觉障碍者系统性能.
- 在多层架构中利用各种VQA模型的优势,以提高准确性和用户体验.
主要方法:
- 一个双层架构,采用两个不同的层次:问题类型分类和专门的VQA模型选择.
- 实现一个交换机功能,根据分类问题类型动态选择最佳VQA模型.
- 在不同级别的多个VQA模型的整合,以满足不同的视觉质询需求.
主要成果:
- 拟议的多级VQA技术在提高系统性能方面表现出显著的有效性.
- 两级VQA模型取得了显著的准确性改进,与最先进的模型相比,性能从87.41%提高到88.41%.
- 实验结果证实,在不同级别使用多个VQA模型可以提高整体系统的准确性.
结论:
- 多层次的VQA框架为开发视力障碍者先进辅助技术提供了一个有希望的方向.
- 双层架构通过智能地将问题路由到适当的模型,有效地提高了VQA的准确性.
- 未来的研究应该专注于优化和实验在多级框架内的各种模型配置,以进一步提高性能.
关键词:
电力电器 (Electra) 是一个电器.医疗-VQA 已经开始了.一个猪猪.意识到残疾的VQA.医学视觉问题答案 回答问题在多层次的VQA.问题 回答 回答 问题 回答视觉语言模型 视觉语言模型更多相关视频
07:12Development of a Gaze-Contingent Display Framework Designed for Perceptual and Oculomotor Research with Simulated Central Vision Loss
Published on: April 11, 2025
845
09:29A Standardized Obstacle Course for Assessment of Visual Function in Ultra Low Vision and Artificial Vision
Published on: February 11, 2014
13.5K
