VI-OCR:用于文本可访问性评估的"视觉障碍者"光学字符识别管道
Qingying Gao1,2, Roberto Manduchi3, Pradeep Y Ramulu2
1Department of Computer Science, Johns Hopkins University, Baltimore, MD, 21218, USA.
Scientific reports
|December 10, 2025
概括
我们开发了VI-OCR,这是一种使用人工智能的工具,用于评估低视力人士的文本可访问性. 它模仿人类的阅读能力,以确保文本可读,改善视力受损人士的产品设计.
科学领域:
- 计算机视觉 计算机视觉
- 眼科医生 眼科 眼科
- 人与计算机的交互
背景情况:
- 低视力严重影响日常活动,特别是阅读.
- 当前的产品设计往往忽视了低视力读者的需求,因为在量化文本可访问性方面存在挑战.
研究的目的:
- 引入VI-OCR,一个新的文本可访问性评估管道.
- 弥合计算机视觉和低视力研究之间的差距.
- 根据视觉敏度和对比度灵敏度,估计低视力读者对文本的识别能力.
主要方法:
- 使用最先进的光学字符识别 (OCR) 模型开发了VI-OCR.
- 在字母敏度 (ETDRS图表),单词敏度 (MNREAD图表) 和场景文本识别上进行基准OCR和视觉语言模型.
- 将模型性能与正常视力参与者在模拟视力缺陷下进行比较.
主要成果:
- 确定了一些模型的局限性,包括不良的概括性和对比度降低的困难.
- 观察到一些模型表现过高的人类能力,而不是模仿它们.
- 证明了像Qwen2.5-VL和GPT这样的先进模型表现出类似人类的性能.
结论:
- VI-OCR 是一种可行的方法来评估视力障碍者对文本的可访问性.
- 在人工智能模型中,类似人类的性能支持VI-OCR在包容性设计中的实用性.
- 进一步的研究可以改进模型,以更好地模仿低视力读者的人类视觉感知.


