Related Experiment Video
Updated: Aug 10, 2025

04:48
Application of Deep Learning-Based Medical Image Segmentation via Orbital Computed Tomography
Published on: November 30, 2022
2.9K
Diversity Learning Based on Multi-Latent Space for Medical Image Visual Question Generation.
He Zhu1, Ren Togo2, Takahiro Ogawa2
1Graduate School of Information Science and Technology, Hokkaido University, N-14, W-9, Kita-ku, Sapporo 060-0814, Hokkaido, Japan.
Sensors (Basel, Switzerland)
|February 11, 2023
Summary
This study introduces a novel visual question generation model for automated clinical diagnosis. It enhances diagnostic accuracy by generating diverse, informative questions from medical images, reducing physician workload.
Area of Science:
- Artificial Intelligence
- Medical Imaging Analysis
- Clinical Decision Support
Background:
- Auxiliary clinical diagnosis aims to address resource disparities but remains physician-dependent.
- Current intelligent systems have limited involvement in the diagnostic process.
- Existing medical question generation lacks diversity, hindering comprehensive patient evaluation.
Purpose of the Study:
- To develop a diversity learning-based visual question generation model for automated clinical diagnosis.
- To enhance patient information capture from multiple perspectives with reduced physician involvement.
- To generate informative and diverse question sets from medical images for interactive diagnosis.
Main Methods:
- Proposed a diversity learning-based visual question generation model utilizing a multi-latent space.
- Embedded visual and language information in different latent spaces to generate diverse questions.
- Introduced a novel loss function for diversity training and a new metric (similarity) for evaluation.
- Enabled control over generated question categories for directional questioning.
Main Results:
- The model successfully generated diverse and informative questions from medical images on Slake and VQA-RAD datasets.
- Demonstrated the effectiveness of the multi-latent space and diversity loss in enhancing question variety.
- The proposed similarity metric accurately evaluated model performance.
Conclusions:
- The developed model can generate diverse questions, improving automated clinical diagnosis.
- This approach supports interactive automated clinical diagnosis by working with answering models.
- The method offers a cost-effective solution for generating diagnostic datasets, reducing manual annotation efforts.
Keywords:
computer visionmedical image analysismedical informaticsnatural language processingvisual question generation
