Exploring clinical feasibility of zero-shot learning in a large language model for immunofixation electrophoresis

Berrin Oztas1, Irfan Kosesoy2

  • 1Department of Biochemistry, School of Medicine, Kocaeli University, Kocaeli, Turkey.

Insights

Large language models (LLMs) show promise for interpreting immunofixation electrophoresis (IFE) images. Gemini demonstrated superior performance over ChatGPT in automated IFE analysis, though further validation is needed.

Area of Science:

  • Artificial Intelligence
  • Medical Diagnostics
  • Laboratory Medicine

Background:

  • Immunofixation electrophoresis (IFE) is the standard for detecting monoclonal immunoglobulins but is subjective.
  • Multimodal large language models (LLMs) offer zero-shot visual reasoning capabilities.
  • Automating IFE interpretation could reduce variability and improve efficiency.

Purpose of the Study:

  • To evaluate the feasibility and diagnostic performance of zero-shot multimodal LLMs for IFE image interpretation.
  • To compare the performance of different LLMs in classifying IFE patterns.
  • To assess the impact of prompt design on LLM performance.

Main Methods:

  • A dataset of 487 IFE images across ten classes was used.
  • Two multimodal LLMs (ChatGPT-5.2, Gemini3 Pro) were evaluated using a zero-shot visual question answering (ZS-VQA) framework.
  • Performance was assessed using precision, recall, F1-score, and confusion matrix analysis with simple and detailed prompts.

Main Results:

  • Gemini outperformed ChatGPT, achieving high F1-scores for clinically relevant monoclonal categories (e.g., MK, AK, GK).
  • Detailed prompts significantly improved recall and F1-scores for both models.
  • Both models struggled with visually subtle patterns, indicating areas for improvement.

Conclusions:

  • Zero-shot multimodal LLMs, especially Gemini, show potential for automated IFE interpretation.
  • Further optimization and validation are necessary for clinical implementation due to performance variability.
  • Prompt engineering is crucial for enhancing LLM diagnostic accuracy in IFE.
Abstract