Reproducibility and Robustness of Large Language Models for Mobility Functional Status Extraction

Xingyi Liu1, Muskan Garg1, Eunji Jeon1

  • 1Department of AI and Informatics, Mayo Clinic, Rochester, USA.

Summary

Evaluating large language models (LLMs) for clinical information extraction (IE) is crucial. This study found that prompt paraphrasing and model choice significantly impact LLM stability, but self-consistency can improve reliability.