Evaluating large language model performance in Risk of Bias assessments: A cross-sectional validation study

Siddharth Gandhi1, Arveen Shokravi2, Yashan Chelliahpillai3

  • 1Faculty of Medicine, Queen's University, Kingston, Ontario, Canada.

Plos One
|July 9, 2026
PubMed
Summary

ChatGPT-o3 identified more high-risk randomized clinical trials (RCTs) than human reviewers, but its performance was modest. It may assist, but not replace, human assessment in systematic reviews.