Preclinical HistoBench: A Pilot Benchmark Dataset for Evaluating Large Language Models on Preclinical

Avan Kader1, Marie-Luise H H Ranner-Hafferl2, Felix Reuter1

  • 1Department of Diagnostic and Interventional Radiology, Technical University of Munich, Ismaninger Str. 22, 81675 Munich, Germany.

Biology
|March 13, 2026
PubMed
Summary

This study introduces a benchmark dataset for evaluating large language models (LLMs) in preclinical histopathology. LLM performance varies significantly, showing sensitivity to class imbalance and potential as research screening tools.