関連する実験動画
Updated: May 3, 2026

05:37
An R-Based Landscape Validation of a Competing Risk Model
Published on: September 16, 2022
2.2K
ランダム化臨床試験の記事の報告品質の大規模言語モデル分析: 体系的レビュー
Apoorva Srinivasan1, Jacob Berkowitz1, Nadine A Friedrich1
1Department of Computational Biomedicine, Cedars Sinai Medical Center, Los Angeles, California.
JAMA network open
|August 28, 2025
まとめ
新しい大型言語モデル (LLM) パイプラインは,ランダム化臨床試験 (RCT) の報告品質を効果的に評価し,割り当て隠蔽や外部有効性議論などの重要な要素の持続的なギャップを特定します.
科学分野:
- 臨床試験報告
- 医療における人工知能
- 生物医学研究の透明性
背景:
- ランダム化臨床試験 (RCT) の不完全な報告はバイアスの評価と再現性を妨げます.
- 試験報告の統合基準 (CONSORT) のガイドラインの遵守に関するRCTの手作業の監査は,スケーラブルではありません.
- RCTの報告の質を評価するための自動化された方法が必要である.
研究 の 目的:
- 自動化されたCONSORTガイドライン評価のためのゼロショット大言語モデル (LLM) パイプラインの開発と検証.
- 臨床試験の特徴と関連して,生物医学分野における報告の質の傾向を分析する.
主な方法:
- PubMed (1966-2024) でインデックスされたRCTの体系的なレビュー,PDFからXMLに変換.
- LLM (Chat GPT-4o-mini) は,CONSORT-Text Classification Model (CONSORT-TM) のベンチマークでテストされ,専門家のレビューに基づいて検証されました.
- LLMは,21のCONSORT項目の報告を分析したRCTの大きなサンプルでCONSORTの遵守を評価するために適用されました.
主要な成果:
- LLMは高いパフォーマンスを示し,専門家のレビューと91.7%の正確さで一致し,CONSORT-TMベンチマークでマクロF1スコア0.86を達成しました.
- 平均的なCONSORT準拠は27.3% (1966年−1990年) から57.0% (2010年−2024年) に増加したが,割り当て隠蔽 (16.1%) や外部有効性議論 (1.6%) のような重要な要素は依然として報告が不十分である.
- 臨床試験の特徴との関連は最小で,各科間の報告順位は大きく異なっていた (薬理学では35. 2%,泌尿器学では63. 4%).
結論:
- ゼロショットLLMは,CONSORTの遵守をスケールで効果的に監査し,報告の質に関する洞察を提供します.
- 重要な試験要素を報告する際の 持続的なギャップは 標的を絞った介入を必要とします
- 生物医学研究における透明性と再現性を向上させるための編集の強化の必要性を強調しています.

