関連する実験動画
Updated: Sep 10, 2025

06:19
Constructing and Visualizing Models using Mime-based Machine-learning Framework
Published on: July 22, 2025
634
稀有病情報抽出のためのパイプライン,seq2seqモデル,LLMの比較
Shashank Gupta1, Xuguang Ai1, Yuhang Jiang1
1University of Kentucky, Lexington, KY, USA.
まとめ
パイプラインとシーケンスツーシーケンスモデルは,複雑な生物医学データのエンドツーエンド関係抽出 (E2ERE) に優れています. 大規模な言語モデル (LLM) の出現にもかかわらず,従来の E2ERE 方法は,訓練データがある場合に優れている.
科学分野:
- 生物医学における自然言語処理 (NLP)
- 情報抽出
- 知識の発見
背景:
- エンドツーエンド関係抽出 (E2ERE) は,生物医学知識グラフの構築に不可欠です.
- 既存の E2ERE 方法は,ドキュメントレベルのタスクで見つかる複雑なエンティティ (不連続,重複,ネスト) としばしば苦労します.
- RareDisのデータセットは,これらの複雑な特徴のために,E2EREに挑戦的な用例を提示しています.
研究 の 目的:
- 複雑なデータセット (RareDis) の3つの主要なE2EREパラダイムのパフォーマンスを評価し比較する.
- 生物医学NLPのタスクに最も適したE2EREアプローチを決定し,特に複雑なデータ構造に対処する.
- 生物医学分野におけるE2EREモデルの選択を導く経験的証拠を提供すること.
主な方法:
- 3つのE2EREパラダイムの比較分析:パイプライン (NER + RC),シーケンス対シーケンス,ジェネラティブ大言語モデル (LLM).
- それぞれのパラダイムから代表的なモデルを評価するために,複雑なエンティティによって特徴づけられるRareDisデータセットを使用しました.
- 2番目のデータセットで検証された結果は,化学物質とタンパク質の相互作用に焦点を当てた.
主要な成果:
- パイプラインベースのE2EREモデルは,RareDisデータセットで優れたパフォーマンスを示しました.
- シーケンスツーシーケンスモデルも 競争力があり パイプラインアプローチに 緊密に従います
- 大型言語モデル (LLM) は,ゼロショットシナリオではより効果的であることが判明したが,データがある場合,訓練されたモデルよりも最適ではない.
結論:
- 訓練データがある複雑な生物医学的な関係抽出のタスクでは,従来のパイプラインまたはシーケンスツーシーケンスモデルは,大規模な言語モデルよりも推奨されます.
- この研究は,専門的な生物医学NLP課題に対する確立されたE2ERE方法の継続的な関連性と有効性を強調しています.
- この研究は,RareDisデータセットに関する最初のE2ERE分析を提供し,この分野に貴重な洞察をもたらします.

