对女性恶性瘤中的大型语言模型的评估 问答
Kai Xin1, Sen Hong2, Xiahui Wu3
1Department of Oncology, Nanjing Drum Tower Hospital, Affiliated Hospital of Medical School, Nanjing University, Nanjing, China.
Medicine
|September 17, 2025
概括
大型语言模型 (LLM) 显示了回答女性恶性瘤问题的潜力,其中Llama-3.1-405B,OpenAI o1和DeepSeek-R1表现最好. 复杂的医学术语和灵活的场景仍然存在挑战.
科学领域:
- 人工智能在医学中的应用
- 在瘤学瘤学.
- 自然语言处理自然语言处理.
背景情况:
- 基础的大型语言模型 (LLM) 对医学中的AI至关重要.
- 有限的评估研究存在于LLM问答表现在女性恶性瘤.
研究的目的:
- 评估和比较流行LLM在女性恶性瘤中的问答能力.
- 建立一个基准数据集来评估LLM在这个专业领域的表现.
主要方法:
- 通过使用205名女性恶性瘤问答的基准数据集进行了一项横截面研究.
- 七名受欢迎的LLM与三个人类瘤学家进行了评估.
- 性能指标包括准确性,一致性,延迟和模型间协议.
主要成果:
- 拉玛-3.1-405B,OpenAI o1和DeepSeek-R1的准确性和一致性超过了80%.
- 拉玛-3.1-405B显示了比OpenAI o1.1.更高的准确性和更低的延迟时间.
- 删除令牌限制显著提高了OpenAI o1和DeepSeek-R1的准确性,接近Llama-3.1-405B的性能.
结论:
- 拉玛-3.1-405B是女性恶性瘤的强有力的基线问答.
- OpenAI o1 和 DeepSeek-R1 显示出有前途,特别是没有代币限制,但需要改进一致性.
- 需要进一步精细化临床数据,以克服复杂的医疗术语和场景的挑战.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
07:13Comparison of Predictive Performance of Three Lymph Node Staging Systems in Colorectal Signet Ring Cell Carcinoma Based on Machine Learning Model
Published on: April 18, 2025
