探索用于家庭护理人员使用的大型语言模型的评估措施:范围审查
Soojeong Han1, Hannah Cho2, Yong K Choi3
1School of Nursing, Columbia University, New York, NY, USA.
Digital health
|February 23, 2026
概括
这次审查考察了如何评估大型语言模型 (LLM) 对家庭护理人员的评估. 目前的措施显示出混合的结果,表明需要改进,可靠的评估工具,以有效地支持护理人员.
科学领域:
- 医疗保健技术 技术 医疗保健 技术
- 人工智能在护理中的作用
- 研究方法研究方法研究方法学
背景情况:
- 大型语言模型 (LLM) 对包括医疗保健在内的各种领域提供了显著的好处.
- 家庭护理人员在医疗保健中发挥着至关重要的作用,并且可以从技术支持中获益.
- 在这种情况下,对于评估LLM的标准化,可靠和有效方法缺乏共识.
研究的目的:
- 对专门针对家庭护理人员的大型语言模型 (LLM) 使用的评估措施进行全面的文献审查.
- 确定当前的方法,并评估它们在护理人员领域的适用性和有效性.
主要方法:
- 根据Arksey和O'Malley的方法进行了范围审查,并坚持PRISMA-ScR检查清单.
- 从2018年到2024年7月,在主要数据库 (PubMed,EMBASE,CINAHL,PsycINFO) 中进行了广泛的文献搜索.
- 快速审查更新了2024年7月至2025年11月的文献,以捕捉最新的研究.
主要成果:
- 在1812个初始出版物中,10个符合纳入标准,主要关注ChatGPT,其中一些包括Google Bard和Bing AI.
- 评估的关键评估组件是准确性,可靠性,可读性和全面性.
- 研究报告说,LLM的答案通常是准确和可靠的,可读性和全面性的结果是可变的,并且特别关注ChatGPT.
结论:
- 该审查提供了对当前对护理人员的LLM评估措施的详细概述.
- 显然需要开发和实施更强大,可靠和有效的评估指标.
- 结果为未来的研究和实际应用提供了基础,通过持续的质量改进来增强LLM的好处.
更多相关视频
07:56Assessing the Coherence of Parents' Short Narratives Regarding their Child Using the Five-Minute Speech Sample Procedure
Published on: September 19, 2019
10.9K
12:18A Machine Learning Approach to Design an Efficient Selective Screening of Mild Cognitive Impairment
Published on: January 11, 2020
8.1K
