儿童保育中的人工智能:评估聊天GPT响应的性能和接受度
Yudai Kaneda1, Mira Namba2, Uiri Kaneda3
1School of Medicine, Hokkaido University, Sapporo, JPN.
Cureus
|October 4, 2023
概括
聊天GPT-3.5和GPT-4在儿童保育问答方面显示出潜力,但在国家考试中失败. 虽然GPT-4在考试中准确度更高,但在现实世界中,人们更喜欢人类答案的有用性和同理心.
科学领域:
- 人工智能的人工智能
- 儿童保育服务 儿童保育服务
- 自然语言处理自然语言处理.
背景情况:
- 像ChatGPT这样的大型语言模型 (LLM) 越来越多地用于信息检索.
- 它们在儿童保育等专业领域的应用需要仔细评估性能和用户接受.
- 评估人工智能对准确性,有用性和同理心的反应对于安全实施至关重要.
研究的目的:
- 评估ChatGPT-3.5和GPT-4在回答日本儿童保育相关问题的表现.
- 与人类专家相比,评估人工智能生成答案的准确性,有用性和同理心.
- 确定这些AI模型在日本儿童保育部门的潜在适用性和局限性.
主要方法:
- 日本儿童保育工作者国家考试问题 (2023) 用于计算GPT-3.5和GPT-4的正确答案率.
- 来自日本国家儿童护理工作者协会网站的育儿问题和答案由GPT-3.5,GPT-4和人类儿童护理工作者回答.
- 人类专业人员盲目地使用五点评分表对人工智能和人类答案的准确性,有用性和同理心进行评分.
主要成果:
- 在国家考试问题上,GPT-4的正确答案率达到47.7%,而GPT-3.5 (p<0.01) 的正确答案率为30.3%.
- 人类儿童护理工作人员的答案最常被选为最佳 (45.7%),其次是GPT-3.5 (31.4%) 和GPT-4 (22.9%) 问答.
- GPT-3.5获得了最高的准确度评分 (3.69),而人类的答案在有用性和同理心 (3.57) 中得分最高.
结论:
- 无论是GPT-3.5还是GPT-4,都不符合日本儿童保育工作者国家考试的合格标准.
- 虽然人工智能显示出希望,但人类专家的答案在实用方面,如实用性和同情心等方面得到了更高的评分.
- 该研究强调了错误信息的潜在风险,强调在日本儿童保育环境中使用人工智能时需要谨慎.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
261
06:37Author Spotlight: Addressing Technical and Subjective Challenges in Measuring Classroom Attention
Published on: December 15, 2023
3.8K
