Reinforcement
Observational Learning
Reinforcement Schedules
Reasoning
Purposive Learning
Inductive Reasoning
您也可能阅读
通过共同作者、期刊和引用图与本文相关的文章。
Daya Guo1, Dejian Yang1, Haowei Zhang1
1DeepSeek-AI Team, Hangzhou, China.
强化学习 (RL) 增强了大型语言模型 (LLM) 在没有人类数据的情况下的推理. 这种方法促进了先进的AI推理模式,以提高复杂任务的性能.
科学领域:
背景情况:
研究的目的:
主要方法:
主要成果:
结论: