国内刊号:11-5602/TP
国际刊号:1673-9418
发布日期:
作者:钱鹏, 储开斌, 殷聪聪, 黄思涵
单位:1. 常州大学 王诤微电子学院,江苏 常州 2131592. 常州大学 机器人产业学院,江苏 常州 213164
关键词:思维链,ChatGLM2-6B模型,P-Tuning v2,反思性CoT,任务级交互
基金:江苏省研究生科研与实践创新计划项目(KYCX25_3380)。
现阶段,大语言模型在处理复杂的长程任务推理时仍面临“幻觉”等问题,这对机器人控制构成了重大挑战。传统的思维链(CoT)技术在应对多模态信息整合与错误校正方面仍存在局限。为此,提出一种基于反思性思维链的大模型微调方法,以提升大语言模型在智能小车任务级控制中的规划能力。该研究以ChatGLM2-6B模型为基础,结合P-Tuning v2微调技术实现深度提示优化,构建了三类逐步增强推理能力的数据集:基础的CoT数据集、以自洽性为目标的CoT-SC数据集,以及具有反思和修正能力的反思性CoT数据集。通过引导模型进行逻辑推理和错误纠正,大幅度提升了规划结果的准确性和鲁棒性。实验结果表明,相较于基准模型,经过反思性CoT微调的模型在单步和双步任务指令中,BLEU-4指标分别提升20.91和26.80个百分点,在逻辑推理、任务规划及多步骤指令处理方面均优于其他微调方法。
来源:2026年第1期
《计算机科学与探索》期刊编辑部