计算机科学与探索

北大核心,INSPEC,JST,CSCD,WJCI

国内刊号:11-5602/TP

国际刊号:1673-9418

计算机科学与探索杂志2024年第12期:CFB:金融领域大模型评估方法

发布日期:

作者:李毅, 李浩, 许骁哲, 杨一凡

单位:1. 山西财经大学 信息学院,太原 0300002. 山西财经大学 统计学院,太原 0300003. 太原理工大学 机械工程学院,太原 0300004. 中南财经政法大学 信息工程学院,武汉 430073

关键词:金融大模型,评估基准,提示词工程,知识检索增强,指令微调

随着大语言模型(LLM)在金融领域的应用潜力不断显现,评估金融大模型的性能变得尤为重要。然而,由于当下的金融评估方法评估任务单一、评测数据集覆盖面不足以及测评基准数据污染等方面的局限,大模型在金融领域的潜力尚未得到充分探索。基于此,提出了中文金融大模型评估方法CFB,构建36个数据集,涵盖24个金融任务,涉及多项问答、术语解释、文本生成、文本翻译、分类任务、语步识别、预测决策7个金融大模型测评任务,并构建了相应的测评基准。CFB提出的新思路包括:更广泛的任务和数据范围,引入了基于LLM的基准去污方法以及基于指令微调、知识检索增强和提示词工程3种方法的评估。并对包括GPT-4o、ChatGPT和Gemini在内的12个LLM进行了评估,实验结果显示,虽然LLM在信息提取和文本分析方面表现出色,但在高级推理和复杂任务方面存在困难。GPT-4o在信息提取和股票交易方面表现突出,而Gemini在文本生成和预测方面更胜一筹。经过指令微调的LLM在文本分析上有所提升,但对复杂任务提供的益处有限。

来源:2024年第12期

《计算机科学与探索》期刊编辑部

查看计算机科学与探索杂志2024年第12期

联系我们

  • 地址:北京市海淀区北四环中路211号
  • 电话:(010)89056056
  • E-mail:fcst@vip.163.com

咨询工作人员