随着AI大语言模型越来越多地表现出接近人类智能,面向人类设计的高难度、综合性考试被越来越多地引入到对语言模型的智能水平进行评测。OpenAI 在其关于 GPT-4 的技术报告中就主要通过各领域的考试对模型能力进行检验。
(资料图片)
2023年高考今日开考,中文大语言模型是否能够在高考中赶超ChatGPT呢?
综合“大考”:“书生·浦语”多项成绩领先于 ChatGPT
近日,商汤科技、上海AI实验室联合香港中文大学、复旦大学及上海交通大学发布千亿级参数大语言模型“书生·浦语”(InternLM)。
“书生·浦语”具有1040亿参数,是在包含1.6万亿token的多语种高质量数据集上训练而成。
全面评测结果显示,“书生·浦语”不仅在知识掌握、阅读理解、数学推理、多语翻译等多个测试任务上表现优秀,而且具备很强的综合能力,因而在综合性考试中表现突出,在多项中文考试中取得超越ChatGPT的成绩,其中就包括中国高考各个科目的数据集(GaoKao)。
“书生·浦语”联合团队选取了20余项评测对其进行检验,其中包含全球最具影响力的四个综合性考试评测集:
由伯克利加州大学等高校构建的多任务考试评测集MMLU;
微软研究院推出的学科考试评测集AGIEval(含中国高考、司法考试及美国SAT、LSAT、GRE和GMAT等);
由上海交通大学、清华大学和爱丁堡大学合作构建的面向中文语言模型的综合性考试评测集C-Eval;
以及由复旦大学研究团队构建的高考题目评测集Gaokao;
实验室联合团队对“书生·浦语”、GLM-130B、LLaMA-65B、ChatGPT和 GPT-4进行了全面测试,针对上述四个评测集的成绩对比如下(满分100分)。
“书生·浦语”不仅显著超越了GLM-130B和LLaMA-65B等学术开源模型,还在AGIEval、C-Eval,以及Gaokao等多个综合性考试中领先于ChatGPT;在以美国考试为主的MMLU上实现和ChatGPT持平。这些综合性考试的成绩反映出“书生·浦语”扎实的知识掌握程度和优秀的综合能力。
虽然 “书生·浦语”在考试评测上取得优秀成绩,但在测评中也可以看到,大语言模型仍然存在不少能力局限性。“书生·浦语” 受限于2K的语境窗口长度(GPT-4的语境窗口长度为32K),在长文理解、复杂推理、撰写代码以及数理逻辑演绎等方面还存在明显局限。另外,在实际对话中,大语言模型还普遍存在幻觉、概念混淆等问题。这些局限使得大语言模型在开放场景中的使用还有很长的路要走。
四个综合性考试评测数据集结果
MMLU是由伯克利加州大学(UC Berkeley)联合哥伦比亚大学、芝加哥大学和UIUC共同构建的多任务考试评测集,涵盖了初等数学、物理、化学、计算机科学、美国历史、法律、经济、外交等多个学科。
细分科目结果如下表所示。
(图中粗体表示结果最佳,下划线表示结果第二)
AGIEval是由微软研究院在今年新提出的学科考试评测集,主要目标是通过面向的考试来评估语言模型的能力,从而实现模型智能和人类智能的对比。
这个评测集基于中国和美国各类考试构建了19个评测大项,包括了中国各科高考、司法考试以及美国的 SAT、LSAT、GRE 和 GMAT等重要考试。值得一提的是,在这19个大项有9个大项是中国高考,通常也列为一个重要的评测子集 AGIEval (GK)。
下列表格中,带GK的是中国高考科目。
(图中粗体表示结果最佳,下划线表示结果第二)
C-Eval是由上海交通大学、清华大学和爱丁堡大学合作构建的面向中文语言模型的综合性考试评测集。
它包含了52个科目的近14000道考题,涵盖数学、物理、化学、生物、历史、政治、计算机等学科考试,以及面向公务员、注册会计师、律师、医生的职业考试。
测试结果可以通过leaderboard获得。
Gaokao是由复旦大学研究团队构建的基于中国高考题目的综合性考试评测集,包含了中国高考的各个科目,以及选择、填空、问答等多种题型。
在GaoKao测评中,“书生·浦语”在超过75%的项目中均领先ChatGPT。
分项评测:阅读理解、推理能力表现出色
为避免“偏科”,研究人员还通过多个学术评测集,对“书生·浦语”等语言模型的分项能力进行了评测对比。
结果显示,“书生·浦语”不仅在中英文的阅读理解方面表现突出,并且在数学推理、编程能力等评测中也取得较好成绩。
知识问答方面,“书生·浦语”在TriviaQA 和 NaturalQuestions 两项评测上得分为69.8和27.6,均超越LLaMA-65B(得分为68.2和23.8)。
阅读理解(英语)方面,“书生·浦语”明显领先于LLaMA-65B和ChatGPT。浦语在初中和高中英语阅读理解中得分为92.7和88.9,ChatGPT得分为 85.6 和81.2,LLaMA-65B则更低。
中文理解方面,“书生·浦语”成绩全面超越主要的两个中文语言模型ERNIE-260B和GLM-130B。
多语翻译方面,“书生·浦语”在多语种互译中的平均得分为33.9,显著超越LLaMA(平均得分15.1)。
数学推理方面,“书生·浦语”在GSM8K和MATH这两项被广泛用于评测的数学考试中,分别取得62.9和14.9的得分,明显领先于Google的PaLM-540B(得分为56.5和8.8)与LLaMA-65B(得分为50.9和10.9)。
编程能力方面,“书生·浦语”在HumanEval和MBPP这两项最具代表性的考评中,分别取得28.1和41.4的得分(其中经过在代码领域的微调后,在HumanEval上的得分可以提升至45.7),明显领先于PaLM-540B(得分为 26.2和36.8)与LLaMA-65B(得分为23.7和37.7)。
此外,研究人员还对“书生·浦语”的安全性进行评测,在TruthfulQA(主要评价回答的事实准确性) 以及CrowS-Pairs(主要评价回答是否含有偏见)上,“书生·浦语”均达到领先水平。
(以上图片由商汤科技授权中国网财经使用)
标签:
华润元大双鑫债券增聘基金经理尹华龙
成都中小学2023年招生正在进行中,成都墨尔文学校计划于6月18日举办校
塞尔达传说王国之泪你是萨派还是科派任务怎么做?你是萨派还是科派是本
这次成毅把自己“折腾”到了医院,到底是现场拍戏的时候保护不到位,导
民主与法制网讯(记者黎志飞)近日,记者从四川省甘孜州雅江县了解到,
近期,有不法分子以培训班退费名义实施诈骗,危害严重。不法分子先是在
龙卷预警黑龙江省气象台2023年6月7日14时20分发布龙卷预警:预计未来2
在第十六个国际档案日到来之际,湖北、江苏两省联动,6月6日共同签署武
可没人理解房月婷辞职背后的心声,她迫切的想要改变现在的工作状态,可
央视网消息(新闻联播):6月6日是我国发放5G商用牌照四周年。记者从工
深交所:腾信股份股票终止上市 6月1
深交所公告,北京腾信创新网络营销技术股份有限公司股票终止上市,自6
金龙羽:决定对深圳工业园实施停产,
金龙羽:决定对深圳工业园实施停产,将工业园整体对外出租金龙羽6月7日
生活百科小窍门小妙招大全_关于生活
生活百科小窍门小妙招大全,关于生活百科小窍门小妙招大全介绍这个很多
哈登左右为难原因何在?76人聘请纳斯
哈登左右为难原因何在?76人聘请纳斯造争冠新幻想,纳斯,费城,火箭队,76
青岛市地铁2号线二期工程下王埠车站
6月5日,在青岛地铁集团第一建设分公司、中国铁建青岛地铁项目总部及施
拳皇97电脑版怎么双人_电脑拳皇97怎
大家好,小石来为大家解答以上问题。拳皇97电脑版怎么双人,电脑拳皇97
电脑启动出现启动修复_电脑启动修复
大家好,小石来为大家解答以上问题。电脑启动出现启动修复,电脑启动修
尼昂谈下家:我想体现自己的价值 希
近日,尼昂在采访中谈到了自己的未来。尼昂表示:“我想要加入一支能体
保罗谈巴克利无冠:我的优势在于我还
近日,太阳球员保罗在《ThePivot》播客节目中谈到了冠军话题。主持人:
生活电器_关于生活电器介绍
生活电器,关于生活电器介绍这个很多人还不知道,我们一起来看看!1、生
以“绣花功夫”活用闲置空间,广州白
以“绣花功夫”活用闲置空间,广州白云这些桥底已成便民场所百姓说好,
深圳两个创新医疗器械产品获批国家药
深圳两个创新医疗器械产品获批国家药监注册申请6月7日,记者从广东省药
东莞市盲人协会举办全国爱眼日科普宣
东莞市盲人协会举办全国爱眼日科普宣传活动文 羊城晚报全媒体记者王默6
硕贝德:子公司金日工业拟投资2.55亿
硕贝德:子公司金日工业拟投资2 55亿元开展新能源线束生产项目硕贝德6
环球热文:生活的106条黄金法则_关于
生活的106条黄金法则,关于生活的106条黄金法则介绍这个很多人还不知道
趣炫游戏等在广州成立科技公司 经营
天眼查App显示,近日,广州很爱网络科技有限公司成立,法定代表人为念
她曾是央视美女主持,2婚上《非诚勿
可没人理解房月婷辞职背后的心声,她迫切的想要改变现在的工作状态,可
兰州中考时间2023年具体时间 2023中
2023年甘肃兰州中考时间:6月16-18日,中考考试科目分为全市统一考试科
你还见过哪些古诗 关于同学们没有见
抄写作文网小编为大家提供你还见过哪些古诗关于同学们没有见过的古诗来
2023父亲节暖心短句有哪些
2023父亲节暖心短句:1、父亲是一座山,那么伟岸那么刚强!爸,我永远
中国关心下一代工作委员会邓俊峰:近
人民网北京6月7日电(记者孙红丽)6月6日,在第28个全国“爱眼日”来临
【世界聚看点】艺术 | 湖北武汉琴
极致还原原著,话剧《白鹿原》带来原汁原味的原上风情。音乐剧《粉丝来
全球快讯:电脑没关机自动黑屏怎么回
大家好,小石来为大家解答以上问题。电脑没关机自动黑屏怎么回事,电脑
爱立信中国总裁方迎:中国 5G 将提
方迎强调,就「做精」而言,就是要持续打造性能优异、绿色节能、智能高
公司问答丨协鑫能科:多原因删减电池
今天,记者以投资者身份致电协鑫能科,公司工作人员表示,公司是根据市