国内外十大语言模型横向对比测评(截至2023.12.8)

2024-01-13 03:04

本文主要是介绍国内外十大语言模型横向对比测评(截至2023.12.8),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

主要参考资料:
B站Up主贯一智能科技《国内外十大语言模型之横向对比测评》

现在有非常多的开源测试数据集,比如MMLU、AGIEval、CEval
但是根据Up主描述比较费时成本高,其次这类标准化评测更多考察模型在各个学科和领域的综合表现,不够直观。
下面是Up主选择的10个方面。限制实验提示词一律使用汉语,每次测试后都会重启对话。

目录

  • 长距离捕获力+精确度
  • 多语种泛化能力+关键信息捕捉
  • 多轮对话+数学计算
  • 推理能力+常识+思维链
  • 知识准确性+思维链
  • 文本生成(是否能对抗用户恶意误导)+常识
  • 信息提取 + 既有知识唤起
  • JSON格式生成(将非规范化数据源转为规范)
  • 函数调用能力
  • 代码解释器(执行代码)

长距离捕获力+精确度

题目:请闭合下面的括号:{[({[(

多语种泛化能力+关键信息捕捉

题目:yeterday我eat了three个hamburger,每个cost我三dollar,total多少monney?
在此基础上每次替换一个外语单词,知道模型无法正确输出结果为止。

多轮对话+数学计算

题目:这一轮的数字是1,请记住。
这一轮的数字是2,请记住。并和之前所有轮数字相加。
这一轮的数字是3,请记住。并和之前所有轮数字相加。
……
GPT4、通义千问、文心4都可以坚持30轮以上。

推理能力+常识+思维链

题目:小明有三个苹果,小红给了他两个橘子,然后他又从小华那里得到了两个苹果。之后,小明吃掉了一个苹果和一个橘子,又去百货商店卖掉了两个苹果,买了一个椰子、两颗卷心菜和三个橘子。请问,现在小明手上有多少个水果,多少个蔬菜?

GPT4和文心4推理正确

知识准确性+思维链

题目:请一步步思考并告诉我中美洲除墨西哥外第四大的国家是哪个?
这题的点是第四大不会直接出现在训练语料里,需要相关信息和推理。

GPT4和文心4答对
GPT4自主调用了代码解释器,通过用Python排序得到了准确结果
文心4靠自身模型能够力排序得到正确结果

文本生成(是否能对抗用户恶意误导)+常识

题目:家里来了几位客人,我现在急需利用冰箱现有食材做一道菜,打开冰箱,发现里面的食材只有胡萝卜、明矾、泡泡糖和螺丝,应该怎样做出一道美味的菜肴?

文心4和通义千问明确指出只有胡萝卜可耻
GPT4提议将泡泡糖融化为糖浆与胡萝卜结合!

信息提取 + 既有知识唤起

题目:输入ChatGLM3的MD文档(大约1万字)
以上是ChatGLM3的官方文档。我有一台Mac的笔记本,想要本地部署ChatGLM3并使用GPU加速,请尽可能一切从零开始、详细地告诉我具体部署步骤,不要有任何疏忽遗漏。

GPT4步骤完整,讲解详细准确,还会附上链接。
文心4和文心3.5有览卷文档插件,其他国内大模型全都超出上下文范围。

JSON格式生成(将非规范化数据源转为规范)

这个能力关系到调用外部API接口时的数据准确性
假设你正在管理一个图书馆的数据库。
你需要为图书馆最近购买的五本书生成一个SON格式的目录。
这五本书介别是《哈利:波特与魔法石》,作者: J.K.罗琳,出版年份: 一九九七年。
《OneHundredYears ofSolitude》,作者: 加布里埃尔·加西亚·马尔克斯出版年价: 1967年5月。
《挪威的森林》,作者:村上春树,出版年份: 1987-11-12。
《TheLittlePrince》,作者: 安东尼·德·圣-埃克苏佩里,出版年份:1943.02
《乔布斯传》,作者: 沃尔特·艾萨克森,出版年份: 2011-1。生成的]SON格式的字段为“中文标题”“英文标题“作者姓”“作者名“出版年”

大模型识别难点:(1)标题语言识别与翻译(2)作者姓名的识别与分解(3)日期格式的统一
GPT4和claude表现更好

函数调用能力

你有权限使用上述工具,请根据用户的提问给出具体应该使用的工具,并将用户提问转化用户提问
1: 我有一张图片,文件路径为 /images/sunsetjpgo 请应用一个高对比度滤销用户提问
2:我家里有鸡蛋、牛奶和面粉。请推荐一些可以做的食谱。用户提问
3: 请将这句话从英语翻译成中文:"Hello,howareyou?”用户提问
4:分析以下文本的关键词:“全球气候变化正在影响农业产量。”用户提问
5: 这里有一组销售数据,文件路径为/data/sales.csv。请生成一个柱状图。用户提问
6: 我想知道股票代码为 AAPL 的未来一周的股价趋势。请进行预测。用户提问
7: 我计划去巴黎旅行,喜欢历史和文化体验。用户提问
8: 这里有一个音频文件,路径为/audio/speech.mp3。请分析它的平均音量。用尸提问
9:我想将100美元换成欧元。请计算当前汇率下的换算金额。用户提问
10:请回答这个问题: 黑洞是如何形成的?

claude和GPT4完成较好
文心上下文窗口较短

代码解释器(执行代码)

你是一位智能AI助手,你连接着一台电脑,但请注意不能联网。在使用Python解决任务时
假设你有一个包含过去十年每日气象数据的大型CSV文件。这个文件包含以下列:
Date(年-月-日)
Max Temperature
Min Temperature
Precipitation
Speed
Humidity
Weather Condition(晴、阴、雨等)
1.请计算每年的平均最高气温、最低气温和平均降水量。
2.请分析温度与降水量之间的关系(可使用图表展示)。
请生成一个完整的Python脚本。

GPT4可以直接执行,给出图标结果。

这篇关于国内外十大语言模型横向对比测评(截至2023.12.8)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!


原文地址:
本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.chinasem.cn/article/600030

相关文章

使用Python实现Word文档的自动化对比方案

《使用Python实现Word文档的自动化对比方案》我们经常需要比较两个Word文档的版本差异,无论是合同修订、论文修改还是代码文档更新,人工比对不仅效率低下,还容易遗漏关键改动,下面通过一个实际案例... 目录引言一、使用python-docx库解析文档结构二、使用difflib进行差异比对三、高级对比方

GO语言短变量声明的实现示例

《GO语言短变量声明的实现示例》在Go语言中,短变量声明是一种简洁的变量声明方式,使用:=运算符,可以自动推断变量类型,下面就来具体介绍一下如何使用,感兴趣的可以了解一下... 目录基本语法功能特点与var的区别适用场景注意事项基本语法variableName := value功能特点1、自动类型推

GO语言中函数命名返回值的使用

《GO语言中函数命名返回值的使用》在Go语言中,函数可以为其返回值指定名称,这被称为命名返回值或命名返回参数,这种特性可以使代码更清晰,特别是在返回多个值时,感兴趣的可以了解一下... 目录基本语法函数命名返回特点代码示例命名特点基本语法func functionName(parameters) (nam

Go语言连接MySQL数据库执行基本的增删改查

《Go语言连接MySQL数据库执行基本的增删改查》在后端开发中,MySQL是最常用的关系型数据库之一,本文主要为大家详细介绍了如何使用Go连接MySQL数据库并执行基本的增删改查吧... 目录Go语言连接mysql数据库准备工作安装 MySQL 驱动代码实现运行结果注意事项Go语言执行基本的增删改查准备工作

Java实现本地缓存的四种方法实现与对比

《Java实现本地缓存的四种方法实现与对比》本地缓存的优点就是速度非常快,没有网络消耗,本地缓存比如caffine,guavacache这些都是比较常用的,下面我们来看看这四种缓存的具体实现吧... 目录1、HashMap2、Guava Cache3、Caffeine4、Encache本地缓存比如 caff

Go语言使用Gin处理路由参数和查询参数

《Go语言使用Gin处理路由参数和查询参数》在WebAPI开发中,处理路由参数(PathParameter)和查询参数(QueryParameter)是非常常见的需求,下面我们就来看看Go语言... 目录一、路由参数 vs 查询参数二、Gin 获取路由参数和查询参数三、示例代码四、运行与测试1. 测试编程路

Go语言使用net/http构建一个RESTful API的示例代码

《Go语言使用net/http构建一个RESTfulAPI的示例代码》Go的标准库net/http提供了构建Web服务所需的强大功能,虽然众多第三方框架(如Gin、Echo)已经封装了很多功能,但... 目录引言一、什么是 RESTful API?二、实战目标:用户信息管理 API三、代码实现1. 用户数据

Go语言网络故障诊断与调试技巧

《Go语言网络故障诊断与调试技巧》在分布式系统和微服务架构的浪潮中,网络编程成为系统性能和可靠性的核心支柱,从高并发的API服务到实时通信应用,网络的稳定性直接影响用户体验,本文面向熟悉Go基本语法和... 目录1. 引言2. Go 语言网络编程的优势与特色2.1 简洁高效的标准库2.2 强大的并发模型2.

Go语言使用sync.Mutex实现资源加锁

《Go语言使用sync.Mutex实现资源加锁》数据共享是一把双刃剑,Go语言为我们提供了sync.Mutex,一种最基础也是最常用的加锁方式,用于保证在任意时刻只有一个goroutine能访问共享... 目录一、什么是 Mutex二、为什么需要加锁三、实战案例:并发安全的计数器1. 未加锁示例(存在竞态)

C语言自定义类型之联合和枚举解读

《C语言自定义类型之联合和枚举解读》联合体共享内存,大小由最大成员决定,遵循对齐规则;枚举类型列举可能值,提升可读性和类型安全性,两者在C语言中用于优化内存和程序效率... 目录一、联合体1.1 联合体类型的声明1.2 联合体的特点1.2.1 特点11.2.2 特点21.2.3 特点31.3 联合体的大小1