大模型新王诞生!Claude 3首次超越GPT4 大模型新王诞生!Claude 3首次超越GPT4
admin
2024-03-28 13:03:30
0

作者:卜淑情

来源:硬AI

一觉醒来,大模型世界迎来了“新王登基”!

当地时间周三,聊天机器人竞技场Chatbot Arena更新对战排行榜,Claude 3反超GPT-4,一举摘得“最强王者”桂冠。

这次登顶榜首的是Claude 3系列的超大杯Opus,它以2分Elo的微弱优势,险胜GPT-4-1106-preview模型,GPT-4-0125-preview位列第三。

而且,不仅仅是超大杯Opus,Claude 3家族其他两个成员大杯Sonnet和小杯Haiku都杀进了TOP10,分别获得了第四和第六的好成绩。

小杯Haiku达到GPT-4级别

尤其是小杯Haiku,被官方单独拉出来表扬。

“Haiku给所有人留下了深刻的印象,根据我们的用户偏好,Claude 3 Haiku已经达到了GPT-4级别!”运行Chatbot Arena的LMSYS平台发帖大赞,“它的速度、功能和上下文长度目前在市场上是独一份的。”


更难等可贵的是,Haiku参数规模远远小于Opus以及任何的GPT-4模型,而且它的价格是Opus的1/60,响应速度却是它的10倍。

GPT-4自去年5月被纳入Chatbot Arena榜单以来一直牢牢霸占榜首,但现在,Claude 3凭借其出色表现,尤其是其在高级任务处理上的能力,成功颠覆了这一格局。

这是史上第一次,面向高级任务的第一模型Opus和面向成本效率的Haiku均出自非OpenAI的供应商,”独立AI研究员Simon Willison在接受媒体采访时表示,“这非常让人欣慰——在这个领域,顶尖供应商的多样性对大家都有好处。”

“向新国王下跪!”

吃瓜网友也纷纷对Claude 3竖起大拇指。

“印象深刻,Very nice!”


还有人建议苹果将Claude设置为默认AI工具。


更有人直呼:“旧王已死。安息吧,GPT-4。”


“向新国王下跪!”



相比之下,网友对GPT-4的感情更加复杂。

“GPT-4变得非常蹩脚。”


最近几个月,有关GPT-4变懒的话题在网上闹得沸沸洋洋。

据称,GPT在高峰时段使用时,响应会变得非常缓慢且敷衍,甚至还会拒绝回应,单方面中断对话。

比如,它在进行编程工作时会习惯性地跳过部分代码,还出现了让人类自己写代码的名场面


评分准确吗?

在一阵赞扬Claude 3的声音中,也夹杂着质疑的声音。


那么,Chatbot Arena究竟是如何给这些大模型打分的?

Chatbot Arena由伯克利大学主导团队的LMSYS开发。平台采用匿名、随机的方式让不同的大模型“打擂台”,并让人类用户担任裁判,最后根据大模型所得的积分进行排名。

具体来说,系统每次会随机选择两个不同的大模型和用户匿名聊天,让用户决定哪款大模型的表现更好一些,系统会根据用户的选择对大模型进行打分,然后将分数汇总整理形成最终的积分,最后以排行榜的形式呈现。


自推出以来,已有超过40万名用户成为Chatbot Arena的裁判。新一轮排名又吸引了7万名用户加入。

在本次激烈的“擂台赛”中,Claude 3通过成千上万次的对战,在GPT-4、Gemini等一众强劲对手中杀出重围,成为新的大模型之王。


值得一提的是,在评价一个大模型的好坏时,用户的“感觉”也就是体验感至关重要。

“所谓的参数标准无法真正评价大模型的价值,”AI软件开发者Anton Bacaj此前发贴说,“我刚和Claude 3 Opus进行了一场长时间的编码会话,真的是远超GPT-4。”

Claude 3的进化可能会令OpenAI感到一丝不安,一些用户已经开始在工作中“叛变”,放弃ChatGPT,转而使用Claude 3。

“自从有了Claude 3 Opus,我再也没有用过ChatGPT。”


软件开发者Pietro Schirano在X平台写道:“老实说,Claude 3 > GPT-4最令人震惊的事情之一,就是切换太容易了。”

但也有人指出,Chatbot Arena并没有考虑到添加工具后的表现,这恰恰是GPT-4的强项。


另外,Claude 3 Opus和GPT-4之间的分数非常接近,而且GPT-4已经问世一年了,预计今年某个时候会出现更强大的 GPT-4.5或GPT-5。



毋庸置疑,到那时这两大模型之间的PK将会更加激烈。

相关内容

热门资讯

linux入门---制作进度条 了解缓冲区 我们首先来看看下面的操作: 我们首先创建了一个文件并在这个文件里面添加了...
C++ 机房预约系统(六):学... 8、 学生模块 8.1 学生子菜单、登录和注销 实现步骤: 在Student.cpp的...
A.机器学习入门算法(三):基... 机器学习算法(三):K近邻(k-nearest neigh...
数字温湿度传感器DHT11模块... 模块实例https://blog.csdn.net/qq_38393591/article/deta...
有限元三角形单元的等效节点力 文章目录前言一、重新复习一下有限元三角形单元的理论1、三角形单元的形函数(Nÿ...
Redis 所有支持的数据结构... Redis 是一种开源的基于键值对存储的 NoSQL 数据库,支持多种数据结构。以下是...
win下pytorch安装—c... 安装目录一、cuda安装1.1、cuda版本选择1.2、下载安装二、cudnn安装三、pytorch...
MySQL基础-多表查询 文章目录MySQL基础-多表查询一、案例及引入1、基础概念2、笛卡尔积的理解二、多表查询的分类1、等...
keil调试专题篇 调试的前提是需要连接调试器比如STLINK。 然后点击菜单或者快捷图标均可进入调试模式。 如果前面...
MATLAB | 全网最详细网... 一篇超超超长,超超超全面网络图绘制教程,本篇基本能讲清楚所有绘制要点&#...
IHome主页 - 让你的浏览... 随着互联网的发展,人们越来越离不开浏览器了。每天上班、学习、娱乐,浏览器...
TCP 协议 一、TCP 协议概念 TCP即传输控制协议(Transmission Control ...
营业执照的经营范围有哪些 营业执照的经营范围有哪些 经营范围是指企业可以从事的生产经营与服务项目,是进行公司注册...
C++ 可变体(variant... 一、可变体(variant) 基础用法 Union的问题: 无法知道当前使用的类型是什...
血压计语音芯片,电子医疗设备声... 语音电子血压计是带有语音提示功能的电子血压计,测量前至测量结果全程语音播报࿰...
MySQL OCP888题解0... 文章目录1、原题1.1、英文原题1.2、答案2、题目解析2.1、题干解析2.2、选项解析3、知识点3...
【2023-Pytorch-检... (肆十二想说的一些话)Yolo这个系列我们已经更新了大概一年的时间,现在基本的流程也走走通了,包含数...
实战项目:保险行业用户分类 这里写目录标题1、项目介绍1.1 行业背景1.2 数据介绍2、代码实现导入数据探索数据处理列标签名异...
记录--我在前端干工地(thr... 这里给大家分享我在网上总结出来的一些知识,希望对大家有所帮助 前段时间接触了Th...
43 openEuler搭建A... 文章目录43 openEuler搭建Apache服务器-配置文件说明和管理模块43.1 配置文件说明...