Transcription
大家好,我是大舅。今天呢,发生了一件比较重要的事情,那就是Claude 3发布了。
大家知道,在大语言模型领域的话呢,主要是有三家。一个是OpenAI的ChatGPT,一个是Google的Gemini,再一个呢,就是Claude。那Claude的前两代呢,比如说Claude 2和Claude 2.1,当时不是很有名,主要是因为ChatGPT 4当时实在太耀眼了,大家觉得ChatGPT 4是完全的领先。
那这一次Claude 3的发布,那他们是认为Claude 3是远远的强于ChatGPT 4和Google的Gemini。那到底发布了什么呢?它到底是不是真的强于这两个呢?那我们今天呢,就来比对一下。
好,我们先说发布了什么。Claude一共发布了三个模型,分别叫做Haiku、Sonnet和Opus。你可以把它理解为是像星巴克里面的咖啡一样。Haiku就是中杯轻量级的选择,Sonnet是大杯,平衡性能与速度,而Opus是超大杯,就是AI模型的巅峰之作。
大家可以看到这张图,横轴呢是成本,纵轴呢是智力。可以看到Opus是成本最高,智力也最高。Sonnet在中间是平衡点。Haiku的话呢,则是智力是中等,但是成本最低。这张图呢,是一个非常好的一个总结。
那么可以看到,Opus智能水平最高,Sonnet是高,Haiku呢是中等。从API的成本角度来说呢,Opus是最高的,100万个TOKEN呢需要15美元输入,100万个TOKEN呢是75美元输出。我们可以比对一下ChatGPT的API的价格。那GPT 4 Turbo的价格是100万个TOKEN,是输入10美元,100万个TOKEN输出是30美元。所以相比来说,用API的话,Opus是比ChatGPT 4 Turbo是要贵的。但是Sonnet和Haiku呢,是比GPT 4 Turbo要便宜的,要便宜的。
那上下文的窗口都非常大,都是20万。速度呢,这个特别强调一下,Haiku的速度是最快的,最快的那这样的话呢,虽然它的智能只是中等,但是对于某些需要快速反应的使用场景,但用它可能是没错的,是没错的。
那可用性角度来说的话呢,Opus和Sonnet现在就可以用。Haiku还没有推出,他说是即将要推出。Sonnet呢,如果你现在在他的网站上去,就可以直接使用,而且是免费的。而Opus你要使用的话呢,需要交每个月20美金才可以使用。
接下来我们对比一下Claude 3和Claude 2.1,也就是它的前面一代。首先是incorrect refusals,就是错误的拒绝。就是在这个以前的这个Claude里面,有时候他会拒绝回答一些问题,因为他觉得这个问题是有害的,但其实呢,这个问题是无害的,所以是错误的拒绝。那这个数据呢,在Claude 2.1里面呢,是大概在25%左右。而Claude 3的Opus和Sonnet都降低到了10%。Haiku更降低到了10%以下,说明这个模型确实是进步了。
在回答困难问题方面的话呢,cloud 3 Opus和2.1又有明显的进步,特别是在正确回答的这个比例上,几乎是翻了一倍,翻了一倍。
那刚才我们说的是Claude 3和Claude 2.1的对比。那如果横向来说,跟其他的模型对比怎么样呢?这张图呢,大家可以看到,是Claude自己推出的一张图。上面可以看到Claude 3 Opus、Claude 3 Sonnet、Claude 3 Haiku、GPT 4、GPT 3.5、Gemini Ultra和Gemini Pro。左边呢,是它用来测评的各个不同角度,比如说第一个是本科水平的知识,第二个是研究生水平的逻辑,后面还有数学、有编程、有常识等等。那么在这些选项里面的话呢,Claude 3声称,自己的Opus是全部高于GPT 4和Gemini Ultra。
那这个听上去是非常强的一个存在,一个存在。那么接下来呢,我们就做一个横评,来看ChatGPT 4、Gemini Ultra和Claude 3 Opus这三个最强的模型之间的一个对比,看他们到底的表现怎么样。
在我们进入到这个活动之前呢,请记得给我们节目点一个赞,这样可以让更多的人看到我们的节目,非常的感谢。
好,在进入测评之前,先说一下,现在有些博主呢,已经做了一些英文的测评了。这里的话呢,主要是做中文环境下的测评。那有时候呢,我也会用一些其他博主用过的材料,来测评一下,看看在中文的环境下,他们的表现怎么样。
好,那我们现在开始测评。先做一个最简单的,那就是文字翻译。好,我们现在让他们都来翻译一下这句话。那这个呢,是ChatGPT 4的结果,还不错。这个是Gemini的,应该说相当不错。在Claude上的这个翻译呢,也很不错。可以说这三家基本上在翻译上是相当的,都是相当优秀,相当优秀。
接下来我们做一些识图方面的一些测评。这张图是个比较模糊的一个图片,上面呢,有一个一元二次方程的一个解法的一个公式。我们看看他们认不认识好。首先是在ChatGPT 4上,那他非常正确的得到这个二次方程的跟着求解公式,而且呢,用了一个非常容易理解的方式,把公式给表达出来了。Gemini呢,其实也是得到了这样一个二次方程的通解公式,但是呢,它的这种表达形式非常的让人困惑,所以还是呃ChatGPT 4的表达比较好。而Claude 3 Opus则没有能够得到这个答案。
接下来给他们看到的,这个是中国国家男子足球队的队徽。我们看看他们能不能识别好。这个是ChatGPT 4的答案,他说对了,这个是中国足球协会的标志。但是呢,后面他写了上方有四颗星星,下方有汉字中和族,这个完全是原作中没有的,可以说是他的幻想。Gemini的话呢,从他的答案上来说也是正确的,是中国足球协会的官方徽标。不过后面的这个具体的含义上来说,比如说蓝色环代表中国足球的国际化和开放性,这个我觉得也是在胡扯。五颗金星代表中国足球的五个主要部分,这个也是胡扯。
Claude 3的答案的话呢,他也是能够判断出来是国家队的队徽,然后呢,他的解释呢,应该说是没有什么问题的,他是没有出现这种胡扯的情况的。
下一张图呢,是这个这个呢,是一个投影机,但是呢,他的这个设计比较特别,所以说是一个有一定歧义的一个图。我们看看他们能不能够判断出来。那从结果来看呢,ChatGPT,它说是PlayStation 5,那么可以说是完全错误。Gemini呢,正确的答到这是一个投影仪,而且呢,它还测出了它是哪个型号的投影仪。这个是一个正确答案,确实是xgimi aura,这个是它的网站,确实是xgimi aura。所以说这个答案是非常好的。而Claude呢,它没有办法得到具体的型号,但是它正确的得到,这是一台激光电视投影仪。所以这个回答里面,我觉得Gemini的最好,Claude也不错,而ChatGPT是完全错误。
下面这个呢,是一张视频里的截图,主要是想让他们看一看,整个他们能不能够发现这个白板上写的内容是什么。ChatGPT说呢,白板上写的是不走寻常路,成本篇,产品篇,九大流量等等。那可以说是完全不对,可以说是完全错误呢。Gemini它是在努力的去识别,上面的每个字是什么,比如说新内容,流量进入速度等等,包括这个受众广,CTR观看咪,就是说它有些字,它没有办法完全的识别出来,它把它能识别的识别出来,不能识别的呢,就给它找一个相近的字出来。Claude说它写的是一个代办事情清单,发布时间三点,新内容,京沪等等等等。那这个也是一个错误答案。所以虽然三个都不怎么样,但是Gemini在里面算是比较好的,比较好的。
接下来呢,是一段手写的一个文字啊,文字写的比较潦草,所以我们看看他们能不能够识别出来里面写的是什么。是关于停灵的习俗。OK,所以说现在的ChatGPT 4,它无法支持中文,它的OCR只能支持英文,呃,所以说它无法去识别这里面什么意思。Gemini呢,我觉得他还是比较努力的去识别里面的字词,确实有一些不对的地方,但是还是有比较多对的地方。而Claude的中文识别则是完全不行。
接下来给他们看这样一张图。这里有一个车,车后面有个车牌,这里有太阳,这里下着雨,这里的话有一个理发店的标志。我们看看它能不能识别出这里面的东西。好,ChatGPT说车牌号是DE20 DNF,但其实呢,车牌号是DE20 DWF,对,DE20 DWF。所以它有一个错误。然后呢,天气,它说是晴朗的。他说有一个叫Adam的店,指的是有个标识,但是他没有看到理发店的这个标志。
而Gemini的车牌号是完全正确,他说天气晴朗。这里面说有理发店,理发店的名字是Simmons。也就是说他正确地看到了这个理发店的标识。Claude那Claude的车牌号也是正确的被识别出来。它说是天气晴朗,看到了这个Simmons红色圆形LOGO,但是他没有看到这个理发店的标识。所以说在这个里面的话,Gemini的表现最好,Claude第二,ChatGPT第三。
好,接下来呢,我们让他来做一个数学证明题,看看能不能做出来。那么这个数学证明题呢,首先ChatGPT呢,是做了一下,然后我的感觉呢,还是第一题做对了,但第二题没有做对。第一题得到的是个是切线角,这个是正确的。第二个呢,它得到c的平方等于de乘以de的平方加ae的平方除以4的1/2次方,也就是它的平方根。这个跟原文要的,就是CD的平方等于c乘以CA是不一样的。所以说,他没有完全证明原来的这个结果。
而Gemini呢,是完全拒绝回答这个问题,他说我不会做。而Claude这个题却答得非常好,他完全呢,将两个题目都正确的证明出来了。所以说这一次的评判呢,是Claude好于ChatGPT 4好于Gemini。Gemini可以说这个题是一分都没有得到。
好,我们再让他做一道物理题,这是一道电磁学的题。好,我们来看一下答案。那ChatGPT呢,做了一下,但是他没有做出来,所以说可以说是没有结果。Gemini呢,做了一下,他有了结果,但是呢,做结果是错误的,因为我这里有正确答案在这个地方。那我们看到呢,Gemini的答案呢,是错误的。而Claude答案是正确的,这个答案是根号下2qU除以m。那我们看一下呢,根号下2qU除以m,非常正确。所以做这个物理题呢,最终是Claude胜出。
最后放两个彩蛋,来看看跟大舅有关系的图片,他们能不能识别。这张照片呢,是我和星夜的原稿的一个合影。我们看看他们能不能识别出星夜来。好,我们看ChatGPT 4成功的得到了文森特·梵高的星夜,所以说他是一个非常正确的结果。而Gemini呢,直接放弃,他把这个图片给移除了掉,说我没法处理这个文件,不知道什么原因,可能是因为上面有我的脸的原因吗?但是我问的是墙上的画呀。Claude呢,也能够判断出来这个是星夜,这是星夜。
最后给大家看一张20年前英俊的大舅,年轻吧。这张照片呢,是在北京的日本音乐中心拍的,后面呢,有当时的一些日本音乐的CD封面什么的。我们就让他看看,说这个墙上的这张专辑,他能不能够认出来。好,ChatGPT说呢,是clay drive,实际上应该是Glay drive。Glay是一个乐队的名字,所以它这个地方是判断完全错误。Gemini呢,他说Glay和drive是Glay的两张专辑的名称,这个其实不对,就是只有drive是专辑的名称。但是他成功地判断出来了drive和Glay。这两个地方还有些莫名其妙的东西,大乔是日本音乐信息中心的吉祥物,这个属于胡思乱想。Claude的结果呢,是跟ChatGPT差不多,应该说这三者的表现都不太好。
好,今天我们测了几个不同的方向,比如说有翻译,有图片识别,有手写识别,还有数学物理题等等。那总的来说呢,我对Claude 3 Opus还是印象比较深刻的。有几点吧。第一个在解题方面非常强,数学物理题都非常的厉害。第二个呢,它整个答案没有特别离谱的,就是没有出现那种胡说八道的情况。像Gemini和GPT 4,它答着答着,突然会把一些不相干的信息直接想象出来了,就像胡思乱想一样。这种情况在Claude里面比较少见,比较少见。
应该说呢,Claude和ChatGPT 4比较,在这次判断中,可以说Claude 3 Opus是强于ChatGPT 4的。Gemini表现其实也很不错,但Gemini有的时候呢,它会直接撂挑子,直接说这题我不会,或者说这个图片我无法处理,直接帮你把图片给删了。这些事情让人觉得很烦恼。所以我觉得这件事情上,我觉得Claude在这种稳定性来说,确实还比Gemini还稍微好一点,还稍微好一点。
那综合来说呢,这三家我觉得还算是各有千秋,各有优势和劣势。Claude现在来看呢,在某些方面的确是领先的。当然了,它是新的一个模型嘛,它领先也非常正常。所以我们也非常期待着其他的公司也能推出更新的模型,比如说GPT 5呀,比如说Gemini 2啊等等。所以说这个是非常令人期待的。
好,今天的节目就到这个地方。如果你喜欢我们的节目,记得给我们点个赞。如果你喜欢AI相关的内容,请记得订阅我们的频道。我们的节目就到这里,我们下次再见,拜拜。