Transcription
我不觉得我会真的还会说,再想一遍,我也会待在美国。可能唯一大的变化就是,我会囤更多的Bitcoin和Ethereum,这是唯一的变化。
张毅是Codatta的联合创始人兼CEO。他曾在支付宝担任高级工程经理,领导人工智能驱动的产品和平台开发。同时,也曾在Pinterest担任数据科学家。张毅拥有辛辛那提大学机械工程博士学位,具备丰富的技术和数据分析经验。
AI的迭代其实离不开更优质的数据。我们其实更专注于是experts,有Domain knowledge的这些专家,来提供更精炼的高质量的数据。这个方向去做fairness是我要optimized,所以我讲的是个fair,不是cheap。
那今天我就觉得就是说,可能每一个人你所拥有的写作班子,可能都超过历史上任何一个国家领导人,他的写作班子。所谓的构思想法就变得更加重要了。其实我觉得,写作是非常核心的能力,确实要培养写作能力。清晰的写作等于清晰的思考,你清晰的思考是非常非常核心的一个竞争力。
大家好,欢迎来到Bill it Up,全球首个连接东方与西方,科技与人文,人工智能和Web3的跨界沟通平台。我是Bill。好,让我们进入今天的对话。
好的,张毅。那我们先聊聊你个人的这个经历。你是属于非常典型的80后,出海做留学生,然后在中国和美国的科技大厂都待过。能方便再简单介绍一下你的经历吗?
可以。我基本上基础教育是在中国完成的,差不多是国内的一所985高校吧。然后正好是在中美其实比较蜜月期吧,2008年金融危机之后,2009年来了美国,然后开始我的PhD相关的研究吧。然后去,最开始就做data mining(数据挖掘)和machine learning(机器学习)这个方向。然后毕业之后去了Pinterest,当时也是比较热门的一个初创公司,在硅谷。然后主要做广告方向。后面正好2018年收到国内的一些互联网的一些机会吧,然后就加入了蚂蚁,负责一些B端和C端的产品。但是一直都从事AI这个方向。
我其实之前遇到过一些人,他们就很后悔在2015年到2020年之间从美国回了中国。觉得呢,那个时候算是,有人开玩笑说就是最不好的换地方呢,有点像是比如东升西降的时候,你是在西,对吧?然后西升东降的时候你又在东。我不知道,就你自己,在选择城市和选择区域的过程中,你现在会为自己过去的16、17年的决策打几分?然后如果再来一次的话,我不知道你会做出哪些不一样的选择,还是你还是会依然做同样的选择?
我觉得首先说打几分吧。首先我觉得打多少分都是有点主观的。首先说客观情况,你想那个,我们看一下当年,尤其是疫情期间,美国如果我们一直在来硅谷,那资产的升值肯定是很明显的。房产的升值和股票升值非常明显。但中国那时候科技股也还可以,对吧?但中国的房产不太行,房产不行科技股也在下降。尤其是我加入的蚂蚁,蚂蚁正好也是整个互联网被**打压**的一个起点吧。所以说,你要这边从实际情况角度来讲,从经济收益来讲肯定是一个相对来说不是一个最优的一个解。
但是从我个人角度来讲,我其实对自己人生还是有一些时间段的一个规划。从我个人角度来讲,其实我觉得是满足我个人的计划的。其实尤其是我想做自己公司,当时其实在2016年、2017年、2018年那个阶段,其实在硅谷打工还是一个主流,华人创业还不是那么明显的一个情况下。我觉得当时考虑到未来自己要创业,中国的资本环境和一个自己本身文化的一些优势吧,可能那边可能当时这个选择是符合这个预期的。而且我觉得也是按照我这条路去走的。尤其是在硅谷时候是个IC,然后回到蚂蚁的时候就带了比较大的一个团队,其实对我后面创业的这些准备工作,我觉得是非常好的一个机会。所以说我是觉得,我对我的自己的选择,长远角度来讲是满意的。
如果说做的更好的话,我不觉得我会真的还会说,再想一遍,我也会待在美国。可能唯一大的变化就是说,我会囤更多的比特币和以太坊,这是唯一的变化。
对,我很同意你这个观点。我觉得就人到最后做决策,其实跟他自己的这个年份还是很相关的嘛,对吧?就是说,我们看现在,比如说在美国做AI做得很好的那种创始人级别的或者是比如说联合创始人,很多时候是因为就是说他们可能本身年纪也更小一点,对吧?就90后甚至95后,那可能就是他们那个时候在美国,自然而然那个决策就会是继续在美国发展。但是如果是到80后的话,其实那个时候你没有办法就是说站在那个时间点去决策,说2022年2023年之后美国AI会爆发,同时美国会有大量的给华人的就是突破玻璃天花板的机会,对吧?这个我觉得其实在那个时间点,你也没有办法去做这个决策。而那个时候,其实回国获得更大的空间就是最好的选择。对,我觉得应该从事后角度讲,也是这个事实。
嗯,是的,对。然后呢,在这个过程中的话你是怎么样就是说从Web2到了Web3?然后可以简单介绍一下就Codatta现在这个生意,你是怎么样迭代出来的吗?
可以。当时我觉得我们想出来的时候应该是跟那几个都是从美国回来一些小伙伴吧。其实我们是2021年年底就在琢磨我们要出来了。因为蚂蚁没什么太多机会,国内看互联网大厂也就遇到瓶颈了吧,肯定要创业的一些方向。当时还没到这一轮AI的爆发前夜,应该这一轮爆发应该是2022年底,整个ChatGPT 3.5出来之后。然后那个时间点我们就想,到底做AI还是Web3?当时Web3也是个显学。所以从各种角度讲,我们从互联网整个创业过来,肯定是随着未来的方向,谁更火,去做哪个方向的机会点可能会越多,因为资本嘛,你可能拿到更多的助力会好一点。所以当时选择Web3,那是2021年年底。
对,2021年年底就在计划这件事情了。
2021年年底,明白。那**就是**比特币历史最高的时候就6万多,双十一那会前后。
就是说,你刚刚问的问题其实是有几个问题。一个是,我们当时为什么选择Web3这个方向?另一个问题就是说,现在Codatta这个business怎么迭代过来的?那我可以简单讲一讲Codatta怎么迭代,大概是分三个阶段吧。
第一个阶段的话,就是我们当时出来的时候,考虑到自己背景,有些金融科技的一个背景吧。当时觉得整个Crypto可能对我们方向哪个比较合适。当时我们看的是反洗钱合规。其实从现在这个角度来讲,这个方向也是对的,而且现在可能是更佳的一个时间。然后就朝这个方向去做。但是真的开始做的时候,我们发现我们的机会点,我觉得从策略角度,因为反洗钱合规它分几层,有些是策略层,技术层,但最终还是一个数据这一层。所以数据这一层,我们发现这个行业当时最厉害的公司叫Chainalysis,但是这个数据成本是极高的。
所以我们当时就想到,那Crypto本质上是比较讲的一个协同Protocol,是一个open的东西。那我们就从Protocol的角度去做这个事情。所以当时跟Coinbase的一些哥们打个电话,我说,诶,我们要做个协议,把数据这个问题一起来采集和收集。大家觉得我们也这么想的。所以我们当时就做一个开源的一个project,叫Microscope,其实跟Coinbase一起开始的。
然后在这个过程中我们发现确实,这是一个可能是一个用Token激励或者说数据确权的这个角度,是能降低数据成本的一种手段。所以我们把它衍生到做一个通用的数据平台。因为从我个人角度来讲,我们当时做machine learning,因为我开始做推荐系统,其实推荐系统里面最重要是就叫feature或者说数据。我们拿到最多的收益其实不是模型的迭代,往往是我们发现的一个新的数据源,有更好的feature。所以从我个人经历角度来讲,AI的迭代其实离不开更优质的数据。而且本质上这一轮的那些机会点,我们也看到大语言模型,它也需要越来越多的精致数据。
所以我们觉得用把整个方向从一个专注于某一个垂类的反洗钱合规的一个软件,迭代成变成一个数据的一个平台,然后从一个专业平台变成一个通用平台。然后这个通用平台,从一个比较低端的,从成本优化角度来讲,去招聘更多人,降低数据成本,到迭代到现在,我们其实更专注于是experts,由domain knowledge的这些专家来提供更精炼的高质量的数据。这个方向去做。然后我们现在更关注的,我们不追求我们数据的成本的最低,我们更专注的是一个term叫fairness。我们希望跟从business角度,他拿到数据的成本可能更可控,或者说质量更高。当整个商业模式,你可能会有其它问题,我们可能会涉及到,我讲的会更多一点。但当下我给你回答一个问题,就是整个business的演进。
明白。那今天的话,你会怎么样向一个小白去描述你这个东西?是为谁提供什么服务或者提供什么产品?比如像你要构建你的,做一个财报的分析师,你需要专业领域的数据。这样的数据的话,你可以通过Codatta,我们找到相应的专家,帮你提供这些专业数据,让你完成这些垂类的应用的开发。
嗯,所以用户是开发者对吗?
对,我们是个marketplace,一个是供给端,一个是需求端。拆开讲,需求端就是你是个generative AI的公司,你需要数据。那**你**通过我们平台可以拿到非常专业的数据。那好,你是另外一个角度,你是个专家,或者说你有一些特殊的技能,那你可以来到我们平台,领取相应的任务,去提供相应的数据,获取相应的报酬。
明白。所以你是连接这个就垂类的专家作为知识的供给,和不同行业的这些AI的应用层公司作为数据的需求?
对,但是不准确。我们现在客户不光是垂类的公司,也有基础模型的公司,因为他们也需要垂类的数据。
嗯,明白。那这一类的企业的话,我听说比如说在Web2,其实现在也有做的非常大的,像Scale AI,对吧?创始人刚刚加入Meta。还有Surge AI这些。能描述一下就是说,从基本的生意模式角度来讲,就你跟他们之间的相似和不同吗?
我觉得可能从几个层面上。因为你提到两个公司,其实比较有代表。现在其实还有一个公司叫Mercor。其实Mercor和Surge AI,相对于Scale AI,它是两个,应该是两个代际。Scale AI首先发展起来角度来讲,它是在无人驾驶当时起来,当时是2016年2018年没记错的话,应该当时发展起来。它当时更多是相当于降低整个用工成本,做了一个地区的套利,在这些比较欠发达地区,招聘这些人员去做无人驾驶的这些数据打标。
然后Surge AI和Mercor AI的话,他们典型特征是这一轮大语言模型起来的。他们更专注是他们的角度,叫human centric,他们更关注的是人,而且是高质量的人来做这件事情。然后我从我们角度来讲,我们其实更像是理念角度来讲,也是更偏向于Surge AI和Mercor AI这类公司。我们觉得目前的数据的应用,其实低质量的数据,或者说相对来说比较不是对专业技能要求比较高的数据,其实是不太需要了,或者说量不是特别大了。因为AI它本身就能产生这一类数据。然后更多需要专业人士,而专业人士我们是专注于做这一块。这是比较相同的地方。
然后我们商业模式最大的不同,其实我们推动一个东西,就是让数据资产化,实现一个商业模式变更,叫royalty engine,就是翻译成中文叫版权或者叫版税模式吧。这个什么意思啊?就是我们看到就说,因为现在单品的数据非常值,价格非常贵,一条数据可能是几百美金一条。像物理题,我们现在正在采集的一些物理题,可能就是PhD专家来提供的,上百条。但是专业的可能一些垂类的应用公司,他们是前期是**没有**这个钱去支付这样的成本。
而我们的royalty based payment的好处就是,你前期不用付相应的支出,不用预付款,但是你就可以开始使用这个数据。但是你用什么东西?用你的未来的收益去还款给我们的knowledge provider。这样的好处在两点,一个是降低这些builder的风险,你前期不用付出这么高成本去拿到数据。但是你未来,对我们数据贡献者来说,也是一个好处,就拿到更多收益。
嗯。那这里面的话,就是你的供给侧,就supply这些专家的话,他们都是什么样一个画像?就你现在有多少供给侧?然后他们都是哪些国家就做什么岗位的人?然后他们都是兼职来参加你的这个网络吗?
对,这个是非常好的问题。就说如果说一个大致数字,有些东西是比较虚的。我们现在注册用户应该上千万的,但是我**觉得**那个不重要。最核心的是,我们现在完成过KYC的用户大概是一百万。然后他们的画像其实是分布蛮广的,就是那个美国、日本、中国大陆,然后东南亚地区,然后中东,还有非洲这些地方都有。但是他们的人才的画像是我们逐步逐步提升的。不会说一上来你就把所有信息提供给我们。我们往往随着task的需求,你要做资质认证,会提供给我们的信息。所以目前来说,我们看到就是说达到研究生及以上学历的用户,至少他self reporting给我们的,是超过15%。
明白。那他们加入这个知识网络,他们的动机是什么?是希望能够赚取一些零花钱吗?
因为这个business目前来说,我们还是处于一个比较早期这个阶段,所以说从那个rewarding角度来讲,它不一定是一个能够当下就能给Mercor或者Surge AI能够竞争的一个状态。所以说我们大量的用户,他们来的时候,更多是通过Token的空投,这是一个动力。当然另外一个动力,其实我们听到用户,他们也会跟我们反馈,确实觉得这个数据价值非常大。另外还有一些Cohort一些用户,数据贡献者,是本身我们邀请的这些专家,他们的收入水平非常高,是加拿大或者美国的一些退休的医生。他们更看重的就是说,数据的所有权,就是我们拿到你的数据去任何的下游的应用,认可他们的贡献,不管是你做论文发表还是模型开发,他们非常重视这种认可。这也是我觉得数据确权的一个非常重要的一个价值。
嗯,明白。那这样的话就是说,如果按美元计的话,在你这的这个专家,他们比如说大概的一个时薪,就每小时的回报,大概会是什么样的?就是我也比较好奇,像Scale和Surge的话大概是什么样?然后就是这个是他们的主要**的**这个诉求吗?还是说其实最后被认可是更主要的诉求?
这个是非常好的问题。这个是本身他的收入水平,也决定了他对这两个因子对他的权重的不同而不同。比较极端的像这些医生,他本身就退休,他们收入非常高,他更看重就就完全图名,我根本不该图你的利,因为我足够有钱。另外一些可能就是在校的学生,他就在做Phd,对他们来说就是钱可能对他们来说更重要。所以这是两种极端,不同收入水平有不同需求。
关于横向做比较,因为他们有些数据其实不是特别公开的。其实我跟你可以跟透露一下,就是像物理这种PhD这种水平的这些出题,高端的题,大概是500~800美金一条。但是他出完这道题的时间,是每个专家他可能耗时时间是不太一样的,可能是1小时,可能是4小时,有可能是8小时,这个看情况。所以说你说,我只能说一个case可以高到五六百美金一条,但是大概是一天都能完成的。但是你说hour rate,这个是不太好容易去给出来的。当然我也跟你说是比较高端的一个收益。
当然还有说大众,相对来说大众可以比较参与的,就是我们有客户,他是做反洗钱合规,他要收集一些敏感机构的或者说地区的一些Crypto的地址。这样的话,一个地址大概我们会收大概50美金左右。
明白。那你觉得就是说,你跟Surge或者Mercor来讲,区别和不同在于什么?然后为什么就是说到最后,你的数据的供给侧和你的比如AI的这些需求侧的公司,最后会愿意把Codatta也当做是一个重要的平台来参与?
我们先说一下不同点吧。就是他们的模式,就是假如说我举个例子,我现在要训练一个PhD level的医疗的一个AI,我现在需求可能是一万条数据。那一万条数据,每一条我大概给报价是1,000美金,那就是1,000万。做这样公司,他预付就要准备1,000万美金这样的一个估算融资额度要做。不管你分批支付还是怎么样子,你这个1,000万是肯定是要支出的。那这就是一类公司,可能能够满足。
但是现在大量的AI的公司,他可能像未来,我们就看到一个趋势,就超级个体或者小团队去做这些初创公司,他们也需要垂类的数据,但是他是没有前置有这么样大一个成本去做这件事情的。所以我们从我们business角度来讲,我觉得我们是做的是一个降低风险一件事情,帮这些business降低了它的整个的business model的一个风险,让它前期的话不需要太多的资本支出用于这些数据方面,让它把整个模式跑通,然后拿更多的收益给到我们。我觉得最终状态应该是这样子。但是现状是,我们还没有走的这个状态,更多的我们也是比较传统模型去拿传统订单,然后这订单的公司也分两种,大公司或者不要融资的公司,另外一种是初创公司。初创公司的这个成本相对来说是我们在补贴一部分,但是大公司的话基本上是跟其它的公司的订单规模差不多。
嗯,那在这个过程中能谈一谈,就是你发Token的这个必要性,和它在你整个生态里面起的这个作用吗?然后呢就是说,因为有了Token,有哪些事情是你可以做,然后你的Web2竞争者Surge这些不能做的?
首先我先解释一下我们Token的价值吧。我们Token大概是有三个功能,一个叫做一个是做payment,一个是Gas fee,第三个是所谓的staking。那个payment什么东西就比较好理解,如果数据能够确权之后,数据它的ownership,它代表着未来的一些收益,它其实就是个asset。这个asset进行交换的时候,也因为有些个人他本身是有一些可能流动性的一个需求,他可以把所有权交易出去,那**就**用我们Token进行交易,这是它的所谓payment的功能,也让所有权有一个变现的一个渠道,而不是完全靠长期持有拿到未来的收入分成,这种事情,这是它一个价值,通过提供流动性。
第二贡献就是说Gas fee,因为数据中间我们是要放到链上的,去确权它一定上链的。然后链上呢,我们也需要数据质量都需要成本,而且有些成本是必要支出的,可以降低一些数据,因为数据质量非常重要的。所以有这个Gas fee的话,是降低那些提供那些垃圾数据的可能性,因为这个成本很多是个攻防的关系,你提交数据成本越高,那你作弊的可能性就会越小,所以数据质量也相对比较高一点。所以它也是我们去中心化,或者说提交数据质量的一个手段。
然后第三个点的话就是说staking,这个staking其实借鉴的,就是所谓当时Ethereum比较显学的地方,是economic security。因为我们是staking on people,也可以staking on data。你通过staking的话,就是后面不管这个人作恶,还是这个数据它故意做差的,我们都会对你的这staking做一些惩罚性扣减。但是从另外一个角度,你要staking它你要一些责任,你需要检查这个数据的质量,或者说你对这个人比较信任,因为有这个staking的话,这个在上面,我们觉得这个数据的 confidence level就越高,这个数据的价值也会更大,我们下游用户也更敢使用。本身你这staking也产生了收益。
所以我们 Token大概有utilities这三个功能。从我个人角度来讲,它是有一定必要性的。但是从另外一个务虚的,或者说比较功利的角度讲,因为整个Crypto你一旦有Token,其实是你构建社区,或者说是一个marketing的**一个**非常重要的功能。一旦你有Token,大家的参与度也会高很多,对吧?
嗯,明白。那我这里正好有一个发散的问题,咱们随便聊聊。就是我们在加密,经常会遇到一个说法,就是加密行业的这个AI项目,基本上都是把AI当做是一个叙事来发币的。然后呢,很多人会说,就是正经的或者是顶流的这些AI创始人,其实现在都是在Web2,因为就是在Web2,你可能融资的这个规模,基本上也都相当于是Web3里面融资的估值,对吧?然后呢,明显可以看到,就是说大量的Web2的项目,它的ARR,收入的增长,好像就是说实实在在他们那边是在创造更多的收入,然后呢人员的profile也比Web3要好很多。但其实你也是从Web2出来的,大厂的AI的科学家嘛,你怎么看这个现象呢?
我觉得这是个非常尖锐的事实。我就先说这是个事实。因为我们看吧,现在做,不管说你在估值最大的AI公司,像Nvidia、Google、Meta这些公司,它就是一个事实,确实比较不错。另外一点我们也看到像Andrej Kapathy、李坤阳,这些就是伟大的AI的科学家,他们都是确实从某种角度来,确实最顶级的人才,是在Web2这个领域去做这个事情。所以我承认,目前来讲,最**好的**AI的顶级的人才,目前来说是在Web2这个领域。
另外一个角度,我觉得可能是一个,一个阶段性的问题吧。因为我觉得从我个人角度,Web3它是一个解决的手段,它不一定就是一定是一个,不一定所有的问题都适合这个手段去解决。比如像算力的问题,比如像算法研究的问题,还有AI的应用的落地的问题,我觉得这不是所有的问题都适合这样一个方法,或者这个手段,用Crypto或者Web3的手段去解决。
但是从我个人是比较相信,我们现做这个方向的,就是数据,它确实理想。从我们角度讲,现在的Web2的商业模式,你的数据其实是个service。我作为一个专家,我提供这个数据,你一次性给我的费用是挺高的。但是这个数据,它下面产生再多的应用,跟我没有一点关系。而且最终我培养这个数据,最后训练做AI,它迟早会替代我的工作。其实从某种意义上看,我是不希望这种事情发生的,对吧?我觉得从我具体角度,这个是不应该的。
另外角度就是说,AI公司也遇到个现状,你可能大家都会看到一些明星公司,动不动就融多少亿,叫thinking machine,可能产品都还不是那么成熟的情况下,就可能融个十亿美元。但是还有更多的公司,其实它没有这么多的机会拿到比较好的funding,去做自己想做的产品。尤其我举例了很多的应用公司,可能就三四个人,他们其实就能做很好的产品。但是他们也确实,不管需要人工判断进行验证,还是domain knowledge特定领域的专家提供高级数据,这些东西他们都需要。然后我觉得目前的这些商业模式是不匹配的。像Surge AI没有,据我了解,如果没有50万美金的订单,他们是不会启动的。所以我觉得这样的一些市场,是需要我们去服务的。
嗯,那我听上去,你说这个点就在你这个赛道,其实到最后Surge他们是做的比较机构化的订单,但也需要一个拼多多版的平替的订单解决方案。其实我不太喜欢说打低价这个事情,而且我对打低价这个事情,我不是特别是觉得是个好生意。因为我一直在跟我同事讲,我们一直要贯穿一个term叫fair。fairness是我要optimized。什么fairness?从两端讲,对business角度来讲,你可能从我们平台长期角度来讲,你可能付出更多。因为你如果生意做得好,你拿到10%的收入来回馈数据的贡献者,那可能长期角度是会更高。但是我们的好处就是,你前期是不用支付任何成本的,是个低风险的。你做得好了给大家一点,那理所当然,因为你生意做得好,确实是这些数据帮了很大的忙才做好的,所以你付出更多,我觉得是也是个fair的term。
所以我讲的是个fair,不是cheap。然后对数据贡献的人角度来讲,我是拿我的专业知识培养的AI。因为从我们角度讲,未来的AI和领域专家,更多是一个master和apprentice的一种关系,就是师傅和学徒的一个关系。那我教会的学徒,不能说是老师教会学徒,就是饿死师傅。最好的一种模式,其实就应该是,我把这个生存技能交给你,你产的收益,长期角度也应该回馈给我。所以说我觉得对master来说,他拿到长期收益也是会更多一点。但是他可能不像一些大公司,拿的传统模式可能一上来,我前两天我就拿到我所有的收益,我们可能是细水长流,你拿到是长期更多的收益。所以说从成本角度来讲,我们可能不是一个最优解,但是我们讲的是个fair。
嗯,明白。所以其实从公允的这个角度来讲,大家各自有自己的性价比所在,对吧?
对对。
你最近有没有用Google的Gemini?
最近非常密集的在用,不管从编程,还是视频生成,还是写文档,我都在用,都在测试。
嗯,我其实之前会觉得,就是我对谷歌的很多这种怎么讲,这个比较高风亮节的一些克制的态度和企业文化我都比较佩服。就比如说,其实过去的两三个月我都已经很久没有用Chrome这个浏览器了,因为我一直在用就是Perplexity的Comet和这GPT的Atlas。然后但同时呢,我又会发现就一是好用,二呢其实这两家用的都是Chrome的内核。然后我就觉得像这种事情在亚洲是绝对不可能发生的,对吧?怎么可能会有一个生态大厂把自己最核心的一个业务最后都当做是一个API或者是内核贡献出去。但是呢,现在看来好像这个可能很多事情就是有所失也有所得。现在发现这谷歌它厚积薄发,这次出Gemini,一下子就会给人一种眼前一亮。我不知道,就是说一,你对这个产品本身,你自己作为AI专家,你用下来什么感受?二就是说,你怎么去看就是谷歌在这方面未来对这公司基本面的影响?
我个人觉得它非常厉害,有厉害点。就是说我举个实际例子,我们在正常在upgrading我们的blocking system,传统的,我就是会给我们设计师说,提供我的一些AI的诉求或者设计的一个诉求。现在我直接画个草稿,基本上我就直接发给Gemini,它一次性就能生成,甚至能够比较好的做相应的部署。这个事之前你是找谁做?你是找Cursor还是找GPT?
我是Cursor也在用,然后用Gemini,然后它的Antigravity我也都在用。然后目前来说,确实它一次性生成前端的效果比之前要好很多,比Cursor不管你后面对接的什么模型,我觉得都要好很多。这是我觉得one hack,一次性就能达到我比较接近我诉求的一个标准。所以从体感角度来讲,它确实印证了目前很多benchmark描述的一个性能的优势,那确实是这个样子。
基本面的话,我觉得Apple AI遇到大问题了,遇到大的挑战了。嗯,为什么呢?因为我之前也做广告的,前段时间我们也看到就现在,以前我们都聊SEO嘛,现在聊GEO了。就是你怎么去优化你的产品,在拿占据market中间被透出来。它其实讲的是个流量。
抱歉,你刚刚说什么GEO?
G是Geographic(GEO就是Geographic缩写,意为地理区域/市场定向)。应该是这个。现在讲GEO怎么让你的产品更多的被各种大语言模型的产品去被引用出来,对吧?其实就是个流量生意。然后我们也看到这是它一个变现的一个拉浆肉般变现的一个手段。第二个手段就是,我们觉得可能是一个相当于电商的模式,你做任何产品进行导购,对吧?然后但是它其实本身是个广告生意。广告生意,我们以前认为OpenAI有巨大流量,它就能快速让这件事情变现,那是基于它产品能够固守这样的流量。但是Gemini出来之后,它Google,它首先能够争夺这样的流量,同时它有非常世界上最大的ADS inventory。如果做过广告的人都知道,ADS inventory不是那么容易构建的。这个这不是一年两年能够构建的。因为我们碰巧我当时在Pinterest,就是几乎经历了Pinterest广告的0.5~60的这个阶段,所以我们能够知道广告的系统构建有很难。
你觉得这个难是在商务上的难?它是一个相当于一个重云梯的角度啊,就是左脚右脚相互迭代的。你产品不好的时候,你能够拿到的广告主是有限的,你的广告的候选集有限,那**你**广告效果也就比较差。所以这两边都是只有一步一步相互摸索起来,它是需要一个迭代周期的。
嗯。所以你觉得就是从这个角度来讲,就是谷歌现在后来居上,而且将来就是基于整个AI的这个逻辑,广告业务还是它的?因为她其实所有东西都准备好了,现在相当于说AI它也没落下,对吧?因为Google的优势太明显了。Google我们就说它两层,一个是business变现的一个优势,另外然后它整个的技术优势。技术优势很大一块就数据。你想后面最大的数据的来源或优势就是Google就算力、人才数据优势,尤其数据优势太明显了。后面的数据,我们觉得整个下一波AI的爆发,应该是multi-modality就多模态。多模态最大的数据源,高质量数据源,就是在YouTube上面。它如果卡紧所谓的copyright,那其它地方是很难够抓上去。就像特斯拉对无人驾驶一样,它有百万级的自己的车辆,每天都在给采集训练数据。
对对。这里面也涉及到,就是最后大公司,他自己对于自己的数据,在把它公共物品性的角度去贡献和私有化之间的一个平衡呢?我看比如说我就比较喜欢用Grok做加密的一些研究,那**就是**因为本身就是推特的这个数据对它来讲就是自留地了,对吧?就像你刚刚说的,如果谷歌未来把YouTube的这个内容,当作自己的自留地,在这个访问权限上进一步去下降的话,那可能这些就变成他自己更强的一个一方数据了。
对的。所以你看最终后面数据真的是一个非常大的一个大家的一个胜负手。
嗯,那跟这个对比你怎么看Facebook?因为Facebook Meta,坦白讲就是我除了在Whatsapp的这个聊天框里面偶尔会看到一个助手,但那个助手我也从来不用。我作为一个普通用户,我**就**没有怎么用过它的产品。但好像他们一直都很努力。就是你怎么看就整个Facebook他在这方面的布局?
Facebook的话其实作为作为当年华人工程师,肯定要感谢一下小扎,他当时把整个工程师的收入水平提高的。这个就是场外话。他先给华人工程师涨薪的吗?他涨薪涨的特别高。另外一个汗水工厂就特斯拉,这个我们就这些就场面话我们就不说了。我们回头看一下就是Meta,其实目前来讲,其实有点掉队了。尤其是今年年初,应该今年年初LLaMA four出来之后,拉了一坨大的。它本质上是数据出了很多问题。它其实过早地相信synthetic data可以替代那个human generated或real-world data。但这个就是它的一个问题。
怎么理解?我觉得这个问题,我们先把它往后面放一放。我后面再聊一下。现在我们先梳理一下Meta的一个情况。Meta其实大家如果是开发者的话知道,在2016年的时候,当时有两个我们开发框架,其实很重要,一个是Tensorflow,一个是Pytorch。当时Tensorflow是Google的,Pytorch现在是当时叫Facebook做的。然后当时两家都是,其实Tensorflow更占优势。但到现在其实Tensorflow已经几乎没太多大家在用了。现在叫JAX另外一个迭代。但是Pytorch就成整个AI界大家通用的一个做大模型的,一个做deep learning的一个框架吧。所以它首先,我们先说Meta在开源上面的贡献是非常明显的。大家现在用的很多基础设施都是它共建的。而且小扎当年也是说Open source是它的一个非常重要的project,是对公司来说,对整个社会来说,都是非常有价值的事情。以及整个公司也是享受这个open source带来福利。所以我们先说一下Meta在整个行业的贡献,是必须要得到认可的。
嗯,在开源上的贡献。
对,但是现在就是有点尴尬,就是说他主导的开源的模型,这样就open的model这件事情,其实它已经让步给中国的,大陆的很多基础模型的公司了。它已经不relevant了。它在开源这方面已经不在牌桌上了。尤其这个,就刚才说到为什么不在牌桌上,反正我们很多朋友还是在Meta,有些他们也知道组织上的一些问题,大家也知道最近他们也解雇了很多高端的科学家。一方面也是可能现在整个基础设施到一个阶段,不需要那么多人了。但是可能也感觉到他们对整个的战略的一个一个摇摆吧。我不知道怎么去判断。
其实从某种意义角度来讲,如果后面模型变现,除了在一些生产力工具上面,最大的肯定还是商业化。就在流量这一块,它其实扮演角色,应该跟Google还是有的一拼的。因为它也掌握了很多场景,尤其在美国,像Whatsapp,像Facebook、Instagram还是很巨大的流量场景。
我**就**很奇怪,就是作为普通用户,其实都没有怎么用过Meta的前端的应用层的产品。我也很少听别人提起说,我用了Meta的什么AI产品。它主打的LLaMA已经不行了。它没有一个直面用户的AI的产品。它的LLaMA更多,它自己的AI应用,更多是用在自己的产品的后端,可能是做翻译,或者做内容加工,或者推荐等等等等。它确实没有一个消费端的AI产品。
我跟你的理解几乎是一样的。
嗯,是。
好的,如果往后看五年或者十年,就是如果你跳出来,作为一个比如说行业的观察者,或者是投资人的这个角度,你觉得就是未来在AI和Web3领域,有交集的最大的一个生意,可能会是什么?因为比如说像你的话,其实你是在做数据应用层的这么一个AI x Web3产品。那**就是**如果跳出来,你会觉得就是说可能AI x Web3最大交集的一个生意,有可能会是什么?不管是从市值,还是从交易量的这个角度?
我觉得我没有这么其实没有这么宏观的去看Crypto和AI的这两边的交集,哪一个地方会比较大。因为我回答这个问题,我肯定是更看好数据这个方向,数据资产这个方向。这个肯定是有很大的偏见,因为我自己在做这个事情。所以如果我这样回答,我觉得不是特别公允。
所以这个问题,我可能我会给你一下别人,我听到的一些答案,但是不代表我认可。像有些说是agent,它需要agent to agent,或者agent to the real world,它需要make payment,用Crypto去make payment就会make sense,因为Crypto它不能有银行账户。但是我也听到蔡崇信的一个challenge,就说为什么我不能我自己人开个账户,我能把我的代理权限给到我的agent,它其实也可以干这件事情。所以它是不是一个必要性?从开账户这件事情,它不是个必要性。就连信用卡都有自动续费,对吧?都有自动订阅。对,所以说有些时候是从叙事角度强加进去来的。
但是Crypto它确实在支付,降低支付成本,尤其是micropayment。我觉得像micropayment这个事情,其实从某种意义上讲,它也是在做。我觉得micropayment可能是个机会,尤其在我们像这些版权。如果我们打通一下我们这个链路,我们数据生产,生产之后部署个模型,模型部署成API做inference,每一次inference最好都能有一个,都能charge一些钱,不管是千分之一dollar,能够回到上游,给到我们。是个micropayment这种样的低成本的,把下游的收益及时结算给我们上游。那确实需要micropayment。它可能不是当下的infrastructure能够完成的,可能有成本情况。我觉得在支付层Crypto和AI这种这种做清算或者说利益分配,我觉得是个机会。
嗯,所以听上去可能最终还是在,其实就是数据的交付,对吧?还有数据的交互和支付的交付。这些可能都是更大的交集。然后你其实现在是在数据的交互这个赛道上。然后呢,很多做支付的,那他们可能就是在资金的交互上了。
其实我也没有回答你的问题,就是Crypto、AI结合,未来5年10年哪个方向最好。我确实无力回答。
我觉得我自己没有想清楚的一点,也是就是说到最后,Web3或者是加密货币,它本身是不是一个被AI去很好赋能的一个垂类行业,就像是农业一样?还是说呢,就是Web3和加密货币反过来,又会变成AI巨大的一个基础设施?这样的话,这是一个相乘关系。否则其实更多的是说,我AI来赋能你,对吧?AI来赋能教育,AI来赋能农业,AI来赋能,比如说任何一个垂类行业。那这个我觉得是,这没有任何问题的,对吧?就任何一个Web3的工程师,只要你在用Cursor,你在用GPT,你**就**被AI赋能了。但x的话,可能更多的是说就是两个事情,它更多的是一个平等的,互相去赋能的一个关系。这个我觉得可能现在行业也是在早期的摸索过程中吧。
对对对对对。如果**我们**走通了,那确实是Crypto赋能的AI了。
是的,对。那从你们的这个角度来讲,就是说未来的两年到三年,你会去怎么样去描述这个Codatta的未来两三年的愿景?
我最终肯定是希望能够成一个Royalty的,把这个Royalty这个business model能够跑通。我希望的未来愿景就是说,在两方面是我特别,我最终我不是说我不希望唯一服务的就是foundational model的公司,他们是大公司。我觉得Surge AI他们传统模式可能能服务的更好。而我觉得未来的公司,不管是我这边都是一些垂类的公司,一想到领域的知识和专业应用,首先就想到Codatta。这是一类我们想服务的人群。
另外一类就是学者,他们其实非常缺乏预算,他们有非常多的想法,他们也需要人工去数据的提高,不管是他们设计schema还是什么样子。我希望他们能够把需要的这些数据都能想到Codatta,能够帮他完成这个事情。从ideation到后面的prototyping,到最后的production,他能从学界跨到工业界都能找到我们。这样子让他没有任何的资金的顾虑。对,因为我们以前在学校里面做任何的ideas时候都会想到这个数据怎么办,很多时候就找自己朋友,找自己同学,大家一起打标。
另外我也希望就是这些专家领域的公司,也成为他们的一种lifestyle或者说second job。他们就通过把自己领域的数据贡献出来,然后可以躺赢,尤其是比较高端的数据,然后被下游的应用公司给使用了。相当于他自己通过自己的凝结的这些知识,成为数据赋能了一些AI垂类公司,他们不断地给他产生收益。其他这种通过自献数据,持有的一个portfolio。
是的,对,我觉得这点很有意思。因为就是当我们说到这个,就是中文叫灵活就业,对吧?好像灵活就业的人呢,他作为一个个体,没有那么的超级,从收入各个方面来讲,这个社会上,提供灵活就业的岗位呢,一般也都不是那种特别高收入的岗位。但未来的话就是说,如果,我们说AI或者Web3,能够让更多的超级个体出现,那应该是让更多的高收入的超级个体的出现,对吧?那今天其实就是说,高收入的个体,我们会发现很多都还是比如说Creator,对吧?KOL,YouTube上的网红,好像这是唯一的一条路。但未来就是说,如果你的这个专家的能力,最后在分拆的这个社会分工里面,通过你的网络也能够提高每个人的收入,那可能就会创造更多的这些这个高收入的,灵活就业的超级个体了。
未来的比较大家都希望财务自由嘛,其实都希望能够有自己更多的可支配时间。然后最好的财富自由方法就是有自己的产品,那个让自己躺着睡觉的时候,能够在你睡觉的时候也能持续产生收入,对吧?这是最好的一个方式。传统像高净值的比较有技术能力的,他们其实产生这种产品的渠道是有限的,要么自己写书,要么自己像您一样做一些比较相当于time resistant content,对吧?写书也是一种,做视频也是一种,产生内容也是一种,做这种产品。但这些都是有一定的门槛。但是如果把它专业变成数据,通常以前是服务,变成一种产品,其实让他们确实给他们更多的躺赢的一些机会吧。
嗯,是。
好的,谢谢。那最后一个问题就是,对于现在刚刚走出校园,或者还在读书的年轻人,你**会**对未来的就业,择业选方向有什么建议吗?
我觉得他们现在的,现在小朋友出来的话,其实面临挑战比我们当年可能要大一些,但是我觉得机会也更多。世界变复杂了,不确定性更多了,但是某种角度来讲机会也变得更多了。我觉得其实现在最好,大家应该去多创造。有AI的工具,其实让我们创造成本大大降低。像以前我们要做个APP,要自己学会前端,自己学后端,其实是对能力要求是比较高的,时间的commitment要求比较高。但现在的话,其实你有更好的idea,其实你可以用更多的AI工具,尝试去解决。所以我觉得可能希望大家是找到自己爱好,然后去多学习去创造,通过不断地多做,去提高自己发现需求的敏锐的能力。我可能没有什么太多的择业的建议,更多是一个大家一个所谓的心法,或者说一个mindset。
嗯,对。因为就是再往后的话,可能就除了创造以外的其他的这个价值,可能都会被缩减,对吧?因为在机器的帮助下,那可能就是创造性本身这件事情,就会变得特别的重要了。
对对,我觉得就是培养一个mindset,就享受创造,然后build一个非常完整的feedback loop,就通过creating你能收到feedback,不管是开源的,earn recognition, earn credits,或者说你本身是一个商业化产品,产生收益。我觉得这个挺重要的。我觉得更重要是赚钱,就是通过你的产品有人愿意付费,我觉得是个硬指标。这个给你的反馈最直接的,不管是多是少,哪怕你一个人愿意给你付100美金,那也是非常有价值事情,你至少解决了一个人的刚需。
是的是的。嗯,有道理。对,而且我觉得就是比如说,以我作为例子,就以前我其实是特别讨厌写作的。然后呢,因为我觉得写作这件事情,就是你大概有一个想法是没问题的,但真的要把它就是全部成文,包括就是因为写分析性的文章,你中间还有大量的研究和数据,就整个事情到最后,就会做的让人特别的心浮气躁。你可能需要一个很大的一个commitment。
那今天我就觉得就是说,可能每一个人,你所拥有的这个写作班子,可能都超过历史上任何一个国家领导人,他的写作班子,对吧?然后呢,在这个基础上的话,其实所谓的想法、结构,然后所谓的构思,就变得更加重要了。然后呢,其它的事情,其实只要你善用工具,那最后都可以被完成。
对对。我觉得我们应该是去年年底讨论过这个问题。我觉得AI确实让我们写作,我不知道当你发了这个观点,正好我也是插一下我的观点。因为你说写作嘛,当时你觉得比较challenging。我另外一个观点就是,我其实很多像我们这工科生,尤其在大陆训练过,其实很讨厌写作的。但是真的是在美国训练之后,我非常喜欢写作。因为作为工程师,其实最重要的能力其实就写作。你写代码其实也是写作,其实代码的实现,其实是个整个工程量比较小的。我们大量时间发生在design doc,要写design doc。你要写个新的产品,或者你写新的系统,你**把**design doc写好。其实我觉得写作是非常核心的能力。
我觉得如果给现在学校的同学,或者刚出来的工作的学生朋友建议的话,只是作为稍微年长的同学的一个建议,就说确实要培养一个写作能力。我觉得Paul Graham博客我是经常看的,一直**在**读,他特别强调写作。然后clear writing等于clear thinking,对吧?Clear thinking是非常非常核心的一个竞争力。
是的,非常同意。
好的,行。那我们今天差不多就这些问题。然后也非常谢谢张毅的参与。我们下期到时候再见。
好,谢谢Bill,谢谢。
感谢收看今天的Bill It Up。如果你喜欢今天的内容,请记得订阅、留言或分享给你的朋友。谢谢大家一路的支持与陪伴。我是Bill,我们下期再见。