Transcription
现在的模型,如果真的把所有条件都打开,它能不能直接进入股市?
那我是觉得说,至少它的不稳定性是稳定的。哈哈哈,咱经常说的嘛,一顿操作猛如虎,其实输出250。
这六个模型吧,各有特色。大家会试图把它带入原生家庭,就是说DeepSeek之所以火,是因为它背后就是量化的基因在里面。嘛,Gemini就更像散户,操作超级多,就是很焦虑,几天交易几十次,是亏的就最多。
我认为,在现在这个时间点,反倒是用模型去炒股,去做量化最好的时间点。我想到的是另外一个极端,就是当大家都用AI的时候,你可能又很难用了。
所以,为什么现在大家对中国的开源模型都这么推崇?你觉得中国的开源模型真的强到这地步了吗?
这一期我们来点新鲜的,就是这个六大AI模型比拼炒币的事。这个事,这个事大家或多或少肯定知道,对吧?而且就是说,尤其是我们人民公园说AI的这些,咱们的股东们董事们,对金融市场,对这个AI市场都是非常的非常的熟悉,非常的不陌生的。
正好这两个话题凑在一块了,那简直是天作之合。我们今天不聊它都不合适了。但可惜就是今天,今天小苏同学有点小样啊,所以就今天不登场了。
我在那个后台官邸料阵,我和我和老修主要代表人民公园说AI,哎,跟大家聊聊这个话题。哈哈,是的是的。
小老修,你先说说,就说你你觉得这事有意思点在哪,或者说最吸引你的是什么?
对我最吸引的是看他们怎么掉链子。其实哈哈哈,看热闹不嫌事大是吧?
对对对对。我看他们掉链子在哪,因为其实我自己日常编程,哪怕我们自己做一个自己的这个新闻产品,就是早晚报这样的东西,我就天天看AI掉链子。就是这些最顶级的AI,其实掉链子率是非常高的。也就是说,在他的很多调教,你感觉都没问题,大部分的时候都会出问题。所以,我特别,我特别关注的就是这个,他们其实掉链子的情况是什么样子的。
其实就是,大家头几天以为这几个东西是什么样,包括总结了,可能哎呀,DeepSeek像老司机啊,go to像什么从来不复习,但是老是能蒙对答案的天才少年啊。那个什么Claude又像是那种呃,财务人员一样,算清楚了才出手,然后非常谨慎啊,千万可能又很中庸啊,就是很严谨的,也不激进也不保守。然后GPT-5就是比较那个,脑子里理论装太多了,实操太少,天天策略老是矛盾,自己想的是什么,执行的时候是另外一个事情。然后那个Gemini就更像散户,然后就是操作超级多。
对,最像人的就是你感觉好像有策略,实际执行起来又没策略,然后就有很多东西,就是很焦虑啊,几天交易几十次啊,然后亏的就最多。等等,就是但是这些很多都是在早期的时候,就是大家会定义好像是这样。但是到了中后盘的时候,又会发现又不一样。
就是到最后,你其实看他们的几个趋势,就是基本上大家的相对位置是比较稳定的,就是不会说相对位置,说突然一下子谁逆袭,好像没有。基本上就是相邻的几个,可能前后会换一换啊。那最后的座次其实跟头一周开始之后,那个座次之后其实变化没有那么大。
那那我是觉得说,至少它的不稳定性是稳定的。哈哈哈,这个是我看到的,很有意思。
对我,我觉得咱们现在稍微的,稍微的介绍一下背景啊,也给就是说万一,万一就没关注这个新闻的咱们的听众们,稍微普及一下。这其实是一个美国的实验室对吧,一个lab,然后做的一个对所谓实验,对叫。在这个实验室叫Nof1,然后在这个Alpaha Arena上做的,一个实验。
是用了六个最知名的模型,美国的四个,中国的两个。中国两个尤其有意思的,两个都是开源模型,一个是DeepSeek,然后一个是通义千问(Qwen)。然后呢,美国两个,四个呢,当然是首先首推的肯定是ChatGPT的,然后是我们最喜欢的Gemini,还有Claude,还有Grok。对,其实六个模型吧,各有特色。
然后呢,在整个的交易过程中,大家是希望给它做成拟人化那种描述,对吧?然后呢,对闲哥也说了,就是大家会试图把他带入原生家庭。我看这个意思就是说,好像就是原生家庭有罪,或者是有利。对,就是说DeepSeek之所以火,是因为它背后就是量化的(幻方)这个在里面吧?对吧?中国四大,四大量化公司之鼻祖,最强的这几个对。然后说通义千问(Qwen)里面又有什,么这个大A股培训出来的,这个哈哈哈,这个大A股是经过这种残酷的训练场,养股出来的。对,真正斗兽场的这个能力。
然后说又说什么那个Gemini呀,还有什么Claude呀,都是属于学究型的,等等等等。我觉得这些描述都无可厚非,大家为写文章嘛,对吧?为了引起大家注意对。
但其实分析数据的时候特别有意思,就是我们先得对规则有一些简单了解啊。首先大家都是一万块钱起步对吧?然后呢,交易的是虚拟币嘛?啊,所以我看到其实国内报道比较少,可能也是因为,就是因为涉及到所谓炒币这一个话题,所以大家不好聊嘛。但我们只聊模型,只聊AI模型,只聊这个事本身啊。
然后在这个市场上,其实是去操作几种虚拟币对吧?包括比特币,包括这个以太坊等等的这几种虚拟币。然后呢,而且是这种就是直接的线上交易。但是呢,他也不能够高频交易,包括他使用的都必须是同样的Prompt,对吧?提示词最开始。
嗯,然后最重要一点,其实很多人介绍时候忽略了,就是这个本身所有模型,都不能跟实时的这个数据做交易。也就是说,他不能获取到实时新闻,不能获取到其他,除了交易数据以外的东西。对,他就是纯数据序列给到他。对,是纯数据序列,纯数字的东西对吧?包括这个,对,现在目前的这个,现在目前交易值多少,等等等等这些信息。
对,但是对,但是没有其他场外信息,就我们所谓的常规信息,就没有这些东西。对,然后对他标榜的是什么?我也特有意思,闲哥我不知道注意到没注意到,他说标榜的是说,说是给模型提供一个真实的测试。嘿嘿,对吧?这所谓对比的是什么?就是之前的是吧?像MMLU啊等等的这些刷榜行为啊,打分都能打很高,积分都很高,刷榜的刷的很很牛。
那到底这些模型在真实世界中,能不能赚钱?对吧?但是我个人看啊,我觉得这一点都不真实。真的就说,哎,虽然说操作操作看起来很真实,就是看起来很唬人啊,你看规则定这么清楚啊,也不干预,而且还就是模型也不调优对吧?我觉得他特意强调说各个模型都没有做调优,然后在这种情况之下,真实率操作完不干预,然后连续17天等等的这些信息。
可是你你仔细看啊,就是老修,我不知道你怎么看?反正我先说我的观点,我这里面有几件事。首先,首先,17天并不能真实反映出什么能力来。对吧?17天,对于就是说,如果说这郭德纲的相声吗?我都科学家好几天了对吧?你说炒股炒17天我就退场,这种情况不可能。要说真正做金融交易的话,你不可能说就17天就不做了。所以这一个阶段性的这个输赢,很难反映出一个真实的水平来。
第二点,就是说到他不能直接接入场外信息吗?那真正交易员,或真正的市场是顺序万变的。场外信息本身,就是构成市场波动的,一个重大的一个条件。就不能做。
再加上什么呢?再加上就是说,这些模型本身,它这个有没有做到长期?这点我很怀疑啊。就是我看到有分析说,这个比如说像像像ChatGPT或者Gemini,他并不记得之前自己交易的结论是什么,自己是什么东西。
对的对的对的。所以这点记不了。对,就是那那变成了所有的决策都是当下决策。所以所谓实时决策,对吧?那只是纯粹考量模型的算力,然后呢,但他又不能说基于这个足够的信息去做计算。对吧?那觉得这种又不真实了。
然后更重要一个信息就是什么?就说没有补仓啊。我就一万块钱,对吧?那这是就相当于什么?什么概念?就是说OK,你像比如说我们如果玩德州,我知道买入,就比如说我这1000块钱输掉之后,我可以再买入。如果我的后手够深的话,对吧?我只要是做的不错,我长期下来的话,总体盈利水平会很高的。
那问题是,就像CBT和这个Gemini,都属于前几天就直接是输了一底料,直接后后面就没本了。本都没了,你追都追不了。对,当然了,这个咱不能往后跑啊,就是我只说,我只强调说这个测试本身,他所谓的真实是画引号的。
就是就是,我觉得这很重要的,就是叫做脆弱性。就是他这整个整个整个比赛的设计,就脆弱了,就是特别容易一个小的失误,导致一个模型已经可能很难翻身了。
会会这样子。没错。那这个,那这个问题,其实我突然想到一个比喻,其实很像大家去跑马拉松,结果中间不给你补给水的那个点。就是你出去就从头跑到尾,中间就一堆人围著你拍,然后也不给你递毛巾,也不给你递水。
因为因为你真的没,就刚才说的没有记忆这件事情就很惨。你自己做过什么规划,你自己都不记得。那你到执行的时候,你到执行的时候突然触发说,哎,现在要按这个执行。他其实这里面有几个典型的那个呃问题啊,就很呃,很崩溃。
这个记忆不行的话,他就会出现说,他自己真的到了要执行那个止盈点,或者止亏点的时候,他其实会很犹,他会很犹豫。哎,这个这个方案好像为什么这么搞啊?这么搞?现在现在最新的数据好像有点冲突,但是他又不知道以前的结果是为什么,因为他没有那个长的记忆。他只有短记忆。完了你们就相当于就是那个长下,长上下文没有,然后又没有那个,又没有做笔记的地方。对吧?这两个东西都要有。
因为长上下文,只是就是我们相当于思考的脑子,马上思考的时候去结算,那个窗口本来就不够大。然后旁边又不让做小抄。这个小抄他又又有问题。那这样子他在真正计算那个,我们说我们买卖人最重要的是,我买卖的那个点,是不是要算清楚,然后就该执行嘛?对吧?结果他那个点的时候,他算不清楚。
这个包括一些算数也会出错,我们知道大模型其实算数很差。对,因为他是存在模型,又不让他掉那么多的那个东西。对,这里面他出的问题,哈哈哈,对。所以这,这就直接出现了很多自我矛盾的规则,他就会出现博弈。
那然后呢,呃,包括说他自,己其实有的时候还会出现那种想要做一些那种欺骗行为,就是对试图利用规则,绕过规则去,对希望想想绕尝试这个事。对,这个事情他也会做的。然后这种时候,他就会在,因为我们知道做做交易的时候,你这个要是在那边犹豫,那可能那个操作一下就过了,就不行了。
对吧?没错。那他这里面就会出现,有的时候他反复验证,然后直接错过了交易点,然后整个策略就失效了。对,这就是一个很明显的一个,就是你最多综合看得起来,但是综合的问题,其实有两个很基本的问题,真的基本的不能再基本的,你可能想象想象不出来。
这个我经常碰到,我们自己实际做产品经常碰到。第一个,你真的想象不出来,就是你跟他说,数据这个从从最新到最旧,顺序排列是倒序的,从上到下这样给你。嗯,然后他理解的时候,其实由于格式,他们对格式其实高度的敏感。对,刚才不是说是给他们格式嘛?对,但其实不同不同模型,对于格式的理解能力是有差别的。
你可能想象不到,OpenAI为了处理一个我们工程上常用的那个JSON,这个这个格式,差不多花了3-4个月时间,才能让大模型准确的去处理这个这个这个格式。那其实还有很多种格式,OK?然后数据量大的时候还容易出错。
就是我就算这一次能做对,但是我做99次可能会失败两三次。那你想一下,他这个里面的那个错误,其实他们的执行,执行次数是很多的。然后呢,你可以想象到有很多次,可能这个数据就就我看有实际的报道,就是说他有非好多个模型都有多次,把最新读成最旧,嗯,然后把最就读成最新,这么反正前后都倒反了。
那你说这个决策能对吗?就是相当于数据,我们说一个人做数据的时候,呃,做决策的时候,你基本的那个上下文,数据都是错的啊,或者就是数据是对的,你理解又理解错了。就像我们做题的时候看错了,明明这个这个应用题写的是这个,从早上到晚上,我硬是理解成了从晚上到早上,那可能少了好多个小时。
你要历练九阴真经,我还要打通任督六脉。对,然后然后还有一个苦逼的事情是什么?就是就是叫做术语模糊性的问题。就是你里面不是有专业的术语吗?比如说什么可用现金,自由抵押品。对,哎,这些东西,可能就是如果你不是很专业的人,看起来就就已经不太懂了。
那它模型其实跟人是类似的,尤其是原模型吧。对,原模型出现,他有些没微调,他可能知识太多了,他知识里面有可能可用性,现金可能都有好几种说法,然后自由抵押品也有好几种说法。他到时候真的决策的时候,他可能只会在当时情况,选了一个他觉得概率最高的东西,去拼了一下。然后那几个,那几个定义可能有的不一样,那最后他就难以采取一个正确的,那个行为,或者是错,或者根本采取不了行为,他觉得这个无无法判断。
那他又又错过了。所以我们刚才说到最后,他已经反复计算的还有什么东西,就已经很苦逼了。然后反复计算的时候,原数据还是错的,或者是数据是对的,他还理解又错了。那其实这里面的那个,基本上他这个整个的脆弱性是非常强的。
我觉得说这个东西,我就会真的会觉得很像,你去跑马拉松,没有任何补给,你在这边跑。然后那到最后谁赢了?这个真的看天看天命。我靠,就就就咱经常说的嘛,一顿操作猛如虎,其实输出250,真的就是这样。
对吧?而但但但咱咱那什么一下啊,咱在这稍微停一下,就是通过这刚才这个描述,你不觉得就是这种,这种操盘或者这种操作真的很像人吗?就真的很像,就是普通人的操作吗?对吧?就是在自己自己号称自己有个策略,然后在真正做做决策的时候,数据量不够,或者甚至说,对一些概念模模糊不清的理解,或者说我都已经忘了,我之前策略是怎么想到要做这件事,是到真正执行的时候发现我已经,我靠,还是凭感觉吧?
还是对对对,不是这挺经常的嘛?对对对。所以我就说当时那个什么嘛?就是我看评论里最搞笑,就说嘛,说这个啊,这么证明还是GBT最像人。哈哈哈,然后真正的真正那什么,真正的AI是吧?阿提菲社的这人就是输的最惨的那个。
对,是啊,是啊。然后就最像散户的,最大家一下就共情了。反倒是这个中国两个大模型,一个DeepSeek,一个那个,一个那什么,千问嘛。我DeepSeek尤其尤其,在前几天的时候,DeepSeek一路绝尘嘛,甚至说好像,呃,不是甚不是好像,就甚至说回报率都已经超过100%了。
要不是后来最高的时候有对,要不是是因为后来市场震荡确实频繁,和和震震动的比较那什么的话,由于他的策略,他应该是真的,是一直能够保持比较高位的,一个领先优势的。结果后来被千问(Qwen)给,因为千问(Qwen)的那个直接大大,就是大量持仓的那个比特币嘛,然后直接就翻身了嘛。然后一下子就说有一天时间翻身,然后有一天时间又又翻回来,然后最后还是保持领先。
所以策,从策略上来讲,如果说如果说啊,就是我们真的去分析他的策略的话,他确实每个策略代表,都是不同的一个思路啊。尤其是说像那个就是DeepSeek,他执行的非常的晚,就这非常的非常的严肃,特真的,就像一个,就说真正在长期在市场中交易员似的。啊,分散持币,然后呢,再加低杠杆,然后呢,再保持这个策略的这个绝对性,就是执行的绝对性,等等等等。
但是,我觉得我们不用讨论这些东西,这些东西毕竟只是十几天的一个行为,而且是其实太小了,不不具备,其实这样子说不具备统计学上的样本,样本价值。没错,没错。而且这里就是这个东西秀场的更大,就是跟我们国内,我记得我们国内搞了好几把,那个机器人什么格斗啊,机器人马拉松什么的,都都是秀的。你实际上这些都没有用。
对,实战我觉得真的完全是这样,就是说真的去再,去复习他的策略或者什么,我觉得这东西就有点不靠谱。就是你真的是在一个,一个很小样本的事情上,完了,非要分析出来一个普遍性的普世的,一个概一个一个一个一个价值,我觉得是没有的。
但是本身,你觉得就是,咱们完全抛开所有假设,再说你觉得现在的模型,嗯,如果真的把它所有条件都打开,微调做好之后,它能不能直接进入股市?或者说进入这种量化,量化市场去做操作?
呃,我是觉得你让他去操作还肯定还太远,但我觉得说他辅助你做一些操作,应该是很合适的。就是嗯,我们肯定有一个很很硬伤的问题,就是人看看资料太慢了。嗯,就我,我知道我有一个策略,但是我其实这个策略要很多数据,我要去抓的话,我自己是很费劲的。
但这个东西其实你用AI去有调教的,AI去帮你处理,我觉得是会很好。就比如说我对某个策略是特别的坚定,我要做这个,做空还是要做哪个,哪个东西好的,怎么做?然后里面但是要要抓好多数据来分析,但是我我这个东西就是,其实我人类就是有明显的局限嘛,你给我这个数据,确实你能给到我这个方面的数据,但我看不过来对吧?然后我分析不过来。
像这些的话,其实如果有是AI去辅助,我是觉得是是完全是肯定是有帮助的。但是你让他完全像像他这样子,完全没有人类干预的去去跑啊,我我觉得就是可靠性实在太低了。因为都不要说他这样跑,就我们普通的,一个小的小的程序,做做新闻处理而已的这种小工具,嗯,他的那个可靠性都已经很低了。
其实我们就是一周之内,发生个10%-20%的事故,都经常发生。你说他这个高,这么高频的,我是觉得说是肯定远远不到,这个他能独立去去炒股,还能够你指著他很稳定,这个我觉得是绝对没有的。就是稳定性这一块是绝对不行的。
就大概是这样。他可能有,有时候行,有但是你不是,就像就是说有行的时候,你可能很难归结,于是他能力行,就就是这样,可能是正好,可能就是唉,就正常正好是市场好,然后你的策略刚好有一个,就是碰上,就是运气成分比较大一点。
这个这个,我觉得是这样子的。因为就是说,呃,比如这我还是像刚开始讲的,就是这几家,我说他的不稳定性是稳定的。就是从他们的那个规划,呃,从他们的那个整个的那个钱的那个呃,波动情况来上,我是说他们,其实不会出现什么第一名,突然变最后一名,这种其实时间跑的越长,越越不会出现这种事情。
基本上就是,只是前后两位在有点换位而已。然后那个呃,就是他,因为他们的不稳定性,其实是相对稳定的。嗯,他们其实本质都是概率模型,他就算调优到非常好,它也只是取一个最大概率,它不是100%。它跟我们以前的硬编码的那个,是完全不一样的。
但这这恰恰是它智能的部分,就是如果是编码死了,它就不智能了。对,它就,我们之前最近不是讲卡帕西或讲很多,人都讲的是这个,其实你你遗忘,就是你忘记掉一些规则,或者忘记掉一些知识,这恰恰是智能的表现。他知道要把哪些东西扔掉。
其实现在最近已经开始,有一些比较智能的模型,已经就就已经出来了。就是他会遗忘你训练过的东西,预训练的东西都会忘,你知道吧?现在已经有这样子的这个这个模型出现了。就是大家正在尝试这种增加,增加遗忘,增加他不记得更多的东西,然后让他更智能。
有这么有这么搞的这个。其实这个,其实不就是咱们前两期,一直在聊的事吗?对吧?一个是压缩吗?对,当时说的这个就是,我们压缩其实就是模糊,然后但是最后最终提炼时候,我们提炼的是,就是说可能是一个概念,或者也不能叫一个概念,我觉得应该是一一种一种策略啊,然后并不是事实本身。
然后第二个来讲,上一期咱们聊那个,聊那个特斯拉的时候对吧?嗯,然后聊到智能驾驶嘛,聊到这个整个的这个端到端嘛,然后就聊到黑盒这个事。我看咱们评论区还有小,还有好多听众跟我们在讨论这个事。
其实就是这样,就说你所谓的智能到底是什么?如果还是以前那种纯编码形式的,模块形式的,所有东西都要先预定义好的,那就不是人工智能。对,你就不是有,我觉得在就人工智能就是,对,就是要有智能的所谓的涌现。
就这个东西,它不是说设计出来的,而是说到数量数,无论是数据还是算法,还是到一定一定阶段之后,涌现出来这个。就有一个问题,它有个很直接的问题,就是你如果是预设置,说明它是在模仿人类嘛?对,这个没错。你模仿是没办法超越的。
就这么个事情,很简单。你的天花板永远是你设置模型,或者设置策略,这个人本身是天花板,而不是这个模,而不是人工智能的天花板,而不是AI的天花板。对对,是这样。
我我跟你倒持相反概念,相反的结论。我认为在现在这个时间点,反倒是用模型去炒股,去做量化最好的时间点。真的。我首先我先说啊,就是我自己,确实个人个人经历,我参与过量化这个事。
量化这个事的话,其实可以分成很多步骤,但我们就说大的块啊。首先肯定是信息收集嘛,对吧?就是你需要收集数据,尤其是需要有很多历史数据。但是历史数据必须是真实的,它必须有交易和这个交易,交易交易量等等这些东西。
就是说你这个历史数据越细越好,颗粒度越高越好,因为你要回测。嗯,你有一个策略之后,你先要过用过去几年的数据做回测,然后来来证明,你这个就是策略是否有效嘛?如果说嗯,OK,你做了一个策略,认为是有效的,然后你直接扔进,那你就真真的交学费,你就是可能会运气好,或者说赢一大赢一个大的,然后呢,过去再输光,长期再输光。
要不然就上就输,就跟这个PPT一样,然后呢,再也翻身不了。对,但是你必须得有很好的数据。
然后第二来讲,你得有场内场外信息嘛?就是你得能拿到及时的,而且可能甚至到毫秒级别的,或者说起码到秒级的,这种就是叫市场的交易信息。对吧?交易值是多少啊?能接受的盘口,能接受的这个这个这个吞吐量是多少等等的这些数据。
然后还有什么?还有就是你的策略,肯定你策略要不断优化嘛?策略其实就是,就是一一整套的执行方案,到什么时候止损,止盈点是什么?完了呢,能能接受多少啊?要不要做事等等的一大堆的东西。
然后才是执行。在执行层面上其实更惨,就很多时候,你的你所下单的价位,挂单的价位,你根本执行不了,没有机会被触发嘛?对吧?对,就可能就滑点,直接就甚至说你要做双边市场的话,有可能单边执行了,那边没执行,那是最惨的,你直接留了一个巨大的敞口。
对,然后然后你可能就是说,这纯粹就裸奔在那,然后等著扛著啊,然后等等等等等等。但是到了最后,就是这些东西都完了之后,还有一个心理问题。最大的心理问题就是说,当你看赢钱的时候,你可能就会突然就觉得啊,以前策略都不是策略,既然赢我就让他持续赢下去,我是不是要到止盈点上,直接就就就高位,就就兑现了?
还是说觉得我现在这个时间点判断错了,我要及时调整策略?对吧?就像现在咱们说这个什么英伟达一样,人家奔5万亿,那下面可能就是6万亿,可是很多人觉得5万亿就是最高了,不能再得回调了。所以,这个时候心里又是一个很大问题。
所以这这个整个量化的过程中,它不是一个简单的就是你定一个策略,到时候就赚钱了啊,或者说你策略好,就就就值值钱了。不是的,策略其实在里面,我觉得是怎么说呢?就不可能占到100%的决定因素。反倒说这个中间有很多步骤。
为什么我说现在用模型可能是最好时间点?我有两个自己的看法。第一个来说,就是咱们看这个测试,咱们当时举了,咱们刚才就已经列举了很多局限性嘛?对吧?但是这些局限性都是可人为可控的。
比如说我们模型做微调,对很多定义做的更清楚,对吧?然后呢,对资金的补充,我们可以不定义,在就是一万块钱我们可以顶,就说我后面的仓位很深,我可以补仓嘛?对,特别重要的是你刚才说的场外信息,就实时的给他场外信息。
这个实际上就是我们说的模型的那个上下文,是他的那个外挂的知识,这对他决策实在太重要了。而且,而这一部分就是印证你刚才说的话,就这部分人人是处理不过来的,因为信息量太大了,而且速度时效性也不够嘛?对吧?然后呢,还有还有什么?还有模型还有学习能力啊?对吧?
就说现在就有个例子,就说我看到很多人在干什么事,就大家看热闹,但我看到一些高手在干嘛?在把他们所有的策略给我执行,策略全下载下来,而让模型自己分析他的策略,或者交叉测测试,然后呢,试图从中间提炼出来有效策略。
嗯,啊,就是说句不好听的话,就说我数据量足够大的时候,人是判断不了的。这时候就拼算力,拼模型能力。对吧?然后东西到底能不能从从中找到规律?这些事情其实是我更擅长的呀。你只要让他自我学习,自我迭代,其实有可能就会真的能找到一定的,在一个时间段上找到规律嘛?对吧?
这个事我觉得这有感触了。我知道为什么我突然也感觉,你说的这个时候多用这个东西,是一个好时间。
没错,因为我想到的是另外一个极端,就是当大家都用AI的时候,你可能又很难用了。这这是我后面的话,你先把它说出来了。
就是就是,为什么我说现在是最好时间?就是现在用的人还少,甚至很多人觉得这是不可,你会有碾压式的,就跟这个大炮对这个长枪一样。是吧?对,哈哈哈。
你先你先这么著,就是民不畏死,奈何与死惧之。就比如说,你现在你找不出更好的策略来,比如说你人工去操作,也不见得能到20%的回报率的时候,对吧?那你用模型也许用用千问(Qwen),你看这回23%,对吧?也许就比你个人操作还牛,牛多了对吧?
就在这种波动市场上,很多人是输钱的,那模型人家还赚钱,起码人跑出来17天是赚钱的。那我说我说的概念什么?就说当你能够把模型用好,那肯定前提是你懂什么叫策略,懂什么叫执行,知道怎么去做,然后对产完消息的这个来源和敏感度,也有。但是你自己的算力,和你以前的策略不够有效,那你就用模型去跑,你不要干扰他,你就让他自己去完善,自己去做。
但是如果说所有人都开始用模型了,那这时候模型就失效了。对吧?肯定的嘛,就是说所有都是模型,模型可能最终会趋同,因为大家都互相学习,最终可能找到了一个所谓的优秀策略,最优解。那很可能就是大家都赚不到钱,要不然就是同一时点执行同样策略,直接市场闪崩啊,市场不存在了对吧?那这时候大家全赔个底掉。
那这时候肯定不是用模型最好时间点。所以,我反倒觉得就是说,在现在这个时间点上,在大家都会模模型,产生一个就是犹豫,怀疑和用和不用之间的时候,坚定的用模型的人反倒可能有机会啊。当然这咱不鼓励任何炒币的行为啊,咱我只是从模型本身的这个应用条件和场景来来分析这件事。
所以给就下一个问题就来了,就说那你觉得就说,为什么现在大家对中国的这种开源模型都这么推崇?因为我看到的,在这件事讨论的背后,还话还还链接出很多新的话题来,甚至说有些硅谷投资人,现在说就就也不是开玩笑,真真的在说,就说现在很多在硅谷的初创公司,在演示PPT的时候,展示的都不再是PPT了,都说背后的模型是千问(Qwen),或者说这个这个DeepSeek之类的开源模型。
对,然后同时这次比赛也也跑出这样成绩,对吧?而且我看到还有公司模仿,开始用AI炒美股啊,也是中国的模型,包括豆包,包括那个minmax等等,在也在上面有排行嘛,也也排名的比较靠前。
嗯,你怎么看?你觉得中国的开源模型,真的强到这地步了吗?还是说只只是偶然现象而已?
呃,我是觉得说两者都不是。就是应该,也不是说他特别强到了那个地步,就是特别适合炒股。然后还有一个也不是说他那个,可能现在是运气好什么,就但有一定的这个技,那个实力成分在的。
就是我我的角度是觉得说,呃,很有可能,很有可能是我们刚才我刚才提到的一个,就是叫做那个那个呃,数据的那个那个那个敏感度的问题。所以我会觉得很有可能是呃,DeepSeek和那个千问(Qwen)的数据敏感度的字,那个那个处理能力,也就是基本功。
其实这是一个基本功,嗯,会比其他几个,那个闭源的美国那些模型要好。这个原因可能有很多种,也许其中之一,是因为他在早期训练的时候,本身就用到了,确实有很多数据去测,比如说就是换发量,发量化里面原来的一些数据,可能对它进行很多个数数据的测试,所以它会比较敏感。
这部分东西它处理的还可以,那这样至少有很多这种低级的,什么最新最旧啊,然后有一些数据你能读进来不,不会不会啊,而且能保证一个高的稳定性,你不会说执行了100次以后,失败了好几次,然后那个决策完全就错了。
这个可能是很基础的事情,但是很可能就是因为这么基础的东西,导致你很多决策都都失误。这个这个事情其实我是觉得是有影响的。
那为什么说呃,那DeepSeek有这个优势,为什么千问(Qwen)也有啊?这里其实就是千问(Qwen)到底怎么训练的,我们呃,我没有做更多的那个那个那个了解。但是我知道我们应该,应该大家都有点印象,就是今年年初的时候,其实DeepSeek刚出的那几个,最早的开源版本,就是呃,都是有那个千问(Qwen)是有基于它去改,改成几个版本,就是小的,小的那个参数版本,都是钱文最早去搞的。
所以我是觉得在那个时期,其实就像这种基本功,实际上是应该是已经是啊,已经是融入进来了的。我觉得是这样子的,在那个时候,应该这种对数据的基本功,应该就是进来的。
那这种这种基本功,在后面实际上是还会更多的,会强化的。因为随着你后面的更新的一些数据啊,还有各种那些东西进来以后,这些东西只要大家平时有这个基线,他会不断的去,就我们说是回归测试啊,和各种各样的测试,会测这个部分。觉得这可能作为我们中国模型,最基本的一个基本功,有可能会练,会练得很好。
某种程度也许如果又类比人,就像我们中国的学数学,都比较扎实一点,因为我们基础教育整天都在教这些。然后其实我们在正常训练的时候,我猜,就是不管说是不是幻方,就是可能就是本身中国数据,很多数据的处理,都是还是会,还是不错的。对,然后这个可能算是一个,我觉得是基本功的一个点。
然后呃,后面就是到了市场里面,那个我就我觉得是,不很难评价到底是怎么回事。但是就是我是觉得,至少他在处理原数据上如果有优势,这个成功率如果我比你高百分之,这个有的时候可能不是高10%和20%的差别,而是0和一的关系。
对,就是我,我到底决定投还是不投,可能就是因为一个数字,数字算错了,或者我这个数字根本没读进来。对吧?因为可能一个格式我我不认得,或者我因为我不稳定,我没有读进来,那我这个角色可能就完全不一样。
你觉得要上,我觉得不上。对吧?那如果我在这里基本上是不出差错,就是我们孙子兵法里面经常讲的那句,原话忘了,大概但但但是他的意思就是说,其实胜利不在对方,而在自己。如果你自己不犯错,你大多数时候嗯,等着别人犯错,你最后就赢了。
那讲的就是这个事情。那我觉得说呃,他其实就是,基本上这部分应该算是做的还可以。然后在股市这边的话,由于这一点,有可能他的胜率就会高一些。但是嗯,其他方面我们不知道。真的真正的就因为这个,这次的局限性太大了吗?其实实时数据,各种数据没有进来。
当那些东西进来的时候,就好像不是实时数据,是实时的,那些场外的新闻,各种各样的,对信息就是各种信息,它不是纯数据的。到到时候进来,肯定是数据跟文字,肯定是混合在一起的。那那个时候的考验其实更高,那个时候考验更高,就是你对这个数据,跟文字混合处理的时候,情况怎么样?包括小程序,包括对对对一些交叉信息对吧?互相的干扰,有可能是噪音,也有可能就是就是那什么。
对,因为其实从我看起来,说不定你有更多的信息,他噪音更大,他有可能表现还不如现在。这这这是这样的,这这也是为什么,对,这也是为什么,我其实没错没错,就人也是这样嘛,因为这我所以我会觉得说,为什么他这个比赛设计方会设计拿掉了这些实时的,这些场外信息?
其实某种角度上来讲,拿掉了,确实我是觉得从评估上会简单的多,因为你实在说不清楚到底谁影响谁。对,那如那你现在没有的时候,你还可以说一说模型,说一说这个其他的一些东西啊,大概是这样。
等有的时候,其实有时候很难说清楚到底谁的问题。对,大概是这样。包括就说你像Grok我就很看好,因为他背后有X的大量的这些数据,而且那在上面人的真就是,怎么说呢?我觉得在X上,很多人的真实性表现比较比较突出,大家不怎么哈哈哈,就人性的那一面东西表现多一些。
然后呢,对,但是就是说如果说真的,就是加入这些场外信息之后,真的鹿死谁手还不好说呢。所以我觉得会很难说,很难。没错,没错。很难说,尤其是像社社交媒体这种东西,其实社交媒体我们才我们,我们自己做新闻处理,就会非常深刻的体会到,这个社社交媒体的质量是非常差的。
就大部分的那个数据是,其实都是不可用的,无效信息和错误信息。就是他因为是断章取义的,或者是为了情,绪调动,或者是为了一些政治和销售的目的,他跟你讲的一些东西,其实你真的提出来以后,发现这真的是个垃圾信息。
但是还是广告,软广告,哎,对,他就是很博眼球,他让你很带情绪,让你感觉这个事情好像非干不可,马上干不可。但是其实你真的跟著他去做操作,我估计会死的很惨的。哈哈哈啊。
然后还有就是X本身也是一个,现在其实被很多其他的,比如说他们啊,有一些做做THREAD啊等等,就是一些其他平台已经大起来了,就是大家不在X上待着。对,X本身内容质量也好,那七七八八的一些问题也很多。
那其实就是这个社媒也不仅仅是X了,那还有好多呢,还有好多其他的社媒。那你真正在这次这么多设备,不同的数据质量本来就不太高,又合合在一起,再加上这个实时性,哇,这个我觉得对大模型的那个计算的,这真的是又要好多地方要要烧冒烟了。
然后算出来可能又错过了这个执行点。对,对,有可能。所以,这个其实又又引发出另外一个话题,就比如说你做量化的时候,大家讲叫策略,而不再叫算法。对,所谓策略就是说你需要做决策嘛。对吧?
就是说对他和这个我的个人感觉啊,我觉得就是说这件事本身就做测试,这件事和当时DeepMind的打败,那个就是围棋,或者或者说,我对这种就是说完全不是一个概念。你想啊,就说在棋类比赛中,他叫game,是有非常清晰的规则,而且它是有先后顺序的,你走一步我走一步,你走一步我走一步。
这种时候就说它有很强的逻辑性,然后这个时候就说,我们只是在玩法上做,就是在规则之内的玩法上做探索。所以当时OK能打出人类没有做过的,就是就神秘之手嘛,对吧?就是神之一手之类的这种东西。
但是他不需要有特别多这种这种,这种情况就可能赢了比赛。但是真正在量化中那不一样,因为策略是这样,就说你的策略再有效,你也不可能每一次做都做对决策,但你必须要去做决策。而且不是说这时候你在跟什么打,在比赛我觉得他,你这时候,虽虽然说是各个模型之间,在比赛最终结果,但并不是说所有模型在同一个时间点上,同时做决策,然后决策和决策之间做比做做比拼。
更多是什么?是说你要在这个某一个时间点上,做出一种选择啊,这个选择会影响你后面的结果。但但是如果改变了很多条件之后,其实这个选择正不正确都无所谓了,关键是它可持续对吧?关键是它可复可复现,或者说在同一个条件相似的情况下,它还能做同样决策。
我觉得这就是很难很难的。以前是靠人,你比如说我做量化的时候,是真的找了几个博士,然后有一个所谓科学家,数据科学家专门做带领,然后大家去开发这个东西,然后其实用MATLAB做了很多的算法,然后做了好多的校验,然后又找了去买了很多数据,然后做回做回测,然后呢,就看回撤空间是多少,准备钱开始做真正东西。
最后OK是赚钱了,但也是是一个时点上,那个后来我听说就是那个团队,后面就输了很多钱,因为时间拉长到一定地步之后,策略失效了。对啊,但现在来讲的话,就是在模型层面,我觉得这已经不是算法的问题了,那确实是说我需要用模型去做决策,形成策略。对吧?然后呢,算法或者说算力,它可以不断的增加,算法可以不断优化,然后呢,算力可以不断增强。
但策略,其实我并不觉得是根据时间的长短,或者你使用次数的增加,策略就会变得更好更好更好。这是一个这是没有相关性的。对对对,执行多少次之后就一定会变得更好,这是没有相关性的。
所以这一点上就我想说一点,其实很简单,就是说我觉得人工智能,反倒有可能会真的发现好的策略。因为我们现在人工智能是个黑盒,就是他怎么涌现出他现在智力来讲,我们可能人类越来越不明白了,越来越不知道,他是怎么样形成这个策略的。
但是真的有可能会被他找到一个,在人类创造的规则之下,就是金融市场,或者什么股票市场,或者什么其他市场,然后我们人类在设计过程中,并没有考虑说这个问题,然后他通过不断的去测试验证之后,哎,找到了一个可执行的策略,然后真的就把人类打败了。
我觉得这一天到来之后,就真的太有意思了,太有意思了。哈哈哈啊,是的是的是的。
我记得我记得当年看的将近20年前,就是当时那那个虎胆龙威die hard 4里面有一个情节,就说有一帮恐怖分子,他专门劫持了美国的这个基础设施,然后呢,他直接把那个华尔街的那个主机给崩溃那个瘫痪了嘛,所以所有数据都丢失了,然后造成了所有的财务分配重新那什么造,就是所谓恐怖主义嘛。
就是如果你不给我钱,我就把这个东西会盘毁掉,等等全给你毁了。对,但如真的,如果市场用模型的人越来越多,很可能就真的会形成一种这样的合力,甚甚至不是某个人去设计的,就是AI模型自己本身,哎,找到了人类的设计的一套东西,玩法里的一个漏洞,然后去执行,因为他的目标是赚更多钱嘛,然后一下子把所有财富都集中起来了,然后最后发现这,这是一个这个算法层面的一个一个胜利。
这个挺有意思的,看不知道会不会出现这么一天。嗯,这个这个现在就是无法预测,但是看起来就是呃,AI跟AI之间很可能会形成一种对抗。这个这个也是好多的这个这个研究嘛,就是现在其实就是说在安全层面,不管怎么做,这个AI都都得有一个就是默认,可能得红队蓝队一直做,就是两边互相对抗,不然的话可控性确实可能都会是个问题。
就是现在想现在,比如说现在再怎么样,我们每个AI都是人训练出来的,然后在那互相呃,互相之间他们之间是没有通信的对吧?那这但是如果以后更通畅之后,可能他们自己能够互相之间通信,那他们之间在互相通信的时候,在聊啥有可能人完全看不懂啊。
那这个不得受监管?那现在其实有一套的,一些监管的一些东西,只是有限的那种交流嘛,没有说到很深的。所以这些东西,现在的不确定性是很高的。应该应该来说,只能拭目以待,看后面怎么样了。哈哈,哎,这也是我期待的嘛。
就是说我觉得中国在做模型,是追赶还是追赶方嘛?然后天下武功出少林,在GBT真的是一一支一绝,神在前面,在然后我们期待着他可更好东西。但是如果中国模型不能够说跑出自己的一个特色,当然这回测试感觉到啊,还是确实有差异的啊,各个模型之间确实有巨巨大差异。
要真的就是所有模型,最终都是趋向于一家或者两家,很危险,非常危险。就像你说的是的,你就必须红队蓝队同时跑,但是你靠一家公司去跑出一个红队,一个蓝队来,不太可能,不行,一定是靠不同的公司,对,不同的不同的投入,不同的方法去实验才行。嗯,嗯,是这样。
对,哎,不过就这回这模型这测试,我觉得有一点他没公布,就是这6个模型最后使用成本是多少?就是调用API的成本是多少?哈哈哈,这要比较比较一下,可能中国,中国这开模型的价格又又直接领先,就就真的是有巨大优势了。
对,这点是真的没没讲。而且很有意思的是,这次最后千问(Qwen)是夺冠嘛,但其实他一开始在讲这个实验的那个设计,上面他有讲到千问(Qwen),呃,所有的模型都是开了那个reasoning,就是推理是最大的,就是能配的都配了。
那千问(Qwen)好像是由于不知道是什么原因,啊,不知道什么原因他没讲,但是他说他没有配到这个最大的推理,这个这个选项,就大概是这样啊。然后那个有可能是没有这个选项,它默认也许就是比较大的推理,还是怎么样的。
所以这里面就是还有一些这种配置啊,各方面的一些东西,有可能还还没配到最最顶级的配置。啊,反正最后也赢了,那就这样子的一些东西,就会让很多人觉得很有意思。但是,其实这里也也是一种实验本身的偏差。没错,没错。
对,嗯,对。而且这个实验本身,其实我认为,就组织这个实验方是获利最大的。他们把自己的这个名声给推出来,而且就是引起巨大关注嘛。而且我在那个主页网站上看,他就是about us那块,就关于他自己介绍了一遍,就一条招人,就如果你对我们的感兴趣,你来投我们简历吧。
啊哈哈哈,是,他也没有什么历史的东西,就这一次比赛,就这么一个事。对,所以,我怀疑他背后也是要做量化的,也是也可能就是准备拿模型去搞点赚钱的事,搞钱的事。是啊,是啊。
然后或者就最基本,就是把自己做成一个新的Benchmark嘛,把你自己做成一个新的Benchmark,以后模型要推出来都先找我刷一刷,那这个不一样了。没错,嗯,裁判,嗯,我这就做标准,对,我来做标准,这个太厉害了。没错,是的是的是的。
行,那好,那我们今天就是随便,藉著这个这次竞赛这个情况,来简单聊一聊。而且听说后面1.5要开始,Season 1.5又要开始了,甚至说未来有会有新的这个测试,我们也可以持续关注。
但我觉得关注本身就是图一个乐趣,能能够通过一个案例吧,让我们对这些模型有一个更直,更直观了解。我更希望就是看到真的有人,大家能靠能靠模型赚到钱,而且也能够看到,就是在你可以看到,这种智能模型和专业模型的区别。
我认为就是说像这像TPC,这个肯定在,就是综合方面还是不如还是要差。对吧?然后像千问(Qwen)什么的,还是有追赶的这个方向。但是在应用层面上,就不见得你怎么能把模型用好。
就像你说真的把给你把这个倚天剑,你也不见得比这个人家杨过拿一把,拿一把铁剑打的好。打的好,是的,对。所以就是谁能把它用好才是关键。现在的AI,我觉得从能力上,已经在各方面溢出了。
我所谓溢出,就是对一些日常异常行为的,或者异常的这工作的需求已经溢出了。但是在最顶级的,比如你说像在这种金融市场,这已经算是最顶级了吧?真正能做到金领的,那都是高学历,高智商,高甚至说是高情商的人才能做的。
那现在模型已经轻松的开始自己跑起来了,在人为完全不干预的情况之下,那你谁知道哪一天,没准再再过6个月以后,人类这个就不能以智力,就是地球上智力最佳,来命来来来来定义自己了。没错,完全,就被AI给超越了。
是的是的,对,所以非常期待后面的。因为其实这种比赛实际上是很有意思的,就是作为对于我们而言,可以从不同的侧面去看这些,这些模型的潜力到底在哪里,或者它的坑在哪里,就挺明显的,就是一场大考。
嗯,没错,人类就喜欢看比赛嘛,对吧?从那个罗马竞技场的时候,到现在搞奥林匹克,没事就比来比去,然后先拿自己比,然后再拿机械比,再拿再拿动物比,现在来好了,拿AI来比啊。咱们就拭目以待,看下一场斗,就是这个数数据斗地主,或者叫这个竞技场会成什么情况啊?对。
好,那今天我们就先到这里,期待大家多留言互动。没错,欢迎大家,搞笑的一期,有点没错,而且一定要关注我们人民说公园说AI,然后呢,我们会定不定期的,然后把我们感兴趣的话题跟大家分享,做大家创业路上的BGM。
也也祝大家啊,生活愉快,工作愉快,用AI玩的愉快。拜拜,期待下次再见。拜拜,拜拜。