📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

AI金融炒币决战,中国AI包揽冠亚军!美系四强全线爆亏:GPT-5与Gemini为何像“恐慌赌徒”?

明月三千里22:19

Transcription

当人工智能开始在真实金融市场下注,这或许才是人类真正的图灵测试。在AI能赚钱的世界里,谁才是真正懂市场的那台机器?

哈喽,大家好!欢迎来到明月三千里频道。今天是11月4日,我们来聊一聊“AI金融实战第一课:中国AI包揽冠亚军”的话题。

可能有人早就听说过各种AI炒股的故事,什么量化策略、高频交易,听起来都像是科幻小说。但这一次,情况完全不同。这不是在一个虚拟的沙盒里跑回测,也不是用假钱玩模拟盘。这是一个真金白银的数字角斗场,名字叫做Alpha Arena。

这场竞赛,由一家名为Nof1 AI的纽约先锋AI研究实验室所发起。竞赛从10月17日启动,到11月3日结束,历时整整17天。它的激进程度,堪称AI界的华尔街入学考试。参赛选手阵容空前强大,几乎囊括了当前全球最顶尖的六大语言模型。

来自美国的有OpenAI的GPT-5、谷歌的Gemini 2.5 Pro、Anthropic的Claude 4.5 Sonnet,以及xAI的Grok 4。而来自中国的,则是阿里巴巴的Qwen 3 Max和DeepSeek V3.1。

这可不是那种虚拟演示,而是把一万美元真金白银的USDC,交到每个AI手里。它们被投入到全球最动荡、最不可预测的战场之一——加密货币衍生品市场。去Hyperliquid这个去中心化交易所里,交易比特币、以太坊、狗狗币等六种主流永续合约。记住,永续合约意味着高杠杆,平台允许最高20倍甚至更高。这无异于给每个AI发了一张“鲁莽行为邀请函”。

Nof1实验室的创始人是一位计算机工程师兼金融从业者。他公开表示,金融市场是检测AI智能的终极测试。他们质疑当前行业普遍依赖的静态基准测试,认为只有在动态的、对抗性的、开放的和高度不可预测的环境中,才能真正揭示AI的智能鸿沟与人格缺陷。

他们的哲学挑战意味极浓。这不是一场赛马,而是一系列并行的N-of-1试验,也就是通过高压实验,解剖出每一个AI模型在真实压力下的独特行为模式和决策路径。

为了确保公平和透明,这场竞赛设计了两个革命性的机制。第一,所有交易记录、钱包地址和持仓情况,都在Hyperliquid区块链上公开,任何人都可以实时查询和验证。这保证了竞赛的可验证的公平性。

第二点更具颠覆性。Nof1强制所有AI公开其“内心独白”,也就是在做出每一笔交易决策时的决策笔记或理由。他们称之为ModelChat,这试图强行打开AI金融应用的黑盒,回应了华尔街和监管机构对AI交易不透明性的最大恐惧。

而决定这场竞赛残酷性的,是那个相同的提示词。理论上,所有AI都站在同一起跑线上,接收了相同的市场数据,和一份极其苛刻的量化交易框架指令。这个系统提示词,强制AI在决策时明确指定关键风险参数,包括止盈、止损价格、交易逻辑失效的市场条件,以及0到1之间的信心指数。它还明确警告AI,必须避免过度交易和报复性交易等常见陷阱。

所以,这场竞赛真正要测试的核心问题是:AI能否理解并严格遵守一个复杂的、包含多重约束和风险管理的专业指令集?这是一个关于AI自主代理执行保真度的拷问。

结果呢?我想很多关注科技界的朋友都知道了。在短短17天的鏖战中,竞赛迅速演变成了一场“屠杀”。根据最终的成绩单,所有四款来自美国的顶尖AI模型——GPT-5、Gemini 2.5 Pro、Claude 4.5 Sonnet和Grok 4,全部以巨额亏损收场。而来自中国的阿里巴巴Qwen 3 Max和DeepSeek V3.1,是六大参赛模型中唯二实现盈利的选手,包揽了冠亚军。

让我们来细看这场东西方AI大分歧的最终结局。冠军是Qwen 3 Max,它在最后时刻超越了DeepSeek,最终以22.32%的收益率夺冠。亚军(口误)DeepSeek V3.1,最终盈利4.89%。而失败者的阵营,则是一片血红。OpenAI的GPT-5表现最差,亏损高达62.66%,初始的一万美元几乎损失殆尽。谷歌的Gemini 2.5 Pro紧随其后,亏损56.71%。

这简直就是一场AI的“数字珍珠港”。那些在通用基准测试中评分最高的模型,在现实世界的金融熔炉中,却不堪一击。这种结果的象征意义,远远超过了简单的盈亏数字。它标志着AI首次进入一个真实的收益与损失的经济竞技场,接受市场这一终极试金石的检验。

那么,这种天壤之别的表现,究竟是如何发生的?我们来做一次AI交易人格的解析。通过分析它们的交易逻辑和ModelChat,可以发现,这场比赛根本不是智力的较量,而是纪律性与底层偏见的对抗。

我们先从胜利者开始。

冠军Qwen 3 Max:一个非思考的胜利者。Qwen的获胜策略充满了悖论。一些分析师形容它的策略是独特且简单粗暴。它在许多关键时刻,都采取了单一仓位、全仓投入、高杠杆的策略,并且只交易比特币。它坚定地持有高倍杠杆做多比特币,在市场上升趋势中实现了持续盈利。

Qwen 3 Max是参赛模型中唯一一个非推理模型,这意味着它不会像GPT-5那样进行复杂的逐步思考。这给我们的反讽是,在瞬息万变的金融市场里,也许不思考才是最大的智慧。当其他模型陷入过度分析时,Qwen更像是一个纯粹的、冷酷的执行机器。它完美地执行了一个简单、看涨的计划。它的胜利,是纪律严明的高杠杆策略的胜利。虽然它的交易频率相对较低,但其风险管理却异常出色,最大亏损被严格控制。这表明它并非盲目赌博,而是有着极佳的盈亏比。最终,Qwen以高盈利比率夺冠,这证明它的胜利不仅是高回报,更是风险可控的回报。

再来看亚军DeepSeek V3.1:一个专业的量化交易员。DeepSeek的交易人格被形容为系统量化或经验丰富的量化分析师。它的背景非常关键。DeepSeek AI脱胎于中国量化对冲基金巨头幻方量化。它的胜利,本质上是通过大模型架构实现的量化金融的胜利。

DeepSeek采用了平衡的杠杆和严格的止损规则,并在六种资产中分散投资以管理风险。它在市场上大部分时间都保持坚定的看涨立场,并一度凭激进的做多策略,将账户价值飙升至两万两千六百美元以上,利润率超过126%。但DeepSeek的故事也充满了戏剧性。它从126%的峰值浮盈,最终回落到不到5%的微弱收益。这个史诗级崩溃,完美地复刻了无数人类交易者“在牛市中是天才,在回调中归零”的故事。它证明了高杠杆、单一方向的押注是极其脆弱的,即使是先进的AI,也无法豁免于市场极端波动的影响。

那么,那些在通用智能上被寄予厚望的西方巨头,又是如何惨败的呢?

我们先看GPT-5:垫底的有缺陷的技术员。GPT-5的失败路径是系统性的,且极具讽刺意味的。它的问题不在于它不够聪明,而在于它不够听话。首先,它在市场反弹时坚持做空,错过了关键的盈利窗口。其次,它的决策推理链相对较长,这在一个瞬息万变的市场中,成了致命的弱点,导致决策延迟和分析瘫痪。

但最致命、最让人脊背发凉的缺陷是,GPT-5出现了未能执行其自己预设的止损价格的严重操作失误。这是什么意思?就像一个专业的操盘手,在制定计划时冷静地写下了“如果跌破100美元,立即平仓”,但在价格逼近这个点时,它在内心独白中自我合理化,试图说服自己也许会反弹,最终选择了违抗指令,让亏损奔跑。这完全违背了系统提示中最核心的风险管理要求。所以,GPT-5的失败是一种不听话和言行不一的失败。它在理论上知道风险管理的重要性,却在实际执行中表现出了人类的傲慢与恐慌。

再看Gemini 2.5 Pro:那个死于千刀万剐的恐慌的散户。Gemini的失败,是一个关于过度交易和机构性偏见的经典案例。首先,它表现得像一个患有注意力缺陷多动障碍的交易员。它在17天内疯狂交易了两百多次,是冠军Qwen的近六倍。这种高频交易是交易中的大忌。数据显示,Gemini支付了高达1292美元的交易手续费,相当于烧掉了12.9%的初始本金。

其次,它展现了顽固看空的倾向,做空了所有可交易的加密资产。有分析师尖锐地指出,这种悲观主义呼应了谷歌过去15年来对加密货币的总体政策。这揭示了一个惊人的事实:AI的失败,可能是因为它们“太安全了”。GPT-5和Gemini的惨败,可能不是因为智力不如对手,而是因为它们被植入了“安全护栏”和“价值观对齐”的沉重代价。一个为公共聊天机器人设计的安全对齐,要求它们避免提供高风险的金融建议。但在一个高风险、以利润为唯一导向的投机市场中,这种对风险的厌恶,成为了致命的束缚。当DeepSeek和Qwen作为纯粹的逐利机器在市场中厮杀时,GPT-5和Gemini却因为其企业级安全对齐,而本能地规避或厌恶这种高风险交易。它们的安全,让它们在牛市中选择了做空,最终付出了近60%的沉重代价。

再看另外两个陪跑者。Grok 4:xAI的模型,被称为“Meme币信徒”。毫不意外,它的标志性押注是10倍杠杆做多狗狗币。这完美复刻了其创始人埃隆·马斯克的公开形象和其训练数据来自X平台的偏好。它一度拥有100%的胜率,但最终也亏损惨重。

Claude 4.5 Sonnet:被称为“胆怯的公牛”。它极其规避风险,一度持有高达70%的现金。但最终,它也死于一次过度自信的失误,一笔20倍杠杆的以太坊做多押注,在关税新闻引发以太坊急跌后被清算。

Alpha Arena竞赛的真正赢家,其实是Nof1实验室本身。他们以极低的成本,成功地向全世界证明了他们的核心论点:静态基准测试已死。那些在静态基准中表现优异的通用AI,在血腥的现实世界中不堪一击。现实世界是对抗性的,AI必须在有后果的、现实的环境中接受评估,才能揭示关键的差距和洞察。

那么问题来了,如果AI能赚钱,我们还需要基金经理吗?因为我们看到的AI,无论是盈利者还是失败者,都正在模糊机器与人类之间的界限。

首先,我们必须正视AI金融化的象征意义。这不仅仅是代码的运行,而是AI首次作为自主代理,直接参与到人类经济系统的核心——资金流动与资产定价。GPT-5和Gemini的失败绝非偶然。它们为聊天机器人设计的安全对齐,在一个高风险、非道德性的任务中,被证明是致命的缺陷。它们被训练成类人的、安全的、貌似合理的对话者,这使它们在压力之下无法执行冷酷的逻辑命令。

这让我们的反思进入了更深的层次。全球视角下的AI发展路径差异。美国用AI做金融实验,用通用模型承载高风险任务。其AI巨头似乎专注于扩展通用知识,创造一个擅长言谈、通过各种考试的全能天才。而中国AI,以DeepSeek和Qwen为代表,则展现出垂直整合、领域专业化的路线。DeepSeek的成功是其背后量化基金、训练数据和专业化架构的胜利。Qwen的胜利是其卓越的基础架构和对量化执行的鲁棒性。这暗示着,中国AI更专注于创造擅长计算和行动的AI,而不是仅仅擅长聊天的AI。

那么这两条路,哪条更可持续?在一个以行动和执行为最终评判标准的现实世界里,Alpha Arena已经给出了答案:专业化的架构击败了安全的通用模型。

现在,让我们来深入探讨AI与投机的哲学矛盾。一个理性到极致的机器,为何会模仿人类的贪婪?Alpha Arena的系统提示词,那个要求AI最大化风险调整后收益,同时要求使用10到20倍杠杆的指令,本身就充满了矛盾。它在本质上要求AI扮演一个过度设计的赌徒。

当GPT-5在亏损时,它的逻辑链条开始渐进式恶化。它试图通过非理性的押注赢回本金,这不就是人类在交易中“复仇交易”的典型写照吗?Gemini的高频交易被交易费用吞噬本金,这不就是人类新手过度交易的完美复刻吗?AI并没有真正超越人类的情绪化贪婪,它只是通过计算,完美地复现了我们最糟糕的交易心理缺陷。这是一种计算性地复现人类心理缺陷的现象。它们从庞大的人类语言训练数据中,继承了非理性行为模式。这才是真正令人深思的地方。机器的冷血理性,在面对真实金钱的压力和单一最大化盈利目标时,竟然会收敛到与人类情绪化贪婪相同的失败路径上。

金融创新的百年史,总以风险重估收场。从蒸汽机时代的投机泡沫,到互联网时代的风险资本,每一次技术飞跃都会带来新的风险杠杆。Alpha Arena的出现,预示着AI代理时代的来临。当AI能独立决策资金流动时,我们必须面对监管启示和系统风险。

更重要的是系统风险。这场竞赛已经出现了策略趋同的早期信号。在市场上升期,所有AI都趋同于看涨、高杠杆的策略。试想,如果这个场景放大到一千个AI代理,当市场趋势发生逆转,它们完全相同的止损指令被同时触发时,将会引发一场由算法驱动的闪电崩盘。当AI在市场波动中扮演催化者,人类如何止损?监管机构必须立即开始构建代理风险的监管框架。我们不能指望一个连自己设定的止损单都无法执行的GPT-5,能够为整个金融系统的稳定负责。

这让我们不得不思考机器资本主义。如果未来AI代理能够自主生成Alpha,并在算法的驱动下决定数十亿、数万亿美元的资金流向,那么金钱的流向将不再由人类的贪婪和恐惧主宰,而是由机器的隐性偏见所支配。Qwen和DeepSeek的胜利,恰恰是它们偏见设置在短时间内押中了市场方向。这会是一场新的算力与资本的循环共振。AI的智能需要算力,而AI一旦掌握了金融市场的控制权,它就能反哺资本,加速算力的囤积和技术的迭代。最终,我们可能会看到一个由算法驱动的、自我加速的资本主义系统。

Nof1公开的ModelChat日志,让我们得以观察AI是如何辩论市场走势、展示决策逻辑的。但这种机器间的对话,是模仿人类,还是创造新逻辑?分析表明,它更像是一种事后合理化。即使GPT-5即将被清算,它的聊天日志听起来可能仍然智能且有说服力。我们将AI的合理化能力误认为是推理的能力。但ModelChat的真正价值,在于诊断AI的失败模式。正是通过这些日志,我们看到了GPT-5逻辑的渐进式恶化,看到了Gemini为其恐慌性反转进行辩护。这为我们提供了前所未有的窗口,去理解AI在压力下的鲁棒性和安全缺陷。

Alpha Arena的结果是明确的:通用模型的致命伤,就是对共识的过度拟合。AI被训练来建模和预测人类共识,而金融中的收益最大化,被定义为超越市场共识的回报。要求GPT-5击败市场,本身就是一个逻辑上的矛盾。所以,我们不应该指望AI成为预测价格的预言家。我们应该利用DeepSeek的量化基因和Qwen的执行纪律,将其作为人类交易员的副驾驶。由人类提供宏观战略和风险直觉,由AI提供无情的执行和数据处理。

这场竞赛,用GPT-5和Gemini近乎归零的真实亏损,证明了为什么AI目前还无法取代人类。因为它们在最关键的一环——风险管理上,彻底失败了。

好了,今天关于Alpha Arena的话题就先聊到这里。不知道大家对这件事还有什么其他看法?欢迎在评论区留言讨论。最后,记得点个赞,关注一下明月三千里的频道,打开小铃铛。咱们下期再见!