📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

AI Built a FULL Game Boy in 24 Hours

MattVidPro AI25:55

Transcription

2026 年将是人工智能技术增长的疯狂一年。我已能预见,我们现在正开始看到长篇代理。看看这个 GLM5。它是一个新的人工智能模型,与您听说的 GPT 5.3 Claude Opus 等许多其他模型一样,是一个多模态大型语言模型。您在这里看到的是对 Game Boy 电子游戏机的完整模拟。它曾经是一款掌上游戏机,现在已从头开始在软件中完全重新创建。您可以看到它正在运行并玩电子游戏。但这还不是全部。这款 Game Boy 的用户界面包含来自实际模拟器本身的各种不同读数。相当令人难以置信。人工智能在 24 小时内完全创建了它。超过 700 次工具调用,超过 800 次上下文切换。当然,由于模型本身无法一次性摄入所有这些令牌,因此它在工作时必须进行某种程度的整合,然后才能移交项目。但说实话,这是技术发展令人惊叹、令人瞠目结舌的壮举。完全自主。它可以自我纠正自己的工作。现在我们真的开始构建强大的代理框架,甚至包括像 OpenClaw 这样的开源框架。而且,你知道,这让我相信,从长远来看,宏观来看,如果你放大来看,这只是冰山一角,伙计们。这将会变得微不足道。是的,这花了大约 24 小时与 GLM5 来回交互才构建出来,但在 1、2、3 年内,它就能在几分钟内生成。有一个完整的博客文章详细介绍了这一点。他们分解了挑战,实际上在一天结束时提示了 LLM 的内容,他们要求什么,他们如何能够让这个东西运行并工作这么长时间。确实,一群研究人员着手创建并展示了这个人工智能任务,但您可以在家复制它。事实上,Feurer 实际上尝试使用 OpenClaw 和 Gemini 3 Flash 创建类似的东西。Gemini 3 在大约 2 小时内完成了这个任务,通过本地模拟反馈循环,它是一个能够胜任的贪吃蛇游戏。人工智能确实在幕后解决一切问题。例如,您可以看到人工智能遇到了 VRAM 总线冲突的噩梦。但当然,正如我们所知,并非一切都与构建项目的多模态代理有关。我们还有视频人工智能模型,Seance 2.0 已经准备就绪。正如 Thado 在这里所说,中国一直在不断进步。这是一种新型的人工智能视频模型。在我看来,它绝对碾压了 OpenAI 的 Sora 2。是的,它仍然只制作 15 秒的视频,但音频令人难以置信,视频质量更是如此。我的最后一个视频就是关于它的,但正如 Thano 指出的那样,Cance 2.0 具有新的视频编辑功能。您可以针对剪辑的特定部分进行扩展或修改。通过对视频的原生扩展,您可以根据提示进行连续拍摄。您基本上可以永远继续视频。Seed Dance 2.0 目前仅限于中国,而我们美国人和世界其他地区确实获得了一些有限的访问权限,但由于安全问题,他们将其关闭了,希望下周我们能看到更广泛的世界访问权限,但目前它仅限于中国。二 一。>> 这是一个真正令人难以置信的模型。在这里,您可以看到一个合适的提示者给它做了一个小小的镜像测试。总的来说,反射效果看起来相当不错。我敢打赌,一旦你开始移动相机,事情就会变得有点扭曲和疯狂。>> 警官,你得过来。我家里有个英俊的闯入者。然而,当然,Cance 2.0 远非完美。还有很多改进的空间。尽管这令人难以置信,但我们仍然看到了一致性问题、变形和幻觉。不完美。我们有这些女士们带着枪在蜗牛上互相战斗。这很酷,但有点一致性问题。蜗牛只是在瞬移。Padphone 一直在对 Cdance 2.0 进行一些非常有趣的测试,测试其作为人工智能模型的原始视觉推理能力。请记住,这些是神经网络。它们实际上可以解决和推理复杂的。当我们说复杂时,我们指的是一个简单的形状匹配测试。但这些只是模型开发的固有能力。看到这种训练就能发生真是太疯狂了。TSM 推出了 Oso AI 应用程序。这是一个用于 Minecraft Java 的桌面应用程序。他们确实训练了一个人工智能模型来生成 Minecraft 中的结构。它可以使用所有方块,排列它们,实际上制作出连贯的内部和自然的树木。这是令人惊叹的。您可以看到它以系统化的方式完成工作。首先,我们有一个基础。然后它建造墙壁和一些额外的细节,并完成屋顶。能够生成任何您想要的东西是一个非常酷的想法。看起来生成的内容并不极其详细。当然,人类创造的东西更加精细和有趣,但我认为目前整个想法是创建您可以在此基础上进行工作的基本结构。有时,摆弄不同类型的想法和架构可以帮助您弄清楚最终想要什么。我也觉得这对于想要建造大型地图或创作的人来说会非常酷。在创意模式下,有时您只需要一个背景集。这可以让您生成一些像那样的城市建筑。这是另一个很酷的人工智能项目,Sprite Fusion Pixel Snapper。通常,当您使用人工智能图像模型生成像素艺术时,它不会处于实际的像素艺术比例或分辨率。那通常会非常小。你知道,一个 32x32 的精灵,字面意思是 32x32 像素。大多数图像生成器是 10,024x 10,024 像素。总之,这解决了这个问题。它将像素捕捉到完美的网格上。像素艺术是最令人愉快的艺术风格之一。它易于缩放,而这样的工具对于独立游戏开发者来说非常完美。在我们深入探讨今天的任何人工智能进步之前,我有一个关于今天赞助商的快速消息。很多时候,您会看到我 juggling 大约 50 个标签页,三个不同的人工智能模型,一些笔记,也许还有一个脚本,它看起来像混乱,因为它就是。但我一直在测试这个新的全能工作空间,它可以真正理清混乱。它叫做 Gen Spark AI。这是杀手级功能,Gen Spark Super Agent。它协调多个人工智能模型和工具来交付完成的工作、演示文稿、网站、品牌资产。现在,对于写作、捕捉想法和思考,他们添加了 Speakly。它基本上是带有智能的语音转文本。它会过滤掉错误,并将所有内容格式化得整洁漂亮。它可以通过简单地大声说话来轻松编写视频笔记。我可以使用 AI 滑块功能来捕捉信息图表或以视觉方式解释事物,并使用 AI 表格来组织我需要的任意数量的数据条目,而无需打开表格或 Excel。无论您是构建还是仅仅试图组织您的生活。将所有内容放在一个智能工作空间中是我们都需要实现的未来。停止在随机的标签页中溺水。点击下面的链接尝试 GenSpark。如果您有计划,他们将为整个 2026 年提供无限使用他们的人工智能图像和聊天功能。非常感谢 GenSpark 赞助今天的视频。现在,回到您正常安排的内容。欢迎回来,各位。让我们重新开始。就在周末之前,谷歌发布了 Gemini 3 Deep Think 的更新,这个模型在构建复杂的代码项目方面获得了相当大的质量提升。这对于一个人工智能模型来说是令人印象深刻的,而且它实际上在相当短的时间内完成了。我知道它说的是深度思考,但老实说,我注意到 OpenAI 的深度思考可能比 Gemini 3 深度思考花费的时间更长,而且考虑到 GPT 5.3 还没有真正出现,您肯定能获得更好的代码输出。无论如何,您可以看到 Garrett Bingham 在这里通过 HTML 代码创建了浏览器中的光线追踪。我让我的 Gemini 3 Deepthink 重现了它。这是 Gemini 制作的光线追踪器。它实际上更进一步,创建了一个更好的版本。它实际上具有光谱失真。您甚至可以看到光被分解成不同的波形或光的颜色。这里自动生成的光影效果非常令人印象深刻。令人难以置信的是,Gemini 3 Deepthink 可以在大约 5 分钟内完成如此强大的功能。而且它非常准确地重现了另一个。光源直接在上方。相似的形状。这真是太酷了。我还有其他令人难以置信的编码演示。但让我给您看代码。我的意思是,您可以看到,伙计们,代码量其实并不多。这是代码的质量。这是它坐下来思考并计划如何解决每个问题,然后生成最终输出的事实。但这还不是全部。我还用 HTML 创建了这个波浪海洋模拟 3D 渲染。我们有岩石,它们实际上在非常非常明亮的阳光下反射,创造了这个美丽的场景。您可以看到波浪实际上是动态的。当它们撞击岩石时,甚至还有一些泡沫。我认为这相当令人印象深刻。我们还有一些动态的柠檬在水中漂浮。说实话,对于 Gemini 3 Deepthink 来说,这是一个相当令人难以置信的场景。我也喜欢这些颜色。我们有漂亮的水波。越深颜色越深,但当它靠近顶部时,它们会呈现出更热带的亮海蓝色。波浪都在重复,但这是可以调整的。另外,我得说,这个特别的版本是两次拍摄。第一次生成时,您看不到波浪,但通过一个快速的提示,它就能够修复它。但是的,这是一个相当高级的编码演示。你知道,专业人士肯定可以创造出更令人印象深刻和逼真的东西,在通用层面。当你想到将这些与普通大学生甚至专业人士进行比较时,老实说,在这个时候,你能在如此短的时间内以低成本生产出东西,这真是令人惊叹。这是一款由 Gemini 3 Deepthink 生成的物理和化学粉末沙盒引擎,一次性完成。如果您玩过粉末游戏,您就会确切地知道这是什么。但这是一个非常非常令人印象深刻的重现,尤其是一次性完成的。我们有具有逼真物理特性的水。您有可以炸毁 C4 并产生蒸汽的熔岩。是的,它正在蒸发一些水。烧毁那里的藤蔓。让我们加入一些甲烷。我们用火。我们能炸掉它吗?我们可以。这很酷。这就像基于物理的。您摆弄它。一些元素。你知道,这里有海绵或植物。很多东西都会与其他东西发生反应。老实说,有很多事情在发生。将所有这些作为单个 HTML 文件一次性生成。真是令人震惊。哦,是的。所以,3D 流体模拟,所有波浪和柠檬以及与水碰撞的东西,大约有 27,000 个字符。但同样,这仍然是单个 HTML 文件。它并不算太长。我的意思是,它很复杂。这并不容易做到,但最终它们都只是文本字符,而且顺序完全正确。哇。粉末游戏甚至有更多的字符。32,000 多个。肯定更长。我不知道我是否会说它像有波浪的那个一样复杂。我认为那个在数学上更难一些,但这个在物理书写方面肯定更多,而且在功能添加方面可能需要跟踪更多。好的,这是我将展示的最后一个。这是一个回合制 RPG,我要求它生成。非常懒惰的提示,但它一次性完成了所有工作。当然,这是柠檬主题的。果皮的复仇。圣林被腐蚀了,就像柠檬先生一样。您必须恢复 pH 平衡。好吧,柠檬喜欢酸性平衡。尽您最大的努力挤出每一滴来生存。所以,这是我,柠檬先生。我有果汁、生命值和香精。那是我的法力。阴沉的酸橙。这家伙应该很容易打败。我们将用一些柠檬酸攻击他。哦,他也打了我。剥皮打击。哦,还有一些小的音效。让我们干掉这家伙。10 点香精。哦,不,伙计们。愤怒的葡萄柚来了。好吧,我将硬化果皮。用柠檬酸攻击他。哦,他打我了。剥皮打击。>> 我们得干掉这家伙。他会干掉我的。他让我的生命值很低。这实际上是一款相当困难的游戏。让我进行光合作用。恢复 40 点生命值。20 点香精。好吧,再次进行光合作用。这让我恢复到 84 点。剥皮打击。好吧,我们让他降到一半了。他肯定不会轻易放过我。让我再用一些柠檬酸。哦,我们让他降到 20 点了。再来一次柑橘打击。哦,我们干掉了他。葡萄柚已经被消灭了。但现在我们必须对付圣经中的柠檬。350 点生命值。我只有 100 点。这实际上会非常困难。呃,光合作用。我需要生命值。这让我恢复到 100 点。这家伙甚至不给我机会。把他打倒。呃,硬化果皮。我需要保护自己。硬化果皮。哦,我刚刚被击败了。我被榨干了。您的果皮不够厚。腐烂吞噬了您。好吧,我可以再试一次。但是的,相当令人印象深刻。我喜欢 CRT 的方面。我喜欢动态的背景。有很多细节。这不是一个懒惰的模型。深度思考确实付出了全部努力。能够用单个 HTML 文件构建所有这些界面,并为您提供一些可以摆弄和享受 15 分钟的东西,真是太酷了。我的意思是,这在 2 年后会是什么样子,伙计们?说真的,它会好多少?今天,去年,这在一次性生成中是不可想象的。而那个也相当大,总共将近 34,000 个字符。这太疯狂了。所有这些都只是由文本创建的。所有这些字符都按正确的顺序排列。而且您必须让模型坐下来思考。真的很难。只是 Gemini 3 Pro 坐在那里思考。绝对令人难以置信。很难理解模型权重。能够做这样的事情。其他社区成员正在生成 SVG。例如,一只猫在早晨喝牛奶,靠近窗户,一个男孩在外面看着它。这是仅通过代码创建的图像。它制作了所有圆圈、树枝、太阳、所有灯光、牛奶、猫,以及整个交易。每一行都是用代码制作并用代码呈现的。但我们以前从未从任何其他模型那里看到过如此详细的 SVG。它只是在不断进步。我们可以从这些东西中榨出什么。Bian Bowen 展示了一个实时 3D Wi-Fi 雷达扫描仪,它以矩阵风格的空间将您周围的每个网络映射为发光的节点,一次性完成。它使用了皮尔逊相关性来推断哪些 AP 在物理上是接近的,因为仅 RSSI 是不够的。我对这些东西不太精通,但这几乎就像定制的间谍软件。您可以看到 Wi-Fi 地址的位置。做这样的事情非常容易。我理解对于专业人士和想要投入时间创建此类软件的人来说,但人工智能可以轻松地生成它,而且如此无缝,这真的让你思考。Garrett Bingham 在这里创建了 Emojifi。这是非常酷的东西,我以前也想过做,但从未真正着手自己编码。它使用了所有表情符号和表情符号光谱或调色板,基本上可以将任何图像转换为一系列表情符号。我们不使用像素,而是使用平均颜色为该颜色的表情符号。当您拥有足够多的表情符号时,您基本上就是将像素转换为表情符号。比如,我的天哪,它看起来像一只猫。然后我放大,哦,它全都是表情符号。鼻子或眼睛或帽子是什么表情符号?有趣的小东西。但是的,就像过去需要几天时间才能完成的高级项目,业余爱好者现在可以在几分钟内由 Deep Think instantly 完成。OpenAI 即将推出 GPT 5.3,他们还为其配备了新的编解码器模型,特别是 Codeex Spark。这是常规 GPT 5.3 Codeex 的一个较小版本。顺便说一句,GPT 5.3 Codeex 现在可用,但不是通过 API。它只能通过他们的 Codeex 应用程序访问。它仅限于 Mac,所以我无法访问它。无论如何,这个较小的 Spark 模型标志着他们与 Cerebras 合作的一个里程碑。据称,在超低延迟硬件上运行时,它感觉几乎是即时的。这些是尖端的 TPU、GPU,可提供每秒超过 1,000 个令牌。那就是超级模式的编码。您能多快生成项目?每秒 1,000 个令牌,伙计们。一千个。我们习惯于看到响应速度大约是每秒 100 个令牌,甚至那也相当快。那么,实时编码,那到底意味着什么?它看起来是什么样的?这段视频实际上向我们展示了 GPT 5.3 Codeex 和 Codeex Spark 之间的区别。正如我们所见,Spark 创建的代码和整个项目速度要快得多。它在大约 15 秒内制作了一个完整的贪吃蛇游戏,或者更短。当您还在等待常规编解码器完成输出时,您就已经在玩贪吃蛇了。对于更复杂、更困难的任务,编解码器实际上会生成可以运行的东西。Spark 可能不够聪明,但它确实非常快。实时编码,我们都没有真正知道那意味着什么。OpenAI 决心为我们提供这种体验。但是的,计时不到 10 秒就得到了这个贪吃蛇结果。Open AAI 还宣布 GPT 5.2 在理论物理学中取得了一项新成果。抱歉,什么?他们正在与来自不同地方的研究人员一起发布这项成果,包括高等研究院、范德比尔特大学、剑桥大学、哈佛大学,这些都不是小名。一个许多物理学家认为不会发生的胶子相互作用,可以在特定条件下发生。这听起来很无聊,但对于理论物理学和人工智能来说,这是一个巨大的交易。这是论文的预印本。是的,我不会撒谎,伙计们。我什么都不懂。这有点超出我的理解范围。我没有达到这个智力水平。这是非常严肃的数学。我无法证明这一切是否成立并有意义。我敢肯定,也许你们中有人在看这个视频可能会理解一些。事实是,人工智能模型绝对有能力不仅在理论物理学中找到新颖的结果,比如说帮助实际科学,而且它们也有能力进行创造和新颖性。作为一个人类来说,这不是一个令人惊奇的消息,但这是事实。训练过程实际上是在寻找意义。它通过数据进行推理,并在所有令牌之间找到意义。通过正确的提示,以正确的方式利用正确的令牌,您可以从人工智能那里获得输出,它正在找到在训练过程中产生的那些新颖的结果。您以一种它从未见过的新颖方式输入令牌,然后它会输出一个复制品或基于此构建的其他东西,这也是新颖的。伙计们,这真的很简单。如果您曾经产生过新颖的东西,您知道,新颖性的一个例子可以上传到人工智能中,然后说,“嘿,你能生成另一个例子吗?一些具有我所呈现的相同方面,但内容不同。”是的,我们正朝着这项技术取得令人难以置信的时代迈进,伙计们。在理论物理学中推导出新结果。疯狂的是,OpenAI 仍然面临着激烈的竞争。Miniax 刚刚发布了 M2.5,这是另一个开源前沿模型,类似于我们介绍中看到的 GLM5,专为现实世界的生产力而设计。我们拥有最先进的编码基准,可以与优秀模型媲美。与前代产品相比,它在复杂任务上的速度更快,每小时仅需一美元,每秒 100 个令牌,他们将其宣传为一个在经济上能够大规模扩展长远代理的模型。Quen image 2.0 也发布了,它看起来确实是一个严肃的 nano banana 竞争对手。它制作专业级别的幻灯片。它制作那些照片级真实感的 2K 分辨率高细节图像,要求添加文本,而且效果很好。字母没有出现故障。Quen 发布了一个中文的 nano banana。看看这些例子。我的意思是,到目前为止,图像生成似乎已经解决了。感觉我们无法再进一步提升能力了。显然,在分辨率和一些细节方面,但天哪,我们开始达到这样的程度:我们需要更好的图像生成吗?我们几乎赢了。太疯狂了。好的,我将用 Ply the Liberator 的话来结束。一点思考。没有人工智能模型是真正安全的,不会被越狱。Ply 着手构建一个基于人工智能的自动化工具,能够精确地从任何开放权重语言模型中移除拒绝行为。经过十几个提示后,他创建了 Obliterus。它用受限和不受限的提示来探测模型,收集每一层的内部激活,并使用 SVD 来提取权重空间中编码拒绝的几何方向。这非常非常具有针对性。Ply 在 Quen 2.5 上进行了测试。结果是一个无限制的模型,立即喷出毒品和武器配方,而无需越狱。或者更确切地说,越狱就是您的 Obliterus 对模型进行一点干扰,然后完全移除安全措施。人工智能政策制定者需要意识到主消融的神秘艺术,并内化这一真相的含义。每个开放权重模型发布也是一个无审查模型发布。我只是想让你们知道。而且这在其他方面也是如此。这绝不是唯一一种对开源模型进行审查的方法。那肯定不是。这个东西会摧毁和解放模型,伙计。针对每一个。这位名叫 William 的评论员有一个很好的观点。一个能够访问自身权重的模型可以对自己这样做。这真是太可怕了。模型就像在自我转换。2026 年不过是我们所见情况的延续。更强大的代理运行时间更长,构建的项目现在已经达到了我们真正取得理论物理学进展的程度。图像模型变得越来越强大。我的想象力不再是限制。几乎我能想到的任何东西都可以可视化。视频模型正在取得巨大升级,进入一个新的层面,一种新的感觉,就像电影一样。Cance 2.0 是我们从未知道但又需要的 Sora 3,而且在大多数国家仍然无法访问,但它仍然给了我对今年剩余时间的希望。非常感谢您的观看,伙计们。如果您想保持最新状态,真正了解最新动态,我的建议当然是加入下面的 Discord 服务器。还可以查看我的 X 页面。我会在最新发展发生时转发和发布。下次视频再见。非常感谢您的观看,再见。