Transcription
AI 正在以一种特殊的方式改变人们的生活,欢迎收听探索这些方式的播客《普通人》。我是主持人,也是一名 YouTuber 和普通的创业者。今天,我们邀请到了 쓸모랩 的代表林根锡先生。他早在 AI 浪潮来临之前就开始了 NLP 研究,目前正在广告、贸易、人力资源、时尚、房地产等多个行业构建 AI 代理系统。非常感谢您能来,能否请您先做个简单的自我介绍,并介绍一下您目前正在做的工作?
是的,您好。我目前是 쓸모랩 的代表林根锡,主要为企业提供 AI 引入咨询和自动化系统开发服务。很高兴见到您。
今天是 10 月 7 日。10 月 6 日是中秋节正日,10 月 7 日也是中秋假期。我趁着中秋假期短暂地回了趟釜山。正好借此机会,我一直保持联系的、网名叫“Neuru”的林根锡先生,我一直很想邀请他来我的播客,所以就提出了请求。这次回釜山正好能见到您,我感到非常荣幸。今天能在这么好的地方和您交流,我感到非常高兴。我们准备这个播客的时候,今天 OpenAI 公布了 Agent Builder。这在开发者和非开发者之间引起了巨大的轰动。稍后,我们可以简单聊聊这部分。
我和 Neuru 先生开始联系的契机是,我们经常就 n8n 的相关话题进行交流,我曾多次向他请教。他是一位非常有能力的开发者,并且在做很多事情,所以我一直关注着他的工作。能否请您简单介绍一下您之前做过哪些工作?
我最近参与的项目,如果从最近的开始说起,大概是在 9 月份,我参与了广告行业首个广告 AI 代理系统的构建项目。目前我正在参与的项目是,基于数据进行设计思维,提供数据分析洞察的代理系统和代理平台开发。除此之外,我还积极地在贸易、人力资源、时尚、房地产等多个不重叠的行业领域推动 AI 系统的引入,并为此努力开发。
那么,对于企业来说,当提到“代理”时,他们追求的方向肯定是非常不同的,对吧?能否请您谈谈在构建开发者和企业都期望的代理时,需要付出哪些努力?
我之前的工作方式,可以说更接近于技术销售。而技术销售的方式,我认为与现在并没有太大区别。我仍然沿用我过去的技术销售方式。但有一个不同之处在于,现在有了 AI,特别是有了低代码(low-code)/无代码(no-code)工具。在与客户 상담 的过程中,我可以使用领域术语,尽可能地开发出客户想要的东西,并在客户面前进行低代码/无代码演示,然后问客户:“您想要的效果是这样的吗?”通过这种实时沟通,我能够快速吸收领域知识,并迅速与客户建立沟通。我认为这是我过去开发与现在开发最大的区别。因为当客户能看到视觉化的内容时,对话会更加顺畅。过去,要实现这样的设计,需要重新进行策划,重新进行设计,在开发之前需要经历这两个阶段,然后再次拜访客户进行说服。而现在,通过使用低代码/无代码工具,我可以在客户面前直接展示,并具体规划日程和开发进度。我认为这是最大的不同之处。
正如您所说,过去要完成一个产品需要很长时间,而现在通过低代码/无代码,可以在很短的时间内交付一个简单的 MVP(最小可行产品),这大大缩短了与客户沟通的许多环节。过去,客户想要的东西非常广泛,开发者也很难理解。开发者大概理解后,会问:“您是想做这个吗?”然后快速利用低代码/无代码工具制作 MVP,从而缩小客户的需求范围。与过去相比,客户满意度更高,开发者的工作速度也大大加快了。
是的。过去我们称之为“Design Prototyping”,即设计然后沟通。现在这个词已经演变为“Rapid Prototyping”。通过这种快速原型开发,我们可以极大地压缩与客户的沟通时间。之后,开发过程本身并没有太大变化,但在中间设计师与开发者、策划与设计师之间的沟通过程中,如果利用 AI 的其他工具,而不仅仅是低代码/无代码,那么他们之间的协作效率会大大提高,沟通成本也会大大降低。这使得整个软件开发时间缩短。
现在,由于低代码/无代码工具非常热门,很多人都对此很感兴趣。在 AI 时代,那些想成为开发者的人应该如何准备呢?这感觉非常模糊。我是否应该先学习编程?学习 Python?还是 C 语言?这范围太广了。在如今这个可以通过自然语言进行开发的时代,其中肯定存在漏洞和明显的局限性。对于那些想在快速变化的 AI 时代成为开发者的人,您有什么准备建议吗?另外,能否也谈谈传统的开发方式与现在开发方式的变化?
我不知道我是否有资格谈论这些,但我认为作为一名新入行的开发者,需要具备的与当前趋势相符的能力,我认为有一点。这不仅适用于新入行的开发者,也适用于那些没有积极使用 AI 的在职开发者。回顾过去,以 ChatGPT 的出现为开端,过去编写代码需要大量的计算机科学知识,甚至需要计算机科学专业的背景。虽然现在仍然如此,但即使是制作一个非常小的功能,也不一定需要完全理解那些细节和深入的知识。然而,在大多数企业中,开发团队是分工的,并且有领域知识专家团队。开发者经常被要求开发一些小功能,但他们看起来很忙,如果你去打扰他们,他们可能会说:“我现在很忙,晚点再说。”这种情况经常发生,导致你不好意思去约会议,错失了很多机会。过去,领域专家(比如市场营销团队、销售团队、甚至财务团队,以及企业中除了开发团队之外的所有部门)想要开发一个小功能,需要花费大量时间,甚至可能破坏团队的和谐。自从 ChatGPT 出现以来,领域专家只需要学习一点点编程知识,大概了解代码是如何工作的,然后通过 ChatGPT 询问“我想做这个功能”,并用低代码/无代码的方式制作一个功能,然后逐步改进,最终完成一个程序。现在这种情况已经非常普遍了。我想,您作为一名普通的创业者,能够进行编程,也是基于类似的逻辑。
事实上,如果您要求我开发一个非常复杂的系统,那将非常困难。但大多数人想要的只是收集 Naver 博客文章,或者在 Coupang 等平台通过关键词搜索并收集内容。这些很多都是爬虫工作。过去,这需要专门的开发者来设计复杂的系统,但现在,即使是开发小型功能的人也可以做到。ChatGPT 的出现和低代码/无代码的流行,使得这些开发者的生存空间受到挤压。但另一方面,如果你能自己开发这些小功能,这对领域专家来说将非常有帮助。
那么,对于新入行的开发者和尚未广泛应用 AI 的开发者,在 AI 时代应该如何准备呢?简单的功能开发,现在领域专家通过学习一点点代码阅读,也能很快跟上。因此,与其开发单个简单功能,不如学习设计整个系统的架构。系统架构的设计,从小处说,包括如何组织文件夹结构,如何创建文件夹树,如何命名文件,以及在其中放入什么代码。这些都是架构的一部分。我认为学习设计系统架构是 AI 时代开发者生存的方法。对于新入行的开发者来说,与其开发一个执行简单功能的页面或应用程序,不如开发易于维护的代码,这在未来将变得更加重要。
接下来,我想问您一个问题。您刚才提到,在 AI 浪潮来临之前就开始了 NLP 研究。您是什么时候开始研究 NLP 的?当时,现在 AI 如此受关注,很多人都想学习这个领域。但在 AI 成为热潮之前,您是如何决定学习这个领域的?您当时是如何预测未来的?
事实上,在 ChatGPT 出现之前的 2021 年,我就开始研究了。ChatGPT 可以说是自然语言处理技术和人工智能技术的结合体。其中,我更专注于自然语言处理部分。我学习这些技术,与其说是出于个人意愿,不如说是公司项目需要。但在学习过程中,我发现自己想在公司学习之外,更深入地学习一些技术,于是我开始寻找参与开源项目的机会。大约在 2021 年底,Stability AI(开发 Stable Diffusion 的公司)旗下的非营利 AI 研究机构 Eleuther AI,有一个开发语言模型的项目。当时,现在在 Kakao 负责视觉模型的研究员也和我一起参与了这个项目。他建议我们可以一起合作,于是我就加入了。我负责数据收集部分,他负责模型开发和训练的领导工作。
那次经历让我学习到了如何在拥有数千台 H100 或 A100 的 GPU 云环境中进行训练、数据收集和数据清洗。虽然我没有完全学会,但通过查看各种命令,以及观察研究人员如何交流和讨论,我逐渐理解了领域术语。当时,很多词汇对我来说都很陌生。我非常想理解它们,所以花了很多时间学习。当时我遇到的最难的词是“In-Context Learning”。这现在与 Context Engineering 类似,但当时我甚至不清楚这是一种学习方式还是提示工程。我第一次接触到这些词汇,是在 2021 年。由于接触了许多陌生的词汇,现在对我来说,它们已经变得非常熟悉了。因此,现在出现的新词汇对我来说并不算新,我能理解为“哦,当时说的就是现在这种情况”。
我想补充一点,如果你不理解内容,只是先接触词汇,最终你会因为词汇的熟悉而自然地理解“这个词就是那个意思”。因此,我认为接触词汇非常重要。所以,即使你没有赶上 AI 时代的浪潮,通过先听到这些词汇,并经常听到它们,即使一开始不理解,但最终会在你的脑海中形成一定的概念,并理解“那个就是那个”。与从未听过的人相比,那些听过一次的人将有更多的机会吸收知识。所以我认为现在还不算晚。我强烈建议您越早接触 AI 的学习或知识越好。
非常感谢您的分享。您在我们的社区,以及我所在的 n8n Korea 社区都很活跃,还运营着自己的社区。稍后可以谈谈这方面。首先,我之所以和林根锡先生聊得很多,是因为您在社区里分享了很多有用的信息,而且您作为一名开发者,却能用非开发者也能理解的方式进行解释,这让我印象深刻。我想,这可能是因为您一直在关注 AI 的趋势,并在研究过程中获得了比别人更多的知识。既然谈到了社区,能否请您介绍一下您活跃的社区,以及在这些社区里您做了哪些事情,这样观众就能更好地了解您了。
我从 2022 年至今,一直坚持参与一个名为“모각코”(一起学习编程)的开发者社群活动,已经坚持了 2-3 年。这种活动在釜山已经持续了大约三年,我们致力于推广一种名为“釜山 IT 모각코”的开发者文化,并分享和维护这种 IT 文化。这个社群活动吸引了各种各样的人。虽然可以称之为开发者文化,但我通常将其视为 IT 从业者的文化。在开发者文化中,最著名的是“开源”文化。开源活动的核心是公开自己编写的代码或项目代码,从而传播其价值。你可能会想,“我辛苦写出来的代码,为什么要分享呢?”但实际上,这可以体现开发者对自己代码的自信。而且,程序只有被更多人使用,其价值才会更大,影响也越大,所以这其中也包含一种责任感。这些就是我们一直以来所维护的开发文化。我将这些作为我的基本哲学,在各种公开的 KakaoTalk 群组中活跃,包括 LLM RAG 社区,以及您(普通创业者)的 YouTube 频道订阅者所在的频道。我尽力分享我所知道的知识,并用最简单的语言进行解释和传递。
关于 모각코,如果您能分享链接就太好了。您刚才提到,现在加入的开放聊天群组里有多少人?我刚加入时大概不到 90 人,但经过一两年,现在已经有大约 730 人了。我敢说,这是釜山最大的社区之一。
我听说你们还在继续进行线下聚会。
是的。事实上,“모각코”这个词并不是我们创造的,它源于“一起聚集,各自编程”的聚会。一开始,我看到“모각코”这个词,将其解读为“聚集在一起,认真编程”,并以此激励自己。但后来发现,它的意思是“聚集在一起,各自编程”。我们每周六、周日都会举行这样的活动。大多数参与者是上班族,还有一些正在学习的学生或求职者。他们每周都会聚集在一起编程,分享他们正在学习的内容,或者遇到的困难。因为有经验超过 10 年、20 年的资深开发者也会来,他们也在不断学习,并将自己的知识传授给他人。这样就形成了一个良性循环,前辈们不断地提携后辈,而前辈们也能从新朋友那里获得新的想法。这种良性循环的文化已经持续了三年。
现在,我们过去是在咖啡馆聚会,但随着人数的增加,我们觉得应该举办自己的活动,创造一个属于我们自己的舒适空间。因此,今年 2 月,我们在釜山一条非常热闹的街道上开设了一个类似咖啡馆的空间,供开发者、设计师以及所有 IT 从业者舒适地前来。
我觉得这非常好。因为我学习了很长时间,独自学习时,有时会觉得“我是否走在正确的道路上?”因为一旦沉浸其中,视野可能会变得狭窄。我曾有过这样的经历,当看到别人如何思考和接触 AI 时,即使我们学习相同的工具,但每个人的需求都不同,使用方式也大相径庭。通过观察别人的使用方式,我能获得启发,思考“我是否可以从中获得一些灵感,并将其应用于我想要的方向,以获得更好的结果?”我深刻体会到,一起奔跑的聚会非常重要。特别是对于编程者来说,这真的很不一样。而且 AI 发展如此迅速,如果有一个可以共同分享并抓住机会的聚会,我觉得会非常有安全感。而且,这也不是短跑,我认为这是面向未来 10 年、20 年的商业模式,它将为未来的商业带来范式转变。从长远来看,要想跑得更远,找到能保持相同配速的人非常重要。
是的。就像配速员或同伴一样,可以互相鼓励。而且因为我们一起学习,所以背景知识也基本一致,这非常有帮助。
是的。所以,如果您对此感兴趣,我们会提供 모각코 的链接。另外,我和根锡先生的想法似乎很相似。在之前的预问卷中,您提到希望在釜山能为这个领域的发展做出贡献,并希望成为一名这样的开发者。我完全相信这是可能的。虽然我在首尔的影响力可能还不够大,但首尔是一个聚集几百人的地方。去年年底,我们举办了一个脱口秀音乐会,大约有 100 人参加。首尔在聚集人群方面非常自由,聚会也很多。因此,这种氛围很自然。釜山也应该形成这种氛围,让开发者能够分享和交流。甚至可以与首尔联合举办活动,有时在釜山举办,有时在首尔举办,进行交流,共同抓住 AI 时代的机遇。我一直在思考,我们是否可以创建一个这样的开发者和非开发者聚会。
为了实现这一点,我认为首尔有其独特的特色,釜山也有其独特的特色。最近,我还与“济州岛 AI 俱乐部”合作运营了一个社区。最初只有 4 个人,现在已经有大约 140 人了。我认为,无论地区或地点如何,每个地区都有其独特的特色。而特色,最终我认为 AI 在影响个人生活之前,对产业影响最大。每个地区都有不同的产业,如果能根据这些产业来特化和发展 AI 技术,那么我们的国家虽然小,但每个地区都有其特色,技术也可以根据这些特色来发展。
另外,我们刚才简单介绍了一下,您也积极参与了 n8n Korea 社区。能否也简单介绍一下 n8n Korea 社区,以及您对 n8n 这个工具的喜爱。如果您最近有任何更新,能否介绍一下?以及您用 n8n 进行过哪些项目?
在 n8n Korea,我算是比较晚接触 n8n 的。但晚接触并不意味着落后。我认为 n8n 对非开发者来说更具吸引力。原因在于,它看起来非常简单。从外观上看,代码就像外星语,而且不是韩语,全是英文,很难理解。但 n8n 这样的工作流自动化工具的特点是,它能直观地表达其功能。因此,非开发者很容易被吸引。我之所以主要使用它,是因为我认为它对非开发者具有吸引力。因为,正如我一开始所说,技术销售中最重要的是吸收客户的需求。在这个过程中,如果我用代码来解释我要做什么程序,无论解释多少次,对客户来说都没有意义。但 n8n 以可视化的节点形式呈现,即使不完全理解具体功能,但通过大致的说明和图标,客户也能轻松理解。这也是我非常喜欢 n8n 的原因之一,即使是我开发的非常复杂的系统,非开发者也能理解其工作原理。
此外,我喜欢 n8n 的另一个原因是,如果 n8n 提供的功能不足,我具备开发能力,可以通过额外的开发来弥补不足之处。因此,它既有通用的、易于使用的 UI,又能在复杂或困难的情况下进行额外开发。这两点结合起来,我认为 n8n 有很多优点。此外,还有 Make、Zapier、以及 Make 等其他框架。它们各有特色,但在通用性方面,我认为 n8n 最为强大。
随着 AI 的出现,企业和个人最关注的关键词无疑是“自动化”。其中,虽然有 Zapier 和 Make,但我也使用过 n8n。我曾经长期使用 Zapier,但当时国内社区非常缺乏,信息不足,我甚至不确定我是在自动化工作,还是在为自动化而工作。我曾经对自动化感到厌倦,但最近关于 n8n 的信息越来越多。正如您所说,很多开发者都在使用它,并且在开发者生态系统中,他们公开了很多关于构建工作流或自动化的方法。这使得构建我自己的自动化代理或工作流变得非常容易。而且,n8n 是免费的(当然也有付费版本),我可以在自己的服务器上本地运行,无需支付费用。由于它是本地运行,而不是基于云,所以速度也很快。这些都是我偏爱 n8n 的原因之一。
企业肯定也有这方面的需求。在构建自动化代理时,是否遇到过困难?大多数人认为自动化就是一切都一键完成。在这一点上,企业或个人对自动化代理、自动化工作流的看法与开发者构建这些工作流的看法之间,是否存在差异?
您刚才提到的,在使用 Zapier 时,您觉得自己是不是在为自动化而工作,这正是许多开发者看待 n8n 的方式。一些开发者认为,“我是否为了使用 n8n 而强迫自己使用本可以用代码完成的事情?”大多数开发者都有这种想法。而我则相反。虽然用代码可以更高效、更快地完成,但我认为,软件开发中最困难的部分是,一旦完成,如何进行维护。从这个角度来看,非开发者也能协同工作,我认为这是无代码自动化工作流技术的核心。因此,我首先认为,由开发者先设置好困难的部分,然后由领域专家参与功能的高级化,例如“我需要这个功能”,非开发者可以通过学习 n8n 来进行开发。我认为这是最理想的结构。
另外,关于 n8n,您也制作了 MCP(可能是指某个插件或工具),虽然还不是最终版本。能否简单介绍一下它的功能?我想从您这里得到一个承诺:最终版本何时才能实现自然语言操作 n8n?如果您能谈谈这一点,我相信观看此视频的观众会对此感兴趣。
事实上,我从 7 月份就开始讨论您刚才提到的 n8n 工作流 MCP,并已经编写了一部分代码。最近由于个人工作繁忙,优先级有所推迟,但核心想法是:n8n 的一个优点是,它将创建的工作流保存为 JSON 文件,可以备份和恢复。在这个过程中,账户信息会进行匿名化处理,隐藏我的账户信息,只共享核心逻辑部分。这是其最大的特点。因此,如果添加 MCP,就可以自动创建 n8n 工作流。这意味着,我们现在有很多可以编写代码的软件,例如 Cursor、CodiumAI、Codeium,以及其他 IDE 或终端工具。MCP 的最大特点是,可以连接一个独立的外部程序,让 AI 在编码时提供帮助。最终,编码就是创建文本文件。JSON 文件本质上是文本文件,而不是加密的、压缩的文件,而是我们可以直接看到的文本格式。n8n 是开源的,通过分析其源代码,我们可以发现其中的规则。我将这些规则融入代码中,逐行分析 JSON 文件中的项目,检查是否存在问题。如果存在问题,我会指出是哪一行、哪个部分出了问题,以及原因。这就是我正在开发的 n8n 工作流 MCP 的特点。
这样做是因为,当 AI 创建了 n8n 工作流后,我们需要运行它来验证是否能执行。通过使用 MCP,我们可以进行验证,并告知 AI “第几行出现了什么错误”。然后 MCP 会自动运行,验证文件,将错误部分传递给 AI,AI 看到后会修改代码,再次验证,检查错误。通过这个循环过程,最终会自然而然地生成我想要的代码。这就是我目前构思的 n8n 工作流 MCP。
我非常期待!我们从 7 月份就开始讨论了。您忙完之后,如果能继续开发,对很多非开发者来说会非常有帮助。许多人仍然觉得 n8n 很难。在美国,有很多相关的 SaaS 或第三方服务,但在韩国,由于对 n8n 的开发者工具的认知较强,很多人觉得它很难,而不是有趣。如果有人看到这个视频,并愿意一起努力,请在评论区留言。我们希望能邀请他们一起,直到我们都能愉快地自动化为止,共同构建 n8n MCP,并分享 n8n 的使用案例。
事实上,我曾想过是否已经出现了一个开源项目。但还没有一个真正符合概念的 MCP 出现。这让我觉得,如果我不自己动手,可能没有人会真正理解。同时,最近在其他韩国 YouTube 频道上看到类似的创意,我认为这种创意方法是合理且正确的。
如果关于这方面有任何更新,请在我的社区或您所在的社区分享。
我们继续聊 n8n。今天上午,我们简单提到了,但今天一整天都非常热闹。OpenAI 公布了 Agent Builder 系统。我最初认为这可以非常轻松地实现自动化工作流,但深入了解后,我发现对于非开发者来说可能有些困难。能否请您在使用后,从开发者的角度,用非开发者也能理解的方式解释一下这个系统?另外,您之前提到过,您正在使用 SDK,例如 CodiumAI,它以前的名字不同,但现在加上了 Agent SDK,用 CodiumAI 代码也可以构建代理。从自动化角度来看,这就像一个真正的人工智能助手。能否请您解释一下今天公开的 OpenAI Agent Builder?
首先,您无法在 ChatGPT 中使用它,但可以在 OpenAI 提供的 OpenAI 平台中单独使用。我原本的期望是,在 ChatGPT 中通过 Agent Builder 创建后,可以直接进行部署。但他们发布了一个基于 API 的平台,这有点令人失望。不过,我还是找到了一些有趣的东西,想向您展示一下如何创建它,以及 Agent Builder 的构成。
首先,进入 platform.openai.com,在左侧菜单中找到“Agents”选项卡。然后点击“Build Agents”,再点击“Agent Builder”选项卡。向下滚动一点,然后点击“Open Agent Builder”,就可以进入构建界面的页面。我这里已经创建了一个,所以这是未创建时的初始界面。上面有一个可以通过 ChatGPT 发送提示的界面,还有一个单独的 Agent Builder 界面。今天我想尝试创建一个搜索网红的 Agent Builder。
如果只创建一个可能有点不够,所以我想将我拥有的 n8n 进一步扩展和结合。在 n8n 中,也可以轻松创建 MCP 服务器。因此,我想结合 MCP 服务器、n8n 和 Agent Builder,创建一个新的应用程序。
首先,点击中间的“Create”按钮,就会出现一个界面。
这样,基本来说,
这里有一个 Start 节点,然后是一个 Agent 节点。虽然这里还有很多其他节点,但我打算只用这两个最简单的节点来构建一个 Agent。因此,我将尝试只用这两个节点来创建一个 Agent。首先,我将点击名为“Agent”的节点,将其激活并显示。然后,我将更改其名称,将其命名为“Influencer Search Agent”。关于指令,虽然最好填写,但为了快速构建,我将跳过它们,保留默认值。
接下来是模型。右侧是 GPT-5。尽管 GPT-5 的价格已经大幅降低,但它仍然相对昂贵。我发现,在我测试时,GPT-5 Nano 已经足够好地运行了,所以我会将其更改为 GPT-5 Nano。然后,有一个名为“Reasoning effort”的部分。这部分是关于 Agent 会思考多久,思考多长时间。我将将其更改为“Medium”。
然后,我打算在这里重新整理一下“Tools”。在“Tools”中有多种选择。我今天打算只简单地调用 MCP 服务器来使用。默认情况下,这里有一个由 OpenAI 自己创建的 MCP 服务器,以及由 OpenAI 的第三方合作伙伴创建和提供的 MCP 服务器。但是,我们打算创建并集成我们自己的 MCP 服务器。通过提供链接并为标签设置一个简短的名称,然后进行创建,我们就可以连接到我们自己的 MCP 服务器,并构建 Agent Builder。
因此,我将暂时切换到我自己的 n8n 服务器来继续。这是我的 n8n 服务器。在这里,我将创建一个新的工作流。然后,我将点击中间的空白节点,搜索“MCP”,并创建一个 MCP 服务器触发器。在此状态下,我不更改任何其他设置。对于身份验证,我将使用 API 进行身份验证。需要一个认证密钥才能访问此部分,但目前我将暂时跳过它。
然后,我打算点击下方的“Tools”边缘来添加。我打算在这里添加一个名为“Tavily”的工具,它擅长搜索。如果我简单介绍一下这个工具,那么是的,我在使用 n8n 时也了解到了 Tavily。说到搜索 API,我们以前经常使用 Surf API 等,但现在很多人使用 Tavily 的原因是什么呢?您也打算解释一下,我也很好奇。
关于 Tavily,我并不是从一开始就学会它的,而是因为我的许多客户都在使用它,所以我很好奇他们是如何使用的。我问他们是如何使用的。我认为最大的区别在于它还利用了 Instagram 的搜索功能。Instagram 的搜索功能实现起来非常麻烦,而这一点可以轻松实现,这可以说是最核心的优势。它提供了多种搜索方法。但与其他工具相比,在 n8n 中,它以 MCP 工具的形式出现,所以我不必担心如何搜索,这非常好。
此外,n8n 还提供了名为“Firecrawl”的爬虫 API。这些工具各有特点,因此最好根据各自的特点找到更适合自己的搜索引擎。然后,正如您所提到的 Surf API,它是一个统一了 Google 搜索引擎和其他类似搜索引擎 API 的搜索引擎 API。在这种情况下,使用 Google 搜索引擎的费用等支付方式可能比较复杂,因此简化支付部分是其主要区别。
Tavily 每月可以免费使用一千次操作,我认为这足以进行测试,所以使用 Tavily API 是非常有价值的。因此,我将连接这个。然后,我打算稍微更改一下工具描述。我打算更改为我想要的描述。这部分是告诉 GPT 创建的 Agent 在什么情况下最好调用此工具。在提供信息时,我建议尽可能使用英语。我用英语写道:“在搜索 Instagram 影响者时,请使用此工具。”但我希望搜索所有影响者,而不仅仅是 Instagram,所以我将这样修改。
然后,这里的“Resource”是指 n8n 提供的功能,每个功能都可以称为一个资源。在资源内部,还有一个名为“Operation”的独立子概念功能。如果您学习 n8n 课程,可以集中精力学习这部分。我将只说明有这些东西可以更改。
关于“Query”,这是 LLM 如何提问,即输入提示或搜索词的空间。在正常情况下,我们需要像输入动画一样手动输入关键词。如果输入关键词,那就不是 AI Agent 了。因此,如果按下右侧的按钮,就可以将其更改为一种功能,让 AI 自动填充查询语句。这样,我们就完成了在 n8n 中创建 MCP 服务器。
然后,为了使其可以在 Agent Builder 中使用,请将其设置为右上方激活状态。然后,在激活状态下,再次双击 MCP 服务器触发器,然后点击“Production URL”。点击这里显示的 URL,我们就完成了部署 MCP 服务器的准备。
回到 Agent Builder,粘贴复制的 URL,然后点击“Connect”。稍后,Agent Builder 将显示连接已完成的消息。在这种状态下,我们无需更改任何其他说明,只需点击“Add”按钮即可最终完成连接。
然后,我个人觉得 Agent Builder 中最令人印象深刻的部分是“Widget”。创建 Widget 的方法是,在“Output Format”的右侧点击“Text”按钮,然后在下方点击“Widget”,就可以添加 Widget。Widget 有些是我们需要从头开始创建的,有些是我们可以直接使用的。点击一次,查看屏幕,然后体验一下会很有帮助。
点击“Widget Plus”按钮,然后点击“Create”按钮,就会进入一个名为“Widget Chatkit Studio”的独立平台。进入这里并查看内容,首先它可能看起来像一个输入 ChatGPT 提示的地方。在这里,您可以通过输入提示来设计您想要的界面,就像用代码一样。我将使用我预先准备好的提示。我希望创建一个显示搜索到的影响者的 UI,所以我将请求创建一个这样的 UI。
这样,就会出现一个像我们在 ChatGPT 中经常看到的 iPhone 或 Android 小部件那样的结果。在等待的过程中,如果您查看我预先制作的结果,您可以看到代码以 React 的形式显示,这是一种在 Web 上常用的代码。下方可能不太容易理解,但下方的部分是“State”,我们可以直观地看到 ChatGPT 如何输入数据,以及数据的形式。
这里的这些东西将充当变量。这些变量将对应于上面 UI 渲染部分中的“results”。由于“results”是数组形式,有一个名为“map”的特殊变量。这部分是编程内容,我将跳过解释。这样创建的界面,右侧将显示实际运行的界面。您可以将 Widget 理解为这样的内容。
令人遗憾的是,额外的功能目前还不多。我之前没有看到的是,左上方可以切换暗模式和亮模式,并预览 UI 的变化,这让我觉得他们在这方面花了很多心思。
现在,我将查看我刚刚创建的界面。它与之前通过提示发送的界面没有太大区别。如果您喜欢这样的结果,点击右侧的“Download”按钮,就可以下载文件并上传到 Agent Builder。但是,我将下载并使用我预先制作好的 Widget。上传后,它将显示并渲染内容。这样,搜索影响者的 Agent 就完成了。
那么,现在就来测试一下吧。点击右上角的“Preview”按钮,然后发送我预先准备好的提示。我很有可能无法立即运行,但还是尝试一下。如果一次无法运行,我将切换到我预先制作好的工作流,并在那里查看内容。
由于这是在 10 月 7 日刚刚更新的功能,许多开发者正在进行测试,OpenAI 可能存在一些错误。每次服务更新时,似乎都会伴随这些问题。所以,今天在拍摄之前,金石先生也进行了很多测试,有时结果会如我所期望的那样,有时也会出现错误,请您参考这一点。
现在,您可以看到 MCP 工具已成功调用。我还没有批准,所以它还没有被调用。现在,当我批准后,您将看到我的 n8n 服务器发生了什么变化。稍后,如果调用成功,它将连接到新创建的 MCP 服务器,并显示结果。是的,它已成功调用。我运气真好。
这样,我使用 MCP 工具,通过提示发送了问题,要求搜索“cosplay influencer”,特别是“animation cosplay influencer”。我将继续查看它是否真的推荐了存在的 Influencer。
您可以看到实际的 Widget UI 已渲染。上部显示了详细内容。我将进入查看它是否是真实存在的人物。是的,它确实存在。粉丝数是 362 万。我将检查这些数字是否正确。遗憾的是,这里没有显示粉丝数。但是,我在这里创建了 UI 元素,需要渲染 URL,所以您可以看到这部分也已正确渲染。
您可以看到 Jessica Nigri 的名字是相同的。通过 MCP 服务器和 Tavily API 进行搜索,然后将搜索结果与 Agent 结合起来,以 UI 的形式显示,这就是 Agent Builder。
那么,它只能在这里使用吗?那太可惜了。因此,我们可以将其部署,开发者可以单独连接到他们自己的系统中进行使用。我将进行部署。在这里,将其命名为“Influencer Search Agent”并部署,就会生成一个工作流 ID。
有了工作流 ID,就可以复制它并进行部署。部署方法虽然复杂,但我们可以通过克隆并运行 OpenAI 公开的源代码来简单地使用它。我有一个预先制作好的工作流,如果我运行它,就可以在自己的环境中创建我想要的界面并运行它。
这可能是我预先制作好的另一个工作流中的内容。我将进行更改。为了确认它是否正常工作,我将保存这部分,然后重新运行。从外观上看,没有任何变化,唯一的区别在于 Agent 的连接方式。
我将调用我预先制作好的工作流。在这里,您可以继续查看我预先制作好的工作流。我发送了提示,然后它会要求我批准,然后进行搜索,并将结果以 Widget 的形式渲染出来,这与我之前看到的几乎相同。虽然略有不同,但会这样显示。然后,如果您批准它,它将真正开始搜索,并将搜索结果以 Widget 的形式渲染出来。
这与之前的 OpenAI GPTs 类似,对吧?如果能解释一下它们之间的区别,对于非开发者来说会更容易理解。GPTs 的最大缺点是无法在外部运行我创建的 GPTs。但 Agent Builder 在一定程度上解决了这个问题。然而,令人遗憾的是,您需要自己输入 API 密钥。
最大的区别在于,虽然可以连接外部的 MCP 等服务并使用自己的 API 密钥,但 GPTs 的缺点是最终所有内容都以文本形式显示,因此很难创建所需的流程。虽然可以通过系统提示来创建顺序,但并不总是完全一致。
但是,我没有介绍的是,在 Agent 之后,还可以创建 Agent。这样,通过创建 Agent 并连接下一个 Agent,流程就不会只进行一次。第一个 Agent 执行功能后,下一个 Agent 将执行功能。如果将其做得更高级,例如在搜索后,结果是否符合我的期望,可以通过按钮操作来设置数据的 True/False 条件,然后根据条件向上或向下移动。这与 GPTs 中不存在的流程不同,不是通过自然语言,而是通过系统来改变,这与 GPTs 有很大的区别。
是的,感谢您的解释。能否请您再次点击“Influencer Search Agent”,然后简要解释一下之前的菜单?左侧有 Agent、End、Note、Tools、File Search 等部分。我还没有完全看过文档,所以可能无法完美解释,但我将尽我所能解释我所知道的。
Agent 节点可以用来创建使用 GPT 来执行某种 AI 任务的节点。End 节点如果说有什么意义的话,就是可以将结果以 JSON 这种文本格式接收。但大多数情况下,End 可能不太常用。所以我也没有特意使用 End。但是,如果需要使用 End 的情况,可以这样连接并使用结果。
关于 Note,我想使用它,但遗憾的是它不能重叠。这与 n8n 不太一样。这里不能重叠显示,这很遗憾。虽然可以在这里写说明,但遗憾的是,它不支持 Markdown 渲染。不支持 Markdown 渲染是其中一个遗憾。另外,在 Windows 环境下,删除功能不起作用。总之,有些地方不太好用。
在 Tools 中有 File Search。File Search 是连接 OpenAI 提供的向量数据库,预先上传我创建的文件,然后在这些内容中搜索句子或位置,进行向量搜索,然后获取内容进行连接。这是 File Search 的特点。
太好了。关于 Guardrail,当 AI 接收我们请求的提示结果时,如果它试图随意获取我的信息,例如在文件搜索后,Guardrail 试图获取我的信息,那么在 Jailbreak 部分激活它,将其视为试图破解我们的系统,试图破解我的文件。如果打开这个 Jailbreak 的开关,就可以确认是否有人试图破解我的 Agent。这是一种安全措施,可以说是保护提示的作用。
还有其他各种情况。例如,询问非常私人的问题,或者阻止暴露仇恨言论。这些是 Guardrail 节点的特点。这很好。GPTs 之前的一个明显弱点是个人信息或提示破解。还有防止幻觉的切换按钮吗?
我不知道它有多详细,但这些部分可以减少幻觉。而且,我不知道的是,似乎还有一个单独的向量存储器来减少幻觉。所以,它看起来像是预先注入了相关信息然后进行回答。是的,这很好。
这就是我为 Agent Builder 准备的内容。如果您还有其他疑问,我们可以一起研究,或者您也可以提供其他想法来使用它。我认为它需要几周的时间才能稳定下来,但这是一个非常有趣的工具。
另外,MCP 似乎很强大。但我不确定 MCP 在这里可以如何使用。我认为在 Agent 的 Tools 中使用 MCP 会更好。我不确定在这里单独使用有什么优势,但这部分还需要进一步研究。也许对于一些不需要思考的 Agent,不需要连接的简单请求,例如“每天收集 10 篇文章并 가져와”,可以直接作为 MCP 工具使用。
但是,在开始时,这里还没有 MCP 触发器。是的,因为这里还没有,所以与工作流不同,Agent Builder 的起点总是以自然语言开始,这是工作流系统和 Agent Builder 系统之间的一个主要区别。
然后,这里有 Logic,以及名为 Logic 的部分。有 if 和 while。这些部分需要一些编程知识。User Approval 是关于是否满意?是否可以继续?等等。我还不确定如何使用它。
关于 if/else,在执行 if/else 逻辑之前,最重要的可能是 Set State 节点。因为 Set State 的作用是检查数据当前的状态。它会比较内容是否与此匹配,即 Agent 创建的句子或结果是否与此匹配。所以,这可能是一个很大的区别。
另外,在前面,可以调用之前的节点。Input as text 是开始时的节点。而 Agent 下面的这个区域,可以查看 Agent 输出的句子或回答的状态,并定义如何存储和传递数据。
关于 if/else,可以获取之前的条件,进行比较,如果匹配则执行上方,如果不匹配则执行下方,从而改变逻辑。这是 if 节点的特点。
关于 while 循环,当结果以数据包的形式出现时,例如我们之前获取了影响者列表。results 是结果。通过循环遍历每个搜索到的影响者,执行某个操作。这就是 while 循环的作用。我还需要实验一下如何在里面创建。
是的,现在我应该能充分理解结构是如何构建的了。由于这是今天刚发布的,我们还需要进行很多研究。目前,对于非开发者来说,它仍然有点难度。如果能发布更多相关内容,人们就可以参考。如果能展示它如何真正帮助我的工作,并提供更多用例,将有助于更多人使用它。
最后,在数据部分有一个 Transform 节点。这可能是我在 n8n 中最常使用的类似节点。Transform 节点用于处理结果数据。例如,当处理年份或日期信息时,将 Excel 数据放入时,通常需要将其转换为指定的格式。或者在通过日期信息进行搜索匹配时,需要创建指定的格式。在创建这种格式时,经常会用到 Transform。我认为,如果您学习这些差异,您会经常使用 Transform 节点。
感谢您如此快速地进行了整体解释,以及您是如何使用的。今天刚发布的最新消息也传递给了我们。看到这个内容的人们可能会觉得它很有用。关于 n8n MCP 的更新消息,如果您再次出现并分享,我非常期待很多人能够构建 n8n 工作流,并实现自然语言生成的那一刻。届时,再次出现并分享将非常棒。
是的,谢谢。
好的,今天的对话就到这里。感谢您的到来。