Transcription
人工智能技术发展迅猛,几乎每天都有新技术涌现。因此,信息滞后是毫无益处的。
许多人常常忽视数据的重要性,但事实上,人工智能的本质就是数据。数据占80%,而人工智能模型只占20%。
我22岁时创立了公司,至今已有六年。目前的年销售额约为100亿韩元。我们预计明年的销售额也将达到100亿韩元。
>> 您好,这里是AI Money Trend制作组。
>> 您好,我是金智贤。我感兴趣的领域,比如人工智能或技术领域,我会设置成让AI自动总结,然后只选择阅读我想要的文章。
>> 哦,那AI会主动帮您收集文章吗?
是的。这是Slack这个通讯软件,我在里面设置了一个机器人。这个机器人会实时向我推送信息。前不久,开发出ChatGPT的OpenAI公司来韩国了,我分享了相关新闻。这是我们公司的通讯群组。像“公告”这类信息,是大家需要了解的,会发布在这里。而当客户在我们官网提交咨询时,信息会自动发送到这个Slack群组作为提醒。
>> 如果用以前的方式,大概需要多长时间?
以前如果我自己搜索,大概需要30分钟。现在我快速浏览一下,感觉不到5分钟。
>> 您会向普通人推荐AI吗?有什么推荐的吗?
>> 嗯。我一定会推荐的是ChatGPT。
ChatGPT可以被视为一个基础工具。我来向您展示一下我平时是如何使用ChatGPT的。我安装了ChatGPT应用程序,直接对着它说话。
“我需要给团队成员反馈,但他们写的报告太肤浅,缺乏专业性。请你加入更多AI知识,重写报告,并润色一下。”
哇,不到3秒就出来了。
>> 是的。我说话也只需要一两秒,实际的回答也很快就整理好了,只需要几秒钟。我可以直接复制粘贴,然后转达给团队成员。
>> 工作效率肯定大大提高了。
>> 是的。我们使用像ChatGPT或Claude这样的生成式工具,使用与否的效率差距可能超过五倍。
我现在看的是“Trending Papers”,这是最近流行的论文,在开发者之间引起热议的技术等都会发布在这个网站上。虽然这和我们的主要领域不太相关,但看起来很有趣,比如这是关于视频生成的论文。
>> 哇,这些是AI论文吗?
是的,是的。你看,当输入人脸数据时,就会生成合成的,也就是我们常说的“Deepfake”技术。这些论文是关于在视频中保持一致性,同时将人脸嵌入进去的。我看到有趣的论文时,也会将其输入ChatGPT进行总结,然后分享给团队成员。人工智能技术发展迅猛,几乎每天都有新技术涌现。即使是我从事AI行业的人,也觉得速度非常快,比我预想的还要快。因此,信息一旦出现,滞后是毫无益处的。
是的。所以必须尽快分享,以免信息过时,因此我们会立即分享。
这是LinkedIn。在海外,人们甚至用LinkedIn代替名片,它是一个非常普及的平台。我写的一篇文章,曝光量达到了13万次。
>> 嗯,您的关注者通常是同行吗?
我想是的。通常是创业公司的人,或者从事AI行业的人,95%以上应该都是IT从业者。我的社交媒体好友。
>> 谢谢。这里是我们公司。
>> 哦,您是代表吗?
是的。是的。我是韩国深度学习公司(Korea Deep Learning)的代表,这是一家专注于人工智能文档理解的企业。目前,我正与大约40名人工智能专家一起,致力于开发能够理解文档的人工智能。
现在这个画面是我们Agent的界面。这是之前录入的文档列表。这些文档通常是金融机构或贷款公司使用的。里面有很多文字,比如“某某股票持有量”、“某某变动确认”等等。但实际上,我们在工作中需要的信息,可能是客户的名字、客户的出生日期。但使用我们的Agent,可以在0.5秒到5秒内快速读取这些信息。然后,这些信息可以直接与系统对接,无需人工处理。
>> 那您是怎么开发出这个模型的呢?
是的。可以说,这是因为我们开发了VLM(Vision-Language Model),所以才成为可能。VLM最初主要用于场景理解。比如监控。在CCTV中,会识别有多少人,谁在拍摄谁等等。VLM在这方面应用最广泛。比如“请解释这张图”、“请告诉我这是什么情况”。我们将其针对文档图像领域进行了专门的调整,因此才有了我们独有的、专注于文档的VLM技术。
我的父母都是开发者,家里的长辈也都是第一代开发者。所以我从小就对电脑很熟悉。小时候,你们知道书架上会放着书,比如Java、C++之类的书。虽然当时我无法完全理解所有内容,但我就是在这样的环境中长大的。父母也从小就教我编程等知识。所以,我确实受到了很大的影响。
要不我给您展示一下?对比一下Google和我们的产品有什么不同。我将上传这个文件。实际上,有些地方需要每年比较股东名册。如果用Google来读取,它会这样读取:人工智能,姓名,关系,期初,期末,备注,结束,股份数量。
>> 只是把文字读出来而已。
是的。我们用Google和我们的产品读取同一份文档。它会这样显示。刚才的OCR或者Google Document AI根本无法捕捉到这种关联性。我们能够识别出“李在镕”这个人持有的普通股数量是多少,期初股份数量是多少,持股比例是多少。信息的层级结构没有被破坏,而是完整地关联在一起。
>> 哦,都显示出来了。
这清晰地展示了使用了VLM的文档理解技术与未使用该技术的文档理解技术的巨大差异。您看,以前的文档能正确识别“正常销售额5% VAT另计”,也能正确识别“5”。但实际上我们需要的信息是,正常销售时的佣金率是多少?均一销售时的佣金率是多少?也就是说,文档技术需要结合前后信息,理解“正常销售的佣金率是5%”。这才是更重要的。所以,我们文档理解Agent的准确性标准是:将“가”识别为“가”,不再是其他意思。将“金智贤”分类为“申请人”。将2024年12月的电梯维护费识别为1128韩元。这些才是更重要的。
>> 代表,这里的数字是什么意思?
这个数字是人工智能判断该客户信息为“韩某某”的可能性。人工智能认为这个人是“韩某某”的概率是99.5%。也就是说,它认为这个判断是正确的。我们可以设定这个置信度分数规则,比如,如果置信度低于90%,就让我再确认一次。我们可以这样指示人工智能。这样,一些不太准确的信息,就可以由人工再次确认。
>> 人工智能识别手写体应该很困难吧?
是的。关键在于收集了多少样化的数据。我们公司6年多来一直专注于收集这类文档数据,并研究文档、手写体和印刷体。因此,我们现在拥有超过4亿份这样的数据。这是实际工作中使用的办公文档,超过4亿份。因此,我们拥有各种各样的手写体。
哇,收集了这么多数据,识别率才这么高吗?
是的,没错。在行业内,将识别率提升到这个程度非常重要。因为像ChatGPT这种通用型ChatGPT,即使准确率达到一定程度也就可以了。稍微修改一下就可以使用。但是,像直接应用于行业的AI Agent,1-2%的差异就可能决定了它是否能在实际场景中使用。因此,像ChatGPT这样的通用型人工智能,在应用于行业时存在一定的局限性。这也是客户选择我们公司的原因。
辛苦了。
>> 您还有会议吗?
是的。刚才提到的客户是从外地特意过来见我的,而且是一家大型公共机构,所以我需要亲自参加会议。
在会议中,客户通常会带来他们实际使用的文档。然后我们会对文档进行EDA(Exploratory Data Analysis),也就是数据特性分析。
>> 我们也在群里运营着。
嗯。客户带来的文档,95%以上都可以通用我们的产品。但也有一些特殊文档,比如图纸,其准确率还未达到行业应用的标准。这些都需要定制开发,而我们目前不提供这类服务。所以,我们会在会议中明确告知,能做到就说能做到,不能做到就说不能做到。
我们的Agent目前已经在现代Capital、国税厅、科学技术信息通信部、疾病管理本部等80多家大型企业和公共机构投入使用。我们拥有13项自主研发的大型视觉语言模型(Large Vision LLM)技术专利。我们是一家专注于文档VLM技术,并将其发展为通用人工智能的团队。
这项技术我们在今年上半年完成了商业化。与去年相比,累计销售额增长了400%以上,达到了约100亿韩元。我们预计明年的销售额也将达到100亿韩元。这项技术发布后,仅两个月内我们就签订了价值10.9亿韩元的合同,接近11亿韩元。目前,有非常多的客户希望引入我们的Agent,所以我们实际上是处于一种预约排队的状态。
现实情况是,如果我们一次性接收太多客户,肯定会在我们意想不到的地方出现问题。我们的Agent主要面向B2B和B2G市场,因此稳定性要求非常高。我们预计,能够处理的最低金额是100亿韩元。
>> 肯定有很多地方联系您吧?
客户打来的电话太多了,找我们的人也太多了,我们根本不做任何营销。我们一分钱的付费营销费用都不花。现在,那些试用过我们产品或使用过我们产品的客户,会向其他客户推荐,因此我们在市场上获得了很高的知名度。所以,客户咨询量非常大。
>> 员工们肯定很辛苦吧?
所以,稍后有一个“轮值午餐”的活动,我会和团队成员一对一吃饭。我估计会挨不少批评。
大约90%是批评,10%可能是“你也很辛苦吧”这样的鼓励信息。
崔
>> 您好。
>> 您好。
>> 您辛苦了。
>> 是的。那么,请
在工作中感受到的环境改善点。比如“这些事情需要尽快处理”等等,以更轻松的方式进行交流。与其评价某个团队成员的工作,或者说“需要加快速度”这样的反馈,不如说“我现在遇到了什么困难,请帮我解决”。这就是这次午餐的目的。
现在咨询量积压太多了,大概有23件。
>> 目前GPU供应确实有些困难,所以需要一些时间。我已经让经营管理团队在9月份内尽快扩充基础设施,并准备好IDC(互联网数据中心)的部署。
>> 是的。
>> 您出来不是吃饭,而是来开会的吧?
这确实是一种会议。可能是一个月一次,也可能是两个月一次。就是和团队成员一对一吃饭,让他们直接告诉我平时想直接表达的内容。
>> 看起来很好吃。我第一次见到这个,比我想象的要好。
您觉得这样的午餐活动怎么样?
说实话,工作中需要快速处理的事情很多,专注于这些事情,就很难说出真正想说的话。所以,我觉得午餐时间是一个可以更直率地表达的机会。虽然没有私下花很多时间,但
经历了风风雨雨
我们已经成为了同事,骨子里就是。所以,不会感到尴尬或不舒服。
>> 只是
>> 抱歉,我总是
>> 啊,是吗?
>> 啊,这位朋友,别哭。好好干。
虽然大家都会说辛苦,但他们似乎都是笑着说的。因为团队成员也知道,只有蛋糕做大了,才能分到更大的蛋糕。所以,他们也能愉快地工作。
我最终想做的是,让AI阅读文字,减轻人类的工作负担。我想创造一个能够阅读文字的人工智能。图像中的文字,不仅仅是眼睛跟着看,而是要理解句子中的含义,看懂整体的语境。所以,当我们看到新闻会感到愤怒,或者了解到不知道的事实时会获得启示,我认为这就是“阅读”。
数千年来,人类通过文字的形式留下了所有的知识财富。而阅读这些文字,就是打开了通往人类积累的知识的通道。因此,如果我们能让AI阅读文字,分担原本只能由人类承担的义务,那么这将改革这个世界的运行系统和制度本身。我对此深信不疑。所以,我们致力于让AI阅读文字,从而引领人类工作和生活的整个社会系统和制度的变革,这就是我们的最终使命。
跨越黑夜,追逐无尽的时间,没有休息,没有停顿,正义在山坡上,节假日,在清晨的光芒中,我日夜兼程,你爱 o