Transcription
人工智能驱动的智能手机是否真的准备好取代专业相机,还是这只是硅谷的炒作?今天在 CXO Talk 第 872 集,我们将深入幕后,与两位曾是苹果工程师的团队成员一起,他们创造了您 iPhone 上标志性的人像模式。如今,作为 Glass Imaging 的创始人,Ziv Atar 和 Tom Bishop 正利用神经网络从智能手机相机中提取令人惊叹的细节。Ziv,请告诉我们 Glass Imaging 的情况。
我们希望彻底改变数字摄影,特别是利用人工智能。为了澄清我的意思,这并不意味着从相机中获取图像并使其变得更好,这是很多人在包括智能手机、无人机和摄影在内的各个行业都在做的事情。我们的目标是,从长远来看,实际上是推动由我们正在开发的人工智能所赋能的硬件变革。例如,您可以制造更小、更便宜的相机,但质量更高;如果您谈论的是智能手机,那么您可以制造更薄的相机,以适应这种尺寸非常有限的外形。此外,还可以实现新型光学器件和新型相机模块架构,为您带来某种显著的优势。
Tom,我们经常听到计算摄影这样的术语,请带我们深入了解一下,我们到底在谈论什么?
在传统摄影中,您有一个相机,最后得到一张照片,也许您可以在 Photoshop 等编辑程序中对其进行调整。而计算摄影则将大量能力投入到创建图像中,通常是在相机内部或嵌入到相机数字处理中的算法中。这使得能够收集更多信息,并从现有场景中提取更多信息,从而获得质量更好的图像。它实际上通常是将各种捕获组合在一起,突破硬件能力限制,甚至设计新的硬件、镜头和传感器等,这些都可以通过使用算法来获得更好的最终图像。因此,这是从计算角度重新思考整个相机。
那么,当您谈论您们俩都参与过的人像模式时,计算摄影在哪里发挥作用?或者更笼统地说,您能否以人像模式为例,简要介绍一下它是如何工作的?
人像模式是计算摄影的一个例子,因为在我们拥有足够的计算能力之前,它并不存在。人像模式基本上是拍摄一张普通的彩色图像,就像人像模式出现之前一样,然后它会利用多个摄像头来创建所谓的深度图。因此,现在当您有一张彩色图像时,这张图像就有了另一个维度,那就是深度,即每个像素的距离。显然,它并不完全准确,但足以模仿大型相机上的这种失焦模糊。这就是人像模式的初衷,基本上是模仿大型相机上的效果。在大型相机上,这是通过光学实现的,所以光学效果是,当某个东西不聚焦时,它会变得非常模糊。但这也是一件好事,它有助于分离背景和前景。然后,它是什么让智能手机与专业大型相机区分开来?人像模式就是试图弥合这一差距,并基本上让智能手机用户能够模糊背景。
现在,回到您的问题,Michael,您问的是关于人像模式,也更广泛地关于计算摄影。计算摄影我敢说,几乎是在智能手机摄影开始之后不久就出现了。您可以说,数码相机都是计算性的,因为它们在传感器上有一个所谓的拜耳滤镜,您必须插值一些不存在的数据,这就是计算。但我实际上会称之为计算摄影,当您开始做 HDR 这样的技巧,以及像复杂的降噪和多帧图像融合,这在今天的任何智能手机或其他一些产品上都在发生。这仅仅意味着您正在使用大量的计算来完成事情。这并不是什么新鲜事,这已经持续了,我说,大约 10 年了,当然,每年手机或电脑、笔记本电脑上的芯片都在变得越来越强大,所以您可以使用更先进的计算摄影。但我们看到的是,这也有两个阶段,更具体地说,是人工智能,特别是神经网络在这个领域的应用。
我们开始看到人工智能在智能手机上的应用已经有好几年了,例如用于面部检测、分割等。这是天空,这是皮肤,我们希望有更平滑的天空,我们可以更积极地进行降噪。所以,所有这些语义上的东西,但它们发生在低分辨率下。如果您有一张手机拍摄的图像,您想说,嘿,那里有一张脸,然后您想对这张脸做些什么,您可以在缩略图上运行一个面部检测器,您不需要全分辨率。所以,这些发生在低分辨率下的事情,几年前就发生的人工智能,现在在过去一两年里,我们已经达到了一个点,即手机上的人工智能或人工智能引擎能够实际处理全分辨率计算人工智能计算,这为做很多非常创新和非常有影响力的工作打开了可能性,就像我们正在做的 Glass 一样。我们稍后会更详细地谈论它。
我认为计算摄影这个词可能是在大约五到八年前与智能手机一起出现的,当时它们开始将多张图像融合在一起。它们会捕获一系列图像,然后为了降低噪点、增加细节和保持清晰度,它们可以尝试融合这些图像序列中的信息,以获得一张静态照片。在很长一段时间里,对许多人来说,这就是计算成像。但我认为 Ziv 提到了很多其他用例,以及我们现在正在做的计算摄影的事情,这确实是一种新的范式,即如何设计整个系统,如何用人工智能进行处理,如何操纵硬件以提供更好的图像,同时知道您拥有这种计算能力。
你们都提到了硬件和软件,能详细讲讲吗?Tom,也许你可以给我们看一些示例图像,但首先我想告诉大家,您可以提问。如果您在 Twitter 上观看,请使用 #cxo talk 标签将您的问题发布到 Twitter 或 X 上。如果您在 LinkedIn 上观看,请将您的问题发布到聊天中。
那么,Tom,请再详细讲讲。当我们谈论使用人工智能来提高图像质量时,实际上,在手机的情况下,这通常是在手机本身上运行的。你知道,大部分处理都是在手机上完成的,以生成图像。今天,随着生成式人工智能的出现,有一些服务可以在事后处理图像,但当你捕获图像时,传感器捕获的是原始数据,这实际上只是到达传感器的光线以及来自它的电子信号。通常会发生很多处理步骤,以生成您可以在屏幕上看到的最终图像。这些通常由软件工程师完成,他们创建算法,许多不同的模块组合在一起,试图提高清晰度、降低噪点、获得正确的颜色等等。然后,他们必须调整许多旋钮才能获得高质量的图像。
我们在 Glass Imaging 实际上正在尝试创建一个端到端的人工智能解决方案的神经网络,它用一个过程取代了所有这些算法,该过程可以从给定的图像中提取最多的质量,并且它也适用于特定的相机。因此,在传统的图像处理意义上,所有这些去马赛克、降噪、锐化和细节提取、校正镜头问题,这些都是我们现在可以通过人工智能完成的事情,并且我们在智能手机的相机上运行,以提取最佳图像。
查看 cxo talk.com,订阅我们的新闻通讯,这样您就可以加入我们的社区。我们即将推出一些非常精彩的节目。
使用镜头进行传统摄影的质量与您通过人工智能获得的质量相比如何?说这是人工过程而不是使用镜头的传统摄影,这是否正确?
我不会说它是人工的,因为确实存在插值,而且基本上任何彩色相机都存在这种情况,正如我之前提到的,传感器上有一个彩色图案,即使在大型、传统的佳能、尼康相机上也是如此。这意味着在每个像素位置,您都有红色、绿色或蓝色信息。这也意味着,如果您现在在一个绿色像素上,您就不知道那里的红色值和蓝色值是什么,您必须猜测它。传统上,这个过程被称为去马赛克,这意味着猜测、插值信息。所以,问题是,我们称之为幻觉还是猜测?它是在小范围内,在像素级别上,它是在编造信息。
我认为 Michael,您提出的这个问题现在随着生成式人工智能变得更加有趣,因为现在您不仅能够猜测像素的值是什么,您还可以猜测一个人的嘴巴看起来像什么,或者眼睛,或者房子,或者鸟,或者花,您可以编造整朵花,您不仅仅是猜测一个像素。我认为,如果您谈论的是多个像素,替换多个像素,比如一个 100x100 像素的块,假设里面有一朵花,那么这就是纯粹的生成。如果您替换几个像素,这里那里,并去除一些噪点,那么我不会称之为生成,尽管再次,这是一个完全的灰色地带,不是我可以明确区分的。
正如我试图解释的那样,确实存在现实与虚构之间的界限。在一端是生成式人工智能,它在捏造从未存在过的东西;在另一端是传统摄影。那么,您如何区分呢?您在 Glass Imaging 中在添加、更改或调整原始照片以使其“更好”方面有多大程度地突破了界限,无论“更好”意味着什么?
关于“更好”,如果您正在拍摄某物的照片,并且您正在测试一些算法、一些人工智能,比如,我不知道,墙上的一张名片,您可以走到那张名片前,或者用一台高分辨率相机拍摄一张照片,这样您就有了地面真实情况,您可以判断您正在做的事情有多好或多坏,它是否插值或幻觉了缺失的信息。我们 Glass 特别关注的是,尽量减少生成,而不是编造完全不存在的信息。有些,你知道,其他公司或软件提供像 Dolly 和 Sora 等产品,我们将其视为后期处理,它有点补充了我们正在做的事情,因为即使您有一张图像,并且您想对其进行一些生成操作,比如,我不知道,去除皮肤瑕疵之类的,拥有最高分辨率且尽可能真实的输入图像总是更好的,然后您可以应用一些,比如说,虚假效果。这没关系,我不是在批评它,我认为很多人喜欢它,但我也认为从尽可能真实的事物开始很重要,我们很自豪能够实现,比如说,高置信度或与现实、与地面真实情况的高度可比性。
也许我稍微谈谈我们是如何做到的,因为我们谈论了我们正在做什么,但我们还没有解释如何做。当你看着一台相机时,无论是手机、无人机、专业相机还是医疗设备,相机都由镜头、传感器和一堆算法组成。您对相机的尺寸、成本和使用的材料的限制越多,通常就会有更多的像差,像差意味着镜头中的缺陷,也意味着镜头会有点模糊。如果空间很拥挤,就像手机或电子产品一样,这也意味着您很可能使用一个非常小的传感器,这通常意味着图像中有很多噪点。所以,如果您看看这些小型设备刚从传感器出来的图像,图像很糟糕,真的非常糟糕。我们内部看到了,但大多数人从未见过手机的原始图像。它非常嘈杂,有彩色噪点,到处都是彩色斑点,非常不清晰,有很多光学像差。最明显的通常是色差,所以如果您在原始图像上看到黑白文本,当您看它时,它有紫色和蓝色,但您看真正的纸张,它是黑白的。所以,这些是色差和噪点以及彩色噪点,它们加起来就是一张非常糟糕的图像。而纠正所有这些事情的过程,可以说是算法,计算摄影。
现在回到 Glass 正在做的事情,这与过去几年其他人一直在做的事情也不同。我们建立了特殊的实验室,我们可以对相机进行测试。例如,我们将展示一些 iPhone 的例子。我们拿到了实体 iPhone,把它放在实验室里。我们建立了专门为此目的的实验室。这个实验室的作用,我无法非常详细地描述,但实验室学会了以极其详细的方式表征光学器件和传感器。因此,对于每个像素、每个角度、每种光线、每种光量,它都表征了光学器件、传感器以及两者之间的相互作用。然后收集所有这些数据,数 TB 的数据。收集所有这些数据需要几天时间,然后将其输入到用于训练神经网络的软件中,该神经网络专门针对智能手机进行训练,可以实际在智能手机上运行。我们正在高通芯片上提供我们的解决方案,但我们也有 iPhone 和其他设备的演示。一旦我们完成了,我们就有一个网络,它基本上学会了将这些糟糕的图像变成好的图像,基本上尽可能地去除所有光学缺陷、所有传感器噪点和传感器缺陷。
我现在解释的一切,我举了一个 iPhone 的例子。iPhone 上的相机,他们正试图使其在清晰度、镜头振动、传感器方面尽可能好。但因为我们可以纠正这些事情,这似乎就引出了问题:好吧,如果您可以纠正所有这些事情,为什么苹果、三星或任何其他手机制造商需要使其完美呢?答案是他们不需要。我们可以让镜头比今天差很多,或者相机总体上差很多,仍然从中获得一张好图像。然后下一个问题,我问自己,好吧,如果可以做得好,为什么要做得差呢?而这些问题的答案就是让事情变得有趣。所以,您会做得差,如果您可以纠正它,只是为了获得一些东西,因为我们不是大学,我们不是在试图证明什么,我们正在试图创造一些有形的东西,这些东西实际上对产品有用。所以,为了获得一些东西而做得差,您可以获得成本,您可以让镜头更便宜,您可以让它们更小,您可以让它们支持更大的传感器,而不用疯狂地增加镜头中的元件数量。这只是打开了设计空间,现在比您需要制作一个好的镜头和一个好的传感器时要大得多。
非常有趣。那么,数据来源,如果我理解正确的话,数据来源是您对相机、硬件的剖析。然后这些数据被输入到您的神经网络中,该神经网络可以模拟,数字孪生,这样说对吗?
基本上,我认为有三个步骤。第一,您对相机进行表征。所以,我们拿任何相机,智能手机或其他类型的相机,我们把它放在我们的实验室里,我们进行很多测量。我们完全剖析了镜头和传感器在不同光照条件下的行为,不同的亮度、场景等等。第二步,我们利用这些数据来训练神经网络。所以,在某种程度上,这是一个自监督过程,从人工智能的角度来看,我们没有进行任何数据注释或标记。所以,我们训练一个专门针对该设备的神经网络。第三步,我们必须将其移植到边缘设备上高效运行。所以,今天的大部分人工智能都在云端运行,您知道有大型数据中心、大量的 GPU、大量的电源。在这些移动设备上,您确实有一些相当强大的芯片。所以,高通现在占 Android 手机的大部分。Pixel、Google Pixel 和 Apple iPhone 都有自己的处理器,其中也包含某种神经网络处理单元。所以,您有 CPU、GPU 和 NPU,这三个不同的系统,它们都有不同的优点,但对于任何这类神经网络来说,NPU(神经网络处理单元)都非常强大,而且非常省电。所以,我们可以将该神经网络运行在该 NPU 上,这需要一些仔细的软件工程才能使其高效运行。我们希望处理今天来自一些传感器的大约 12、50 甚至 200 百万像素,接近实时。这意味着您拍照时,不会注意到有后台处理在进行。您在屏幕上渲染图像,并将其保存到磁盘,使用该神经网络,它接收来自传感器的原始图像突发,并创建一个最终图像文件,该文件具有您期望的所有清晰度、细节和低噪点。
所以,您的神经网络就与手机的特定硬件紧密绑定,与那个特定型号的处理器、传感器以及镜头特性绑定在一起,是这样吗?
我可以说这是优势之一,因为今天有一些增强图像的解决方案。您会在 Photoshop 中看到其中一些,例如 Lightroom。您会看到,例如,放大网站,您可以上传一张图像并生成一个 AI 生成的放大图。这些不是针对拍摄照片的相机类型特定的。所以,它们可以在一定程度上提高图像质量。正如 Ziv 之前解释的那样,有一个关于生成多少与从图像中恢复多少的连续体。我们专注于真正尝试恢复信号中编码的细节。从信息论或信号处理的角度来看,存在图像内容,图像具有信息,但这些信息被混乱地混合在一起,它被模糊了,它很嘈杂,它有一些不确定性。存在一个真正的潜在信号,即来自场景的图像,我们正试图尽可能忠实地重建它,利用那里的信息,但它只是被弄乱了。所以,如果您采用其他方法,它们实际上并没有进行那种解乱码,它们只是试图生成、创建或发明可能存在的合理细节。
所以,我们实际上是在补偿镜头的缺陷,如柔和度、像差、传感器产生的噪点,使用我们在实验室测量的配置文件。您与硬件紧密绑定,并且您正在补偿镜头或软件平台中可能存在的缺陷,无论它是什么,都是那个整体移动系统的一部分,手机、任何镜头、任何传感器都有缺陷。它是对物理世界的测量。当您有一个传感器时,您正在收集光子。当您有一个镜头时,您只是试图将光线聚焦到传感器上的小点上。我们可以深入研究物理学,但它有物理限制,我们正试图尽可能地克服这些限制,使用软件。
您问过,或者您提到,这个我们刚才描述的神经网络将是为特定相机量身定制的。它有利有弊,而我们解决了弊端。我将解释如何。最大的好处是,它是为特定相机量身定制的,因此它能够纠正该相机的特定像差和该传感器的特定噪点。它允许我们最大限度地发挥该相机的潜在质量,基本上是最大化给定系统的质量。这种方法的缺点是,您必须为每个特定相机进行训练。基本上,我们过去几年花费的大部分时间实际上是建立一个系统,这是一个物理实验室和一套用于训练的软件以及用于控制实验室的软件。里面有一些机器人。我们很久以前就得出结论,获得最高质量的方法是为每种不同的相机进行训练。我们需要使其快速。所以,我们投入了大量的精力和资源来制造这些实验室,这些实验室可以接收任何带有相机的设备,或者多个相机,比如手机,并且在几个小时内,最多一两天内,我们可以捕获训练神经网络所需的所有数据。然后训练本身需要几个小时到一两天。所以,整个过程可以从周一开始,到周四结束。
只是为了说明一下,如果没有 Glass,您会怎么做?所有手机制造商都会为他们的新一代手机设计新硬件。所以,我猜苹果公司没有在 iPhone 17 上工作。在某个时候,在发布前几个月,这些公司会收到第一批硬件原型,比如带有新镜头、新传感器、一切都是新的手机。然后他们需要调整,这叫做图像质量调整。通常,这取决于公司规模,但有几百到几千人会花几个月,甚至六个月的时间来调整这些东西。所以,当我说四天时,这非常快。而且也值得一提的是,我提到的这四天,从周一到周四,几乎没有人参与。也许有 20-30 分钟是在实验室里设置设备。一旦设置好,我们就关上门,让它运行。然后训练,当然,你知道,是 Nvidia GPU 在 crunching numbers,不是人们在实际工作。所以,我想说的是,我们投入了大量的精力来自动化这个过程。这样,我们可以同时支持数千个不同的项目,并提供输出,即一个为特定平台设计的神经网络,无论是高通芯片、PC 还是 Nvidia 芯片,都在几天内完成。所以,我们每周可以支持非常多的客户。
我们有一个问题,让我们看看来自 LinkedIn 的 Kamaru Dean Lawal。Glass Imaging 是否在招聘?
好问题。是的,感谢您。我们网站上有几个空缺职位,我们还将增加几个空缺职位。有一些软件职位,一些业务职位,以及一些机器学习人工智能职位。Tom,也许你想补充点什么?
光学计算。Kamaru Dean,请查看我们的网站。
Gloria Putam 说:“我在哪里可以买到这些 Glass AI 的运动服?它们看起来很酷。”
这里有一个来自 Ause Jamar 的更技术性的问题,他说:“训练好的神经网络是否会从特定相机的响应函数 CRF(从传感器辐照度到像素颜色的映射)中学习,从而完全取代手机 ISP 的相机管道处理?”
基本上,他想知道你们在相机方面的定位。如果我理解正确的话,我们可以取代整个 ISP(图像信号处理)管道,也可以取代其中的一部分。但我们位于前端,我们直接从传感器接收原始图像,一直到生成最终的 RGB 图像。通常我们说它是线性的 RGB 图像,意味着它还没有经过任何色调响应或颜色处理,这更多的是一种美学处理,如今每台相机、手机或软件都会这样做。所以,我们将其留给供应商应用他们自己的,或者我们可以提供一个提供最佳色调和颜色的解决方案。所有这些都可以完成,而且它是灵活的。
那么,可以说您正在施展魔法,提高清晰度,降低噪点,您保持颜色不变,这样手机平台就可以应用自己的处理,比如三星做某些事情,或者其他制造商在他们的手机软件中做其他事情?这是他们的最终用户软件吗?
这非常正确,Michael。原因不一定是我们能做什么或我们想做什么。你知道,如果你看看智能手机,有些它们有自己的颜色倾向,比如温暖的外观,这种白平衡,那种白平衡。如果我们卖给 10 家智能手机公司相同的后期管道,它们最终都会有完全相同的颜色。这是他们区分手机的一种方式。而且,值得一提的是,这些颜色偏好在地理上差异很大。所以,如果我们看在中国设计和在中国销售的手机,与为韩国市场或日本市场设计的手机,与美国或欧洲市场相比,您会看到非常不同的趋势,例如白平衡、曝光、色彩鲜艳度等。还值得一提的是,这些趋势不是固定的。所以,我们看到过去,比如说五年前,我们看到欧洲和美国的设备,主要是苹果和三星,试图坚持更真实的色彩和色调,而中国的领先手机制造商则推崇非常饱和的颜色。而现在我们实际上看到,或者说在过去两三年里,我们看到了一些反转。所以我只是说,这种趋势不是恒定的,它会随着时间而变化。它有一个非常缓慢的周期,也许每三年左右。我认为这是我的个人观点。我认为,走向更真实的生活的原因与图像质量、清晰度有关。我认为,您获得的图像质量越接近单反相机或专业相机质量,我认为这将驱动对更逼真的颜色而不是过于鲜艳、饱和的颜色的需求。
现在是看一些图像的好时机。Michael,您能看到屏幕吗?
好的。
KPMG。哦,看那个。是的,这是一栋建筑,是从很远的地方拍摄的。但左边是另一部手机,是一部 Android 手机,它有一些非常极端的镜头像差。所以,正如 Ziv 刚才提到的,其中一些,再放大一点。您可以看到这里的边缘过渡有点模糊。它有点清晰,但又有点不清晰。所以,它不仅仅是柔和,但您会看到双边。而且您有一些色差,您也可以在这些电线上、屋顶上和这些管道上看到,在这些白色和黑色过渡的边缘,您会看到红色和绿色。它看起来有点像老式相机。你知道,老式相机之所以看起来那样,是因为它们没有得到很好的控制的镜头。如今,在制造镜头方面,您的公差要好得多。但仍然,当您尝试,这实际上是一个极端情况,您正在尝试放大 10 倍或 20 倍,并将其装入手机,这真的很难。所以,当您将其与非常小的像素结合时,您就会开始看到这些镜头分离,光线以不同的方式汇聚到传感器上,不同的波长。所以,红色和绿色聚焦不同,您会得到色差和其他类似的东西。这就是您用典型处理会得到的结果。但应用 Glass AI 后,它学会了在所有这些提到的条件下进行校准和纠正,不同的焦点设置,不同的距离等等。
所以,不同的视场部分表现不同。这是一个巨大的参数,网络必须学习。但结果是,您可以看到那些非常精细的细节。
再举一个例子。让我们放大一下这个阳台。您可以看到这里非常小的闪亮物体实际上得到了很好的解析。这件悬挂的毛巾的边缘,它要好得多。
但 Tom,在这张图像中,恕我直言,那条悬挂的毛巾也有点塑料感。
当然,这是极端变焦的情况,就像真的在推到实际传感器的极限之外。所以,这里实际上没有物理纹理细节。我们能够做的是纠正这两种边缘,并提供一些东西,你知道,当您稍微缩小一点时,我认为您会同意,它更清晰,更明亮,不仅仅是增加对比度。它是那种清晰度,那种中频细节变得更加清晰和自然。
那是一张 100 倍放大的像素级图像。所以,当您在普通屏幕上观看时,它看起来好多了。
是的,非常清晰。
我们还有另一个问题,这是来自 Steph Bishop 的。“镜头缺陷校正与处理噪点的重要性相比如何?”
如果在阳光明媚的户外,纠正镜头的重点比纠正传感器噪点更重要。如果您在,我说的是弱光。但为了让事情更具 perspective,手机的任何室内环境都意味着弱光,它会很嘈杂,除非您家里有非常花哨的影棚灯。但即使是任何普通的房子,开着灯也已经是弱光了。在这种情况下,我认为两者都同样重要,纠正传感器噪点和镜头效果。而且,再次强调,我知道我们已经说过几次了,我们不是分别纠正它们,它们是在一次通过中,用一个网络进行纠正,这非常重要。而且,我认为当您进入极端弱光时,比如 0.1 Lux 或类似的东西,那么噪点变得更重要,因为如果您有一个 12 百万像素的相机,就像大多数手机一样,而您现在处于极端弱光下,您会非常感激能得到一个高质量的 1 百万像素图像。所以,这意味着纠正像一个像素大小的操作不是超级重要,它更多的是关于纠正噪点。但再次回到我的陈述,如果您分别纠正它们,您永远无法达到最佳结果。当您一起纠正它们时,即使是这种极端弱光,它也非常重要。
也许是为了帮助解释,如果您有很多噪点,而您有一个花哨的传统降噪算法,您想做什么?您基本上想平均像素,对吧?但您不想在到达边缘时平均像素。您有一个边缘,您想保留边缘,对吧?现在,边缘的定义实际上取决于镜头,而不仅仅是。是的,您可以将边缘定义为大的过渡,但如果您不考虑您的镜头能做什么和不能做什么,或者镜头的模糊度,您就无法完美地降噪。您会降噪,但不如您能做的那样好。所以,将这些东西结合在一起,并使用一个算法或神经网络(在我们的情况下)来一起完成这些事情,可以获得最佳结果。它也取决于镜头的特性和传感器的特性,像素大小与镜头上的像差量。此外,不仅仅是模糊的大小,还有性质。所以,有些镜头的模糊很容易纠正,有些则更难纠正。所以,噪点在不同的空间频率下运行。所以,您的低频,您的粗略细节更容易纠正,而高频,非常精细的细节非常难纠正。通常,这是噪点占主导地位的地方。
有一件事我们还没有谈到,我认为很有趣,那就是“深度光学”这个概念,这是我们正在做的另一件事,它更多地属于硬件和软件联合设计的范畴。考虑到我们拥有这个强大的神经网络 ISP,我们开发的 Glass AI,这个可以纠正镜头操作的软件,另一个想法是,如何生产更好的硬件,同时考虑到软件能力。这就是您可以实际设计和工程化模糊,镜头的点扩散函数,以便神经网络能够提取最大细节,并且能够克服与噪点和去模糊的权衡。
或者,或者,我明白了,你正在构建的模型是如此的,嗯,非常彻底,基本上你对整个系统的各种特征有一个非常深入的模型,这就是为什么你在处理图像时能够做出你所做的改变,最终是的,是的,我们现在有一个来自推特的问题,更多的是关于业务方面的问题,问题是这样的,如果你的系统允许一家智能手机制造商使用质量较低、成本较低的摄像头部件,那么成本降低加上你的系统的总成本是否低于购买更昂贵的手机或更昂贵的成像系统的需要?智能手机摄像头大约在 10 到 15 年前开始出现,成本约为 5 美元,目标是将其降至 1 美元。但实际上发生的是价格疯狂上涨,因为现在有更多的摄像头,而且所有这些摄像头都有光学防抖功能,所有这些摄像头都有高分辨率传感器。如今,大多数手机至少有四个摄像头,五个摄像头,或者至少让我们说旗舰手机,这些摄像头的物料清单很容易达到 50 美元,100 美元,有些甚至有几年前猜测的一个设备价格上涨到远高于 100 美元,但我想说它们大多数都在几十美元的范围内。这意味着,这是一个很好的问题,你可以反过来问,假设你没有尺寸限制,如果你是一家手机制造商,并且你今天的质量达到了一定的水平,比如说你有一个 70 分,你想达到 90 分或 100 分,无论 100 分是多少,但你想有很大的提高,你有两个选择,对吧?一个是使用我们的软件,我只是举个例子,另一个选择是为使用更大的传感器、更好的镜头、更好的传感器支付更多费用。为了产生相同的质量差距,你需要支付的金额将是几十美元的量级,而且我把这不会装进手机的事实放在一边,这也是一个大问题,但这将是几十美元,而在我们的情况下,我不是在讨论我们的定价模式,但它比这低得多,比如低一个数量级,所以底线是,如果你正在制造一个摄像头,并且你正在权衡是使用更昂贵的硬件还是使用与你的摄像头配合的软件,那么使用软件而不是硬件可以为你节省很多钱。
除了金钱之外,一个有趣的观察是智能手机厚度随时间的变化趋势,你知道苹果很长一段时间以来一直试图让它们非常薄,然后其他公司增加了这些凸起,它们开始变得越来越厚。苹果最终也跟上了这一趋势,现在我们可能已经达到了一个极限,这些东西几乎,至少旗舰安卓手机,它们可能厚 14、15、16 毫米,它们几乎放不进口袋里,而且我认为有一种回归的愿望。所以他们在过去五六年里增加了越来越好的硬件,现在他们看起来像是,好吧,我们该怎么办?所以像我们这样的软件解决方案实际上是他们可以让他们再次变薄的一种方式,我认为这些事情会像潮水一样,这可能是智能手机的下一个趋势。
那么这一切将走向何方?智能手机摄影的未来是什么?哦,顺便说一句,为什么苹果不直接内置这个呢?你知道他们拥有任何公司都拥有的巨额财富,所以为什么他们没有发明这个并做到这一点?显然这很难。事实上,我已经在这一领域工作了大约 20 年了,你知道,显然有许多聪明人从事这些类型的工作,但当我开始做这件事的时候,需要一台超级计算机才能在几周内完成卷积算法,但现在我们可以在一秒钟内在一台移动处理器上运行它。进行如此大量的工程来实际高效地运行这些东西是非常困难的。有很多事情需要做到恰到好处。正如我们所说,我们必须在许多不同的条件下捕获大量数据。如果你做错了什么,你可能会搞砸图像,显然你不想那样做。但除此之外,我认为这些大公司在集成这些图像信号处理管道方面有一种传统的思维方式,他们投入了大量资金,比如成千上万的人和许多资源,并且朝着那个方向发展。所以这是一个经典的创新困境,需要一种新的思维方式才能部署它,我认为现在是时候了,我们拥有可用的处理能力,而且我们实际上已经工作了好几年,让它在这些边缘设备上运行良好,但我认为现在是这项技术部署的正确时机。
这一切将走向何方?短期内它将走向何方,长期内它将走向何方?短期内,我认为我们将在所有手机中看到更多的人工智能应用,不仅仅是按类别,而是所有手机制造商,芯片制造商,整个行业,无人机,安全摄像头,一切,而且这已经发生了,所以我们会看到更多。我们还特别看到更多像素级的人工智能,这基本上就是我们在做的事情,显然它会随着时间的推移而变得更好,公司之间会有竞争,一家公司会比另一家做得好一点。所以我想这就是短期。我认为更有趣的答案是,长期来看,它将走向何方?长期来看,我的意思是三年及以上,可能更早。实际上,你可以通过人工智能推动硬件行业的变革,我认为这非常有趣。你知道,有很多新的光学技术,金属透镜,折射元件,各种类型的自动对焦材料和机制,这些东西不起作用,但由于没有人工智能就无法使用它们,或者我们正在开发的,汤姆提到的深度光学技术。我举个例子,曾有人尝试在智能手机上使用显示屏下摄像头作为前置摄像头,一些手机制造商实际上已经推出了它,而且摄像头简直太糟糕了。原因是,在摄像头上放置显示屏就像一个衍射光栅,它会产生一个非常混乱的点扩展函数,光学效果变得非常非常像差,而且对于传统算法来说,以一种非常不可预测的方式修复它。这对我们来说根本不是问题,例如,我们会拿起那部带有显示屏下摄像头的手机,把它放在实验室里,我们就能从中获得完美的图像。所以只是举一个很小的例子,说明了什么被启用,这是一块由我们开发的这项技术所启用的硬件,我认为你可以将其扩展到更便宜的镜头,更薄的镜头。所以我们将在未来几年看到传感器尺寸相同但镜头厚度小得多的手机。所以所有这些手机上的凸起都会变得小得多,因为你知道一两毫米的差异,那么你就不会需要一个凸起。
在某个时候,也值得一提的是,折叠手机现在正处于上升趋势。我们上周在巴塞罗那的移动世界大会上刚回来,我和汤姆,我们看到了大量的折叠设备,三折、双折屏幕随处可见。这些折叠手机非常酷且有用,因为它们提供了大屏幕,但它们有一个大问题。手机的任何给定部分实际上都非常薄,这意味着当你设计一个摄像头放进去时,你现在只有正常手机空间的一半,甚至三分之一。这给摄像头带来了更多限制,所以它们今天只使用更差的摄像头。但如果我们能给这些摄像头带来足够大的质量提升,让客户说“好吧,我要买这个折叠设备,即使它有一个小摄像头,我仍然能从中获得良好的图像质量”,那么这就是一种二阶技术驱动力。但总而言之,能够利用人工智能来推动硬件变革将带来非常有趣的事情。
如果你能快速展示这张图片,这是我们从无人机拍摄的。所以我们不仅将我们的技术应用于智能手机,还应用于其他带有摄像头的平台。所以,在这里放大,这些是我们一位著名摄影网站的朋友。他们来我们办公室参观,你又可以看到,我们与左边的无人机直出的照片进行了比较,我们可以分辨出更多的细节。所以我们能够将我们的技术应用于任何有摄像头需要处理并且在边缘运行的平台,比如可穿戴设备,比如智能眼镜等等,我们认为这是一个非常重要的趋势。这是一个非常显著的差异,这两张图片之间的差异非常惊人。
非常快速地说,大型相机制造商也在尝试基于软件的校正,例如,我相信富士胶片和他们的一些相机一直在这样做,其他人也是如此。你对这种技术出现在大型相机上有什么看法?但请非常快速地说。它即将到来。我的意思是,我认为在他们拥有的流程方面,他们落后了。智能手机通常拥有更好的流程,因为出货量很大,但当他们开始使用相同的芯片时,例如高通芯片,那么他们就能运行我们的软件,我们也可以开发可以在这些芯片上运行的版本。
通过将人工智能应用于照片,与仅仅让光线穿过玻璃传感器相比,我们会失去什么吗?你什么都不会失去,除了处理时间和一点电池电量,但实际上这甚至不完全正确,因为计算摄影,非人工智能计算摄影实际上比人工智能消耗更多的电量,因为你知道高通和芯片制造商,他们付出了很多努力来使他们的芯片非常非常省电,我们可以在该芯片上运行大量的计算,持续一整秒,它们消耗的电量将比在相同时间内在 CPU、GPU 上运行的传统算法少。所以,我认为答案是否定的。
从你观察智能手机内部的角度来看,谁拥有最好的相机?简短的回答是,一些中国安卓手机拥有更好的硬件。有一些旗舰手机实际上比 iPhone 或任何 Pixel 或任何其他手机都贵,但是软件……等到我们发货了,我们就会拥有最好的。但图像是硬件和软件结合的结果。
所以,说仅仅购买更好的硬件是为了获得更好的图像是一个不完整的解决方案,因为你需要同时考虑这两者,这是准确的吗?是的,你需要考虑整体。有一个叫做 DxO 的网站,他们测试相机并对它们进行排名。如果你去图表的顶部,你会看到一些带有更昂贵硬件的手机,这并不奇怪。但其中一些手机实际上并没有更昂贵的硬件,只是有更好的软件。所以就像你说的,它是两者的结合。如果你拥有最好的硬件和最好的软件,你就会获得最好的图像质量,这一点很明显。我知道 DxO 对你的成果评价很高,祝贺你。非常感谢。
好了,我们时间到了。非常感谢 Ziv Atar 和 Tom Bishop。非常感谢你们两位,感谢你们的精彩演讲,也感谢观众提出的有趣问题。也感谢所有观看的人,特别是你们这些问了这么棒问题的朋友。现在,在你离开之前,请访问 cxo talk.com,订阅我们的新闻通讯,这样你就可以加入我们的社区。我们有一些非常棒的节目即将到来。这比我们通常做的技术深度探讨要深入得多,但我认为这是一个非常重要且有趣的话题,所以我想,好吧,让我们深入探讨一下。在评论区或者发消息,发烟雾信号,随便什么,告诉我你想看 cxo talk 的哪些节目。所以告诉我,因为我们在这方面反应非常迅速。非常感谢大家,祝大家有美好的一天,下次再见。
[音乐]