📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

The Two Harvard Dropouts Who raised $800M to take on NVIDIA

Invest Like The Best1:32:32

Transcription

Мы знаем, что инференс (вывод) станет крупнейшим рынком в мире. Кто произведет больше всего токенов, тот и станет самой ценной компанией в мире. >> У нас увольнялись люди. >> Да. >> Что люди буквально говорили: "Эту проблему невозможно решить". И удачи вам, ребята. >> Нужно быть немного не в себе, чтобы присоединиться к нашей компании. Вы убедите свою семью переехать в Сан-Хосе ради компании по производству полупроводников, которой управляют два, сейчас уже 24-летних парня, идущих против крупнейших компаний мира с дизайном, который, по их словам, будет не на 10% лучше, а в 10, в 10 раз лучше. Нам нужно 100 миллионов долларов, чтобы это сделать. Если мы это сделаем, мы думаем, что это может стать одной из самых важных компаний всех времен. >> Вы сидите в этот момент и думаете: "Черт возьми, мы не можем себе этого позволить". И я начал думать: "Хм, насколько сложно вернуться в Гарвард?" Итак, джентльмены. Прошло три года или около того, Гэвин, с тех пор, как мы с тобой в последний раз это делали, что безумно. И в то время я был просто дико заинтригован вашей историей и тем, что вы собирались построить. Я тогда мало что знал о чипах. Я рассматривал возможность инвестировать в компанию. И поэтому я звонил всем, кого мог представить, кто мог бы дать мне свое мнение или что-то в этом роде. И в то время, по сути, консенсус заключался в том, что такие компании не строятся молодыми людьми. что в мире полупроводников лучшие компании основаны 40-50-летними людьми, у которых за плечами целая карьера, которые изучили все проблемы, которые выпустили множество чипов. Два 21-летних парня, как бы, не собираются этого делать. Это просто не сработает. И это было показателем темы, которая заключалась в том, что никто в нас не верит. Очевидно, сейчас это сильно изменилось. Знаете, просто пройдитесь по коридорам и поговорите с людьми, которые решили прийти сюда работать. Но в первые дни казалось, что это то, с чем вам приходилось бороться. Каково это было бороться с этим, когда набор устоявшихся игроков и целая индустрия людей и инвесторов и всех остальных, как бы, не верили в вас, и что это закалило в вас, чтобы построить компанию так, как вы это делаете, как это повлияло на вас? >> Я думаю, что требуется определенный уровень наивности, чтобы думать, что вы можете создать чип лучше, чем любой другой когда-либо созданный ИИ-чип, и построить компанию, чтобы сделать это намного быстрее, чем когда-либо было сделано. У нас есть эта наивность. Много раз мы говорили: "Почему это невозможно?" и действительно настаивали на этом, и оказывается, что ответы всех чрезвычайно разрозненны и привязаны к набору ограничений, которые больше не актуальны, а реальность такова, что вся индустрия полупроводников и центров обработки данных построена на буфере, и под этим я подразумеваю, что каждая часть стека, от EDA-инструментов до модулей питания, до печатных плат, до дизайна чипов и стандартных ячеек, все построено для общего назначения для всего, не только в центре обработки данных, но и для IoT, на периферии и так далее. И когда у вас есть конкретный вариант использования, для которого вы действительно пытаетесь разработать, вы можете сильно изменить ограничения. И я приведу вам очень простой пример, который делаем не только мы: одна из вещей, которая вас очень волнует, — это тактовая частота вашего чипа. Она пропорциональна пропускной способности вашей системы. Знаете, когда вы выполняете проверку на соответствие различным временным параметрам, вы знаете, на какой тактовой частоте вы фактически сможете работать, когда будете выпускать свой чип. Существует концепция, называемая "углами", которая заключается в том, при каких температурах вы сможете работать на этой тактовой частоте. Знаете, стандартные конфигурации для многих из этих EDA-инструментов предполагают, что вы будете использовать свои чипы при минусовых температурах. Ну, я не знаю, как вы, но я никогда не видел ИИ-центра обработки данных со льдом внутри. Так что, знаете, мы можем быть довольно уверены, что наши чипы не должны работать на полной скорости при 0 градусов по Цельсию. На самом деле, они никогда не будут работать ниже 80 градусов по Цельсию. И просто зная, что это ограничение, которое не имеет значения, мы можем внести массу изменений во всю систему. Это очень простой пример, но есть много других, где вы получаете 20% здесь, 50% там, в 2 раза здесь, и это накапливается в систему, которая может быть радикально лучше для инференса. >> Ну, я думаю, вы нашли два типа людей. Есть люди, которые шли чисто по эвристике. Хорошо, молодые основатели. Они утверждают, что могут победить крупнейшую компанию в мире по производительности. Это не может произойти. И нет ничего, что вы могли бы сказать мне, что заставило бы меня передумать. Но есть и люди, которые, конечно, скептически настроены, которые готовы сказать: "Я потрачу время. Я сделаю работу". И это действительно возможно. Например, одним из наших самых ранних, самых ранних сторонников был этот парень Марк Росс. И Марк был очень уважаемым экспертом по полупроводникам. Раньше он был техническим директором Cypress Semi, которая была продана за 9 миллиардов долларов. И когда мы встретились с ним, мы были просто парой парней в общежитии. И мы пришли к нему и сказали: "Эй, мы хотим создавать оборудование для инференса. Мы думаем, что можем быть намного быстрее Nvidia". А Марк такой: "Нет, не можете. Это не сработает". Но он хотел меня убедить, если вы напишете технический документ. Вы должны построить функциональную симуляцию и показать мне. И вот, после многих долгих ночей, я вернулся к Марку и сказал: "Эй, вот симуляция. Что вы думаете?" И он такой: "Хм, это работает". Но чтобы создать такую компанию, вам понадобится большой капитал. Вам понадобится как минимум 3 миллиона долларов, чтобы просто начать. В итоге мы привлекли пять, а потом еще много. И тогда он снова был удивлен, но стал более вовлеченным, а затем стал советником, полувременным советником и, в конечном итоге, полноправным техническим директором, поскольку он видел все больше и больше прогресса в разработке. И я думаю, что в целом это очень сильно отфильтровалось. люди, которые хотят быть правыми независимо от обстоятельств, люди, которые хотят быть очень ищущими истину и говорят: "Конечно, я скептически настроен, но я сам разберусь с цифрами. И если я смогу понять, почему это возможно, ну, давайте построим это". >> Конкретные ставки, которые вы сделали, то, как вы построили эту систему, мне чрезвычайно интересны. И поскольку так много людей пытаются сделать это сейчас, создавать новые чипы, которые будут лучше обслуживать инференс в огромных масштабах, мир интересуется исследовательскими подходами, различными архитектурными подходами, которые люди применяют при создании нового ИИ-чипа. И я хотел бы, чтобы вы начали с описания того, что это такое, что оно делает, но, возможно, более интересно и важнее, с процесса, который вы прошли, чтобы решить, какие ставки делать, какие технологии изобретать, и сравнить и противопоставить их тому, что, как вы видели, пытается сделать остальная часть рынка. >> Да, я думаю, вы начнете с продукта. Мы не просто создаем чип. Мы создаем полное решение для инференса. И это означает стойку. Это означает чип. Это означает подачу питания на чип. Это означает плату, на которой он находится. Это означает интерконнект, по которому чипы общаются друг с другом. Это означает производство для этого массового объема стоек. По сути, производство — это продукт. Мы думаем о том, как получить наше преимущество. Есть две ключевые части работы инференса: префилл и декодирование. Теперь у нас есть два ключевых тега для обеих этих вещей. Префилл — это чтение огромного объема текста, а декодирование — это использование этих данных для генерации выходных токенов. Когда вы выполняете префилл, ваша главная задача — не предсказывать токены. Вы уже знаете текст. Ваша задача — привести модель в правильное состояние памяти. >> Да. >> То, что мы называем KV-кэшем, в правильном состоянии. >> Затем вы можете выполнить декодирование с тем же KV-кэшем. Поэтому мы часто делаем то, что называем разделением префилла и декодирования. Вы затем передаете эти модели памяти, эти KV-кэши в кластер декодирования, а затем используете этот кластер для генерации следующих токенов. >> Так это вроде как зарядить пистолет, а потом выстрелить. Если я думаю об этом в очень простых терминах. >> Да, вы поняли. Это заставляет модель запоминать нужные вещи, а затем использовать их для выполнения задач. >> Обычно люди думают об этом рынке немного лениво или говорят: "Вы чип для префилла? Вы чип для декодирования? Если вы чип для декодирования, вы чип HPM? Вы чип SRAMM? Вы чип 3D RAM? Вы используете оптику, медь?" Когда мы начинали, мы просто хотели понять, почему чрезвычайно умные люди работают в этих разных направлениях. Мы серьезно рассматривали архитектуры, такие как наличие большого количества памяти DDR и общего пула памяти, и рассматривали продвинутую упаковку, чтобы выйти из береговой линии. Мы рассматривали такие вещи, как, знаете ли, есть ли способы разместить чипы памяти поверх вычислительных чипов. Делая это, мы поняли, что бесплатных обедов не бывает. Знаете, у всего есть компромисс, верно? Знаете, 3D RAM, у вас есть тепловая проблема, у вас есть проблема с цепочкой поставок, вам нужно разобраться с гибридным соединением, вам нужно разобраться с флопсами. Итак, теперь вы чип для декодирования. Итак, мы прошли через все, как на стороне префилла, так и на стороне декодирования. Делая это, мы поняли, что есть несколько пространств дизайна, которые никто серьезно не пытался исследовать, потому что они никогда не делались в ИИ-чипах. И мы спросили себя, каковы фактические метрики, которые будут иметь наибольшее значение. На стороне префилла важно количество флопсов и плотность флопсов. И люди часто говорят о флопсах как о заголовке, но в реальности вы должны заботиться о флопсах, которые вы получаете при работе с реальными рабочими нагрузками. Существует концепция, называемая MFU, или утилизация флопсов модели, которая заключается в том, сколько центов на доллар вы фактически получаете от каждого заявленного пикового флопса, и на GPU вы часто получаете от 20 до 50% в зависимости от рабочей нагрузки, и на самом деле вы можете доказуемо не работать на 100%, потому что у вас есть тепловая проблема, где по мере увеличения утилизации флопсов у вас больше транзисторов включается и выключается, вы потребляете больше энергии, и чип будет саморегулироваться и фактически снижать свою тактовую скорость, чтобы убедиться, что он не перегревается. Когда мы смотрели на инференс, мы сказали: если мы хотим намного больше флопсов, потому что мы хотим работать с гораздо более высокой пропускной способностью, мы фундаментально должны решить тепловую проблему, прежде чем даже думать о добавлении флопсов к чипу. Если я просто добавлю больше флопсов к GPU сегодня или другому ИИ-чипу, я на самом деле не получу большей производительности, потому что он просто будет термально дросселироваться. Фундаментально, суть этого заключается в концепции масштабирования Диннарда, которая заключается в том, что напряжение квадратично пропорционально мощности. Так что, если я увеличу напряжение в 2 раза, моя мощность увеличится в 4 раза. Если я уменьшу напряжение вдвое, моя мощность уменьшится в четыре раза. Поэтому мы спросили себя, как мы можем работать с более низким напряжением, чем GPU? И мы много говорили об этом. Мы вылетели в Кремниевую долину после отчисления и, по сути, спросили десятки людей в полупроводниковой отрасли во всех этих различных компаниях по производству чипов, как они это сделали. И ответ, который мы получили, был таким: вы не можете работать с более низким напряжением, чем GPU. И это было очень неудовлетворительно, потому что существовало множество различных отраслей производства чипов, которые работают с более низким напряжением, чем GPU. Я имею в виду, майнеры биткойнов работают при напряжении менее четверти от напряжения GPU. Так что это, очевидно, физически возможно. Вопрос в том, есть ли проблемы с архитектурой GPU, которые делают ее неспособной работать при таких напряжениях? И когда мы долго смотрели на проблему, мы смогли создать новый механизм работы при гораздо более низких напряжениях, новый тип подачи питания, который мы называем низковольтным инференсом. И мы думаем, что все ИИ-чипы в будущем будут низковольтными чипами. Им придется впихнуть гораздо больше флопсов в ту же площадь кремния и без термального дросселирования работать при гораздо более низких напряжениях. Это довольно просто. Для декодирования — это все игра с памятью. Чем больше привязано к памяти, тем быстрее вы можете загрузить модель, быстрее загрузить KV-кэш и обслуживать больше токенов в секунду на пользователя. Мы думаем, что люди задают неправильный вопрос. Люди часто спрашивают, сколько пропускной способности памяти на вашем чипе. Вы должны спросить, сколько пропускной способности памяти на вашем полномасштабном кластере. Что мы можем сделать, это добавить гораздо, гораздо больше пропускной способности и гораздо меньшую задержку от чипа к чипу к нашим интерконнектам. Это позволяет нам обслуживать модели с гораздо более высокой скоростью, потому что вы можете использовать SRAMM и HPM всего кластера как единый пул. И это наша вторая ключевая техническая ставка. То, что мы называем кластерной памятью. И на GPU сегодня пропускная способность памяти кластера часто очень плохо используется, потому что время перехода от одного GPU к другому чрезвычайно велико. Например, на чипах Blackwell это может быть около 4000 наносекунд для перехода точка-точка. И это означает, что если вы перейдете к настройке 8xTP, вы получите намного, намного меньше, чем 8-кратное увеличение количества токенов в секунду на пользователя. И мы построили свой собственный полностью кастомный стек интерконнектов. Мы взяли все выше второго уровня Ethernet, сделали его полностью кастомным, и мы можем добиться гораздо лучших задержек и пропускной способности таким образом. Мы можем сократить это более чем в 5 раз. И это позволяет нам более эффективно использовать память других чипов. По мере увеличения размера мира ваше время на токен уменьшается пропорционально. Это не так удивительно, учитывая, что все эти архитектуры были построены до ChatGPT. Так что, если мы пытаемся создать чип для современных рабочих нагрузок, он будет выглядеть очень иначе. То, как мы организуем наши флопсы, то, как мы используем наши домены напряжения, то, как мы используем наши плоскости питания, будет выглядеть супер иначе. То, как мы делаем упаковку, будет выглядеть супер иначе. То, как мы делаем дизайн платы, будет выглядеть иначе. А на стороне декодирования то, как мы все соединяем, будет выглядеть очень иначе. Сейчас мы выводим на рынок наше первое поколение этой технологии низковольтного инференса, которая работает при напряжении менее половины напряжения любого другого ИИ-чипа. >> RAMP — это единственная платформа, созданная для того, чтобы сделать вашу финансовую команду более компактной, быстрой и лучшей, экономя бизнесу в среднем 5% в год, чтобы вы могли сосредоточиться на росте. Клиенты Ramp росли по доходам в 3,2 раза быстрее, чем средний американский бизнес. Visa, Perscell, Cursor, Stripe, Notion, 11lab, Shopify и 70 000 других компаний работают на Ramp. Моя тоже, и ваша тоже должна. Узнайте больше на ramp.com/invest. OpenAI, Cursor, Anthropic, Perplexity и Verscell имеют что-то общее. Все они используют WorkOS. И вот почему. Чтобы достичь корпоративного внедрения в масштабе, вы должны обеспечить основные возможности, такие как SSO, skim, arbback и журналы аудита. Вот где на помощь приходит WorkOS. Вместо того, чтобы тратить месяцы на создание этих критически важных возможностей самостоятельно, вы можете просто использовать API WorkOS, чтобы получить их все с первого дня. Вот почему так много ведущих ИИ-команд, о которых вы слышите, уже работают на WorkOS. WorkOS — это самый быстрый способ стать готовым к корпоративному использованию и сосредоточиться на самом важном, вашем продукте. Посетите works.com, чтобы начать. Felix от Rogo — это персональный финансовый агент, который превращает один запрос в готовые к работе клиентские материалы, используя собственные шаблоны, контекст и стандарты вашей фирмы. Отправьте Felix электронное письмо, например: "Возьми эти комментарии и переработай их для меня". Или: "Обнови мой трекер с учетом контекста этих писем". Или: "Проведи расчет способности к оплате для этого покупателя". И Felix отправит обратно готовые презентации PowerPoint, Excel-модели и собранные исследования. Felix работает так, как уже работает ваша команда, быстро и точно выполняя работу круглосуточно. Узнайте больше на rogo.ai/felix. Если посмотреть в целом, почему это так важно? Почему доставка гораздо более высокой пропускной способности, гораздо более низкой стоимости за токен, лучших токенов на ватт, всех этих метрик, о которых мир будет говорить все больше и больше. Все знают, что предложение — это большая проблема прямо сейчас. Почему это в более широкой перспективе, глядя на десятилетие вперед, является узким местом в технологическом мире? Ну, я думаю, это сводится к производительности, где мы находимся в этот чрезвычайно интересный момент в истории цивилизации, где существует реальный искусственный интеллект, а не научно-фантастические вещи, но эти модели могут решать проблемы, которые большинство людей не могут. И это приведет к новым научным открытиям. Это обеспечит мгновенный доступ к медицинскому обслуживанию, мгновенный доступ к образованию, и теперь речь идет только о том, сколько людей могут использовать это одновременно, сколько продуктов могут обслуживать это одновременно. А также скорость выполнения различных задач. Так что, когда вы думаете о времени от звонка до звонка, если мы можем взять агента, который может работать с определенным качеством модели и может занять год для решения определенной задачи, используя вычислительные мощности для инференса, если у вас есть гораздо более быстрая скорость декодирования, вы можете сжать это до месяца. Таким образом, объем научных инноваций и объем фактического распространения технологий будет происходить намного быстрее. А затем вторая часть — это одновременность, где сегодня просто невозможно, чтобы миллиард человек одновременно использовали эти модели. В конечном итоге, некоторым людям придется снизить качество. Модели некоторых людей будут медленнее. Некоторые люди просто не смогут получить доступ к оборудованию. Через несколько лет появятся гигантские модели, обслуживающие миллиарды пользователей. Мы находимся на самых ранних стадиях развития ИИ сегодня, где платные планы, всего несколько миллионов пользователей в мире используют платные планы ИИ-моделей. Итак, мы находимся на 1/1000 мировой популяции, фактически использующей эти вещи. Так что, если вы хотите обслуживать в гигантском масштабе, многое изменится, и одно из них — это количество чипов, которые общаются друг с другом, где люди обычно думают об этом в контексте обучения. У вас есть эти гигантские обучающие кластеры. У вас есть Colossus с более чем 100 000 GPU, которые все связаны вместе. И, знаете, сторона инференса, сегодня люди обычно думают об этом как о кластере из 8 чипов или, может быть, просто NVL72 в качестве масштабируемой области, но очень быстро это станет тысячами чипов и десятками тысяч чипов. И способ получить максимальную производительность там, время между отправкой данных с одного чипа на другой, эта примитивная операция имеет гораздо большее значение, чем ей сейчас уделяется должное. Поэтому, когда мы думаем об оптимизации пропускной способности памяти для системы, вы должны думать о том, как быстро эти чипы могут общаться друг с другом, потому что если они могут общаться только очень быстро друг с другом и очень медленно с другими чипами, вы на самом деле не сможете обслуживать гигантские модели со скоростью 10 000-20 000 токенов в секунду. Поэтому нам нужны инфраструктуры на несколько порядков больше, построенные по всему стеку, от питания, знаете ли, от пластины до ватта, знаете ли, от транзистора до токена, чтобы фактически донести эти вещи до мира. И я думаю, что вы посмотрите на большинство других товаров, например, на iPhone, они достигли экономии за счет масштаба, в результате чего больше денег на самом деле не покупает лучший iPhone, будь вы миллиардером или просто средним американцем, вы покупаете один и тот же телефон. И токены пока не такие. Мы все еще на самых ранних стадиях, когда универсальная система, относительно небольшая, как бы вручную создает эти токены, как будто они делали винты в эпоху Возрождения. И я хотел жить в мире, где у вас такая же экономия за счет масштаба для производства токенов, как и для производства, скажем, iPhone или автомобилей, или чего-либо еще. >> Я думаю, что это один из огромных прорывов, который позволяет огромной группе людей использовать модели наилучшего качества. Я думаю, что экономия за счет масштаба сделала капитализм очень, я не знаю, справедливым. Я думаю, что это позволяет вам иметь один и тот же продукт во многих, многих разных руках, и вы можете обслуживать гораздо больше пользователей на одном масштабируемом кластере, что позволяет вам приблизиться к этой точке для обслуживания токенов. >> Да. И также некоторые продукты не могут быть использованы, если они медленные. >> Да. >> Так что, если вы хотите обслуживать модели кодирования, и вы хотите, чтобы люди действительно их использовали, есть определенное количество токенов в секунду, которое вам нужно достичь. Так что вопрос в том, сохраняя эту скорость на токен, сколько пользователей я могу обслуживать одновременно? И вы можете просто решить: я отключу большую часть мира от использования этих вещей, или все получат худший опыт. Так что фундаментально вам нужно найти способы продвинуть кривую, и именно поэтому существует такое давление на новое оборудование. Я хотел бы уделить время, чтобы остановиться и услышать ваши истории о том, как вы пришли к этой идее и этой компании, а затем пройтись по тому, каково было ее строить, потому что, я думаю, таким образом мы поймем систему, которую вы построили для самой компании, которая затем сможет обеспечить последующие поколения таких продуктов, как этот, для этого сумасшедшего будущего инференса, на которое мы смотрим. Роб, возможно, начиная с вас, расскажите, как далеко назад вы хотите, но что меня интересует, так это ваша личная история, которую я впервые услышал от кого-либо из вас много лет назад, которая действительно меня поразила. Меня больше всего интересует ваша мотивация в конечном итоге быть здесь и делать это. >> Это началось еще в старшей школе. Мне очень не везло и везло в разные моменты жизни. Это было одно из самых трудных времен. В конце второго курса старшей школы я получил травму на турнире по боевым искусствам. На следующий день я почему-то не мог ходить. И они думали, что что-то не так с моим крестцово-подвздошным суставом или что-то в этом роде. Я проходил физиотерапию. Я делал разные сканы. Они не могли понять. И в конце концов они обнаружили большой нарост на моей спине на МРТ, и мне сказали, что это опухоль. Рак кости четвертой стадии, мне сказали, что у меня шанс выжить менее 30%. Это был двухлетний сумасшедший опыт химиотерапии, операций, обучения ходьбе заново. И когда вы проходите через что-то подобное, это действительно меняет окно Овертона человеческого опыта и заставляет вас ценить то, что на самом деле важно. И вы также спрашиваете себя, что вы будете делать, если у вас будет шанс жить? Если вы действительно хотите пройти через что-то подобное, вам нужно надеяться на что-то. И я всегда знал, что хочу сделать что-то очень значимое, если у меня будет шанс пройти через это. Мне потребовалось несколько лет, чтобы понять, что это будет. И в то же время, когда я поступил в колледж и встретил множество других людей, создающих крутые технологии, я был чрезвычайно взволнован ИИ-моделями, особенно после выхода GPT3, и я подумал: "Вау, это первая модель, которая может говорить по-английски, и эти вещи станут действительно умными". Что произошло, когда вышел GPT4, появился GPT4V, который был первой моделью с загрузкой изображений. Так что я просмотрел свою галерею и нашел фотографию своей спины с этим наростом до того, как мне поставили диагноз, и сказал: "Эй, ChatGPT, представь, что ты эксперт-врач. Пациент приходит, и он говорит, что у него этот нарост на спине. Что это может быть?" >> И он немедленно говорит: "Это может быть опухоль. Вам следует немедленно сделать МРТ. Идите к врачу". И я просто сидел там, застыв. Это заняло шесть месяцев. >> Да, это заняло у меня 6 месяцев. И знаете, вчера этой функции не было. Сегодня она есть. Я иду показать своим родителям, и я получаю уведомление: "У вас сегодня закончились кредиты на изображения. Вам нужен про-план". И я такой: "Черт возьми". Это изменит все, и, знаете ли, у нас явно нет инфраструктуры для этого, и есть очень мало вещей, над которыми вы можете работать, которые действительно могут быстрее донести эту технологию до мира в масштабе. Я имею в виду, есть много очень умных людей, работающих над моделями. Знаете, фабрики кажутся, возможно, недостижимыми для работы, но казалось, что все оборудование было разработано до ChatGPT. Так что, каждый GPU, каждый TPU, каждый ИИ-чип, который обслуживал эти модели, был фундаментально создан до этого и доработан для обслуживания этих современных моделей. Появится совершенно новая волна архитектур, и что может быть более захватывающим, чем донести это до всех? Совершенно другой угол зрения в то же время. Я руководил стартап-инкубатором под названием ProR, который инкубировал множество различных компаний. Некоторые из самых ранних — это Cursor и Anyphere, которые объединились, а также Mer и Etched, и еще несколько других. Да. В то время, когда эти модели становились умнее, это был 2022 год, я понял, что все эти компании тратят все привлеченные деньги на вычисления, и я пришел к этому выводу, работая над некоторыми своими вещами, что "Боже мой, все продукты, которые я хочу создать, будут стоить десятки миллионов долларов в год на инференс". Это не будет жизнеспособно. Структура затрат каждой программной компании, себестоимость продукции больше не будет нулевой для дополнительного пользователя. Она будет довольно высокой, и это будет функция инференса, а затем операционные расходы каждого бизнеса также будут инференсом, поскольку люди используют все больше и больше кодирующих агентов. Так что фундаментально кажется, что инференс будет действительно важен, и кажется, что мы находимся на десятилетнем марше, чтобы инференс стал, знаете ли, крупнейшим рынком в мире. Так что, когда вы думаете об этом через 10 лет, будут гигантские проекты, где все в этом центре обработки данных фундаментально не было разработано сегодня, мы должны выбрать что-то и работать над этим. И, знаете, вот так все и началось. >> Гэвин, я действительно рад, что ты вернешься так далеко, возможно, даже раньше старшей школы, и расскажешь о своих любимых отметках на временной шкале, которые в конечном итоге привели к твоим амбициям бросить Гарвард и основать эту компанию. Моя первая работа была в компании под названием Exnord, где я занимался разработкой ядра. Мне было 17 лет. >> Да. >> И 17-летний не может подписывать юридически обязывающие контракты. Поэтому, вместо того чтобы пройти традиционный CIA, они посадили меня и сказали: "Гэвин, не делись этой информацией". И Extern была одной из немногих компаний, которая увидела: "Эй, возможно, это хорошая сделка". И я начал работать над созданием ядер. И с тех пор я делал это в ряде других компаний. Extern был куплен Apple за 200 миллионов. То же самое я сделал в Octo, которая была куплена Nvidia за сотни миллионов долларов. Но когда вы занимаетесь такой работой с ядрами, вы понимаете, что математика относительно проста. >> Хорошо. >> Но для достижения высокоскоростного декодирования важно перемещение данных. Почти вся ваша работа заключается в оптимизации того, как вы перемещаете данные по одному чипу или между несколькими чипами. И именно поэтому мы создали эту технологию кластерной памяти. Мы значительно снижаем время интерконнекта. Вы можете перемещать гораздо больше данных и, как следствие, значительно ускорить генерацию каждого последующего токена и создавать эти сумасшедшие вещи, о которых говорит Роб, чтобы выполнять годовую работу за месяц или даже больше в будущем. >> Можете ли вы рассказать о соревновательном духе, который проявляется в некоторых школьных соревнованиях, в которых вы участвовали и побеждали? >> Мы участвовали в нескольких. Например, я был очень активен в FTC Robotics, и мне повезло иметь очень талантливого партнера Сэнфорда, с которым мы долгое время были частью традиционной школьной команды, где около 20 парней работали вместе, как это часто бывает в First Tech Challenge, и цель состояла в том, чтобы построить робота, который набирает больше всего очков, и многое другое. И First уделяет большое внимание сотрудничеству с другими командами, попыткам хорошо документировать, попыткам вдохновить других сделать то же самое. Сэнфорд и я решили, что вместо того, чтобы делать это таким образом, мы выиграем, и мы не делали ничего, кроме того, чтобы набрать больше всего очков. >> как команда из двух человек >> как команда из двух человек >> вместо команды из 20 человек >> что мы были намного, намного меньше, чем почти любая другая команда в соревновании. Мы поняли, что если мы собираемся специализироваться, если мы собираемся выиграть эти чертовы игры действительно хорошо, нам не нужно будет продвигаться на основе качества нашей документации или нашей работы с общественностью. >> мы просто собирались выиграть. >> И так мы и сделали. Мы отделились, создали эту команду из двух человек, построили робота и решили перепроектировать его каждые 3 месяца. И мы сделали это. И на самом деле у нас был мировой рекорд по наивысшему счету во время этого соревнования в один момент. Мы были оценены OPR как третьи в мире по разработке программного обеспечения, и это была чертовски хорошая машина. >> Что из этого эпизода можно перевести как аналог того, как вы построили Etch, компанию? >> Мы думаем о том, как вы хотите создать полномасштабный продукт, как этот. Есть несколько ключевых идей. Одна из них — это скорость, скорость, скорость, вы выигрываете, отправляя продукт. Вы не собираетесь выигрывать, имея лучшую работу с общественностью или лучшую коммуникацию. Вы выигрываете, имея лучший продукт. >> Выбрали не иметь коммуникаций. >> Именно так, как в робототехнике. >> Есть много способов выиграть в бизнесе, но мы предпочитаем сосредоточиться только на создании лучшего продукта. >> И аналогично, мы думаем, что можем сделать это с гораздо меньшим количеством людей, если вы готовы сосредоточиться только на продукте, продукте, продукте, продукте и неустанно работать, вам не нужно 20 000 человек, как у больших компаний, вы можете создать лучший продукт в мире с гораздо меньшим количеством людей. Знаете, есть поговорка: "лучшая часть — это отсутствие части". Я думаю, для нас "лучший поставщик — это отсутствие поставщика". Насколько это возможно, мы хотим вертикально интегрировать весь продукт. Как потому, что мы получаем большую производительность, так и потому, что мы можем двигаться намного быстрее. Итак, знаете ли, все, от чипов до плат, до холодных пластин, до интерконнектов, до даже производства. Мы хотим делать все это как можно более внутренне. Мы на самом деле, я думаю, единственная стартап-компания прямо сейчас, которая строит свой собственный сервер, а также свои собственные чипы. И мы сделали это одновременно. Пару лет назад мы были в последний раз публичными. В то время мы только начали строить нашу команду по производству серверов, и мы привлекли Брайана Лера, который построил все системы HGX и DGX Nvidia, что составляет около 80% выручки, и мы сказали, что будем строить сервер одновременно. Мы на самом деле прошли несколько итераций сервера до того, как чипы вернулись. До того, как чипы вернулись, мы сделали тепловые чипы, которые имели точно такие же горячие точки, как мы ожидали от наших чипов. Так что мы могли построить холодные пластины. Мы могли их перегреть и взорвать. У нас не было ни одной утечки с тех пор, как наши чипы вернулись с холодными пластинами, потому что мы уже их проверили. Да. У нас есть фабрика на Тайване. У нас там работает несколько десятков человек. Мы построили клон нескольких испытательных станций в нашем офисе. У нас есть центр обработки данных мощностью 2 мегаватта на этом этаже. И мы проводили 24/7 циклы разработки. Знаете, люди работают в дневные и ночные смены, чтобы как можно быстрее запустить оборудование. Это крайняя вертикальная интеграция и крайняя параллелизация графика позволяют вам выводить продукты на рынок намного быстрее. Если вы думаете о создании ранней команды и о том, что для этого потребовалось двум молодым парням, создающим эту компанию, есть много очень талантливых молодых предпринимателей, возможно, впервые за долгое время такого масштаба или величины, которым, вероятно, могут принести пользу уроки, которые вы усвоили. Привлечение очень искушенных, талантливых людей, чтобы присоединиться к вам даже после карьеры в других великих компаниях. Если бы вы преподавали это как класс, вот как получить элитный талант, когда вы молоды, неопытны и наивны, какой был бы учебный план? >> У нас довольно бинарная философия талантов. Она начинается с того, что мы называем легендами, когда мы пытаемся решить невероятно сложную техническую проблему и, как правило, сделать что-то, что раньше не делалось. Нам нужно найти лучшего человека в мире, и часто номер один в мире по сравнению с номером 10 или номером 100. Огромная разница в том, возможно ли решить проблему. Мы создали систему, которую мы называем рекрутингом на основе проектов, где мы наносим на карту все самые сложные технические проблемы во всех отраслях, которые когда-либо приходилось решать. Мы смотрим на временность. Итак, кто те люди, которые сделали переход от нуля к одному? Кто главный, так сказать, кто на самом деле сделал работу? Мы говорим с как можно большим количеством людей. А потом мы просто отслеживаем это. И вы удивитесь, сколько людей говорят "да" после первого разговора, это довольно низкий процент, но количество людей, которые говорят "да" после 20-го разговора, удивительно велико. Вам действительно нужно настаивать. Когда вы слышите "нет" от кого-то, кто действительно лучший в мире, это действительно означает: "Эй, вам следует вернуться, когда вы докажете еще несколько этапов". >> Да. >> И я думаю, что одно из самых убедительных доказательств — это то, что мы делаем смелые заявления. И когда вы снова и снова их выполняете, это действительно вдохновляет на веру. Когда мы решили построить сервер, а не просто чип, мы смотрели на это и говорили: "Сколько продуктов действительно было выпущено в масштабе для серверной системы, которые действительно имеют ту плотность мощности, которую мы пытаемся решить?" И, знаете, мы просто сказали, если бы мы могли взмахнуть волшебной палочкой, как бы выглядел лучший человек в мире? И мы подумали: "Ну, если бы мы могли найти кого-то, кто начал работать в NVIDIA и построил всю команду серверов на протяжении всех их различных поколений, изучил все эти разные вещи, но при этом оставался бы предприимчивым, понимал культуру стартапа, но видел бы масштаб, это был бы лучший человек". Итак, мы нанесли на карту все различные команды, связанные со всеми различными серверными продуктами в Nvidia, и нашли трех человек, которые, по нашему мнению, могли бы подойти. И мы поговорили со всеми ними, и двое из них только что вышли на пенсию, а один планировал сделать еще одно поколение для Nvidia, а затем уйти на пенсию. Его зовут Брайан. И со временем мы убедили его присоединиться. Брайан основал команду HGX и DGX в NVIDIA, которая составляла большинство выручки Nvidia, десятки миллиардов долларов в квартал. И другие двое в итоге инвестировали, кстати. Но когда у вас есть кто-то вроде него, он просто знает, как выглядит хорошо, потому что он видел это. И так много раз мы разговаривали с Брайаном, и он просто указывал на нас и говорил: "Это миллиардный урок, который я усвоил. Миллиардный урок, который я усвоил, который просто экономит нам циклы". И вы объединяете кого-то вроде Брайана с кем-то вроде Сэнфорда. >> У вас есть для них имя? Так Брайан — легенда. А как насчет Сэнфорда? >> Да, мы говорим "чипы на плечах" и "чипы в дата-центрах". >> Да. Итак, Сэнфорд и Гэвин в старшей школе были чемпионами мира по робототехнике. И Сэнфорд заканчивал последний курс колледжа, и мы позвонили ему пару лет назад и сказали: "Эй, можешь приехать, посмотреть, что мы делаем, нам нужна помощь на стороне платформы", и он приезжает на неделю, и мы говорим: "Можешь ли ты построить холодную пластину на этой неделе?" И если вы спросите любого инженера по теплотехнике, любого такого специалиста, они подумают, что вы просто совершенно наивны, правда? Я имею в виду, эти вещи занимают месяцы, и, давайте будем честны, так и есть, но вы можете добиться реального прогресса за неделю, если вы поставите себе цель и поверите, что это возможно. И он построил приспособление за неделю, которое фактически снизило риск довольно важного вопроса по питанию, который у нас был. И вы объединяете этих двоих, и они сделали невероятные вещи, и одно не возможно без другого, потому что вам нужны чрезвычайно целеустремленные люди, которые продолжают спрашивать "почему" и не знают, где закопаны тела, чтобы идти на множество агрессивных рисков, а затем вам нужны люди, которые видели масштаб и все еще имеют предприимчивый менталитет стартапа, чтобы помочь им на этом пути. Это действительно легенды плюс сырой, знаете ли, какой-то наивный сырой талант, основанный на первых принципах, но это сочетание. Дело не только в том, что у вас есть оба в компании. Дело в том, что они работают вместе. >> Именно так. >> Если я думаю об этой воронке, есть ли что-нибудь еще интересное, что можно сказать о том, насколько лучше вы стали в рекрутинге и почему эти показатели продолжают улучшаться? Один из шокирующих моментов заключается в том, что быть такой контркультурной ставкой как бы самоотбирает. >> Верно. >> Что вы тот тип человека, который, я думаю, является оппортунистом, который присоединится к любой модной компании, а не будет проводить глубокую проверку, вы не придете сюда работать. >> Верно. >> И это одна из вещей, о которых я беспокоюсь, поскольку мы объявляем все больше и больше о продукте и его спецификациях, мы можем потерять часть этого, если не будем очень осторожны. >> Нужно быть немного не в себе, чтобы присоединиться к нашей компании. Вы думаете об этом на бумаге, это как вы, человек, который, вероятно, очень успешный инженер, зарабатывающий хорошие деньги, это ликвидность, это предсказуемость где-то еще, вы убедите свою семью переехать в Сан-Хосе и жить в этой квартире по этой жилищной программе для компании по производству полупроводников, которой управляют два, что теперь 24-летних парня, которая еще не имеет продукта, которая идет против крупнейших компаний в мире и в самой дефицитной среде, когда-либо созданной, с дизайном, который, по их словам, будет не на 10% лучше, а в 10, в 10 раз лучше. С вами что-то должно быть не так, чтобы сделать это. И, знаете ли, люди здесь просто устроены по-другому, они действительно хотят не доказать, что люди, которые не верят, неправы, а доказать, что люди, которые верят, правы, и они просто принимают это на свой счет, и, знаете ли, это очень весело находить таких людей, и, честно говоря, сама природа компаний делает очень легким отсеивание людей, которые не такие. Одна из первых вещей, о которых мы с вами говорили, Роб, была: я начал спрашивать о Sohoo, который является названием первого продукта здесь. И вы сказали, что мы можем поговорить об этом подробно, но вы должны знать, что мы действительно сосредоточены на создании машины, которая может в масштабе производить эти вещи и их поколения с максимально возможной эффективностью и высочайшим качеством. Так что мы хотим построить компанию или машину, которая является компанией, которая полностью >> будет производить эту вещь, а затем и последующие вещи. Итак, я хотел бы поговорить о нескольких принципах или краеугольных камнях компании. Один из них вы упоминали, вы упоминали некоторые из них. Вы сказали "скорость", вы сказали "вертикальная интеграция". Вы знаете, они стали более популярными темами. Параллелизация — это то, о чем, возможно, стоит поговорить. Но меня особенно интересует ваша готовность идти на огромный риск, чтобы двигаться быстрее. Может быть, расскажите свою любимую историю о том, почему это философия, что она позволила вам сделать, чего, возможно, не сделали другие компании. >> Здесь есть ряд историй. Но одна из моих любимых — это когда мы были близки к выпуску чипа. Мы поняли: "Подождите, один из наших поставщиков сильно, сильно отстает от графика". И у нас было два очень плохих варианта. Один вариант — сохранить текущего поставщика и отодвинуть наши сроки примерно на год. >> Другой вариант — сменить поставщика, начать заново и также отодвинуть сроки на год. И ни один из этих вариантов не был хорошим. Поэтому нам пришлось искать третий вариант, и это было то, что мы выяснили, что вся наша команда в Бангалоре будет выполнять работу. Мы отправили дюжину наших лучших инженеров по всему миру в Бангалор на 6 месяцев. Я тоже был там. Я лично жил в Бангалоре четыре с половиной месяца, и каждое утро мы шли через безумно оживленные улицы Бангалора в офис. Мы были первыми. Мы создали широкий спектр инструментов, как для аудита огромного количества кода, который поступал, так и для создания множества инструментов, чтобы ускорить этот процесс, убедившись, что мы принимаем правильные проектные решения на месте, прямо там. Никаких 12-часовых переписок. Мы могли решить немедленно, а затем в 1:00 ночи мы шли обратно по теперь пустым улицам Бангалора и делали все это снова на следующий день. У нас все еще была часть команды в США. Мы проводили эти 12-часовые передачи с каждой стороны, где у нас был 24-часовой цикл разработки, где в 8 утра и 8 вечера каждый день мы все подключались к Zoom, делились всеми данными, говорили: "Когда я проснусь, это должно быть сделано. Мы должны выпустить этот чип". И это было чрезвычайно напряженно. В то же время мы видели другие чипы на той же стадии, что и мы, у того же поставщика, которые в итоге заняли годы, которые до сих пор не выпущены, которые до сих пор даже не выпущены. И именно такой уровень крайней срочности необходим для вывода продуктов на рынок. >> В чем ключ к этому? Ну, это стало клише, в основном из-за Илона, что его особый навык, и другие, которые пытаются ему подражать, пытаются сделать это тоже: выяснить, в чем заключается ограничивающий фактор, и просто лично сосредоточиться на этом, что похоже на поездку в Бангалор или что-то в этом роде. Кажется, что это центральный принцип бизнеса и любого бизнеса, который собирается заниматься такой вертикальной интеграцией. В чем ключ к этому? Ну, опять же, что вы узнали об этом конкретном действии? Для меня, я думаю, есть два ключевых трюка. Первый

Одно из них заключается в том, что вы не можете создать чип в одиночку. Это должна быть командная задача. И ваша самая важная задача — найти отличных людей, которые пойдут с вами, и отличных людей, которые будут вдохновлены и воодушевлены делать такие сумасшедшие вещи. Это огромная просьба — сказать: «Ребята, оставьте свою жизнь на шесть месяцев или, в одном случае, на 12 месяцев». Мы отправили одного парня далеко вперед. Это неприятно, но нам повезло иметь членов команды, которые делают это по правильным причинам. Но я думаю, что вторая большая вещь — это способность очень быстро принимать решения. Одна из худших вещей — это когда есть фабрика или поставщик, который ждет, пока вы примете какое-то решение, и затем просто останавливается. >> И это происходит постоянно, даже по очень мелким вопросам. Поэтому отправляйте людей, делегируйте им большую часть ответственности и говорите: «Примите разумное решение». Ничего страшного, если вы время от времени ошибаетесь, но я гораздо, гораздо предпочту быть правым большую часть времени и дать ответ немедленно, чем каждый раз ждать идеального ответа. Скорость решает. >> А как насчет траты денег, чтобы ускорить процесс? Есть такая вещь, как обучение на практике, которая стала настолько интересной, и поскольку мир отошел от программного обеспечения и снова движется к аппаратному обеспечению в мире технологий, мы так много чего делегировали обучению на практике, отправляя продукцию за границу и фактически будучи просто идеологами здесь, в США. Похоже, что это очевидно меняется, и вы приняли этот способ обучения на практике, как будто вы хотите быть в этом цикле обучения и итераций. >> Абсолютно. >> И частью этого является готовность тратить и рисковать деньгами. Да. >> Можете ли вы немного рассказать об этом? Я думаю, есть отличная цитата: «Самый большой риск — это не рисковать», очень похоже на это: каждый день в этой категории приходится более миллиарда долларов дохода, и большая часть этого — это вывод результатов, поэтому каждый день, когда мы не отправляем продукцию, мы просто упускаем массу возможностей. >> поэтому ваша готовность тратить деньги должна быть чрезвычайно высокой, если вы можете получить из этого очень четкую рентабельность инвестиций. У нас есть концепция, которую мы называем предварительной выборкой, которая заключается в том, что когда вы ждете, пока одно дело будет сделано, когда вы знаете, что будете делать другие вещи, как только вы это получите, есть ли способы параллелизовать весь график. Например, мы знаем, что наш чип вернется в определенную дату. Мы хотим, чтобы все возможное, что могло быть сделано без чипа, было сделано до того, как чип поступит. И это стоит больших денег, верно? Это означает, что мы хотим построить весь наш программный стек заранее. Это означает, что мы хотим фактически отправить стойки в центры обработки данных клиентов без наших чипов, со всей сетью, всеми процессорами, всем хранилищем, настроенным так, чтобы мы могли развернуть все программное обеспечение центра обработки данных до того, как чипы вернутся. Это означало, что мы взяли более 700 FPGA и разместили полный чип с полным ретикулумом на кластере FPGA и запустили дюжину различных моделей с нашим полным стеком вывода на них до того, как чипы вернулись. Это означало, что мы построили тепловой чип для имитации теплового профиля нашего чипа и на его основе построили охлаждающие пластины до того, как чипы вернулись. Это означало, что вся производственная линия была готова. Это означало, что мы сделали много ревизий печатной платы. Это означало, что весь продукт был готов к выпуску до того, как чипы вернулись. И это то, что это дает вам. Была еще одна очень известная компания по производству ИИ-чипов, которой потребовалось 10 месяцев, чтобы перейти от получения кремния до запуска вывода результатов в стойке. И это было публично объявлено их инвесторам, и это было действительно большое дело. >> Мы смогли сделать это за 40 дней. И это потому, что к тому времени, когда чип вернулся, все было скучно. Программное обеспечение уже было написано, стойка уже была там, производственная линия уже была настроена. Мы просто собирали все вместе. Вы знаете, вы не всегда предугадываете все. Вы вносите некоторые коррективы на лету, а затем отправляетесь. >> Хотя в этом конкретном случае это тоже была большая часть этого. Но также, я думаю, смена тоже сыграла большую роль. >> О, совершенно точно. >> То есть мы вышли и буквально имели дневную и ночную смену. Были члены команды, которые приходили в 10 утра и уходили около полуночи. Да. >> Которые приходили в полночь и уходили в 10 утра, работая круглосуточно, чтобы достичь этих 40 дней. >> Да. Я имею в виду, более половины компании живет рядом с офисом. >> Так что это облегчает такие вещи. >> Вы им за это платите, верно? Платите им дополнительно. Вы все еще делаете это? >> Да. Невидимая рука творит чудеса. >> Я имею в виду, это работает и для меня. >> Мы оба там. >> Я хотел бы сделать один большой шаг назад и поговорить немного о более широкой экосистеме. Количество дефицита на стороне предложения, раскрытие рисков в глобальной системе и цепочке поставок вокруг этого стало как бы ежедневной новостью на первой полосе Wall Street Journal. >> как акции, на которые люди смотрят, инвестируют и которыми восхищаются. Знаете, если вы подумаете о акциях памяти, они были, знаете ли, скучными товарами, как ничего особенного пять лет назад, а теперь они в центре глобального внимания. Если вы просто оцените, поскольку вы занимались этим, глобальную связанную цепочку поставок, которая необходима для создания таких вещей, просто расскажите об этом. Что вас пугает? Что работает хорошо? Что нужно изменить? Что вы надеетесь изменить благодаря тому, как вы строите эту вещь? >> как просто ваша оценка этой истории прямо сейчас? >> Я думаю, что одна из самых недооцененных частей истории цепочки поставок заключается в том, что почти ни одну из этих вещей вы не покупаете и больше не разговариваете с поставщиком. Вы должны сотрудничать. Это самая важная часть успеха, я думаю, в чипах с TSMC или с поставщиками памяти. Вам нужно это партнерство. Я думаю, что для TSMC в частности люди не понимают, почему это так ценно. Вы смотрите на технологию, и технология лучшая в мире. Но для меня настоящая ценность заключается во всем обслуживании. Обслуживание клиентов TSMC намного, намного лучше, чем я видел в любой другой компании в любой другой отрасли. Это то, что если вы говорите: «Эй, мы можем улучшить ваш выход, внеся это изменение. Вы можете дать им рекомендацию, а затем мы проведем эксперимент за их счет в нашем случае, чтобы увидеть, смогут ли они действительно получить более высокий выход». И когда мы обнаружили, что мы были правы, и эксперимент удался, они перевели остальную часть линии. И такое просто не случается в большинстве отраслей. Если я пойду на завод по производству стали, скажу: «Эй, я хочу, чтобы вы изменили состав стали». И они скажут: «Пошли вы». Не TSMC. Это причина, по которой они номер один и почему они победят. >> Одна из вещей, которая имеет огромное значение, — это доступность питания и время до подачи питания. И проблема в том, что чем больше питания вы хотите, тем больше дефицит. На самом деле это очень похоже на кластеры чипов, то есть почему Colossus берет 12 долларов в час за черные дыры? Потому что это единственное место, где вы можете купить 20 000 из них одновременно, верно? >> как почему так трудно найти центр обработки данных мощностью 500 мегаватт? Это та же самая причина. Знаете, одна из вещей, о которых нам нужно подумать, это как мы можем получить гораздо больше энергии из каждого мегаватта? >> и как люди смотрят на весь стек, будь то просто улучшение PUE, но также и совершенно новое оборудование для получения максимального количества токенов на мегаватт для решения этой проблемы. >> но фундаментально строительство новых зданий — это сложно. >> гораздо проще перейти от 100 мегаватт к гигаватту, чем от гигаватта к 10, а от 10 к 100, и знаете ли вы, что мы расширяем границы возможного в эти сроки. >> так что есть много людей, которые пытаются масштабировать свои центры обработки данных так же, как и масштабировать их. >> Да. Я имею в виду, одна из интересных вещей в такой системе — это то, что она заменяет. Да. >> Так что, если я думаю о такой стойке по сравнению с, я не знаю, набором черных дыр или чем-то еще, или Reubens, или чем-то еще, что появится дальше. Как мне это концептуализировать? >> как потому что это не только ватты, но и физическое пространство, к вашему пункту, что люди, как вдруг Cerebras говорили об этом в своем последнем отчете о доходах, что буквально это проблема, что буквально нет места для размещения систем. >> да, как как мне концептуализировать, что это представляет или заменяет в терминах других вычислительных единиц? Вот как клиенты думают о развертывании моделей в целом, то есть, когда я строю центр обработки данных или кластер, это не абстракция типа «о, мне нравятся эти чипы и, знаете ли, это энергопотребление и так далее». Это как у меня есть реальная рабочая нагрузка, которую я пытаюсь обслуживать, и, знаете ли, чтобы мой продукт был полезен, мне нужна определенная скорость обслуживания, и для некоторых продуктов она очень быстрая, а для некоторых продуктов очень медленная, какой бы ни была скорость, это моя скорость. Вопрос в том, при заданном количестве энергии, сколько пользователей я могу обслужить, гарантируя эту скорость? >> так другой способ сказать это — это то, что называется интерактивностью, какова наша пропускная способность? Мы только заканчиваем ранние этапы бума инфраструктуры ИИ, когда людей действительно волновала только скорость. >> знаете ли, GPU не могли достичь многих скоростей других типов чипов, таких как все эти чипы SRAM, тысячи токенов в секунду, и это позволило использовать множество новых вариантов использования, которые очень взволновали людей. >> есть совершенно новая волна ИИ-чипов, знаете ли, мы одни из них, которые все смогут достичь этих скоростей. Вопрос тогда в том, если вы достигаете этих скоростей, сколько пользователей вы можете обслуживать одновременно? И косвенно, если у меня есть центр обработки данных мощностью 100 мегаватт, сколько, знаете ли, программных агентов я могу запустить одновременно? >> так что, когда люди проводят эту оценку, наше оборудование, как правило, сможет обеспечить вам на порядок больше параллелизма при заданном уровне интерактивности. >> так что это напрямую переводится в токены на ватт, токены на доллар, все, что волнует людей, когда они фактически обслуживают эти гигантские смеси экспертных моделей в масштабе. >> есть эти теперь знаменитые кривые интерактивности, верно? >> так что вы можете не многие люди их публикуют. >> но вы можете увидеть кривую Blackwell, вы можете увидеть кривую AMD, которая немного хуже, чем Blackwell, и это все еще компания стоимостью 800 миллиардов долларов. >> так что, если вы подумаете о том, каковы последствия смещения этой кривой не просто немного дальше, а намного дальше. >> Да. >> Что больше всего вас волнует в том, что это позволит? Я хочу выйти и решить некоторые из самых сложных проблем и хочу решить их за гораздо меньшее время. >> Я имею в виду, были вещи, которые я не был уверен, что увижу при жизни. Например, гипотеза единичного диска, одна из вещей, о которых мы говорили в колледже. >> Да. >> И я не был уверен, что увижу ее доказанной при жизни. >> И это было сделано моделью ИИ, и это было сделано в течение длительного периода времени. Но если вы сможете запускать ту же модель в 10 раз быстрее, вы сможете сократить время для получения этих прорывов. И есть огромное количество других проблем в математике, подобных этой, которые, я беспокоюсь, займут 100, тысячу лет, чтобы доказать что-то подобное. Вы можете либо иметь гораздо более умную модель, либо модель того же интеллекта, работающую гораздо быстрее. Вы можете тогда сократить это, и я могу это увидеть. И так здорово видеть, как эти прорывы совершаются. Я очень, очень рад видеть, как происходит гораздо больше этого. Я думаю, что слишком часто люди думают о задачах и приложениях и вещах в очень коротких временных горизонтах. >> так, знаете ли, делать чат, и это как бы на 50% быстрее, приятно, но это не как бы меняет игру. >> поскольку эти агенты работают все дольше и дольше, а модели становятся все более и более способными, вы увидите гигантские объемы работы, которые потребуют месяцев вычислений. И мы думаем об этом в реальном времени. >> как если вы поговорите с исследователем предварительного обучения в лаборатории, они скажут вам, что реальное время часто является одной из самых важных вещей, которые имеют значение. И что означает реальное время, это время от начала вашего запуска до его завершения, чтобы фактически получить данные обратно. >> если вы можете сократить это время, знаете ли, с шестимесячного запуска до двухмесячного эксперимента, вы сможете провести гораздо больше итераций, и люди будут вносить изменения в архитектуры моделей, чтобы фактически улучшить реальное время. >> Очень похоже на то, как мы думаем об использовании, то есть, знаете ли, самая захватывающая часть сверхнизкой задержки декодирования — это то, что реальное время для задач с длительным горизонтом становится намного короче. >> так что годичный цикл вычислений теперь займет месяц, а месячный цикл вычислений теперь займет 3 дня, а трехдневный цикл вычислений теперь займет 7 часов и так далее. >> так что это то, что, я думаю, очень трудно осмыслить, потому что модели становятся все более и более способными делать это. >> Я думал, это было очень круто несколько месяцев назад, когда курсор опубликовал, что у них был набор агентов по кодированию, которые построили целый браузер с нуля за неделю. >> совершенно безумно. >> И это скоро произойдет менее чем за час. >> и будет много таких вещей, которые произойдут с этими массовыми параллельными агентами, работающими над данной задачей. >> Каковы конечные ограничения этих систем? Это просто физический вопрос, типа, насколько быстрее и дешевле мы можем стать теоретически? >> как вы думаете? >> есть много, есть много места внизу, как говорится, если вы думаете о задержках чипов и чипов в продукте NVIDIA, вы смотрите на 4000 наносекунд, чтобы перейти от одного чипа к другому. >> Мы сможем сделать это намного лучше. >> Каков математический предел? >> скорость света. >> Вы можете сделать это всего за несколько, 2-3 наносекунды. >> и они 4000. >> 4000 сегодня. Есть много места внизу. Я думаю, есть такие вещи, как энергоэффективность, которые, конечно, мы можем сэкономить огромное количество, снизив напряжение так сильно. Но вы можете пойти ниже. Вы можете пойти намного, намного ниже. Это очень сложно. Но когда я думаю о 20-30 годах в будущем, тогда я думаю, что это неизбежно, а также для экономии масштаба для масштабирования кластера в течение длительного времени восемь чипов были самой большой областью масштабирования, и даже у них было 72, доводя до ну, 72, но вы можете быть намного, намного больше. Вы смотрите на фабрику, например, у вас есть одно монолитное здание стоимостью 40 миллиардов долларов с всего лишь горсткой линий, проходящих через него, вы могли бы иметь то же самое для какого-то футуристического мегакластера стоимостью 40 миллиардов, 100 миллиардов долларов как гигантская мегафабрика токенов, обслуживающая одну или горстку моделей для огромного числа пользователей, чтобы получить ту же экономию масштаба. Та же модель, огромное количество людей. >> Вы упомянули инженерию ядер и то, что это была ваша первая работа, которая появилась как вещь, о которой никто никогда не слышал, до того, как она стала чем-то, о чем вы слышите постоянно. Важность этого для получения большей производительности от, знаете ли, сырого металла, когда ли это будет просто что-то, что ИИ полностью делает сам? >> люди все еще лучшие инженеры ядер? >> они делают это с помощью систем ИИ, как далеко вниз люди все еще будут участвовать в проектировании этих вещей? >> когда это исчезнет? >> сегодня это все очень гибридно, и лучшие ядра по-прежнему пишутся в сотрудничестве человека и ИИ. >> так что любая модель ИИ построена из этих фундаментальных примитивов, таких как матричные умножения, свертки, операции от чипа к чипу, коллективные операции, и их перекрытие и их действительно быстрое выполнение имеют огромное значение, и задача дизайнера ядер — выяснить, где я могу перекрываться, как я распределяю память, как я проверяю, что если есть какая-то проблема, такая как повторная передача, она не останавливает весь конвейер. >> эти вещи очень сложны, но они могут повысить вашу производительность, скажем, на 3-4% за оптимизацию, и вы можете это сделать. И мы думали о нашем программном стеке. Мы хотели двигаться туда, куда движется шайба. И три года назад было два способа построить программное обеспечение. Один из них — вкладывать значительные средства в компиляторы графов. Эти вещи не очень производительны, но они работают из коробки. Они не требуют, чтобы человек вмешивался и настраивал все ядра. Но мы пошли в противоположном направлении. Мы программируем в первую очередь на ядрах. И это означает, что да, долгое время это не работало из коробки. Но если вы были экспертом по ядрам, вы могли получить невероятно, невероятно высокую производительность. И дело в том, что теперь, поскольку модели кодирования становятся все лучше и лучше, они выполняют все большую часть задачи генерации ядер. И когда модели будут становиться умнее, они в конечном итоге сделают все это. Они станут сверхчеловеческими. >> так что мы будем строить туда, куда движется мир. И даже сегодня мы думаем о наших инструментах профилирования или отладочном стеке. Мы думаем о них с точки зрения того, как модель будет использовать эти инструменты, больше, чем о том, как люди будут использовать эти инструменты. >> Это то, что мы иногда проводим эксперименты внутри компании, и у нас был CodeX, который фактически запустил GPOSS с нуля, просто основываясь на наших документах, совершенно самостоятельно. >> Вау. >> И это заняло, я думаю, ночь. >> Мы много думаем о выборе игр, и что мы под этим подразумеваем, это обеспечение того, чтобы мы вкладывали нашу энергию в правильные ставки, потому что независимо от того, что вы решите делать, это потребует огромных усилий, и знаете ли, одна из вещей, с которых мы начали, это решение явно не строить произвольный компилятор графов, не поддерживать произвольный PyTorch, не поддерживать произвольный CUDA, не поддерживать произвольные графы ONNX, но вместо этого мы предвидели мир, где будет менее ста моделей, которые действительно важны, и все они будут очень похожи с точки зрения базовой математической перспективы, и что мы будем строить примитивы, используя физику, которые ускорят их настолько, насколько это возможно для человека, и мы позволим самым сложным клиентам иметь прямой доступ к оборудованию и делать все, что они хотят, и это сэкономило нам огромное количество времени, не имея необходимости строить компилятор, и это позволило нам получить гораздо большую производительность, и, смешно, когда мы начали, многие люди отвергали эту идею, и единственными людьми, которые относились к нам серьезно, были в высокочастотной торговле, потому что они все, они все ненавидят компиляторы, они все пишут свои собственные ядра, и у нас десятки людей из высокочастотной торговли присоединились к команде, потому что они тоже видели эту философию. >> Каковы пределы вертикальной интеграции? >> где вы, как вы знаете, где провести черту? И я начинаю с этого вопроса, чтобы немного поговорить о более широком рынке. Обстоятельства более широкого рынка действительно интересны мне, где подавляющее большинство чипов, ИИ-чипов покупается очень небольшим числом клиентов. Да. >> Многие из этих клиентов сами пытаются разрабатывать свои собственные ИИ-чипы. OpenAI объявила о Jalapeno. Кажется, это очень забавное обстоятельство, где самая ценная вещь в мире проходит через пару производителей чипов, пару покупателей чипов. Все они, кажется, думают о том, чтобы делать работу друг друга. А затем у вас есть обстоятельство, когда, хорошо, тогда эти вещи идут в центр обработки данных, и у вас есть неооблака и поставщики вывода, и другая часть этого стека. >> у вас есть создатели и поставщики моделей. >> как я могу представить мир, где, поскольку у вас есть лучшее оборудование, вы разрабатываете модели и строите центры обработки данных, знаете ли, вы выходите за пределы своей текущей вертикали. >> так как вы думаете о том, где провести черты для бизнеса? >> у нас есть поговорка: «Производство — это продукт». >> В конечном итоге важно то, что мы знаем, что вывод будет самым большим рынком в мире. Кто бы ни произвел больше всего токенов, тот и будет самой ценной компанией в мире. >> так что все решения, которые мы принимаем, заключаются в том, как мы можем получить максимальную мощность токенов онлайн. И частью этого является создание действительно хорошего продукта, который имеет гораздо большую пропускную способность, который может работать с гораздо лучшей задержкой и так далее, чтобы мы могли, знаете ли, на каждый чип, который мы производим, получить гораздо больше токенов онлайн. Другая часть этого заключается в том, чтобы не делать части стека, если мы абсолютно не должны этого делать, чтобы достичь гигантского масштаба. >> так что есть части, которые мы решили сделать, потому что это было абсолютно необходимо для достижения масштаба, например, построение стойки вместо простого создания чипов. >> как выполнение модели CM вместо выполнения модели JDM. >> но знаете ли, есть части, которые для нас сейчас являются шумом. >> как мы не строим свои собственные центры обработки данных сегодня. Это на самом деле не помогает нам получить больше мощности онлайн. >> знаете ли, в целом наши клиенты фактически обеспечивают питание и перемещают свои кластеры, чтобы получить наши чипы онлайн, потому что они имеют такую высокую пропускную способность. >> если бы был мир, где другие вещи были бы ограничением, мы бы полностью интегрировались с ними. Но реальность такова, что мы полностью сосредоточены на том, чтобы получить как можно больше токенов онлайн. >> Я думаю, это просто сводится к экономии масштаба. Опять же, на определенных этапах стека есть огромная экономия масштаба, а на других — нет. >> например, при проектировании моделей, огромная экономия масштаба там. >> для изготовления чипов — та же история. >> но, например, если вы думаете о создании какой-то маленькой металлической детали внутри этой стойки, такого же эффекта нет. >> Мы считаем, что естественные границы находятся на стороне чипа, внизу, и на уровне модели наверху. >> и мы заполним весь промежуток между ними. >> Несколько недель назад был человек, который тестировал ИИ-чип следующего поколения для, знаете ли, одной из передовых компаний. >> и он пытается завербовать одного из наших архитекторов. >> и этот человек фактически сделал обратный ход и начал вербовать человека, пытающегося завербовать нашего парня, и в течение недели мы его наняли. >> и я шел на прогулку, когда мы как бы завершали предложение. Я спросил: «Ну, вы руководите этим суперважным проектом. Почему вы решили присоединиться?» И его ответ был очень интересным: «Фундаментально это не экзистенциально для моей компании, чтобы этот продукт победил для Google с TPU, как их доход идет от поиска». >> Google не потерпит неудачу, если TPU потерпят неудачу. >> Это верно. Meta не потерпит неудачу, если MTI потерпит неудачу. Microsoft не потерпит неудачу, если Maya потерпит неудачу, а OpenAI не потерпит неудачу, если Jalapeno потерпит неудачу. В конечном итоге это наш продукт. Это как бы совершенно неудивительно, что лучший чип в мире создан компанией, которая только и делает, что производит этот чип. Это Nvidia, верно? И как бы для нас это совершенно экзистенциально, чтобы получить как можно больше мощности токенов онлайн. >> и это привлекает набор талантов и привлекает поддержку от поставщиков и клиентов, которые смотрят на это с той же интенсивностью, что и мы. >> Посмотрите на сырые показатели флопс. >> Вы сравниваете любые из этих чипов, созданных лабораториями или гиперскейлерами. >> Плотность флопс для, скажем, FB8 на FB8 ниже, чем у Black B300. >> Y >> и это имеет смысл, потому что им не нужно рисковать. >> им просто нужно создать достаточно похожий продукт и не платить налог Nvidia. >> Когда я думаю о том, как вы создаете решение, процесс этого заключается в решении последовательности действительно сложных задач. >> Какой был самый трудный эпизод, который пришлось преодолеть? >> Когда мы разрабатывали чип, мы построили этот огромный кластер FPGA, чтобы проверить, работает ли полный чип как есть. И FPGA — это цифровые сущности. Вы можете тестировать цифровую логику, но не аналоговую. И оказывается, что когда чип вернулся, мы начали видеть проблемы в нашей адаптации внимания, неправильные результаты. И мы поняли: «Подождите, есть проблема, когда логика обратного давления при пересечении тактового домена выходит из строя». И это приведет к тому, что чип будет давать неправильные результаты. И это очень, очень трудно решить. И мы поняли, что есть один и только один способ решить это: мы должны были выровнять два тактовых сигнала на нашем чипе с точностью до 50 пикосекунд. Это буквально 50 триллионных долей секунды. И мы должны были выровнять сигналы с такой сверхмалой гранулярностью и делать это на каждом чипе два миллиарда раз в секунду. >> Многие люди говорили, что это невозможно. >> Мы, люди, увольнялись. >> Да. >> Что люди буквально говорили: «Эта проблема неразрешима». И «Удачи вам». >> Ну, когда у вас есть такая проблема, первый шаг — это: «Хорошо, давайте предположим, что проблема решаема». Как бы она была решена? >> Ну, сначала мы поняли, что нам нужно иметь возможность перемещать фазу тактового сигнала на пикосекунду, 10 пикосекунд. И у нас появилась идея. Что, если у нас есть эти два тактовых сигнала? Мы установим их немного далеко друг от друга. И мы выяснили, что если мы выясним фазу, если мы затем используем механизм дрейфа, чтобы подождать ровно столько времени, сколько нужно, чтобы всегда выравнивать эти 50 пикосекунд, мы можем сделать это чрезвычайно надежно, а затем зафиксировать фазы именно там, где они должны быть. Мы можем гарантировать, что этого никогда не произойдет. Люди были, я думаю, несколько поражены тем, что это сработало, и тем, насколько хорошо это сработало. >> Сколько времени это заняло? >> Это было на самом деле около двух недель. >> Это были темные две недели. >> Это были очень страшные две недели, но это было то, что когда такое происходит, это самое важное время, чтобы вложить усилия. Это самое трудное время, чтобы сделать это, когда вы чувствуете, что все безнадежно. Но чем раньше вы решите эту проблему, тем раньше вы сможете вернуться к созданию и масштабированию производства до массовых объемов. >> Я думаю, что большая часть нашей истории заключается в том, как говорит Гэвин: «Предположим, это возможно». >> как предположим, что это вполне возможно, что чип с гораздо большим количеством флопс. >> Предположим, что система с гораздо более низкой задержкой между чипами возможна. >> Предположим, что возможно создать общий пул памяти, который может работать с гораздо большей пропускной способностью. >> как бы один это сделал? >> во многих случаях, когда мы проводим эксперименты, мы проводим десятки экспериментов, и все они терпят неудачу. Но нам нужен только один, чтобы он сработал. >> Было несколько раз. Я имею в виду, Гэвин, я думаю, был лидером, когда мы запускали наш чип с, я думаю, 30 различными экспериментами с платами, и три из них сработали, и все три стоят своего веса в золоте. >> Это одна из тех вещей, когда люди приходят ко мне и говорят: «Гэвин, почти ни один из ваших экспериментов не работает», и я бы сказал: «Мне просто нужно один раз повезти». >> Vanta автоматизирует безопасность и соответствие требованиям для более чем 16 000 быстрорастущих компаний, таких как Ramp, Cursor и Harvey, обеспечивая их готовность к аудиту круглосуточно. Это платформа доверия номер один, и теперь она помогает таким компаниям, как ваша, отслеживать риски, которые возникают между аудитами у ваших поставщиков, ваших инструментов ИИ и всей вашей среды. Каждый новый инструмент, на который подписывается ваша команда, каждый поставщик, который включает функции ИИ, — это возможность что-то пойти не так. И большинство программ безопасности не были созданы для темпов роста ИИ. Агент Vanta работает как круглосуточный инженер GRC в фоновом режиме, находя проблемы, составляя для вас исправления и сокращая время оценки поставщиков до 50%. Независимо от того, являетесь ли вы быстрорастущим стартапом или глобальным предприятием, Vanta помогает вам заслужить и доказать доверие. Инвестируйте как лучшие слушатели. Получите специальное предложение со скидкой 1000 долларов на vanta.com/invest. Ridgeline — это первая сквозная система учета с встроенным ИИ для инвестиционных фирм, управляющая учетом портфеля, сверкой, отчетностью, торговлей и соответствием требованиям на единой платформе. Фирмы отказываются от устаревших технологий и переходят на Ridgeline из-за того, насколько далеко вперед продвинулись функции ИИ Ridgeline по сравнению с любым другим программным обеспечением для управления инвестициями. Я слышал от многих инвестиционных менеджеров об ИИ, и они примерно делятся на два лагеря: одни не уверены, с чего начать, а другие убеждены, что они могут построить свою собственную систему управления заказами за выходные. Реальность такова, что управление инвестиционной фирмой всегда будет требовать механизмов управления и единого источника истины для ваших данных, и никакой энтузиазм в отношении ИИ не изменит это требование. Ridgeline построен именно на этой основе, поэтому я считаю, что фирмы, которые выйдут вперед в эпоху ИИ, будут те, кто работает на унифицированной платформе Ridgeline. Если вы серьезно относитесь к стратегии ИИ вашей фирмы, Ridgeline должна быть частью этого разговора. Вы можете запросить демо на ridgeline.ai. Итак, одна из идей для одной из этих историй, о которых я спрашиваю, знаете ли вы, трудные моменты в истории компании связаны со способностью привлекать капитал для финансирования этого. Я думаю, когда вы начали, вы знали, что вам понадобится капитал, но вы не знали, что вам понадобится та сумма капитала, которую вы в конечном итоге привлекли и тратите на создание решения, и вы раньше не привлекали деньги. Это все новые вещи, верно? И были моменты, когда это было очень, очень трудно, потому что я был там, я видел это. Были моменты, когда было чрезвычайно трудно привлечь деньги, без которых компания не существовала бы. Она бы погибла. И, как и во многих великих историях, есть много моментов, близких к смерти, но деньги, особенно в этом новом мире. Это не программное обеспечение. Вам не нужно немного денег. И тогда, возможно, вы расскажете историю о самой трудной части привлечения денег на раннем этапе. >> до того, как у вас появилось что-то, чем вы могли бы гордиться и показать людям, и производительность, которую вы могли бы им показать и поразить их, это были просто вы, говорящие об идее. Но расскажите о ранних трудностях привлечения денег, потому что это было довольно жестко. >> У нас были напряженные моменты. >> это напоминает мне, вероятно, начало 2024 года, до того, как мы привлекли наш раунд А, и мы были в точке, где мы сделали достаточно архитектуры, достаточно дизайна, что мы знали, что архитектура чипа была надежной. Нам пришлось построить его. Было еще много работы. Мы были готовы перейти к так называемой стадии физического проектирования. Нам нужно было подписать соглашение с поставщиком физического проектирования, которое, знаете ли, обойдется вам как минимум в 40-50 миллионов долларов. >> и тогда мы поняли, что по мере того, как модели становились все больше и больше, и вы видите эти гигантские модели, выходящие, что нам нужно будет построить весь кластер, а не только чип, но нам нужно будет построить платы. Нам нужно будет построить интерконнекты. Нам нужно будет построить охлаждающие пластины. Нам нужно будет разобраться со всей сетью и всем остальным. И что это будет стоить намного больше, чем 15 миллионов долларов, которые у нас были в банке. >> И вы такие: «Черт возьми, это было страшно». >> Да. >> Что, знаете ли, вы сидите в этот момент, вы думаете: «Святые черти, мы не можем себе этого позволить». >> и я начал смотреть на: «Как трудно вернуться в Гарвард?» >> Я имею в виду, я имею в виду, в конце 23 года мы составили этот меморандум. >> Я имею в виду, мы потратили на это около ста часов, потому что мы такие: >> мы понятия не имеем, как люди поверят нам, когда мы попросим сумму денег, которую мы собираемся попросить. >> и это было около 30 страниц. Это было чрезвычайно техническое и подробное описание всех различных вещей, которые нам нужно было построить, и всех этапов, которые нам нужно было достичь, и того, как рынок будет развиваться, и всех новых вариантов использования, и стоимости за токен, и всего этого моделирования. >> и тогда мы пошли и поговорили с инвесторами, и каждый крупный инвестор в долине немедленно отказался. Они просто сказали: «Хорошо, двое детей, которые только что закончили Гарвард, не выпустили чип, нет тестового чипа, знаете ли, вывод результатов, знаете ли, кто знает, будет ли это большой рынок. Все будет обучение, знаете ли, модели все еще галлюцинируют. Все это может быть пузырем». >> знаете ли, в то время самые крупные привлечения средств для полупроводников для серии А составляли около 40-50 миллионов долларов. >> мы смотрели на это, и мы просто подсчитывали счет. Мы такие: «Мы думаем, что потратим 100 миллионов долларов в следующие 12 месяцев». >> если мы действительно хотим сделать это, если мы хотим достичь масштаба и действительно достичь производительности, о которой мы говорим, это будет чрезвычайно капиталоемким. >> Как, черт возьми, мы собираемся это сделать? >> Я думаю, что один из наших ключевых способов, которым мы начали этот процесс, >> мы подумали: «Каков самый дешевый возможный способ сделать это?» И мы решили: «Ну, если бы я зарабатывал почти ничего». >> Да. >> И если бы я ел только рамен, тогда мы бы потратили в основном только деньги на маску 11-го выпуска, и это было бы то, верно? >> И если так, то мы, вероятно, могли бы сделать это за 30 миллионов долларов, что является безумно низкой цифрой. >> И мы фактически обратились к поставщику долга, чтобы он был готов предоставить нам деньги, которые нам нужны, чтобы перейти этот едва-едва порог рамена к чипу. >> С этого момента, я думаю, первым было катализировать серию других: «Эй, может быть, мы можем сделать еще кое-что, еще кое-что, еще кое-что». >> Да. >> Так что мы находимся в этом моменте, когда мы такие: «Если мы действительно хотим построить эту компанию, потому что мы не будем делать это наполовину». >> как мы не собираемся делать тестовый чип и тратить на него годы, и позволить всему буму рынка ИИ произойти, пока мы могли бы создавать продукт. >> если мы собираемся это сделать, мы пойдем до конца. >> Нам нужно будет найти способ получить 100 миллионов долларов. >> Я имею в виду, я помню, мы с Гэвином сидели в офисе в Сертино поздно ночью, просто глядя друг на друга, и мы такие: «Можем ли мы сократить 500 тысяч здесь? Можем ли мы сократить 100 тысяч здесь? Как долго мы можем убеждать всех не брать зарплату?» И мы такие: «Святые черти, математика не сходится». >> мы действительно должны решить это. >> И был период в несколько недель, когда вы просто входите в режим выживания, и вы звоните каждому человеку, который может знать инвестора, и вы говорите: «Нам нужно 100 миллионов долларов, чтобы сделать это. Если мы это сделаем, мы думаем, что это может быть одна из самых важных компаний всех времен. Знаете ли вы кого-нибудь, кто хочет сделать агрессивную ставку, кто хочет верить в нас? >> вот вся информация. >> мы открытая книга. >> вот команда. >> это отличные люди. >> мы работали очень усердно. >> мы сделали это в рекордно короткие сроки, но у нас есть эти, знаете ли, сто вещей, которые нужно сделать. >> хотите ли вы это сделать? >> и снежный ком начинается, и вы получаете миллион здесь и 2 миллиона здесь, и вы такие: «Хорошо, мы не останемся без денег в этом месяце». >> Вы получаете чек на 5 миллионов долларов, чек на 10 миллионов долларов, и вы такие: «Хорошо, может быть, я смогу купить эти FPGA». >> и, знаете ли, снежный ком, снежный ком произошел, где, я имею в виду, нам очень повезло, что мы в итоге собрали все это. >> Я имею в виду, у нас было заседание совета директоров. Я показываю вам электронную таблицу, и мы смотрим на нее, и это около 103 миллионов. >> это все как бы мягкие обязательства, и мы все смотрим друг на друга и говорим: «Мы возьмем это», и это был раунд А, и, к счастью, я думаю, с тех пор стало намного проще, и мы привлекли почти полдюжины раундов с тех пор. >> многие из них от тех инвесторов, просто удваивая и утраивая свои ставки. >> это позволило нам выйти на рынок так быстро. >> как эта стойка не была бы возможна, если бы мы не были так агрессивны. >> Я также думаю, что поставщики тоже заслуживают небольшого признания. Да. >> что TSMC была готова работать с нами еще до того, как мы привлекли эти 100 миллионов долларов, когда это было еще действительно, действительно страшно, фактически позволила нам получить некоторые из их эмуляторов на чрезвычайно выгодных условиях, где мы платим в течение многих лет. >> Да. >> в основном большой кредит, и это требует большого доверия от ваших партнеров, чтобы сделать это, но в конце вы получаете очень сильную команду, и все, кто вас поддерживает, не делают это только из чистого финансового стимула, они верят. >> Почему TSMC поверила, как вы думаете? >> Это отличная история. Еще до того, как вы присоединились, была конференция, мероприятие, и я был одним из немногих молодых генеральных директоров полупроводниковых компаний. >> Я думаю, это своего рода новинка, попросили меня выступить. >> Я прихожу на полупроводниковое мероприятие, и я единственный спикер младше 40 лет и единственный человек младше 30 лет. >> Мне было тогда 22, 22 года. >> Так что я поднимаюсь и выступаю. После этого был ужин спикеров, и по чистой случайности я оказался рядом с очень старшим вице-президентом TSMC. >> Это очень приятный ужин. >> Там бывший генеральный директор ARM. >> Это очень шикарно. >> Все в костюмах, а я там с этим вице-президентом. И оказывается, мы оба изучали математику в колледже, и мы получаем маленький кусочек бумаги и начинаем подробно говорить о том, как работают современные модели ИИ на фактическом уровне тензора за тензором. И парень это понимает. И мы начинаем говорить о том, как это эффективно запустить. >> почему Луисвилл является критически важной технологией для этого? >> И на следующий день я получаю электронное письмо от TSC с просьбой: «Гэвин, я хочу работать с Etch, найдите способ сделать это». >> Сумасшедший. >> Они были отличным партнером с тех пор. И >> Удивительно думать о некоторых тропах и, очевидно, я должен сломать четвертую стену. >> Я большой инвестор Etch. >> Я давно участвую. >> Я думаю, я вас обожаю. >> так что я невероятно предвзят. >> в этом разговоре. >> Я пытаюсь задавать вопросы, которые являются более широкими и интересными и могут быть возражениями против того, что вы делаете, и мы будем продолжать это делать. >> но мне так интересно, что, когда вы читаете об инвестировании, все цитируют эту идею о том, что «контрариан и прав» — это квадрант, который приносит все деньги, и это звучит очень хорошо, но контрариан означает, что все остальные думают, что вы глупы. >> и поэтому, когда вы идете и получаете немедленные отказы от буквально всех, это захватывающий квадрант, в котором нужно существовать до того, как вы станете консенсусом. >> Я имею в виду, каково это было для вас? >> Мне очень любопытно. >> Ну, это интересно. >> В то время это был самый большой, намного больше, первый чек, который я когда-либо писал. >> Само собой разумеется, я не эксперт по математике, не эксперт по полупроводникам и не эксперт по ИИ, на самом деле в то время. >> и поэтому это было гораздо больше веры в концепцию того, что этот рынок потенциально может быть огромным. >> вы сделали очень, очень четкие ставки на то, как будет выглядеть будущее, позиционировали компанию, чтобы атаковать эти вещи в жестком ключе. >> и затем просто вы двое, и то, что я чувствовал по отношению к вам, было основной причиной, по которой мы сделали ставку, когда мы сделали это в 2023 году или когда бы это ни было. >> но в то время это было самое большое. >> И я думаю, что то же самое, что вы сказали о наивности, применимо к инвестированию, как и к созданию стартапа в области полупроводников, это то, что я не знал, чего я не знал. >> И когда я звонил экспертам, они, по сути, говорили: «Это глупо». >> Они очень логично объясняли, почему это не сработает и почему это такая низкая вероятность ставки. >> И я думаю, что одна из вещей, которую я узнал из этого, это то, что вам просто нужно проклясть базовую ставку. >> как если бы вы инвестировали на основе базовых ставок, вам следует делать что-то другое, чем то, что делаем мы и я. >> всегда есть индексный фонд. >> Да, всегда есть индексный фонд. >> Именно. >> Так что для меня это никогда не было страшно. >> Я думаю, вероятно, потому, что я не знаю. >> Есть много того, чего я не знаю. >> И если бы я знал больше о том, что вы сделали, и о трудностях, я, вероятно, не сделал бы этого. >> Я не знаю, что это говорит о взрослении как инвестора. >> как, может быть, я не хочу знать, знаете ли, намного больше, и иметь некоторую здоровую наивность. >> Я не знаю. >> Забавно. >> Я думаю, что многие традиционные фонды полупроводников пропустили весь ИИ-чип, все компании ИИ-чипов. >> и как бы все эксперты по кодированию пропустили все компании по кодированию. >> и я думаю, что очень трудно осознать, что ограничения изменились, и знаете ли, когда вы смотрели на выпуски в течение 20 лет и видели, как многие из них не работают с первой попытки, или со второй, или с третьей, вы просто не могли запустить рабочую нагрузку. >> вы совершенно забываете, что инструменты EDA намного лучше, и что FPGA существуют сегодня так, как их не существовало раньше, и все типы валидации, которые вы можете сделать сегодня, просто не были возможны. >> так что я думаю, что для нас многие наши верующие были либо, они были как бы на двух сторонах этого. >> они просто верили в рынок и команду, или они создавали чипы сегодня и были чрезвычайно техническими, как фирмы высокочастотной торговли, где они буквально проверяли все, от микроархитектуры и RTL до дизайна плат и расписания и программного стека, и мы садились с примерно 10 их людьми, которые создают свои собственные чипы, и они задавали нам такие подробные вопросы, что мы задавались вопросом, построят ли они чип. >> Это было действительно либо на одной из этих сторон. >> И если вы были где-то посередине, вы просто не поймете этого. >> В инвестиционном мире часто говорят о вариантной перцепции, о чем-то, что вы видите или верите, чего другие не видят, верно? >> и это восприятие создает возможность. >> Я думаю, я инвестировал, я не знаю, раз пять в это. И каждый раз, когда вы это делаете, ставки становятся все больше и больше. >> и поэтому это становится немного страшнее и страшнее. >> и потому, что вы были так тихи на рынке, я думаю, очень легко вас игнорировать. >> по мере того, как ставки растут, эти отказы труднее слышать. >> И, и поэтому я думаю, что ставка на что-то, что вы видите, когда то, что вы слышите от внешнего мира, очень отличается. >>

то, что этот разрыв в восприятии является противоположным. >> Точно. Последнее, что я хотел бы сказать, это накопленные доказательства вашей и вашей команды способности решать, казалось бы, неразрешимые проблемы, что является одной из самых интересных вещей, которые может иметь компания. Это как бинарный выбор: компании делают это или нет. >> В этом и заключается большое преимущество людей, которые здесь давно. Приходят новые сотрудники, которые чертовски напуганы. Когда вы видите такое, а есть старожилы, которые здесь всего два года >> курят сигары в окопах. Еще один. Еще один. >> Да, определенно есть менталитет "найди способ". Если вы здесь, вы здесь, потому что предполагаете, что это возможно. Так что, мы не можем говорить, что это невозможно. Все решаемо, и мы просто будем работать над этим, пока не разберемся. >> У меня есть любимая история про парня, который является своего рода легендой в области валидации кремния, который присоединился к нашей команде, и мы занимались ранними стадиями того, что называется сортировкой пластин. >> И вы знаете, когда ваши чипы выходят из фабрики, они идут на этих пластинах, и у вас есть так называемая зондовая карта, которая подключается к пластине перед тем, как вы нарежете ее этими контактными площадками, и вы посылаете эти электрические сигналы, чтобы в основном протестировать, какие чипы хорошие, а какие плохие. Так что, когда я, знаете ли, разрезаю пластину на кучу чипов, я могу упаковать ее и упаковать только хорошие. Мы проходим через нашу первую пластину, и, знаете, это около 2-3 часов ночи, потому что мы делаем это с TSMC по телефону на Тайване. У нас есть экран с пластиной, которая вся серая, и каждый чип серый, а затем, когда вы начинаете запускать паттерны, квадраты должны стать зелеными или красными, а они все становятся красными. Мы такие: "Это действительно плохо". Все такие: "Ребята, сделайте вдох". Он откидывается назад и говорит: "Головоломка начинается". >> Когда вы увидели первый зеленый квадрат? >> В течение дня после этого, но в тот момент вы думаете: "Я годами работал ради этого. Я поставил свою жизнь на карту. Я попросил свою семью, знаете ли, поставить на это все". А потом, знаете ли, это красный. Это чрезвычайно страшно. И есть определенный тип людей, которые просто зависимы от этого чувства, от того, чтобы чувствовать страх и преодолевать его. И, знаете ли, нам повезло иметь много таких людей здесь. >> Если вы подумаете о применении всего этого заработанного ноу-хау за последние несколько лет и теперь, глядя вперед на Gen 2, Gen 3 и далее. >> Конечно. Что вы будете делать по-другому в результате всего, что вы узнали? Просто с концептуальной точки зрения, как вы будете подходить к проектированию и производству следующего, основываясь на том, что вы узнали, делая это в первый раз. >> Нам потребовалось некоторое время, чтобы добраться до примитивов, которые, по нашему мнению, действительно важны для масштабирования инференса. Мы пробовали много вещей на ранних этапах, от компиляторов, которые преобразовывали разные модели в FPGA, до записи весов в кремний, до разделения вашего HBM на KV-кэш и веса, и всего этого. >> И было много циклов обучения, пока мы не пришли к тому моменту, когда поняли, что фундаментально, если вы хотите обрабатывать большинство токенов в мире, вам нужно сделать три вещи. Вам нужно создать чип с наибольшим количеством FLOPS в заданном энергетическом бюджете. Вам нужно создать чип с самой низкой задержкой между другими чипами. Таким образом, самая большая область масштабирования. И вам нужно производить как можно больше этого. >> И я думаю, что, вероятно, в первой половине нашего пути мы изучили первые два, и это сильно повлияло на дизайн. И это сильно влияет на ставки, которые мы делаем в будущем с низковольтным инференсом и кластерной памятью. Но часть производства, я думаю, за последний год стала чрезвычайно очевидной. Насколько люди хотят развертывать эти вещи, если вы можете иметь их сегодня. Вы знаете, лучшая возможность — это доступность. Вы знаете, если у меня есть тысяча чипов сегодня, кто-то их использует. И вы знаете, нам нужно создать чип, который не просто намного лучше того, что было создано раньше, но он должен быть доступен в масштабе гигаватт. Нам нужно иметь возможность создавать продукт, который можно производить в масштабе гигаватт в месяц из предела. Думая об этом, многие проектные решения, которые мы принимаем с нашим следующим поколением, которые вы уже видели, просто сводятся к простоте, удалению множества деталей, попытке собирать и разбирать вещь снова и снова, и изучению того, как сделать ее как можно быстрее и сократить время цикла в производстве, убедившись, что она будет надежной, убедившись, что она будет обслуживаемой, и убедившись, что она будет производиться в гигантских масштабах. Что насчет других проблем в экосистеме, которые находятся вне вашего контроля, таких как мощность на ведущих нанометрах у TSMC или доступность памяти HBM4, или, знаете ли, некоторые из этих других вещей, где все борются за дефицитную единицу мощности или что-то еще. Как вы справляетесь с этими реалиями, когда пытаетесь производить как можно больше? Люди, развертывающие больше всего вычислительной мощности в мире, думают о поставках как о нулевой сумме, то есть существует только определенное количество пластин, производимых на данном нанометровом узле на данной фабрике, и существует только определенное количество памяти, производимой, и именно поэтому для нашего первого продукта мы создали его на другой цепочке поставок, чем Rubins. Так что, знаете ли, мы на 4 нанометрах, Rubins на 3 нанометрах, знаете ли, мы на другом HPM, чем Rubins, и так далее. Так что на самом деле это не игра с нулевой суммой, это игра с положительной суммой, где больше — это больше. Поэтому часто, когда мы говорим с людьми, развертывающими в масштабе, это не выбор между гигаваттом GPU и гигаваттом нас. Это 2 гигаватта. И я думаю, что как можно раньше думать о цепочке поставок на ранних этапах принятия проектных решений, потому что если у вас самый производительный продукт, и вы не можете его произвести, то вы просто подкаст. Это еще одна большая вещь, связанная с вертикальной интеграцией, или определенные вещи, такие как чипы и память, вам придется сотрудничать для большинства других вещей. Это также компоненты с высоким спросом. И чем больше вы создаете сами, тем больше вы можете сделать поверх того, что мир может построить в настоящее время. Это не так, вы отнимаете доступность у кого-то другого. Вы добавляете гораздо, гораздо больше. И я думаю, что так вы побеждаете. >> Одна из вещей, о которых я понял, что мы вообще не говорили, это сами модели, что довольно безумно, то, что стоит за всем этим спросом. Есть ли что-нибудь интересное, что вы могли бы сказать о том, как, по вашему мнению, развиваются модели, основываясь на том, что мы видели до сих пор? Я, скорее, заинтересован в том, как вы, как мыслители об оборудовании, думаете, что оборудование может повлиять на то, куда сами модели пойдут в будущем. Одна из самых важных идей, в которую мы верим, заключается в том, что машины не думают, как люди. Вы посмотрите на самолеты, например, самолеты не летают, как птицы. Когда вы думаете о том, как должны работать механические устройства, это часто очень отличается. И в том же смысле для людей хранение данных и загрузка памяти очень дешевы для нейронов, а выполнение математики относительно дорого, и это прямо противоположно для чипов. >> Обычно загрузка данных очень дорога, а выполнение математики очень дешево, и со временем я думаю, что вы в конечном итоге обнаружите, что математика становится дешевле со скоростью, которая быстрее, чем память становится дешевле из-за этого фундаментального ограничения на любой DRM-устройство. Вам следует подумать о том, как сделать так, чтобы ваша модель использовала огромное количество вычислений. Что, если бы у меня было, например, много копий, работающих одновременно? Что, если бы я активировал огромное количество экспертов? Что, если бы у меня были гигантские эксперты, которых я мог бы запускать одновременно на нескольких серверных стойках? Вот как, я думаю, вы будете создавать модели следующего поколения интеллекта и контекста. Было проделано много работы над очень эффективным инференсом. Что, если я не загружаю полный контекст в память, и в большинстве случаев я думаю, что это имеет большой смысл. Вы хотите создать супер-интеллект, почему он не может посмотреть на миллиард токенов контекста, почему он не может потратить огромное количество вычислений, чтобы прочитать все это очень быстро? Я хотел бы иметь возможность поговорить с машиной, которая могла бы обращать внимание на каждую книгу, когда-либо написанную, и ее краткосрочную память, и я думаю, вы дойдете до точки, когда вы не сможете. >> Тема в моделях прямо сейчас — это фокус на так называемом динамизме, который является этой способностью контролировать уровень вычислений и памяти, затрачиваемых на токен или пользователя при выполнении внимания, а также эту способность динамически на вашем чипе на лету отправлять данные другим чипам для разных моделей, выполняющих определенные типы операций, и, знаете ли, причина в основном в том, что мы масштабируем длину контекста, масштабируем размер модели, масштабируем объем вычислений на пользователя, мы ищем способы быть более эффективными. Так что, знаете ли, первое, как говорит Гэвин, знаете ли, смесь экспертов, знаете ли, архитектуры, где, знаете ли, возможно, нам не нужны все параметры, используемые для каждого токена. Но, возможно, есть вещи, где даже на уровне токена мы можем сказать, что этот токен нуждается в этом контексте от другого токена. Они могут совместно использовать эту память, поэтому нам не нужно иметь накладные расходы на использование памяти в таком объеме. Возможно, этот токен действительно важен, поэтому мы должны тратить больше вычислений. Мы должны иметь более длинный контекст для этого токена. Поэтому оборудование, которое действительно ускоряет эти типы очень динамичных вычислений, чрезвычайно важно. И вы можете представить себе текущее оборудование, которое было разработано до таких архитектур, имеет много накладных расходов при их выполнении. Поэтому вы в основном оказываетесь в этих действительно плохих мирах, где у вас есть неэффективное оборудование для выполнения этого динамизма. Поэтому вы не можете запускать его очень хорошо, или у вас есть эти очень блочные архитектуры, которые как бы применяют грубую силу ко многим разным токенам, которые все требуют более или менее вычислений. >> У меня два вопроса о будущем. >> Мы много говорили о том, что вы построили до сих пор и как вы это построили. Первое — о новых способах использования этих систем. Технология, сырые технологии, логарифмы времени выполнения, вещи такого рода. Когда инференс станет намного дешевле, быстрее, доступнее, будет больше общего предложения, и это будет лучше. Что, по вашему мнению, люди будут использовать эту мощность для самых интересных, захватывающих для вас обоих? >> Да, был вирусный твит от Ноана Брауна, где он сказал, что поскольку у этих моделей все более длительные временные горизонты, они могут выполнять задачи, которые занимают, скажем, шесть месяцев, и часто не хватает времени, чтобы оценить их в течение такого длительного периода времени, потому что к тому времени у вас появится новое приложение модели, которое вы захотите оценить вместо этого. И с такой технологией, как наша кластерная память, вы можете выполнять эту шестимесячную задачу намного быстрее. Но есть и вторая часть этого, говоря с ним об этом, он теперь также ангел, где дело не только во времени, но и в количестве людей или агентов, которые работают над этим. Если вы попытаетесь выяснить, может ли человек построить ракету, вы обнаружите, что ответ — нет. Ни один человек не может построить ракету. Вместо этого вам придется собрать команду. И я верю, что то же самое будет верно и для агентов. Если вы хотите спросить, может ли агент построить какое-нибудь сумасшедшее футуристическое программное обеспечение, вам, вероятно, понадобится очень большая команда. Может быть, это 10, может быть, это миллион. Вам придется иметь это огромное количество как кластерной памяти, чтобы иметь это очень короткое время на токен, так и огромное количество FLOPS, чтобы иметь возможность запускать весь этот флот. >> Я буду немного футуристичен. Я твердо верю, что мы находимся на пути к тому, чтобы инференс стал большинством мирового ВВП. И это может занять более 10 лет, но это произойдет. И прямо сейчас мы измеряем производительность общества как ВВП на душу населения, но на самом деле это будет выглядеть скорее как агенты на мегаватт или, возможно, агенты на гигаватт к тому времени. И пока мы футуристичны, я думаю, что это предпоследний год, когда большинство рабочей силы будет состоять из людей. Я думаю, что в 2027 году вы увидите, что больше агентов будут заниматься интеллектуальным трудом, чем людей. И будет чрезвычайно интересно посмотреть, что произойдет. Вы можете представить себе мир, где для стран большая часть их энергии будет уходить в центры обработки данных, занимающиеся инференсом, а энергоэффективность этих центров обработки данных будет определять, сколько агентов, а следовательно, и насколько велика их рабочая сила. Поэтому вы увидите, как, по словам Гэвина, прямо сейчас у нас есть один агент или команда из пяти-десяти агентов, работающих над групповыми проектами в течение нескольких дней. Так что вы можете сделать довольно крутые вещи, потому что они умны, но это не будет цивилизационный масштаб. Что произойдет, когда появятся страны, которые смогут иметь буквально миллиард одновременных агентов, как миллиард людей в рабочей силе, работающих 24 часа в сутки, 7 дней в неделю, одновременно над одним и тем же? Я имею в виду, это просто немыслимо, что произойдет. И это будет самое большое распространение технологий, которое когда-либо видела человечество. >> Я думаю, что когда у вас есть такое огромное, огромное количество спроса, снова возникает идея экономии за счет масштаба. >> Да. >> Или если вы думаете о людях, у меня есть мозг. Я не использую его весь одновременно. Только часть его будет активна. И так работают здоровые мозги. И для моделей MOE это работает примерно так же. В модели MOE только небольшая часть параметров используется для любого данного токена в любой момент времени. Но если у вас большое количество пользователей на оборудовании, вы можете взять этот мозг, разделить его на множество разных экспертов на множестве разных серверов и пропустить через него огромный объем. Таким образом, у вас будет куча разного трафика. У вас будет много из них, использующих каждую часть мозга в любой момент времени. И вы также сделаете стоимость за мысль, стоимость за токен намного, намного ниже. >> Так что я думаю, что в итоге у вас появятся гигантские распределенные мозги, которые будут выглядеть как реальный форм-фактор — это большой центр обработки данных с кучей чипов, огромное количество FLOPS и огромное количество масштабируемых межсоединений. >> Вы думаете, мы увидим индивидуальный центр обработки данных стоимостью триллион долларов? >> Абсолютно. Это вопрос времени. Это как спросить, видите ли вы фабрику стоимостью миллиард долларов, или фабрику стоимостью 10 миллиардов долларов, или фабрику стоимостью сто миллиардов долларов. Неизбежно, что экономия за счет масштаба не останавливается на том, что 40 миллиардов долларов — это волшебное число для фабрик. Нет, стоимость пластины продолжает снижаться по мере того, как вы тратите больше денег. И то же самое будет верно, скажем, для заводов, которые производят сталь, или заводов, которые производят токены. >> Приземляется очень умный инопланетянин на Землю и хочет узнать от каждого из вас, как бы вы сформулировали эту возможность, которую вы решаете. Что вы ему говорите? >> Сформулируйте это как мышление очень ценно, что каждая компания в мире работает на мышлении, и мы вступаем в этот действительно уникальный момент времени, когда у нас есть машины, которые могут думать почти так же хорошо, так же быстро и даже лучше, чем лучшие люди. Создание этих машин будет огромной возможностью. Но что еще более важно, то, как вы будете управлять таким мышлением, будет очень, очень отличаться, поскольку спрос будет расти все выше и выше. Сейчас уникальный момент, чтобы создать новый набор решений, новую дорожную карту для того, как управлять будущими моделями с квадриллионами параметров для миллиарда человек одновременно в гигантском масштабируемом кластере. >> Мы находимся в новой эре интеллекта, где стоимость производства интеллекта значительно ниже, чем ценность интеллекта, поэтому мы испытываем дефицит этих токенов в течение многих лет, вероятно, многих десятилетий. И, по сути, любой чип или любая система, которая может производить токены, вероятно, будет чрезвычайно ценной. И вам следует найти часть цепочки поставок токенов. Это может быть все, от обучения моделей до того, что мы делаем в кремнии и в другом месте, чтобы потратить время и продвинуть границу. И компании, которые являются крупнейшими, будут, откровенно говоря, компаниями, которые производят большую часть мирового предложения токенов и владеют большей частью цепочки поставок этих токенов. И, что важно, это люди, которые строят системы, которые по мере того, как они собирают все больше и больше чипов дешевле. Так вы хотите, чтобы это масштабировалось, а не так, что, если я хочу обслужить в 10 раз больше токенов, я покупаю в 10 раз больше серверов. Это должно быть какое-то решение, где я хочу обслужить в 10 раз больше токенов, тогда я получаю какую-то выгоду от экономии за счет масштаба с моей технологией кластерной памяти, которая позволяет мне не взимать плату в 10 раз больше за эти стекированные токены. >> Какой нелепо захватывающий будущее вы строите, чтобы обеспечить. Когда я делал это с Гэвином в прошлый раз, я задал ему свой традиционный заключительный вопрос. Так что на этот раз я спрошу вас, что самое доброе, что кто-либо когда-либо делал для вас? >> Во время моего лечения от рака мне пришлось принять важное решение. Врачи пришли ко мне и сказали: "Пришло время вам решить. Вы хотите сделать операцию или вы хотите пройти лучевую терапию?" Вот компромисс. Если вы сделаете операцию, у вас больше шансов выжить, но вы должны предполагать, что никогда больше не сможете ходить. Если вы пройдете лучевую терапию, вы сможете ходить, но вероятность выжить не такая высокая. Вы можете умереть. Что вы хотите сделать? И мне было 16 лет. И мои родители сказали: "Вы должны принять это решение сами". И я долго думал и решил, что сделаю операцию. Я делаю операцию. Одна из вещей, которые вы делаете при резекции опухоли, это анализ некроза, где они смотрят на все разные клетки и говорят, мертва клетка или жива, потому что если у вас есть куча раковых клеток, которые живы, у вас проблема. И они посмотрели на это и сказали: "Знаете, обычно вы хотите 98-99% некроза, чтобы мы сказали, что вы вне опасности. Вы ниже этого. Вам следует пройти лучевую терапию". И было всего несколько машин в мире, которые на самом деле могли проводить тот тип лучевой терапии, который мне нужен. Одна из них была в Бостоне. Я был в инвалидной коляске, и мне нужно было переехать в Бостон на несколько месяцев. И оба моих родителя решили переехать и бросить все, чем они занимались, и жить со мной. И я вечно благодарен. >> Красиво. Спасибо, ребята. Удивительный разговор. Ваша финансовая команда не теряет деньги на больших ошибках. Это утекает через тысячу мелких решений, за которыми никто не следит. Ramp устанавливает ограждения для расходов до того, как они произойдут. Ограничения в реальном времени, автоматические правила, отсутствие тушения пожаров. Попробуйте на ramp.com/invest. По мере роста вашего бизнеса Vant масштабируется вместе с вами, автоматизируя соблюдение требований и предоставляя вам единый источник истины для безопасности и управления рисками. Узнайте больше на vant.com/invest. Ridgeline переопределяет технологию управления активами как настоящего партнера, а не просто поставщика программного обеспечения. Они помогли фирмам в 5 раз увеличить масштабы, обеспечивая более быстрый рост, более умные операции и конкурентное преимущество. Посетите ridgelineapps.com, чтобы узнать, что они могут открыть для вашей фирмы. Каждая инвестиционная фирма уникальна, и общий ИИ не понимает вашего процесса. Rogo понимает. Это платформа ИИ, созданная специально для Уолл-стрит, подключенная к вашим данным, понимающая ваш процесс и производящая реальные результаты. Проверьте их на rogo.ai/invest. Лучшие компании в области ИИ и программного обеспечения от OpenAI до Cursor и Perplexity используют Work OS, чтобы стать готовыми к корпоративному использованию за одну ночь, а не за месяцы. Посетите works.com, чтобы пропустить непривлекательную работу по инфраструктуре и сосредоточиться на своем продукте.