Transcription
Мы знаем, что инференс (вывод) станет крупнейшим рынком в мире. Кто произведет больше всего токенов, тот и станет самой ценной компанией в мире. >> У нас увольнялись люди. >> Да. >> Что люди буквально говорили: «Эту проблему невозможно решить». И, удачи вам, ребята. >> Нужно быть немного не в себе, чтобы присоединиться к нашей компании. Вы убедите свою семью переехать в Сан-Хосе ради компании по производству полупроводников, которой управляют два, сейчас уже 24-летних парня, идущих против крупнейших компаний мира с дизайном, который, как они говорят, будет не на 10% лучше, а в 10 раз лучше. Нам нужно 100 миллионов долларов, чтобы это сделать. Если мы это сделаем, мы думаем, что это может стать одной из самых важных компаний всех времен. >> Вы сидите в этот момент и думаете: «Черт возьми, мы не можем себе это позволить». И я начал смотреть и думать: «Хм, насколько сложно вернуться в Гарвард?» Итак, джентльмены. Прошло три года или около того, Гэвин, с тех пор, как мы с тобой в последний раз это делали, что безумно. И в то время я был просто дико заинтригован вашей историей и тем, что вы собирались построить. Я тогда мало что знал о чипах. Я рассматривал возможность инвестирования в компанию. И поэтому я звонил всем, кого мог представить, кто мог бы дать мне мнение или что-то еще. И в то время, по сути, консенсус заключался в том, что такие компании не строятся молодыми людьми. что в мире полупроводников лучшие компании основаны 40-50-летними людьми, у которых за плечами целая карьера, которые узнали обо всех проблемах, которые выпустили несколько чипов. Два 21-летних парня, как бы, не собираются этого делать. Типа, это просто не сработает. И это было показателем темы, которая заключалась в том, что никто в нас не верит. Это, очевидно, сильно изменилось сейчас. Знаете, просто пройдитесь по коридорам и поговорите с людьми, которые решили прийти сюда работать. Но в первые дни казалось, что это то, с чем вам приходилось бороться. Каково это было бороться с этим, когда набор устоявшихся игроков и целая индустрия людей и инвесторов и всех остальных, как бы, не верили в вас, и что это закалило в вас, чтобы построить компанию так, как вы это делаете, как это повлияло? >> Я думаю, что требуется определенный уровень наивности, чтобы полагать, что вы можете построить чип лучше, чем любой другой когда-либо созданный ИИ-чип, и построить компанию, чтобы сделать это намного быстрее, чем когда-либо было сделано. У нас есть эта наивность. Много раз мы говорили: «Почему это невозможно?» и действительно настаивали на этом, и оказывается, что ответы всех чрезвычайно разрознены по набору ограничений, которые больше не действуют, и реальность такова, что вся индустрия полупроводников и центров обработки данных построена на буфере, и под этим я подразумеваю, что каждая часть стека, от EDA-инструментов до модулей питания, до печатных плат, до дизайна чипов и стандартных ячеек, все построено как универсальное для всего, не только для центров обработки данных, но и для IoT на периферии и так далее. И когда у вас есть конкретный вариант использования, для которого вы действительно пытаетесь разработать, вы можете сильно изменить ограничения. И я приведу очень простой пример, который делаем не только мы, но и то, что вас очень волнует, это тактовая частота вашего чипа. Она пропорциональна пропускной способности вашей системы. Знаете, когда вы выполняете окончательную проверку для различного времени, вы знаете, на какой тактовой частоте вы сможете работать при выпуске вашего чипа. Есть концепция, называемая «углы», которая заключается в том, при каких температурах вы сможете работать на этой тактовой частоте. Знаете, конфигурации по умолчанию для многих из этих EDA-инструментов предполагают, что вы будете использовать свои чипы при минусовых температурах. Ну, я не знаю, как вы, но я никогда не видел ИИ-центра обработки данных со льдом внутри. Так что, знаете, мы можем быть довольно уверены, что наши чипы не нуждаются в работе на полной скорости при 0 градусов Цельсия. На самом деле, они никогда не будут работать ниже 80 градусов Цельсия. И просто зная, что это ограничение, которое не имеет значения, мы можем внести множество изменений во всю систему. Это очень простой пример, но есть и многие другие, где вы получаете 20% здесь, 50% там, в 2 раза здесь, и это складывается в систему, которая может быть радикально лучше для инференса. >> Ну, я думаю, вы нашли два типа людей. Есть люди, которые пошли чисто на эвристику. Хорошо, молодые основатели. Они утверждают, что могут превзойти крупнейшую компанию в мире по производительности. Это не может произойти. И нет ничего, что вы могли бы мне сказать, что заставило бы меня изменить свое мнение. Но есть и люди, которые, конечно, скептичны, которые готовы сказать: «Я потрачу время. Я сделаю работу». И это действительно возможно. Например, одним из наших самых ранних сторонников был этот парень Марк Росс. И Марк был очень престижным экспертом по полупроводникам. Раньше он был техническим директором Cypress Semi, которая была продана за 9 миллиардов долларов. И когда мы встретились с ним, мы были просто парой парней в общежитии. И мы пришли к нему и сказали: «Эй, мы хотим создавать аппаратное обеспечение для инференса. Мы думаем, что можем быть намного быстрее Nvidia». А Марк такой: «Нет, не можете. Это не сработает». Но он хотел меня убедить, если вы напишете технический документ. Вы должны построить функциональную симуляцию и показать мне. И вот после многих долгих ночей я вернулся к Марку и сказал: «Эй, вот симуляция. Что вы думаете?» И он такой: «Хм, это работает». Но чтобы сделать такую компанию, вам понадобится большой капитал. Вам понадобится как минимум 3 миллиона долларов, чтобы даже начать. В итоге мы привлекли пять, а потом еще больше. И тогда он снова удивился, но больше вовлекся, а затем стал советником, а затем штатным техническим директором, поскольку он видел все больше и больше прогресса в разработке. И я думаю, что в целом это очень сильно повлияло. люди, которые хотят быть правыми независимо от обстоятельств, люди, которые хотят быть очень правдивыми и сказать: «Конечно, я скептичен, но я сам разберусь с цифрами. И если я смогу выяснить, почему это возможно, ну, давайте построим это». >> Конкретные ставки, которые вы сделали, то, как вы построили эту систему, мне чрезвычайно интересны. И поскольку так много людей сейчас пытаются сделать это, построить новые чипы, которые будут лучше обслуживать инференс в огромных масштабах, мир интересуется исследовательскими подходами, различными архитектурными подходами, которые люди используют для создания нового ИИ-чипа. И я хотел бы, чтобы вы начали с описания того, что это такое, что оно делает, но, возможно, более интересно и важнее, процесс, который вы прошли, чтобы решить, какие ставки делать, какие технологии изобретать, и сравнить и сопоставить их с тем, что, как вы видели, пытается сделать остальная часть рынка. >> Да, я думаю, вы начнете с продукта. Мы не просто строим чип. Мы строим полное решение для инференса. И это означает стойку. Это означает чип. Это означает подачу питания на чип. Это означает плату, на которой он находится. Это означает соединение, по которому чипы общаются друг с другом. Это означает производство для этого массового объема стоек. На самом деле производство — это продукт. Мы думаем о том, как получить наше преимущество. Есть две ключевые части работы инференса. Есть префилл и декод. Теперь у нас есть два ключевых тега для обеих этих вещей. Префилл — это чтение огромного объема текста, а декод — это использование этих данных для генерации выходных токенов. Когда вы выполняете префилл, ваша главная задача — не предсказывать токены. Вы уже знаете текст. Ваша задача — привести модель в правильное состояние памяти. >> Да. >> То, что мы называем KV-кэшем, в правильном состоянии. >> Затем вы можете выполнить декод с тем же KV-кэшем. Поэтому мы часто делаем то, что мы называем разделением префилла и декода. Вы затем передаете эти модельные памяти, эти KV-кэши в кластер декода, а затем используете этот кластер для генерации следующих токенов. >> Так это вроде как зарядить ружье, а потом выстрелить. Если я думаю об этом в очень простых терминах. >> Да, вы поняли. Это заставляет модель запоминать правильные вещи, а затем использовать их для выполнения задач. >> Обычно люди думают об этом рынке немного лениво или говорят: «Вы чип для префилла? Вы чип для декода?» Если вы чип для декода, вы чип HPM? Вы чип SRAMM? Вы чип 3D RAM? Используете оптику, используете медь? Когда мы начинали, мы просто хотели понять, почему чрезвычайно умные люди работают в этих разных направлениях. Мы серьезно рассматривали архитектуры, такие как наличие большого количества памяти DDR и общего пула памяти, и рассматривали передовую упаковку, чтобы выйти из береговой линии. Мы рассматривали такие вещи, как, знаете ли, есть ли способы разместить чипы памяти поверх вычислительных чипов. Делая это, мы поняли, что бесплатных обедов не бывает. Знаете, у всего есть компромисс, верно? Знаете, 3D RAM, у вас есть тепловая проблема, у вас есть проблема с цепочкой поставок, вам нужно разобраться с гибридным соединением, вам нужно разобраться с флопсами. Итак, теперь вы чип для декода. Итак, мы прошли через все, как на стороне префилла, так и на стороне декода. Делая это, мы поняли, что есть несколько пространств дизайна, которые никто серьезно не пытался исследовать, потому что они никогда не делались в ИИ-чипах. И мы спросили себя, какие фактические метрики будут иметь наибольшее значение. На стороне префилла важно количество флопсов и плотность флопсов. И люди часто говорят о флопсах как о заголовке, но на самом деле вас должны беспокоить флопсы, которые вы получаете при работе с реальными рабочими нагрузками. Есть концепция, называемая MFU, или утилизация модельных флопсов, которая заключается в том, сколько центов на доллар вы фактически получаете за каждый заявленный пиковый флопс, и на GPU вы часто получаете от 20 до 50% в зависимости от рабочей нагрузки, и на самом деле вы можете доказать, что не можете работать на 100%, потому что у вас есть тепловая проблема, где по мере увеличения утилизации флопсов все больше транзисторов включается и выключается, вы потребляете больше энергии, и чип будет саморегулироваться и фактически снижать свою тактовую частоту, чтобы убедиться, что он не перегреется. Когда мы смотрели на инференс, мы сказали: если нам нужно намного больше флопсов, потому что мы хотим работать с намного более высокой пропускной способностью, нам фундаментально нужно решить тепловую проблему, прежде чем мы даже подумаем о добавлении флопсов к чипу. Если я просто добавлю больше флопсов к GPU сегодня или другому ИИ-чипу, я на самом деле не получу большей производительности, потому что он просто будет подвержен тепловому дросселированию. Фундаментально, суть этого заключается в концепции масштабирования Диннарда, где напряжение квадратично пропорционально мощности. Так что, если я удвою свое напряжение, моя мощность увеличится в 4 раза. Если я уменьшу свое напряжение вдвое, моя мощность уменьшится на четверть. Поэтому мы спросили себя, как мы могли бы работать с более низкими напряжениями, чем GPU? И мы много говорили об этом. Мы вылетели в Кремниевую долину после отчисления и, по сути, спросили десятки людей в полупроводниковой отрасли во всех этих различных компаниях по производству чипов, как они это сделали. И ответ, который мы получили, был таким: вы не можете работать с более низкими напряжениями, чем GPU. И это было очень неудовлетворительно, потому что существовало множество различных отраслей чипов, которые работают при более низких напряжениях, чем GPU. Я имею в виду, майнеры биткойнов работают при напряжении менее четверти напряжения GPU. Так что это, очевидно, физически возможно. Вопрос в том, есть ли проблемы с архитектурой GPU, которые делают ее неспособной работать при этих напряжениях? И когда мы долго смотрели на проблему, мы смогли создать новый механизм работы при гораздо более низких напряжениях, новый тип подачи питания, который мы называем низковольтным инференсом. И мы думаем, что все ИИ-чипы в будущем будут низковольтными чипами. Им придется упаковать намного больше флопсов на той же площади кремния и без теплового дросселирования работать при гораздо более низких напряжениях. Это довольно просто. Для декода это все игра с памятью. Чем больше ограничена памятью, тем быстрее вы можете загрузить модель, быстрее загрузить KV-кэш и обслуживать больше токенов в секунду на пользователя. Мы думаем, что люди задают неправильный вопрос. Люди часто спрашивают, сколько пропускной способности памяти на вашем чипе. Вы должны спросить, сколько пропускной способности памяти на вашем полномасштабном кластере. Что мы можем сделать, это добавить гораздо, гораздо больше пропускной способности и гораздо более низкую задержку от чипа к чипу к нашим соединениям. Это позволяет нам обслуживать модели с гораздо более высокой скоростью, потому что вы можете использовать SRAMM и HPM всего кластера как единый пул. И это наша вторая ключевая техническая ставка. То, что мы называем кластерной памятью. И на GPU сегодня пропускная способность памяти кластера часто используется очень плохо, потому что время перехода от одного GPU к другому чрезвычайно велико. Например, на чипах Blackwell это может быть около 4000 наносекунд для прямого соединения. И это означает, что если вы перейдете к настройке 8xTP, вы получите намного, намного меньше, чем 8-кратное увеличение количества токенов в секунду на пользователя. И мы построили свой собственный полностью настраиваемый стек соединений. Мы взяли все выше второго уровня Ethernet, построили его полностью на заказ, и мы можем добиться гораздо лучших задержек и пропускной способности таким образом. Мы можем сократить это более чем в 5 раз. И это позволяет нам более эффективно использовать память других чипов. По мере увеличения размера мира ваше время на токен пропорционально уменьшается. Это не так удивительно, учитывая, что все эти архитектуры были построены до ChatGPT. Так что, если мы пытаемся построить чип для современных рабочих нагрузок, он будет выглядеть очень иначе. То, как мы организуем наши флопсы, то, как мы используем наши домены напряжения, то, как мы используем наши плоскости питания, будет выглядеть супер иначе. То, как мы делаем упаковку, будет выглядеть супер иначе. То, как мы делаем дизайн платы, будет выглядеть иначе. А на стороне декода то, как мы все соединяем, будет выглядеть очень иначе. Сейчас мы выводим на рынок наше первое поколение этой технологии низковольтного инференса, которая работает при напряжении менее половины напряжения любого другого ИИ-чипа. >> RAMP — это единственная платформа, созданная для того, чтобы сделать вашу финансовую команду более компактной, быстрой и лучшей, экономя бизнесу в среднем 5% в год, чтобы вы могли сосредоточиться на росте. Клиенты Ramp росли в выручке в 3,2 раза быстрее, чем средний американский бизнес. Visa, Perscell, Cursor, Stripe, Notion, 11lab, Shopify и 70 000 других компаний работают на Ramp. Моя тоже, и ваша тоже должна. Узнайте больше на ramp.com/invest. OpenAI, Cursor, Anthropic, Perplexity и Verscell имеют что-то общее. Все они используют WorkOS. И вот почему. Чтобы достичь корпоративного внедрения в масштабе, вы должны обеспечить основные возможности, такие как SSO, skim, arbback и журналы аудита. Вот где вступает в игру WorkOS. Вместо того, чтобы тратить месяцы на создание этих критически важных возможностей самостоятельно, вы можете просто использовать API WorkOS, чтобы получить их все с первого дня. Вот почему так много ведущих ИИ-команд, о которых вы слышите, уже работают на WorkOS. WorkOS — это самый быстрый способ стать готовым к корпоративному уровню и сосредоточиться на самом важном, вашем продукте. Посетите works.com, чтобы начать. Felix от Rogo — это персональный финансовый агент, который превращает один запрос в готовую к работе работу, используя собственные шаблоны, контекст и стандарты вашей фирмы. Отправьте Felix электронное письмо, например: «Возьми эти комментарии и переработай их для меня». Или: «Обнови мой трекер с учетом контекста этих писем». Или: «Выполни расчет способности к оплате для этого покупателя». И Felix отправляет обратно готовые презентации PowerPoint, Excel-модели и собранные исследования. Felix работает так, как ваша команда уже работает, быстро и точно выполняя работу круглосуточно. Узнайте больше на rogo.ai/felix. Если посмотреть на все в целом, почему это так важно? Почему доставка гораздо более высокой пропускной способности, гораздо более низкой стоимости за токен, лучших токенов на ватт, всех этих метрик, о которых мир начнет говорить все больше и больше. Все знают, что предложение — это большая проблема прямо сейчас. Почему это в более широкой перспективе, заглядывая на десятилетие вперед, является узким местом в технологическом мире? Ну, я думаю, это сводится к производительности, где мы находимся в этот чрезвычайно интересный момент в истории цивилизации, когда существует настоящий искусственный интеллект, а не научно-фантастические вещи, но эти модели могут решать проблемы, которые большинство людей не могут. И это приведет к новым научным открытиям. Это обеспечит мгновенный доступ к медицинскому обслуживанию, мгновенный доступ к образованию, и теперь все сводится к тому, сколько людей могут использовать это одновременно, сколько продуктов могут обслуживать это одновременно. А также скорость выполнения различных задач. Так что, когда вы думаете о времени от звонка до звонка, если мы можем взять агента, который может работать с определенным качеством модели и может занять год для решения определенной задачи, используя вычислительные мощности для инференса, если у вас есть гораздо более быстрая скорость декода, вы можете сжать это до месяца. Таким образом, объем научных инноваций и фактическое распространение технологий произойдет намного быстрее. А затем вторая часть — это одновременность, где сегодня просто невозможно, чтобы миллиард человек одновременно использовали эти модели. В конечном итоге некоторые люди будут понижены в статусе. Модели некоторых людей будут медленнее. Некоторые люди просто не смогут получить доступ к оборудованию. Через несколько лет появятся гигантские модели, обслуживающие миллиарды пользователей. Мы находимся на очень ранних стадиях развития ИИ сегодня, где платные планы, только несколько миллионов пользователей в мире используют платные планы ИИ-моделей. Так что мы находимся на 1/1000 глобального населения, фактически использующего эти вещи. Так что, если вы хотите обслуживать в огромном масштабе, многое изменится, и одно из них — это количество чипов, которые общаются друг с другом, где люди обычно думают об этом в контексте обучения. Знаете, у вас есть эти гигантские обучающие кластеры. У вас есть Colossus с более чем 100 000 GPU, которые все связаны между собой. И знаете, сторона инференса, знаете, сегодня люди обычно думают об этом как о кластере из 8 чипов или, возможно, просто NVL72 в качестве масштабируемой области, но очень быстро это станет тысячи чипов и десятки тысяч чипов. И способ получить максимальную производительность там, время между отправкой данных с одного чипа на другой, эта примитивная операция имеет гораздо большее значение, чем ей сейчас уделяется должное. Так что, когда мы думаем об оптимизации пропускной способности памяти для системы, вы должны думать о том, как быстро эти чипы могут общаться друг с другом, потому что если они могут общаться только очень быстро друг с другом и очень медленно с другими чипами, вы на самом деле не сможете обслуживать гигантские модели со скоростью 10 000-20 000 токенов в секунду. Поэтому нам нужны множественные порядки инфраструктуры, построенной по всему стеку, от питания, знаете, от пластины до ватта, знаете, от транзистора до токена, чтобы фактически донести эти вещи до мира. И я думаю, что вы посмотрите на большинство других товаров, таких как iPhone, например, они достигли экономии за счет масштаба, в результате чего больше денег на самом деле не покупает лучший iPhone, что если вы миллиардер или просто средний американец, вы покупаете один и тот же телефон. И токены пока не такие. Мы все еще на очень ранних стадиях, когда универсальная система, относительно небольшая, как бы вручную создает эти токены, как будто они делали винты в эпоху Возрождения. И я хотел жить в мире, где у вас есть такая же экономия за счет масштаба для производства токенов, как и для производства, скажем, iPhone или автомобилей или чего-либо еще. >> Я думаю, что это один из огромных прорывов, который позволяет огромной группе людей использовать модели наилучшего качества. Я думаю, что экономия за счет масштаба сделала капитализм очень, я не знаю, справедливым. Я думаю, что это позволяет вам иметь один и тот же продукт во многих, многих разных руках, и вы можете обслуживать гораздо больше пользователей на одном масштабируемом кластере, что позволяет вам приблизиться к этой точке для обслуживания токенов. >> Да. И также некоторые продукты не могут быть использованы, если они медленные. >> Да. >> Так что, если вы хотите обслуживать модели кодирования, и вы хотите, чтобы люди действительно их использовали, вам нужно достичь определенного количества токенов в секунду. Так что вопрос в том, сохраняя эту скорость на токен, сколько пользователей я могу обслуживать одновременно? И вы можете просто решить: я отключу большую часть мира от использования этих вещей, или все получат худший опыт. Так что фундаментально вам нужно найти способы продвинуть кривую, и именно поэтому существует такое давление на новое оборудование. Я хотел бы потратить некоторое время, чтобы отступить и услышать ваши истории о том, как вы пришли к этой идее и этой компании, а затем пройтись по тому, как это было строить ее, потому что, я думаю, делая это, мы поймем систему, которую вы построили для компании, которая затем сможет обеспечить последующие поколения продуктов, подобных этому, для этого сумасшедшего будущего инференса, на которое мы смотрим. Роб, возможно, начиная с вас, расскажите, как далеко назад вы хотите, но что меня интересует, и ваша личная история, это то, что я впервые услышал от кого-либо из вас много лет назад, что действительно меня поразило. Меня больше всего интересует ваша мотивация в конечном итоге быть здесь и делать это. >> Это началось еще в старшей школе для меня. Мне очень не везло и везло в разные моменты жизни. Это было одно из самых трудных времен. Знаете, в конце второго курса старшей школы я получил травму на турнире по боевым искусствам. На следующий день я почему-то не мог ходить. И они думали, что что-то не так с моим крестцово-подвздошным сочленением или что-то в этом роде. Я прошел физиотерапию. Я сделал разные виды сканирований. Они не могли понять. И в итоге они обнаружили большое уплотнение на моей спине на МРТ, и мне сказали, что это опухоль. Рак костей четвертой стадии, мне сказали, что у меня менее 30% шансов на выживание. Это был двухлетний сумасшедший курс химиотерапии, операции, обучение ходьбе заново. И когда вы проходите через что-то подобное, это действительно меняет окно человеческого опыта и заставляет вас ценить то, что действительно важно. И вы также спрашиваете себя, что вы будете делать, если у вас будет шанс жить? Если вы действительно хотите пройти через что-то подобное, вам нужно надеяться на что-то. И я всегда знал, что хочу сделать что-то очень значимое, если у меня будет шанс пройти через это. Мне потребовалось несколько лет, чтобы понять, что это будет. И в то же время, когда я поступил в колледж и встретил множество других людей, создающих крутые технологии, я был очень взволнован ИИ-моделями, особенно после выхода GPT3, и я подумал: «Вау, это первая модель, которая может говорить по-английски, и эти вещи станут очень умными». Что произошло, когда вышел GPT4, появился GPT4V, который был первой моделью с загрузкой изображений. Так что я просмотрел свою галерею и нашел фотографию своей спины с этим уплотнением до того, как мне поставили диагноз, и сказал: «Эй, чат GPT, представь, что ты эксперт-врач. Приходит пациент, и он говорит, что у него есть это, знаете ли, уплотнение на спине. Что это может быть?» >> И он сразу же говорит, что это может быть опухоль. Вам следует немедленно сделать МРТ. Идите к врачу. И я просто сидел там, застыв. Это заняло шесть месяцев. >> Да, это заняло у меня 6 месяцев. И знаете, вчера этой функции не было. Сегодня она есть. Я иду показать родителям, и получаю уведомление: «У вас сегодня закончились кредиты на изображения. Вам нужно получить профессиональный план». И я такой: «Черт возьми». Это изменит все, и, знаете ли, у нас явно нет инфраструктуры для ее обслуживания, и есть очень мало вещей, над которыми вы можете работать, которые действительно могут быстрее донести эту технологию в масштабе до мира. Я имею в виду, есть много очень умных людей, работающих над моделями. Знаете, фабрики кажутся недоступными для работы, но казалось, что все аппаратное обеспечение было разработано до ChatGPT. Так что, каждый GPU, каждый TPU, каждый ИИ-чип, который обслуживал эти модели, был фундаментально создан до этого и доработан для обслуживания этих современных моделей. Появится совершенно новая волна архитектур, и что может быть более захватывающим, чем донести это до всех. Совершенно другой угол зрения в то же время. Я управлял стартап-инкубатором под названием ProR, который инкубировал множество различных компаний. Некоторые из самых ранних были Cursor и Anyphere, которые объединились, и Mer и Etch прошли через это, еще несколько других. Да. В то время, когда модели становились умнее, это был 2022 год, я понял, что все эти компании тратят все привлеченные деньги на вычисления, и я пришел к этому выводу, работая над некоторыми своими вещами, что, о боже, все продукты, которые я хочу построить, будут стоить десятки миллионов долларов в год на инференс. Эй, это не будет жизнеспособно. Структура затрат каждой программной компании, себестоимость продукции больше не будет нулевой для дополнительного пользователя. Она будет довольно высокой, и она будет функцией инференса, а затем операционные расходы каждого бизнеса также будут инференсом, поскольку люди используют все больше и больше кодирующих агентов. Так что фундаментально кажется, что инференс будет очень важен, и кажется, что мы находимся на десятилетнем марше, чтобы инференс стал, знаете ли, крупнейшим рынком в мире. Так что, когда вы думаете об этом через 10 лет, будут гигантские проекты, где все в этом центре обработки данных фундаментально не было разработано сегодня, мы должны выбрать что-то и работать над этим. И, знаете, вот как это началось. >> Гэвин, я очень рад, что вы вернетесь так далеко, возможно, даже раньше старшей школы, и расскажете о своих любимых отметках на временной шкале, которые в конечном итоге привели к вашим амбициям бросить Гарвард и основать эту компанию. Моя первая работа была в компании под названием Exnord, где я занимался разработкой ядра. Мне было 17 лет. >> Да. >> И 17-летний не может подписывать юридически обязывающие контракты. Поэтому, вместо того чтобы идти традиционным путем, они усадили меня и сказали: «Гэвин, не делись этой информацией». И Extern была одной из немногих компаний, которая увидела: «Эй, возможно, это хорошая сделка». И я начал работать над созданием ядер. И я делал это в ряде других компаний с тех пор. Extern был куплен Apple за 200 миллионов. Я делал то же самое в Octo, которая была куплена Nvidia за сотни миллионов долларов. Но когда вы занимаетесь такой работой с ядрами, вы понимаете, что математика относительно проста. >> Хорошо. >> Но чтобы получить высокоскоростной декод, важно перемещение данных. Почти вся ваша работа заключается в оптимизации того, как вы перемещаете данные по одному чипу или между несколькими чипами. И именно поэтому мы создали эту технологию кластерной памяти. Мы значительно снижаем время соединения. Вы можете перемещать гораздо больше данных и, как следствие, получать гораздо более быстрое время генерации каждого последующего токена и создавать эти сумасшедшие вещи, о которых говорит Роб, чтобы выполнять годовую работу за месяц или даже больше в будущем. >> Можете ли вы рассказать о соревновательном духе, который проявляется в некоторых школьных соревнованиях, в которых вы участвовали и побеждали? >> Мы участвовали в нескольких. Например, я был очень активен в FTC Robotics, и мне повезло иметь очень талантливого партнера Сэнфорда, с которым мы долгое время были частью традиционной школьной команды, где около 20 парней работали вместе, как это часто бывает в First Tech Challenge, и цель состояла в том, чтобы построить робота, который набирает больше всего очков, и многое другое. И First уделяет большое внимание сотрудничеству с другими командами, попыткам очень хорошо документировать, попыткам вдохновить других сделать то же самое. Сэнфорд и я решили, вместо того чтобы делать это таким образом, мы победим, и мы не делали ничего, кроме как набирать больше всего очков. >> Как команда из двух человек? >> Как команда из двух человек. >> Вместо команды из 20 человек. >> Мы были намного, намного меньше, чем почти каждая другая команда в соревновании. Мы поняли, что если мы собираемся специализироваться, если мы собираемся побеждать в этих чертовых играх действительно хорошо, нам не нужно будет продвигаться на основе качества нашей документации или нашей работы с общественностью. >> Мы просто собирались победить. >> И мы сделали это. Мы отделились, создали эту команду из двух человек, построили робота и решили переделывать его каждые 3 месяца. И мы сделали это. И мы фактически имели мировой рекорд по самому высокому счету во время этого соревнования в один момент. Мы были оценены OPR как третьи в мире по разработке программного обеспечения, и это была чертовски хорошая машина. >> Что из этого эпизода можно перевести как аналогию на то, как вы построили Etch, компанию? >> Мы думаем о том, как вы хотите создать полномасштабный продукт, как этот. Есть несколько ключевых идей. Одна из них — это скорость, скорость, скорость, вы побеждаете, отправляя продукт. Вы не собираетесь побеждать, имея лучшую работу с общественностью или лучшую коммуникацию. Вы побеждаете, имея лучший продукт. >> Решили не общаться. >> Точно, как ваша, я просто понимаю, насколько точно, как робототехника. >> Есть много способов победить в бизнесе, но мы предпочитаем сосредоточиться только на создании лучшего продукта. >> И аналогично, мы думаем, что мы можем сделать это с гораздо меньшим количеством людей, чем если вы готовы просто сосредоточиться на продукте, продукте, продукте, продукте и неустанно парализовать, вам не нужно 20 000 человек, как у крупных компаний, вы можете сделать лучший продукт в мире с гораздо меньшим количеством людей. Знаете, есть поговорка: лучшая часть — это отсутствие части. Я думаю, для нас лучшим поставщиком является отсутствие поставщика. Насколько это возможно, мы хотим вертикально интегрировать весь продукт. Как потому, что мы получаем большую производительность, так и потому, что мы можем двигаться намного быстрее. Так что, знаете, все, от чипов до плат, до холодных пластин, до соединений, до даже производства. Мы хотим делать все это как можно более внутренне. Мы фактически, я думаю, единственная стартап-компания прямо сейчас, которая строит свой собственный стойку, а также свои собственные чипы. И мы сделали это все одновременно. Пару лет назад мы были в последний раз публичными. В то время мы только начали строить нашу команду по стойкам, и мы привлекли Брайана Лера, который построил все системы HGX и DGX Nvidia, что составляет около 80% выручки, и мы сказали, что будем строить стойку одновременно. Мы фактически прошли несколько итераций стойки до того, как чипы вернулись. До того, как чипы вернулись, мы сделали тепловые чипы, которые имели точно такие же горячие точки, как мы ожидали от наших чипов. Так что мы могли построить холодные пластины. Мы могли бы чрезмерно их накачать и взорвать. У нас не было ни одной утечки с тех пор, как наши чипы вернулись с холодными пластинами, потому что мы уже их проверили. Да. У нас есть фабрика на Тайване. У нас там несколько десятков человек. Мы построили клон ряда испытательных станций в нашем офисе. У нас есть центр обработки данных мощностью 2 мегаватта на этом этаже. И мы проводили 24/7 циклы разработки. Знаете, люди работают в дневные и ночные смены, чтобы как можно быстрее запустить оборудование. Это крайняя вертикальная интеграция и крайняя параллелизация графика, которая позволяет вам выводить продукты на рынок намного быстрее. Если вы думаете о построении ранней команды и о том, что для этого потребовалось двум молодым парням, строящим эту компанию, есть много очень талантливых молодых предпринимателей, возможно, впервые такого масштаба или значимости за долгое время, всем из которых, вероятно, могут принести пользу уроки, которые вы усвоили. Привлечение очень искушенных, талантливых людей, чтобы присоединиться к вам даже после карьеры в, знаете ли, других великих компаниях. Если бы вы преподавали это как класс, вот как получить элитный талант, когда вы молоды, неопытны и наивны, как бы выглядел учебный план? >> У нас довольно бинарная философия талантов. Она начинается с того, что мы называем легендами, когда мы пытаемся решить невероятно сложную техническую проблему и, как правило, сделать что-то, что раньше не делалось. Нам нужно найти лучшего человека в мире, и часто номер один в мире по сравнению с номером 10, по сравнению с номером 100. Огромная разница в том, возможно ли решить проблему. Мы создали систему, которую мы называем рекрутингом на основе проектов, где мы картируем все самые сложные технические проблемы во всех отраслях, которые когда-либо приходилось решать. Мы смотрим на временность. Итак, кто те люди, которые сделали переход от нуля к одному? Кто главный, так сказать, кто фактически сделал работу? Мы говорим с как можно большим количеством людей. А потом мы просто отслеживаем это. И вы удивитесь, сколько людей говорят «да» после первого разговора, это довольно мало, но количество людей, которые говорят «да» после 20-го разговора, удивительно велико. Вам действительно нужно их удерживать. Когда вы слышите «нет» от кого-то, кто действительно является лучшим в мире, это действительно означает: «Эй, вам следует вернуться, когда вы докажете еще несколько этапов». >> Да. >> И я думаю, что одно из самых убедительных зрелищ — это то, что мы делаем смелые заявления. И когда вы снова и снова их выполняете, это действительно вдохновляет на веру. Когда мы решили построить стойку, а не просто чип, мы смотрели на это и говорили: сколько продуктов действительно было выпущено в масштабе для полномасштабной системы стойки, которые фактически имеют такую плотность мощности, которую мы пытаемся решить? И, знаете, мы просто сказали, если бы мы могли взмахнуть волшебной палочкой, как бы выглядел лучший человек в мире? И это было бы так: если бы мы могли найти кого-то, кто начал в NVIDIA и построил всю команду стоек через все их разные поколения, узнал все эти разные вещи, но при этом остается предприимчивым, все еще понимает культуру стартапа, но видел масштабы, это был бы лучший человек. Итак, мы нанесли на карту все различные команды, связанные со всеми различными полномасштабными продуктами стоек в видео, и нашли трех человек, которые, по нашему мнению, могли бы подойти. И мы поговорили со всеми ними, и двое из них только что ушли на пенсию, а один планировал сделать еще одно поколение для Nvidia, а затем уйти на пенсию. Его зовут Брайан. И со временем мы убедили его присоединиться. Брайан основал команду HGX и DGX в NVIDIA. Знаете, это было, знаете ли, большинство выручки Nvidia, десятки миллиардов долларов в квартал. И другие двое в итоге инвестировали, кстати. Но когда у вас есть кто-то вроде него, он просто знает, как выглядит хорошо, потому что он видел это. И так много раз, когда мы говорили с Брайаном, и он просто указывал на нас и говорил: «Это урок на миллиард долларов, который я усвоил. Урок на миллиард долларов, который я усвоил, знаете ли, это экономит нам циклы». И вы сочетаете кого-то вроде Брайана с кем-то вроде Сэнфорда. >> У вас есть для них имя? Так что Брайан — легенда. А как насчет Сэнфорда? >> Да, мы говорим «чипы на плечах», «чипы в центрах обработки данных». >> Да. Так что, знаете, Сэнфорд и Гэвин в старшей школе были чемпионами мира по робототехнике. И Сэнфорд заканчивал последний курс колледжа, и мы позвонили ему пару лет назад и сказали: «Эй, можешь приехать, посмотреть, что мы делаем, нам нужна помощь на стороне платформы», и он приезжает на неделю, и мы говорим: «Можешь построить холодную пластину на этой неделе?» И если вы спросите любого инженера-теплотехника, любого, кто занимается этим, они подумают, что вы просто совершенно наивны, верно? Я имею в виду, что эти вещи занимают месяцы, и, чтобы быть ясным, так и есть, но вы можете добиться реального прогресса за неделю, если вы поставите себе цель и считаете это возможным. И он построил приспособление за неделю, которое фактически снизило риск довольно важного вопроса питания, который у нас был. И вы объединяете этих двоих, и они сделали невероятные вещи, и одно невозможно без другого, потому что вам нужны чрезвычайно целеустремленные люди, которые просто продолжают спрашивать «почему» и не знают, где закопаны тела, чтобы идти на множество агрессивных рисков, а затем вам нужны люди, которые видели масштабы и все еще имеют предприимчивый менталитет стартапа, чтобы помочь им на этом пути. Это действительно легенды плюс сырой, знаете ли, какой-то наивный сырой талант, основанный на первых принципах, но это сочетание. Дело не только в том, что у вас есть оба в компании. Дело в том, что они работают вместе. >> Правильно. >> Если я думаю об этой воронке, есть ли что-нибудь еще интересное, что можно сказать о том, насколько лучше вы стали в рекрутинге и почему эти показатели продолжают улучшаться? Один из шокирующих моментов заключается в том, что быть такой контркультурной ставкой как бы самоотбирает. >> Правильно. >> Что вы тот тип человека, который, я думаю, является оппортунистом, который присоединится к любой модной компании, а не будет проводить глубокую проверку, вы не придете сюда работать. >> Правильно. >> И это одна из вещей, о которых я беспокоюсь, когда мы объявляем все больше и больше о продукте и его спецификациях, мы можем потерять часть этого, если не будем очень осторожны. >> Нужно быть немного не в себе, чтобы присоединиться к нашей компании. Вы думаете об этом на бумаге, это как вы, человек, который, вероятно, очень успешный инженер, зарабатывающий хорошие деньги, это ликвидность, это предсказуемость где-то еще, вы убедите свою семью переехать в Сан-Хосе и жить в этой квартире по этой жилищной программе для компании по производству полупроводников, которой управляют два, что теперь 24-летних парня, которая еще не имеет продукта, которая идет против крупнейших компаний в мире и в самой дефицитной среде, когда-либо созданной, с дизайном, который, как они говорят, будет не на 10% лучше, а в 10 раз лучше. С вами что-то должно быть не так, чтобы сделать это. И, знаете ли, люди здесь просто устроены по-другому, они действительно хотят не доказать, что люди не верят, а доказать, что люди верят, и они воспринимают это лично, и, знаете ли, это очень весело находить таких людей, и, честно говоря, сама природа компаний делает очень легким отсеивание людей, которые не такие. Одна из первых вещей, о которых мы с вами говорили, Роб, это то, что я начал спрашивать о Sohoo, что является названием первого продукта здесь. И вы сказали, что мы можем поговорить об этом подробно, но вы должны знать, что мы действительно сосредоточены на создании машины, которая может в масштабе производить эти вещи и их поколения с максимально возможной эффективностью и высочайшим качеством. Так что мы хотим построить компанию или машину, которая является компанией, которая полностью >> произведет эту вещь, а затем последующие вещи. Так что я хотел бы поговорить о нескольких принципах или краеугольных камнях компании. Один из них вы упомянули, вы упомянули некоторые из них. Вы сказали «скорость», вы сказали «вертикальная интеграция». Вы знаете, они стали более популярными темами. Параллелизация — это то, о чем, возможно, стоит поговорить. Но меня особенно интересует ваша готовность идти на огромный риск, чтобы двигаться быстрее. Может быть, расскажите свою любимую историю о том, почему это философия, что она позволила вам сделать, чего, возможно, не сделали другие компании. >> Здесь есть ряд историй. Но одна из моих любимых — это когда мы приближались к выпуску чипа. Мы поняли: «Подождите, один из наших поставщиков сильно отстает от графика». И у нас было два очень плохих варианта. Один вариант — сохранить текущего поставщика и отодвинуть наши сроки примерно на год. >> Другой вариант — сменить поставщика, начать заново и также отодвинуть сроки на год. И ни один из этих вариантов не был хорошим. Так что нам пришлось искать вариант номер три, и это было то, что мы выяснили, что вся наша команда в Бангалоре собирается и выполняет работу. Мы отправили дюжину наших лучших инженеров по всему миру в Бангалор на 6 месяцев. Я тоже был там. Я лично жил в Бангалоре четыре с половиной месяца, и каждое утро мы шли через безумно оживленные улицы Бангалора в офис. Мы были первыми. Мы создали широкий спектр инструментов, как для аудита огромного количества кода, который поступал, так и для создания множества инструментов, чтобы сделать это еще быстрее, убедившись, что мы принимаем правильные проектные решения на месте, прямо там. Никаких 12-часовых перепалок. Мы могли решить немедленно, а затем в 1:00 ночи мы шли обратно по теперь пустым улицам Бангалора и делали все это снова на следующий день. У нас все еще была часть команды в США. Мы проводили эти 12-часовые передачи с каждой стороны, где у нас был 24-часовой цикл разработки, где в 8 утра и 8 вечера каждый день мы все подключались к Zoom, делились всеми данными, говорили: «Когда я проснусь, это должно быть сделано. Мы должны выпустить этот чип». И это было чрезвычайно напряженно. В то же время мы видели другие чипы на той же стадии, что и мы, у того же поставщика, которые заняли годы, которые до сих пор не вышли, которые до сих пор даже не были выпущены. И именно такой уровень крайней срочности необходим для вывода продуктов на рынок. >> В чем ключ к этому? Ну, это стало клише, в основном из-за Илона, что его особый навык и других, кто пытается ему подражать, пытаются сделать это тоже: выяснить, в чем заключается ограничивающий фактор, и просто лично сосредоточиться на этом, что похоже на поездку в Бангалор или что-то в этом роде. Кажется, это центральный принцип бизнеса и любого бизнеса, который собирается заниматься такой вертикальной интеграцией. В чем ключ к этому? Ну, опять же, что вы узнали об этом конкретном действии? Для меня, я думаю, есть два ключевых трюка. Первый.
Одно из них заключается в том, что вы не можете создать чип в одиночку. Это должна быть командная задача. И ваша самая важная работа — найти отличных людей, которые пойдут с вами, и отличных людей, которые будут вдохновлены и воодушевлены делать такие сумасшедшие вещи. Это большая просьба — сказать: «Ребята, оставьте свою жизнь на шесть месяцев или, в одном случае, на 12 месяцев». Мы отправили одного парня далеко вперед. Это неприятно, но нам повезло иметь членов команды, которые делают это по правильным причинам. Но я думаю, что вторая большая вещь — это способность очень быстро принимать решения. Одна из худших вещей — это когда есть фабрика или поставщик, который ждет, пока вы примете какое-то решение, и затем просто останавливается. >> И это происходит постоянно, даже из-за очень мелких вещей. Поэтому отправляйте людей, делегируйте им большую часть ответственности и говорите: «Примите разумное решение». Ничего страшного, если вы время от времени ошибаетесь, но я гораздо, гораздо предпочту быть правым большую часть времени и дать ответ немедленно, чем каждый раз ждать идеального ответа. Скорость побеждает. >> А как насчет траты денег, чтобы ускорить процесс? Есть такая вещь, как обучение на практике, которая стала настолько интересной, и поскольку мир отошел от программного обеспечения и снова движется к аппаратному обеспечению в мире технологий, мы так много аутсорсили обучение на практике, отправляя продукцию за границу и фактически будучи просто идеологами здесь, в США. Похоже, что это очевидно меняется, и вы приняли этот способ обучения на практике, как будто вы хотите быть в этом цикле обучения итераций. >> Абсолютно. >> И частью этого является готовность тратить и рисковать деньгами. Да. >> Можете ли вы немного рассказать об этом? Я думаю, есть отличная цитата: «Самый большой риск — это не рисковать», очень похоже на это: каждый день в этой категории выручка составляет более миллиарда долларов, и большая часть этого — вывод. Поэтому каждый день, когда мы не отправляем продукцию, мы просто упускаем массу возможностей. >> поэтому ваша готовность тратить деньги должна быть чрезвычайно высокой, если вы можете получить из этого очень четкую рентабельность инвестиций. Поэтому у нас есть концепция, которую мы называем предварительной выборкой, которая заключается в том, что когда вы ждете, пока одно дело будет сделано, когда вы знаете, что будете делать другие вещи, как только вы это получите, есть ли способы, которыми вы можете параллелизовать весь график. Например, мы знаем, что наш чип, мы знаем, что наш чип вернется в определенную дату. Мы хотим, чтобы все возможное, что могло быть сделано без чипа, было сделано до того, как чип прибудет. И это стоит больших денег, верно? Это означает, что мы хотим построить весь наш программный стек заранее. Это означает, что мы хотим фактически отправить стойки в центры обработки данных клиентов без наших чипов, со всей сетью, всеми процессорами, всем хранилищем, настроенным так, чтобы мы могли запустить все программное обеспечение центра обработки данных до того, как чипы вернутся. Это означало, что мы взяли более 700 FPGA и поместили весь чип полного ретикула на кластер FPGA и запустили дюжину различных моделей с нашим полным стеком вывода на них до того, как чипы вернулись. Это означало, что мы построили тепловой чип, чтобы имитировать тепловой профиль нашего чипа, и построили холодные пластины на его основе до того, как чип вернулся. Это означало, что вся производственная линия была готова. Это означало, что мы сделали много ревизий печатной платы. Это означало, что весь продукт был готов к работе до того, как чипы вернулись. И это то, что это дает вам. Была еще одна очень известная компания по производству ИИ-чипов, которой потребовалось 10 месяцев, чтобы перейти от получения кремния до запуска вывода в стойке. И это было публично объявлено их инвесторам, и это было действительно большое дело. >> Мы смогли сделать это за 40 дней. И это потому, что к тому времени, когда чип вернулся, все было скучно. Программное обеспечение уже было написано, стойка уже была там, производственная линия уже была настроена. Мы просто собирали все вместе. Знаете, вы не всегда все предусмотрите. Вы вносите некоторые корректировки на лету, а затем отправляетесь. >> Хотя в этом конкретном случае это тоже была большая часть этого. Но также, я думаю, сдвиг тоже сыграл большую роль. >> О, совершенно точно. >> Что мы вышли и буквально имели дневную и ночную смену. Были члены команды, которые приходили в 10 утра и уходили около полуночи. Да. >> Которые приходили в полночь и уходили в 10 утра, работая круглосуточно, чтобы достичь этих 40 дней. >> Да. Я имею в виду, более половины компании живет рядом с офисом. >> Поэтому это облегчает выполнение таких задач. >> Вы платите им за это, верно? Платите им дополнительно. Вы все еще делаете это? >> Да. невидимая рука творит чудеса. >> Я имею в виду, это работает и для меня. >> Мы оба там. >> Я хотел бы сделать один большой шаг назад и поговорить немного о более широкой экосистеме. Количество дефицита на стороне предложения, подверженность рискам в глобальной системе и цепочке поставок вокруг этого стало как бы ежедневной новостью на первой полосе Wall Street Journal. >> как акции, за которыми люди следят, в которые инвестируют и которыми восхищаются. Знаете, если вы подумаете об акциях памяти, они были, знаете ли, скучными товарами, как ничего особенного пять лет назад, а теперь они в центре глобального внимания. Если вы просто оцените, поскольку вы занимались этим, глобальную связанную цепочку поставок, которая необходима для создания таких вещей, просто поразмышляйте об этом. Что вас пугает? Что работает хорошо? Что нужно изменить? Что вы надеетесь изменить благодаря тому, как вы строите эту вещь? >> как просто ваша оценка этой истории прямо сейчас? >> Я думаю, что одна из самых недооцененных частей истории цепочки поставок заключается в том, что почти ни одну из этих вещей вы не покупаете и больше не разговариваете с поставщиком. Вы должны сотрудничать. Это самая важная часть успеха, я думаю, в чипах с TSMC или с поставщиками памяти. Вам нужно это партнерство. Я думаю, что для TSMC в частности люди не понимают, почему это так ценно. Вы смотрите на технологию, и технология лучшая в мире. Но для меня настоящая ценность заключается во всем обслуживании. Обслуживание клиентов TSMC намного, намного лучше, чем я видел в любой другой компании в любой другой отрасли. Это такая вещь, когда вы говорите: «Эй, мы можем улучшить ваш выход, внеся это изменение. Вы можете дать им рекомендацию, а затем мы проведем эксперимент за их счет в нашем случае, чтобы увидеть, смогут ли они действительно получить более высокий выход». И когда мы обнаружили, что мы были правы, и эксперимент сработал, они перевели остальную часть линии. И такое просто не происходит в большинстве отраслей. Если я пойду на завод по производству стали, скажу: «Эй, я хочу, чтобы вы изменили состав стали». И они скажут: «Пошли вы». Не TSMC. Это причина, по которой они номер один и почему они победят. >> Одна из вещей, которая имеет огромное значение, — это доступность питания и время до подачи питания. И проблема в том, что чем больше питания вы хотите, тем больше дефицит. На самом деле это очень похоже на кластеры чипов, что означает, почему Colossus взимает 12 долларов в час за черные дыры? Потому что это единственное место, где вы можете купить 20 000 из них одновременно, верно? >> как почему так сложно найти центр обработки данных мощностью 500 мегаватт? Это точно та же причина. Знаете, одна из вещей, о которых нам нужно подумать, это как мы можем получить гораздо больше энергии из каждого мегаватта. >> и как люди смотрят на весь стек, будь то просто улучшение PUE, но также и совершенно новое оборудование для получения максимального количества токенов на мегаватт для решения этой проблемы. >> но фундаментально построить новые здания сложно. >> гораздо проще перейти от 100 мегаватт к гигаватту, чем от гигаватта к 10, и от 10 к 100, и знаете ли вы, что мы расширяем границы возможного в эти сроки. >> поэтому многие люди пытаются масштабировать свои центры обработки данных так же, как и масштабировать их. >> Да. Я имею в виду, одна из интересных вещей в такой системе — это то, что она заменяет. Да. >> Так что, если я думаю о такой стойке по сравнению с, я не знаю, набором черных дыр или чем-то еще, или Reubens, или чем-то еще, что появится дальше. Как мне это концептуализировать? >> как потому что не только ватты, но и физическое пространство, к вашему пункту, что люди, как вдруг Cerebras говорили об этом в своем последнем отчете о прибылях, что буквально это проблема, что буквально нет места для размещения систем. >> да, как как мне концептуализировать, что это представляет или заменяет с точки зрения других единиц вычислений? Вот как клиенты думают о развертывании моделей в целом, что, знаете ли, когда я строю центр обработки данных или строю кластер, это не абстракция вроде «о, мне нравятся эти чипы и, знаете ли, это энергопотребление и так далее». Это как у меня есть реальная рабочая нагрузка, которую я пытаюсь обслуживать, и, знаете ли, чтобы мой продукт был полезен, мне нужна определенная скорость обслуживания, и для определенных продуктов она очень быстрая, а для определенных продуктов очень медленная, какой бы ни была скорость, это моя скорость. Вопрос в том, при заданном количестве энергии, сколько пользователей я могу обслужить, гарантируя эту скорость? >> так другой способ сказать это — это то, что называется интерактивностью, какова наша пропускная способность? Мы только заканчиваем ранние этапы бума инфраструктуры ИИ, когда людей действительно волновала только скорость. Знаете, ГП не могли достичь многих скоростей других типов чипов, таких как все эти чипы SRAM, знаете ли, тысячи токенов в секунду, и это позволило использовать множество новых вариантов использования, которые очень взволновали людей. Появляется совершенно новая волна ИИ-чипов, знаете ли, мы одни из них, которые все смогут достичь этих скоростей. Вопрос тогда в том, если вы достигаете этих скоростей, сколько пользователей вы можете обслуживать одновременно? И косвенно, если у меня есть центр обработки данных мощностью 100 мегаватт, сколько, знаете ли, программных агентов я могу запустить одновременно? >> поэтому, когда люди проводят эту оценку, наше оборудование, как правило, сможет обеспечить вам на порядок больше одновременности при заданном уровне интерактивности. >> так что это напрямую переводится в, знаете ли, токены на ватт, токены на доллар, все, что волнует людей, когда они фактически обслуживают, знаете ли, эти гигантские смеси экспертных моделей в масштабе. >> есть эти, теперь уже знаменитые кривые интерактивности, верно? >> так что вы можете не многие люди их публикуют. >> но вы можете увидеть кривую Blackwell. Вы можете увидеть кривую AMD, которая немного хуже, чем Blackwell, и это все еще компания стоимостью 800 миллиардов долларов. >> так что, если вы подумаете о том, каковы последствия смещения этой кривой не просто немного дальше, а намного дальше. Да. >> Что вас больше всего волнует в том, что это позволит? Я имею в виду, я хочу выйти и решить некоторые из самых сложных проблем, и я хочу решить их за гораздо меньшее время. Я имею в виду, были вещи, которые я не был уверен, что увижу при жизни. Например, гипотеза о единичном диске, одна из вещей, которую мы обсуждали в колледже. >> Да. >> И я не был уверен, что увижу ее доказанной при жизни. >> И это было сделано моделью ИИ, и это было сделано в течение длительного периода времени. Но если вы сможете запускать ту же модель в 10 раз быстрее, вы сможете сократить время для получения этих прорывов. И есть огромное количество других проблем в математике, подобных этой, которые, я беспокоюсь, займут 100, тысячу лет, чтобы доказать что-то подобное. Вы можете либо иметь гораздо более умную модель, либо модель того же интеллекта, работающую гораздо быстрее. Вы можете затем сократить это, и я могу это увидеть. И так здорово видеть, как эти прорывы происходят. Я очень, очень рад видеть, как происходит гораздо больше этого. Я думаю, что слишком часто люди думают о задачах и приложениях и вещах в очень короткие временные горизонты. >> так, знаете ли, делать чат, и это как бы на 50% быстрее, приятно, но это не революционно. >> поскольку эти агенты работают на все более длительных временных горизонтах, а модели становятся все более и более способными, вы увидите гигантские объемы работы, которые потребуют месяцев вычислений. И мы думаем об этом в реальном времени. >> как если вы поговорите с исследователем предварительного обучения в лаборатории, они скажут вам, что реальное время часто является одной из самых важных вещей, которые имеют значение. И реальное время означает время от, знаете ли, начала вашего запуска до его завершения, чтобы фактически получить данные обратно. >> если вы можете сократить это время, знаете ли, с шестимесячного запуска до, знаете ли, двухмесячного эксперимента, вы сможете провести гораздо больше итераций, и люди внесут изменения в архитектуры моделей, чтобы фактически улучшить реальное время. >> Очень похоже на то, как мы думаем об использовании, что, знаете ли, захватывающая часть сверхнизкой задержки декодирования заключается в том, что реальное время для задач с длительным горизонтом становится намного короче. >> так годовой вычислительный цикл теперь займет месяц, а месячный вычислительный цикл теперь займет 3 дня, а трехдневный вычислительный цикл теперь займет 7 часов и так далее. >> так что это то, что, я думаю, очень трудно осмыслить, потому что модели становятся достаточно способными для этого. >> Я думал, что это было очень круто несколько месяцев назад, когда курсор опубликовал, что у них был набор агентов по кодированию, которые построили целый браузер с нуля за неделю. >> совершенно безумно. >> И это скоро произойдет менее чем за час. >> и будет много таких вещей, которые произойдут с этими массивными параллельными агентами, работающими над данной задачей. >> Каковы конечные ограничения этих систем? Это просто физический вопрос, как, как быстро, дешевле мы можем стать теоретически? >> как вы думаете? >> есть много, есть много места внизу, как говорится, что если вы думаете о задержках чипов и чипов в продукте NVIDIA, вы смотрите на 4000 наносекунд, чтобы перейти от одного чипа к другому. >> Ммм. >> Мы сможем сделать это намного лучше. >> Каков математический предел? >> это скорость света. >> Вы можете сделать это всего за несколько, 2-3 наносекунды. >> и они 4000. >> 4000 сегодня. Есть много места внизу. Я думаю, есть такие вещи, как энергоэффективность, которые, конечно, мы можем сэкономить огромную сумму, снизив напряжение настолько. Но вы можете снизить его еще больше. Вы можете снизить его намного, намного ниже. Это очень сложно. Но когда я думаю о 20-30 годах в будущем, тогда я думаю, что это неизбежно, а также для экономии масштаба для масштабирования кластера в течение длительного времени восемь чипов были самой большой областью масштабирования, и даже у них было 72, доводя их до, ну, 72, но вы можете быть намного, намного больше. Вы смотрите на, например, фабрику, это 40-миллиардное монолитное здание с всего лишь несколькими линиями, проходящими через него, вы могли бы иметь то же самое для какого-то футуристического мегакластера за 40 миллиардов, сто миллиардов долларов, как гигантская мегафабрика токенов, обслуживающая одну или несколько моделей для огромного числа пользователей, чтобы получить ту же экономию масштаба. Та же модель, огромное количество людей. >> Вы упомянули инженерию ядер и то, что это была ваша первая работа, которая появилась как вещь, о которой никто никогда не слышал, до того, как она стала чем-то, о чем вы слышите постоянно. Важность этого для извлечения большего количества производительности из, знаете ли, голой сырой металлической основы, когда ли это будет просто что-то, что ИИ не полностью делает, а также являются ли люди по-прежнему лучшими инженерами ядер, делают ли они это с помощью систем ИИ, как далеко люди будут по-прежнему участвовать в проектировании этих вещей, когда это исчезнет? >> сегодня это все очень гибридно, и лучшие ядра по-прежнему пишутся в сотрудничестве человека и ИИ. >> так что любая модель ИИ построена из этих фундаментальных примитивов, таких как матричные умножения, свертки, операции от чипа к чипу, коллективные операции, и их перекрытие и их действительно быстрое выполнение имеет огромное значение, и задача дизайнера ядра — выяснить, где я могу перекрываться, как я распределяю память, как я проверяю, что если есть какая-то проблема, такая как повторная передача, она не останавливает весь конвейер. >> эти вещи очень сложны, но они могут повысить вашу производительность, скажем, на 3-4% за оптимизацию, и вы можете сделать это. И мы думали о нашем программном стеке. Мы хотели двигаться туда, куда движется шайба. И три года назад было два способа построить программное обеспечение. Один из них — вкладывать значительные средства в компиляторы графов. Эти вещи не очень производительны, но они работают из коробки. Они не требуют, чтобы человек приходил и настраивал все ядра. Но мы пошли в противоположном направлении. Мы программируем в первую очередь на ядрах. И это означает, что да, долгое время это не работало из коробки. Но если вы были экспертом по ядрам, вы могли получить невероятно, невероятно высокую производительность. И дело в том, что теперь, поскольку модели кодирования становятся все лучше и лучше, они выполняют все больше и больше задач по генерации ядер. И когда модели будут становиться умнее, они в конечном итоге сделают все это. Они станут сверхчеловеческими. >> так что мы будем строить туда, куда движется мир. И даже сегодня мы думаем о наших инструментах профилирования или стеке отладки. Мы думаем о них с точки зрения того, как модель будет использовать эти инструменты, больше, чем о том, как люди будут использовать эти инструменты. >> это то, что мы иногда проводим эксперименты внутри компании, и у нас был CodeX, который фактически запустил GPOSS с нуля, просто основываясь на наших документах, совершенно самостоятельно. >> Вау. >> И это заняло, я думаю, ночь. >> Мы много думаем о выборе игры, и что мы имеем в виду под этим, это обеспечение того, чтобы мы вкладывали нашу энергию в правильные ставки, потому что независимо от того, над чем вы решите работать, это потребует огромных усилий, и знаете ли, одна из вещей, с которой мы начали, это, знаете ли, решение явно не строить произвольный компилятор графов, не поддерживать произвольный PyTorch, не поддерживать произвольный CUDA, не поддерживать произвольные графы ONNX, но вместо этого мы предвидели мир, где будет менее ста моделей, которые действительно важны, и все они будут очень похожи с точки зрения базовой математической перспективы, и что мы будем строить примитивы, используя физику, которые будут ускорять их настолько, насколько это возможно для человека, и мы позволим самым продвинутым клиентам иметь прямой доступ к оборудованию и делать все, что они хотят, и это сэкономило нам огромное количество времени, не имея необходимости строить компилятор, и это позволило нам получить гораздо большую производительность, и, смешно сказать, когда мы начинали, многие люди отвергали эту идею, и единственными людьми, которые относились к нам серьезно, были в сфере высокочастотной торговли, потому что они все, они все ненавидят компиляторы, они все пишут свои собственные ядра, и у нас десятки людей из высокочастотной торговли присоединились к команде, потому что они тоже видели эту философию. >> Каковы пределы вертикальной интеграции? >> как где вы, как вы знаете, где провести черту? И я начинаю с этого вопроса, чтобы немного поговорить о более широком рынке. Обстоятельства более широкого рынка очень интересны мне, где подавляющее большинство чипов, ИИ-чипов покупается очень небольшим числом клиентов. Да. >> Многие из этих клиентов сами пытаются разрабатывать свои собственные ИИ-чипы. OpenAI анонсировала Jalapeno. Кажется, это очень забавная ситуация, когда все самое ценное в мире проходит через пару производителей чипов, пару покупателей чипов. Они все, кажется, думают о том, чтобы делать работу друг друга. А затем у вас есть ситуация, когда, хорошо, тогда эти вещи идут в центр обработки данных, и у вас есть неооблака и поставщики вывода, и другая часть этого стека. >> у вас есть разработчики и поставщики моделей. >> как я могу представить мир, где, потому что у вас есть лучшее оборудование, вы разрабатываете модели и строите центры обработки данных, знаете ли, вы выходите за пределы своей текущей вертикали. >> так как вы думаете о том, где провести черты для бизнеса? >> у нас есть поговорка: производство — это продукт. >> В конечном итоге важно то, что мы знаем, что вывод будет самым большим рынком в мире. Кто бы ни произвел больше всего токенов, тот будет самой ценной компанией в мире. >> поэтому все решения, которые мы принимаем, заключаются в том, как мы можем получить максимальную мощность токенов онлайн. И частью этого является создание действительно хорошего продукта, который имеет гораздо большую пропускную способность, который может работать с гораздо лучшей задержкой и так далее, чтобы мы могли, знаете ли, на чип, который мы производим, получить гораздо больше токенов онлайн. Другая часть заключается в том, чтобы не делать части стека, если нам это абсолютно не нужно для достижения гигантского масштаба. >> так что есть части, которые мы решили сделать, потому что это было абсолютно необходимо для достижения масштаба, например, построение стойки, а не просто создание чипов. >> как выполнение модели CM, а не выполнение модели JDM. >> но знаете ли, есть части, которые для нас сейчас являются шумом. >> как мы не строим свои собственные центры обработки данных сегодня. Это на самом деле не помогает нам получить больше мощности онлайн. >> знаете ли, в целом наши клиенты фактически обеспечивают питание и перемещают свои кластеры, чтобы получить наши чипы онлайн, потому что они имеют такую высокую пропускную способность. >> если бы был мир, где другие вещи были бы ограничением, мы бы полностью интегрировались с ними. Но реальность такова, что мы полностью сосредоточены на получении максимального количества токенов онлайн. >> Я думаю, что это просто сводится к экономии масштаба. Опять же, что на определенных этапах стека существует огромная экономия масштаба, а на других — нет. >> например, при разработке моделей, огромная экономия масштаба там. >> для производства чипов та же история. >> Но, например, если вы думаете о создании какой-то маленькой металлической детали внутри этой стойки, такого же эффекта нет. >> Мы думаем, что естественные границы находятся на стороне чипа, внизу, и на уровне модели наверху. >> и мы заполним весь промежуток между ними. >> Несколько недель назад был парень, который разрабатывал ИИ-чип следующего поколения для, знаете ли, одной из передовых компаний. >> и он пытается завербовать одного из наших архитекторов. >> и этот человек фактически сделал обратный ход и начал вербовать человека, пытающегося завербовать нашего парня, и в течение недели мы его наняли. >> и я шел на прогулку, когда мы как бы завершали предложение. Я спросил: «Ну, вы руководите этим суперважным проектом. Почему вы решили присоединиться?» И его ответ был очень интересным: «Фундаментально это не экзистенциально для моей компании, чтобы этот продукт победил для Google с TPU, как их доход поступает от поиска». >> Google не потерпит неудачу, если TPU потерпят неудачу. >> Это верно. Meta не потерпит неудачу, если MTI потерпит неудачу. Microsoft не потерпит неудачу, если Maya потерпит неудачу, а OpenAI не потерпит неудачу, если Jalapeno потерпит неудачу. В конечном итоге это наш продукт. Это как бы совершенно неудивительно, что лучший чип в мире построен компанией, которая только и делает, что производит этот чип. Это Nvidia, верно? И как бы для нас, это совершенно экзистенциально для нас, чтобы получить как можно больше мощности токенов онлайн. >> и знаете ли, это привлекает набор талантов и привлекает поддержку от поставщиков и клиентов, которые относятся к этому с той интенсивностью, с которой мы это делаем. >> Посмотрите на необработанные характеристики FLOPS. Вы сравниваете любые из этих чипов, построенных лабораториями или гиперскейлерами. Плотность FLOPS для, скажем, FB8 на FB8 ниже, чем у Black B300. >> Y >> и это имеет смысл, потому что им не нужно рисковать. >> им просто нужно создать похожий продукт и не платить налог Nvidia. >> Когда я думаю о том, как вы создаете решение, процесс его создания — это решение последовательности действительно сложных задач. >> Какой был самый трудный эпизод, который пришлось преодолеть? >> Когда мы разрабатывали чип, мы построили этот огромный кластер FPGA, чтобы проверить, работает ли полный чип как есть. И FPGA — это цифровые объекты. Вы можете тестировать цифровую логику, но не аналоговую. И оказывается, что когда чип вернулся, мы начали видеть проблемы в нашей адаптации внимания, неправильные результаты. И мы поняли: «Подождите, есть проблема, где логика обратного давления при пересечении тактовых доменов выходит из строя». И это приведет к тому, что чип будет давать неправильные результаты. И это очень, очень трудно решить. И мы поняли, что есть один и только один способ решить это: мы должны были выровнять два тактовых сигнала на нашем чипе с точностью до 50 пикосекунд. Это буквально 50 триллионных долей секунды. И мы должны были выровнять эти сигналы с такой сверхмалой гранулярностью и делать это на каждом чипе два миллиарда раз в секунду. >> Многие люди говорили, что это невозможно. >> Мы, мы уволили людей. >> Да. Что люди буквально говорили: «Эта проблема неразрешима». И «удачи вам». >> Ну, когда у вас есть такая проблема, первый шаг — это: «Хорошо, давайте предположим, что проблема решаема». Как она будет решена? >> Ну, сначала мы поняли, что нам нужно иметь возможность перемещать фазу тактового сигнала на пикосекунду, 10 пикосекунд. И у нас появилась идея. Что, если у нас будут эти два тактовых сигнала? Мы установим их немного дальше друг от друга. И мы выяснили, что если мы сможем определить фазу, если мы затем используем механизм дрейфа, чтобы подождать ровно столько времени, чтобы всегда выравнивать эти 50 пикосекунд, мы можем сделать это чрезвычайно надежно, а затем зафиксировать фазы точно там, где они должны быть. Мы можем гарантировать, что этого никогда не произойдет. Люди были, я думаю, несколько поражены тем, что это сработало, и тем, насколько хорошо это на самом деле сработало. >> Сколько времени это заняло? >> Это было около двух недель. >> Это были темные две недели. >> Это были очень страшные две недели, но именно в такие моменты важнее всего вкладывать усилия. >> это самое трудное время, когда вы чувствуете, что все безнадежно. Но чем раньше вы решите эту проблему, тем раньше вы сможете вернуться к созданию и масштабированию производства до массовых объемов. >> Я думаю, что большая часть нашей истории заключается в том, как говорит Гэвин: «Предположим, это возможно». >> как предположим, что это возможно, иметь чип с гораздо большим количеством FLOPS. >> предположим, что возможно иметь систему с гораздо более низкой задержкой между чипами. >> предположим, что возможно создать общий пул памяти, который может работать с гораздо большей пропускной способностью. >> как бы один сделал это? >> часто, когда мы проводим эксперименты, мы проводим десятки экспериментов, и все они терпят неудачу. Но нам нужен только один, чтобы он сработал. >> Было несколько раз. Я имею в виду, Гэвин, я думаю, был лидером, когда мы запускали наш чип с, я думаю, 30 различными экспериментами с платами, и три из них сработали, и все три стоят своего веса в золоте. >> Это одна из тех вещей, когда люди приходят ко мне и говорят: «Гэвин, почти ни один из ваших экспериментов не работает», и я говорю: «Мне просто нужно один раз повезти». >> Vanta автоматизирует безопасность и соответствие требованиям для более чем 16 000 быстрорастущих компаний, таких как Ramp, Cursor и Harvey, обеспечивая их готовность к аудиту круглосуточно. Это платформа доверия номер один, и теперь она помогает таким компаниям, как ваша, отслеживать риски, которые возникают между аудитами у ваших поставщиков, ваших инструментов ИИ и всей вашей среды. Каждый новый инструмент, на который подписывается ваша команда, каждый поставщик, который включает функции ИИ, — это возможность что-то пойти не так. И большинство программ безопасности не были созданы для темпов роста ИИ. Агент Vanta работает как круглосуточный инженер GRC в фоновом режиме, находя проблемы, составляя для вас исправления и сокращая время оценки поставщиков до 50%. Независимо от того, являетесь ли вы быстрорастущим стартапом или глобальным предприятием, Vanta помогает вам заслужить и доказать доверие. Инвестируйте как лучшие слушатели. Получите специальное предложение со скидкой 1000 долларов на vanta.com/invest. Ridgeline — это первая комплексная система учета с встроенным ИИ для инвестиционных фирм, управляющая учетом портфеля, сверкой, отчетностью, торговлей и соответствием требованиям на единой платформе. Фирмы отказываются от устаревших технологий и переходят на Ridgeline из-за того, насколько далеко вперед продвинулись функции ИИ Ridgeline по сравнению с любым другим программным обеспечением для управления инвестициями. Я слышал от многих инвестиционных менеджеров об ИИ, и они примерно делятся на два лагеря: некоторые не уверены, с чего начать, а другие убеждены, что они могут построить свою собственную систему управления заказами за выходные. Реальность такова, что управление инвестиционной фирмой всегда будет требовать механизмов управления и единого источника истины для ваших данных, и никакой энтузиазм в отношении ИИ не изменит это требование. Ridgeline построен именно на этой основе, поэтому я считаю, что фирмы, которые выйдут вперед в эпоху ИИ, будут теми, кто работает на унифицированной платформе Ridgeline. Если вы серьезно относитесь к стратегии вашей фирмы в области ИИ, Ridgeline должна быть частью этого разговора. Вы можете запросить демонстрацию на ridgeline.ai. Итак, одна из идей для одной из этих историй, о которых я спрашиваю, знаете ли вы, трудные моменты в истории компании связаны со способностью привлекать капитал для финансирования этого. Я думаю, когда вы начинали, вы знали, что вам понадобится капитал, но вы не знали, что вам понадобится та сумма капитала, которую вы в конечном итоге привлекли и тратите на создание решения, и вы раньше не привлекали деньги. Это все новые вещи, верно? И были моменты, когда это было очень, очень трудно, потому что я был там, я видел это. Были моменты, когда было чрезвычайно трудно привлечь деньги, без которых компания не существовала бы. Она бы погибла. И, как и во многих великих историях, есть много моментов, близких к смерти, но деньги, особенно в этом новом мире. Это не программное обеспечение. Вам не нужно немного денег. И тогда, возможно, вы расскажете историю о самой трудной части привлечения денег на раннем этапе. >> прежде чем у вас появилось что-то, чем вы могли бы гордиться и показывать людям, и производительность, которую вы могли бы им показать и поразить их, это были просто вы, говорящие об идее. >> но поговорите о ранних трудностях привлечения денег, потому что это было довольно жестко. >> у нас были напряженные моменты. >> это напоминает мне, вероятно, начало 2024 года, до того, как мы привлекли наш раунд А, и мы были в точке, где мы сделали достаточно архитектуры, сделали достаточно дизайна, что мы знали, что архитектура чипа была надежной. >> нам пришлось построить его. >> было еще много работы. >> мы были готовы перейти к так называемой стадии физического проектирования. >> нам нужно было подписать соглашение с поставщиком физического проектирования, которое, знаете ли, обойдется вам как минимум в 40-50 миллионов долларов. >> и тогда мы осознали, поскольку модели становились все больше и больше, и вы видите эти гигантские модели, выходящие, что нам придется построить весь кластер, не только чип, но нам придется строить платы. >> нам придется строить интерконнекты. >> нам нужно строить холодные пластины. >> нам нужно будет разобраться со всей сетью и всем остальным. >> и что это будет стоить гораздо больше, чем 15 миллионов долларов, которые у нас были в банке. >> И вы такие: «Черт возьми, это было страшно». >> Да. >> Что, знаете ли, вы сидите в этот момент, вы думаете: «Святые черти, мы не можем себе этого позволить». >> И я начал смотреть на, знаете ли, как трудно вернуться в Гарвард? >> Я имею в виду, я имею в виду, в конце 23 года мы подготовили этот меморандум. >> Я имею в виду, мы потратили на это около ста часов, потому что мы такие: >> мы понятия не имеем, как люди поверят нам, когда мы попросим сумму денег, которую мы собираемся попросить. >> и это было около 30 страниц. >> это было чрезвычайно техническое и подробное описание всех различных вещей, которые нам нужно было построить, и всех этапов, которых нам нужно было достичь, и того, как рынок будет развиваться, и всех новых вариантов использования, и стоимости за токен, и всего этого моделирования. >> И тогда мы пошли и поговорили с инвесторами, и каждый крупный инвестор в долине немедленно отказался. >> они просто сказали: «Хорошо, двое детей, которые только что закончили Гарвард, не выпускали чип, нет тестового чипа, знаете ли, вывод, знаете ли, кто знает, будет ли это большим рынком. Все будет обучение, >> знаете ли, модели все еще галлюцинируют. >> все это может быть, знаете ли, все это может быть пузырем. >> знаете ли, в то время самые крупные привлечения средств в полупроводниковой отрасли для серии А составляли около 40-50 миллионов долларов. >> Мы смотрели на это, и мы просто подсчитывали счет. >> мы такие: «Мы думаем, что потратим 100 миллионов долларов в следующие 12 месяцев». >> как если мы действительно хотим сделать это, если мы хотим действительно достичь масштаба и действительно получить производительность, о которой мы говорим, это будет чрезвычайно капиталоемко. >> как, черт возьми, мы собираемся это осуществить? >> Я думаю, что один из наших ключевых способов, которым мы начали этот процесс, >> мы подумали: «Каков самый дешевый способ сделать это?» И мы решили: «Ну, если бы я зарабатывал почти ничего». >> Да. >> И если бы я ел только рамен, тогда мы бы потратили, по сути, только деньги на маску 11-й ленты, и это было бы все, верно? >> И если так, мы могли бы, вероятно, сделать это за 30 миллионов долларов, что является абсурдно низкой цифрой. >> И мы фактически пошли и получили поставщика долга, который был готов предоставить нам деньги, которые нам нужны, чтобы перейти этот едва-едва порог рамена до чипа. >> Оттуда, я думаю, было первым, чтобы катализировать серию других: «Эй, может быть, мы можем сделать еще кое-что, еще кое-что, еще кое-что». >> Да. >> Так что мы находимся в этом моменте, когда мы такие: «Если мы действительно хотим построить эту компанию, потому что мы не будем делать это наполовину». >> как мы не будем делать тестовый чип и тратить на него годы, и как бы позволим всему буму рынка ИИ пройти, пока мы могли бы создавать продукт. >> как если мы собираемся это сделать, мы пойдем до конца. >> нам нужно будет найти способ получить 100 миллионов долларов. >> Я имею в виду, я помню, как мы с Гэвином сидели в офисе в Сертино поздно вечером, просто глядя друг на друга, и мы такие: «Можем ли мы сократить 500 тысяч здесь? Можем ли мы сократить 100 тысяч здесь? Как долго мы можем убеждать всех не брать зарплату?» И мы такие: «Святые черти, математика не сходится». >> мы, мы, мы действительно должны решить это. >> И был период в несколько недель, когда вы просто переходите в режим выживания, и вы звоните каждому человеку, который потенциально может знать инвестора, и вы говорите: «Нам нужно 100 миллионов долларов, чтобы сделать это. Если мы это сделаем, мы думаем, что это может быть одна из самых важных компаний всех времен. Вы знаете кого-нибудь, кто хочет сделать агрессивную ставку, кто хочет поверить в нас? >> вот вся информация. >> мы открытая книга. >> вот команда. >> это отличные люди. >> мы работали очень усердно. >> мы сделали это в рекордно короткие сроки, но у нас есть эти, знаете ли, сто вещей, которые нужно сделать. >> вы хотите это сделать? >> и как снежный ком начинает катиться, и вы получаете миллион здесь и 2 миллиона здесь, и вы такие: «Хорошо, мы не останемся без денег в этом месяце». >> Вы получаете чек на 5 миллионов долларов, чек на 10 миллионов долларов, и вы такие: «Хорошо, может быть, я смогу купить эти FPGA». >> и, знаете ли, снежный ком покатился, где, знаете ли, нам очень повезло, что мы в итоге собрали все это. >> Я имею в виду, у нас было заседание совета директоров. >> Я показываю вам электронную таблицу, и мы смотрим на нее, и это около 103 миллионов. >> это все как бы мягкие обязательства, и мы все смотрим друг на друга и говорим: «Мы возьмем это», и это был раунд А, и, к счастью, я думаю, с тех пор стало намного проще, и мы привлекли почти полдюжины раундов с тех пор. >> многие из них от тех инвесторов, которые просто удваивали и утраивали свои ставки. >> это позволило нам так быстро выйти на рынок. >> как эта стойка была бы невозможна, если бы мы не были так агрессивны. >> Я также думаю, что поставщики тоже заслуживают некоторого признания. Да. >> что TSMC была готова работать с нами еще до того, как мы привлекли эти 100 миллионов долларов, когда это было еще действительно, действительно страшно, фактически позволила нам получить некоторые из их эмуляторов на чрезвычайно выгодных условиях, где мы платим в течение многих лет. >> Да. >> по сути, большой кредит, и это требует большого доверия от ваших партнеров, чтобы сделать это, но в конце вы получаете очень сильную команду, и все, кто вас поддерживает, делают это не только из чисто финансовых побуждений, они верят. >> Почему TSMC поверила, как вы думаете? >> это отличная история, еще до того, как вы присоединились, было мероприятие на конференции, и я был одним из немногих молодых генеральных директоров полупроводниковых компаний, я думаю, это своего рода новинка, попросили меня выступить. >> Я прихожу на мероприятие Semi, и я единственный спикер младше 40 лет и единственный человек младше 30 лет. >> мне тогда было 22, 22 года. >> Так что я поднимаюсь и выступаю. >> После этого был ужин спикеров, и по чистой случайности я оказался рядом с очень высокопоставленным вице-президентом TSMC. >> это очень хороший ужин. >> там бывший генеральный директор ARM, это очень шикарно. >> все в костюмах, а я там с этим вице-президентом. >> и оказалось, что мы оба изучали математику в колледже. >> и мы берем маленький кусочек бумаги и начинаем подробно обсуждать, как работают современные модели ИИ на уровне тензора за тензором. >> и парень это понимает. >> и мы начинаем говорить о том, как эффективно это запустить. >> почему Луисвилл является критически важной технологией для этого? >> и на следующий день я получаю электронное письмо от TSC с надписью: «Гэвин, я хочу работать с Etch, >> найди способ сделать это». >> Сумасшедший. >> Они были отличным партнером с тех пор. И >> удивительно думать о некоторых тропах и, очевидно, как бы сломать четвертую стену. >> как я большой инвестор Etch. >> Я давно участвую. >> Я думаю, что вы абсолютно восхитительны. >> так что я невероятно предвзят. >> в этом разговоре. >> Я пытаюсь задавать вопросы, которые являются более широкими и интересными и могут быть возражениями против того, что вы делаете, и мы будем продолжать это делать. >> но мне так интересно, что, когда вы читаете об инвестировании, все цитируют эту идею о том, что «контрарный и правильный» — это квадрант, который приносит все деньги, и это звучит очень приятно, но контрарный означает, что все остальные думают, что вы глупы. >> и поэтому, когда вы идете и получаете немедленные отказы от буквально всех, это увлекательный квадрант, в котором можно существовать до того, как вы станете консенсусом. >> Я имею в виду, каково это было для вас? >> Я очень любопытен. >> Ну, это интересно. >> В то время это была самая большая, намного больше, первая проверка, которую я написал. >> Само собой разумеется, я не эксперт по математике, не эксперт по полупроводникам и не эксперт по ИИ, на самом деле в то время. >> и поэтому это было гораздо больше, чем вера в концепцию того, что этот рынок потенциально может быть огромным. >> вы сделали очень, очень четкие ставки на то, как будет выглядеть будущее, позиционировали компанию, чтобы атаковать эти вещи в жестком ключе. >> и затем только вы двое, и то, что я чувствовал к вам, было основной причиной, по которой мы сделали ставку, когда мы сделали это в 2023 году или когда бы это ни было. >> но в то время это было самое большое. >> И я думаю, что то же самое, что вы сказали о наивности, применимо к инвестированию, как и к созданию стартапа в области полупроводников, заключается в том, что я не знал того, чего не знал. >> И когда я звонил экспертам, они, по сути, говорили: «Это глупо». >> Они логически объяснили, почему это не сработает и почему это такая маловероятная ставка. >> И я думаю, что одна из вещей, которую я узнал из этого, это то, что вам нужно проклясть базовую ставку. >> как если бы вы инвестировали на основе базовых ставок, вам следует делать что-то другое, чем то, что делаем мы и я. >> всегда есть индексный фонд. >> Да, всегда есть индексный фонд. >> Именно. >> Так что для меня это никогда не было страшно. >> Я думаю, вероятно, большая часть этого заключается в том, что я не знаю. >> есть много того, чего я не знаю. >> И если бы я знал больше о том, что вы сделали, и о трудностях, я, вероятно, не сделал бы этого. >> Я не знаю, что это говорит о взрослении как инвестора. >> как, может быть, я не хочу знать. >> много больше, и иметь немного этой здоровой наивности. >> Я не знаю. >> Забавно. >> Я думаю, что многие традиционные фонды полупроводников упустили весь рынок ИИ-чипов, как все компании, производящие ИИ-чипы. >> и как все эксперты по кодированию упустили все компании по кодированию. >> и как, я думаю, очень трудно осознать, что ограничения изменились, и, знаете ли, когда вы смотрели на выпуск чипов в течение 20 лет, и вы видели, как многие из них не работают с первой попытки, или со второй, или с третьей, вы даже не могли запустить рабочую нагрузку, вы совершенно забываете, что инструменты EDA намного лучше, и что FPGA существуют сегодня таким образом, каким они не существовали раньше, и все типы валидации, которые вы можете сделать сегодня, просто не были возможны. >> так что я думаю, для нас многие из наших верующих были либо, они были как бы на двух сторонах этого. >> они просто верили в рынок и команду, или они создавали чипы сегодня и были чрезвычайно техническими, как фирмы высокочастотной торговли, где они буквально проверяли все, от микроархитектуры и RTL до проектирования плат, расписания и программного стека, и мы садились с примерно 10 их людьми, которые создают свои собственные чипы, и они задавали нам такие подробные вопросы, что мы задавались вопросом, создадут ли они чип? >> Это было действительно либо с одной, либо с другой стороны. >> И если вы были где-то посередине, вы просто не понимали этого. >> В мире инвестиций часто говорят о вариативной перцепции, чем-то, что вы видите или верите, чего другие не видят, верно? >> и и эта перцепция создает возможность. >> Я думаю, я инвестировал, я не знаю, раз пять. >> И каждый раз, когда вы это делаете, ставки становятся все выше и выше. >> И поэтому это становится немного страшнее и страшнее. >> и потому, что вы были такими тихими на рынке, я думаю, очень легко вас игнорировать. >> По мере того, как ставки растут, эти отказы труднее слышать. >> И, и поэтому я думаю, что делать ставку на что-то, что вы видите, когда то, что вы слышите от внешнего мира, очень отличается. >>
что это восприятие разрыв есть есть опп. >> Точно. Последнее, что я хотел бы сказать, это накопленные доказательства вашей способности и способности вашей команды решать, казалось бы, невыполнимые проблемы, э, это одна из самых интересных вещей, которые может иметь компания. Это как бинарный выбор, типа, компании делают это или нет. >> В этом и заключается большое преимущество людей, которые здесь давно. Приходят новые сотрудники, которые чертовски напуганы. Когда вы видите что-то подобное, а есть старожилы, которые здесь всего два года >> курят сигары в окопах. Еще один. Еще один. >> Да, определенно есть менталитет "найди способ". Если вы здесь, вы здесь, потому что предполагаете, что это возможно. Так что, типа, мы не можем говорить, что это невозможно. Все решаемо, и мы просто будем работать над этим, пока не разберемся. Эм, есть одна любимая история у меня про парня, который является своего рода легендой в валидации кремния, э, который присоединился к нашей команде, и мы занимались ранними стадиями того, что называется сортировкой пластин. Э, и знаете, когда ваши чипы выходят из фабрики, они идут на этих пластинах, и у вас есть такая вещь, как пробная карта, которая подключается э к пластине перед тем, как вы ее нарежете, с этими пробными площадками, и вы отправляете эти электрические сигналы, чтобы, по сути, протестировать, какие чипы хорошие, а какие плохие. Так что, когда я, знаете, разрезаю пластину на кучу чипов, я могу упаковать ее и упаковать только хорошие. Мы проходим через нашу первую пластину, и, знаете, это около 2-3 часов ночи, потому что мы делаем это с TSMC по телефону на Тайване. У нас есть экран э с пластиной, которая вся серая, и каждый чип серый, и затем, когда вы начинаете запускать паттерны, квадраты должны стать зелеными или красными, а они все становятся красными. Мы такие: "Это действительно плохо". Типа, все такие: "Ребята, сделайте вдох". Он откидывается назад и говорит: "Головоломка начинается". Типа, так. У вас должно быть отношение типа: "Да, вы выйдете и будете смотреть в бездну, и вы увидите страшные вещи, и мы их решим". >> Когда вы увидели первый зеленый квадрат? >> В течение дня после этого, но в тот момент вы думаете: "Я годами работал ради этого. Я поставил свою жизнь на карту. Я попросил свою семью, знаете, поставить на это все". А потом, типа, это красный. Это чрезвычайно страшно. И э есть определенный тип людей, которые просто, типа, зависимы от этого чувства э просто чувствовать страх и решать его. И э, знаете, нам повезло иметь много таких людей здесь. >> Если подумать о применении всего этого э заработанного ноу-хау за последние несколько лет и теперь, глядя вперед на Gen 2, Gen 3 и далее. >> Конечно. Что вы будете делать наиболее иначе в результате всего, что вы узнали? Просто с концептуальной точки зрения, типа, как вы будете подходить к проектированию и производству следующего, основываясь на том, что вы узнали, делая это в первый раз. >> Нам потребовалось некоторое время, чтобы добраться до примитивов, которые, по нашему мнению, действительно важны для масштабирования инференса. Мы пробовали много вещей на ранних этапах, от компиляторов, которые превращали разные модели в FPGA, до записи весов в кремний, до разделения вашего HBM на KV-кэш и веса, и всех этих разных вещей. Э, и было много циклов обучения, пока мы не пришли к тому моменту, когда мы поняли, что, по сути, если вы хотите запускать большинство токенов в мире. Вам нужно сделать три вещи. Вам нужно создать чип с наибольшим количеством флопсов в заданном энергетическом бюджете. Вам нужно создать чип с наименьшей задержкой между другими чипами. Таким образом, самая большая область масштабирования возможна. И вам нужно производить как можно больше этого. >> И я думаю, что, вероятно, в первой половине нашего пути мы изучили первые два, и это сильно повлияло на дизайн. И это сильно влияет на ставки, которые мы делаем в будущем с низковольтным инференсом и кластерной памятью. Но часть производства, я думаю, за последний год стала чрезвычайно очевидной. Насколько люди хотят развертывать эти вещи, если вы можете иметь их сегодня. Знаете, лучшая возможность — это доступность. Знаете, если у меня есть тысяча чипов сегодня, кто-то их использует. И знаете, нам нужно создать чип, который не просто намного лучше того, что было создано раньше, но он должен быть доступен в масштабе многих гигаватт. Нам нужно иметь возможность создавать продукт, который можно производить в масштабе гигаватт в месяц из предела. Думая об этом, э, многие проектные решения, которые мы принимаем с нашим следующим поколением, которое вы уже видели, э, сводятся к простоте, удалению множества деталей, попытке собирать и разбирать что-то снова и снова, и изучению того, как сделать это как можно быстрее и сократить время цикла в производстве, убедившись, что это будет надежно, убедившись, что это будет обслуживаемо, э, и убедившись, что это будет производиться в гигантских масштабах. Что насчет других э проблем в экосистеме, которые находятся вне вашего контроля, таких как мощность на ведущих нанометрах на TSMC или доступность памяти HBM4 э, или, знаете, некоторые из этих других вещей, где, типа, все борются за э дефицитную единицу мощности или что-то еще. Как вы сталкиваетесь с этими реалиями, когда пытаетесь произвести как можно больше? Люди, развертывающие больше всего вычислений в мире, думают о поставках как о нулевой сумме, то есть существует только определенное количество пластин, производимых на данном нанометровом узле на данной фабрике, верно, и существует только определенное количество памяти, производимой, и именно поэтому на самом деле для нашего первого продукта мы создали его на другой цепочке поставок, чем Rubins, так что, знаете, мы на 4 нанометрах, Rubins на 3 нанометрах, знаете, мы на другом HPM, чем Rubins, и так далее, э, так что на самом деле это не игра с нулевой суммой, это положительная сумма, где больше — это больше, так что часто, когда мы говорим с людьми, развертывающими в масштабе. Это не выбор между гигаваттом GPU и гигаваттом нас. Это 2 гигаватта. Э, и я думаю, что как можно раньше думать о цепочке поставок на ранних этапах принятия проектных решений, потому что если у вас есть самый производительный продукт, и вы не можете его произвести, знаете, тогда вы просто подкаст. Это еще одна большая вещь о вертикальной интеграции, или определенные вещи, такие как чипы и память, вы должны идти вперед и э партнерство для большинства других вещей. Это также очень востребованные компоненты. И чем больше вы создаете сами, э, тем больше вы можете сделать поверх того, что мир может построить в настоящее время. Это не так, о, вы отнимаете доступность у кого-то другого. Вы добавляете гораздо, гораздо больше. И э, я думаю, что так вы побеждаете. >> Одна из вещей, которую я понял, что мы вообще не обсуждали, это сами модели, что довольно безумно, вещи, стоящие за всем этим спросом. Есть ли что-нибудь интересное, что вы могли бы сказать о том, как вы видите прогресс моделей, основываясь на том, что мы видели до сих пор? Мне скорее интересно, как вы, как мыслители о аппаратном обеспечении, думаете, как аппаратное обеспечение может повлиять на то, куда сами модели пойдут в будущем. Одна из самых важных идей, в которую мы верим, заключается в том, что машины не думают, как люди. Вы посмотрите на самолеты, например, самолеты не летают, как птицы. Что, когда вы думаете о том, как должны работать механические устройства, это часто очень отличается. И точно так же для людей хранение данных и загрузка памяти очень дешевы для нейронов, а выполнение математики относительно дорого, и это прямо противоположно для э чипов. Обычно загрузка данных очень дорога, а выполнение математики очень дешево, и со временем я думаю, что вы в конечном итоге обнаружите, что математика становится дешевле со скоростью, которая быстрее, чем э память становится дешевле из-за этого фундаментального ограничения на любой вид DRM-устройства. Вам следует подумать о том, как я могу сделать так, чтобы моя модель использовала огромное количество вычислений. Что, если бы у меня, например, было много копий, работающих одновременно? Что, если бы я активировал огромное количество экспертов? Что, если бы у меня были гигантские эксперты, которых я мог бы запускать одновременно на нескольких серверных стойках? Вот как я думаю, вы создадите модели, которые являются следующим поколением интеллекта и контекста. Было проделано много работы над очень эффективным инференсом. э, что, если я не загружаю полный контекст в память, и в большинстве случаев я думаю, что это имеет большой смысл, вы хотите создать супер-интеллект, почему он не может посмотреть на миллиард токенов контекста, почему он не может потратить огромное количество вычислений, чтобы прочитать все это очень быстро? Я хотел бы иметь возможность поговорить с машиной, которая могла бы обращать внимание на каждую когда-либо написанную книгу и ее краткосрочную память, и э, я думаю, вы дойдете до точки, когда вы не сможете >> Тема в моделях сейчас — это фокус на чем-то, называемом динамизмом, что является этой способностью контролировать уровень вычислений и памяти, затрачиваемых на токен или пользователя при выполнении внимания, э, а также способность динамически на вашем чипе на лету отправлять данные другим чипам для разных моделей, выполняющих определенные типы операций, и, знаете, причина в основном в том, что мы масштабируем длину контекста, масштабируем размер модели, э, масштабируем объем вычислений на пользователя, мы ищем способы быть более эффективными, так что, знаете, первое — это, как говорит Гэвин, знаете, смесь экспертов, знаете, архитектуры, где, знаете, возможно, нам не нужны все параметры, используемые для каждого токена. Э, но, возможно, есть вещи, где даже на уровне токена мы можем сказать, что этот токен нуждается в этом контексте от этого другого токена. Они могут совместно использовать эту память, так что нам не придется иметь накладные расходы на использование памяти столько. Э, возможно, этот токен действительно важен, поэтому мы должны потратить больше вычислений. У нас должен быть более длинный контекст для этого токена. Так что аппаратное обеспечение, которое действительно ускоряет эти типы очень динамичных вычислений, чрезвычайно важно. И вы можете представить себе текущее аппаратное обеспечение, которое было разработано до того, как такие архитектуры э имели много накладных расходов при их выполнении. Так что вы, по сути, оказываетесь в этих действительно плохих мирах, где у вас есть неэффективное аппаратное обеспечение для выполнения этого динамизма. Э, поэтому вы не можете очень хорошо его запускать, или у вас есть эти очень блочные архитектуры, которые, как бы, применяют грубую силу ко многим разным токенам, которые все требуют более или менее э вычислений. >> У меня два вопроса о будущем. Э, мы много говорили о том, что вы построили до сих пор и как вы это построили. Первый касается новых способов использования этих систем. Э, технология, сырая технология, логарифм времени выполнения, знаете, вещи такого рода. Когда инференс станет намного дешевле, быстрее, доступнее, будет больше общего предложения, и это будет лучше. Какие вещи, по вашему мнению, люди будут использовать эту мощность для выполнения, которые наиболее интересны, захватывающи для вас обоих? Да, был вирусный твит от Ноана Брауна, где он сказал, что поскольку у этих моделей все более и более длительные временные горизонты, они могут выполнять задачи, которые занимают, скажем, шесть месяцев, и часто не хватает времени, чтобы оценить их э в течение такого длительного периода времени, потому что к тому времени у вас будет новое приложение модели, которое вы захотите оценить вместо этого. И с такой технологией, как наша кластерная память, вы можете выполнить эту шестимесячную задачу намного быстрее. Но есть и вторая часть этого, говоря с ним об этом, он теперь также ангел, где дело не только во времени, но и в количестве людей или агентов, которые работают над этим. Если вы попытаетесь оценить, может ли человек построить ракету, вы обнаружите, что ответ — нет. Ни один человек не может построить ракету. Вместо этого вам придется собрать команду. И я считаю, что то же самое будет верно и для агентов. Если вы хотите спросить, может ли агент построить какое-то сумасшедшее футуристическое программное обеспечение, вам, вероятно, понадобится очень большая команда. э, может быть, это 10, может быть, это миллион. Вам придется пойти и иметь это огромное количество как э кластерной памяти, чтобы иметь это очень короткое время на токен, так и огромное количество флопсов, чтобы иметь возможность запускать весь этот флот. Я буду немного футуристичен. Я твердо верю, что мы находимся на глобальном марше, где инференс станет большинством мирового ВВП. Э, и это может занять более 10 лет, но это произойдет. Э, и сейчас мы измеряем производительность общества как ВВП на душу населения, но на самом деле это будет выглядеть скорее как агенты на мегаватт или, возможно, агенты на гигаватт к тому времени. И пока мы футуристичны, я думаю, что это предпоследний год, когда большинство рабочей силы будет состоять из людей. Я думаю, что в 2027 году вы увидите, что будет больше агентов, выполняющих интеллектуальную работу, чем людей. И будет чрезвычайно интересно посмотреть, что произойдет. Вы можете представить себе мир, где э для стран большая часть их энергии будет уходить в центры обработки данных, выполняющие инференс, и энергоэффективность этих центров обработки данных, по сути, определяет, сколько агентов, а следовательно, и насколько велика их рабочая сила. Так что вы увидите, как, как говорит Гэвин, э, сейчас у нас есть, знаете, э, один агент или команда из пяти-десяти агентов, работающих над групповыми проектами в течение нескольких дней. Так что вы можете сделать довольно крутые вещи, потому что они умны, но это не будет цивилизационный масштаб. Что произойдет, когда у стран будет буквально миллиард одновременных агентов, как миллиард людей в рабочей силе, работающих 24/7 одновременно над одним и тем же? Я имею в виду, это просто невообразимо, что произойдет. Э, и это будет самое большое распространение технологий, которое когда-либо видело человечество. >> Я думаю, что когда у вас есть такое огромное, огромное количество спроса, снова возникает идея экономии за счет масштаба. >> Ага. >> Или если вы думаете о людях, у меня есть мозг. Я не использую его целиком все время. Только часть будет активна. И так работают здоровые мозги. И для моделей MOE это работает примерно так же. В модели MOE только небольшая часть параметров используется для любого данного токена в любой момент времени. Но если у вас большое количество пользователей на оборудовании, вы можете взять этот мозг, разделить его на множество разных экспертов на множестве разных серверов и пропустить через него огромный объем. Так что у вас будет куча разного трафика. У вас будет много из них, использующих каждую часть мозга в любой момент времени. И вы также сделаете стоимость за мысль, стоимость за токен намного, намного ниже. >> Так что я думаю, что вы в конечном итоге получите гигантские распределенные мозги, которые будут выглядеть как настоящие, форм-фактор этого — большой центр обработки данных с кучей чипов, огромным количеством флопсов и огромным количеством масштабируемых соединений. >> Думаете, мы увидим центр обработки данных стоимостью триллион долларов? >> Абсолютно. Это вопрос времени. Это как спрашивать, видите ли вы фабрику за миллиард долларов, или фабрику за 10 миллиардов долларов, или фабрику за сто миллиардов долларов. Неизбежно, что экономия за счет масштаба не останавливается на том, что 40 миллиардов долларов — это волшебное число для фабрик. Нет, стоимость пластины продолжает снижаться по мере того, как вы продолжаете тратить больше денег. И то же самое будет верно, скажем, для заводов, которые производят сталь, или заводов, которые производят токены. очень умный инопланетянин приземляется на Землю и хочет узнать от каждого из вас, как бы вы сформулировали эту возможность, которую вы, ребята, решаете. Что вы ему говорите? >> Сформулируйте это как мышление очень ценно, что каждая компания в мире работает на мышлении, и мы вступаем в этот действительно уникальный момент времени, когда у нас есть машины, которые могут думать почти так же хорошо и так же быстро, а скоро и лучше, чем лучшие люди. Создание этих машин будет огромной возможностью. Но более важным, чем это, является то, как вы будете управлять таким мышлением, поскольку спрос будет расти и расти, и расти, и расти. Сейчас уникальный момент, чтобы создать новый набор решений, новую дорожную карту для того, как управлять будущими моделями с квадриллионами параметров для миллиарда человек одновременно в гигантском масштабируемом кластере. Мы находимся в новой эре интеллекта, где э стоимость производства интеллекта значительно ниже, чем ценность интеллекта, что мы находимся в многолетнем, вероятно, многодесятилетнем дефиците этих токенов. И, по сути, любой чип или любая система, которая может производить токены, вероятно, будет чрезвычайно ценной. И вы должны найти какую-то часть цепочки поставок токенов. Э, это может быть все, от обучения моделей до того, что мы делаем в кремнии и иначе, э, чтобы потратить время и продвинуть границу. Э, и компании, которые являются крупнейшими, честно говоря, будут компаниями, которые производят большую часть мирового предложения токенов и владеют большей частью цепочки поставок этих токенов. И, что важно, это люди, которые строят системы, которые по мере того, как они собирают все больше и больше чипов дешевле. Что вы хотите, чтобы это масштабировалось не так, что, о, если я хочу обслужить в 10 раз больше токенов, я покупаю в 10 раз больше серверов. Это должно быть какое-то решение, где я хочу обслужить в 10 раз больше токенов, тогда я получаю какую-то выгоду от экономии за счет масштаба с моей технологией кластерной памяти, которая позволяет мне не взимать плату в 10 раз больше за эти стекированные токены. Какой нелепо захватывающий будущее вы, ребята, строите, чтобы обеспечить. Когда я делал это с Гэвином в прошлый раз, я задал ему свой традиционный заключительный вопрос. Так что на этот раз я спрошу вас, что самое доброе, что кто-либо когда-либо делал для вас? >> Во время моего лечения от рака мне пришлось принять важное решение. Э, врачи пришли ко мне и сказали: "Пришло время вам решить. Вы хотите сделать операцию или вы хотите пройти лучевую терапию?" Вот компромисс. Если вы сделаете операцию, вы, скорее всего, будете жить, но вы должны предположить, что никогда больше не сможете ходить. Если вы пройдете лучевую терапию, вы сможете ходить, но вероятность того, что вы будете жить, не такая же. Вы можете умереть. Что вы хотите сделать? И мне было 16 лет. Э, и мои родители, я сказал: "Вы должны принять это решение сами". Э, и я долго думал и решил, что я сделаю операцию. Я делаю операцию. Одна из вещей, которые вы делаете при резекции опухоли, это то, что они делают так называемый анализ некроза, где они смотрят на все разные клетки и говорят, мертва клетка или жива, потому что если у вас есть куча раковых клеток, которые живы, у вас проблема. И они посмотрели на это и сказали: "Знаете, обычно вы хотите 98-99% некроза, чтобы мы сказали, что вы вне опасности. Вы ниже этого". Э, вам следует пройти лучевую терапию. Э, и было всего несколько машин в мире, которые на самом деле могли делать тот тип лучевой терапии, который мне нужен. Э, одна из них была в Бостоне. Я был в инвалидной коляске, э, и мне нужно было переехать в Бостон на несколько месяцев. И оба моих родителя решили переехать и бросить все, чем они занимались, и жить со мной. Э, и я вечно благодарен. красиво. Спасибо, ребята. Потрясающий разговор. Ваша финансовая команда не теряет деньги на больших ошибках. Это утекает через тысячу мелких решений, за которыми никто не следит. Ramp устанавливает ограждения для расходов до того, как они произойдут. Ограничения в реальном времени, автоматические правила, нулевое тушение пожаров. Попробуйте на ramp.com/invest. По мере роста вашего бизнеса Vant масштабируется вместе с вами, автоматизируя соответствие требованиям и предоставляя вам единый источник истины для безопасности и рисков. Узнайте больше на vant.com/invest. Ridgeline переопределяет технологию управления активами как настоящего партнера, а не просто поставщика программного обеспечения. Они помогли фирмам в 5 раз увеличить масштабы, обеспечивая более быстрый рост, более разумные операции и конкурентное преимущество. Посетите ridgelineapps.com, чтобы узнать, что они могут открыть для вашей фирмы. Каждая инвестиционная фирма уникальна, и общий ИИ не понимает ваш процесс. Rogo понимает. Это платформа ИИ, созданная специально для Уолл-стрит, подключенная к вашим данным, понимающая ваш процесс и производящая реальные результаты. Проверьте их на rogo.ai/invest. Лучшие компании в области ИИ и программного обеспечения от OpenAI до Cursor и Perplexity используют work OS, чтобы стать готовыми к корпоративному использованию за одну ночь, а не за месяцы. Посетите works.com, чтобы пропустить неброскую инфраструктурную работу и сосредоточиться на своем продукте.