Transcription
Так создается интеллект. Новый вид фабрики, генератор токенов, строительных блоков ИИ. Токены открыли новый рубеж, превращая данные в знания и опираясь на все, что мы узнали. Токены используют новую волну чистой энергии и раскрывают тайны звезд. В виртуальных мирах они помогают роботам учиться, а в реальном мире совершенствоваться, прокладывая новые пути и расчищая дорогу для обильного урожая. В решающие моменты токены уже здесь. И на бескрайних просторах они не останавливаются. Они работают там, где не могут человеческие руки. Чтобы мы могли дышать легче. И чтобы самые маленькие сердца бились сильнее. Токены помогают нам осваивать новые территории в невиданных ранее масштабах, чтобы дать миру силу. Чтобы мы могли достичь звездного облака один. Разделение подтверждено. Далеко за его пределами. Вместе мы совершим следующий великий скачок в светлое новое будущее, построенное для всего человечества. И вот здесь все начинается. Добро пожаловать на сцену, основатель и генеральный директор Nvidia, Дженсен Хуанг. Добро пожаловать на GTC. Я просто хочу напомнить вам, что это технологическая конференция. Все эти люди выстроились в очередь так рано утром. Все вы здесь, я рад вас видеть. GTC GTC. Мы поговорим о технологиях. Мы поговорим о платформах. У Nvidia есть три платформы. Вы думаете, что мы в основном говорим об одной из них. Это связано с CUDA X. Наши системы — это еще одна платформа, а теперь у нас есть новая платформа под названием AI factories. Мы поговорим обо всех них, и, что самое важное, мы поговорим об экосистемах. Но прежде чем я начну, позвольте поблагодарить наших ведущих предматчевого шоу. Я думаю, они проделали отличную работу. Сара Го из Conviction, Альфред Лин из Sequoia Capital, первый венчурный инвестор Nvidia, Гэвин Бейкер, первый крупный институциональный инвестор Nvidia. Эти три человека глубоко разбираются в технологиях, глубоко понимают, что происходит, и, конечно, у них очень широкий охват технологической экосистемы. А затем, конечно, все VIP-персоны, которых я лично выбрал, чтобы они присоединились к нам сегодня, команда звезд. Я хочу поблагодарить всех вас за это. Я также хочу поблагодарить все компании, которые здесь присутствуют. Nvidia, как вы знаете, — это компания-платформа. У нас есть технологии, у нас есть наши платформы, у нас есть богатая экосистема, и сегодня здесь, вероятно, 100% из ста триллионов долларов индустрии. 450 компаний спонсировали это мероприятие. Я хочу поблагодарить вас. Тысяча технических сессий, 2000 докладчиков. Эта конференция охватит каждый слой пятислойного пирога искусственного интеллекта: от питания и оболочки инфраструктуры до чипов, платформ, моделей и, конечно же, самого важного и, в конечном итоге, того, что заставит эту индустрию взлететь, — это все приложения. Все началось здесь. Это 20-летие CUDA. Мы работаем над CUDA 20 лет. В течение 20 лет мы посвятили себя этой архитектуре. Это революционное изобретение, SIMT, single instruction, multi-threaded, написание скалярного кода могло порождать многопоточное приложение. Гораздо, гораздо проще программировать, чем CINDI. Недавно мы добавили тайлы, чтобы помочь людям программировать тензорные ядра и структуры математики, которые так фундаментальны для современного искусственного интеллекта. Тысячи инструментов, компиляторов, фреймворков и библиотек с открытым исходным кодом. Есть пара сотен тысяч публичных проектов. CUDA буквально интегрирована в каждую экосистему. Эта диаграмма в основном описывает 100% стратегий Nvidia. Вы видели, как я говорю об этом слайде с самого начала. И в конечном итоге самое сложное для достижения — это то, что находится внизу, — установленная база. Нам потребовалось 20 лет, чтобы создать сотни миллионов GPU и вычислительных систем по всему миру, которые работают на CUDA. Мы есть в каждом облаке. Мы есть в каждой компьютерной компании. Мы обслуживаем практически каждую отрасль. Установленная база CUDA — причина ускорения маховика. Установленная база привлекает разработчиков, которые затем создают новые алгоритмы, достигающие прорыва. Например, глубокое обучение. Есть так много других. Эти прорывы ведут к совершенно новым рынкам, которые строят вокруг них новые экосистемы с другими присоединяющимися компаниями, что создает большую установленную базу. Этот маховик, этот маховик теперь ускоряется. Количество загрузок библиотек Nvidia невероятно ускоряется. находится в очень большом масштабе и растет быстрее, чем когда-либо. Этот маховик позволяет этой вычислительной платформе поддерживать столько приложений, столько новых прорывов. Но самое главное, он также обеспечивает этим инфраструктурам чрезвычайно полезный срок службы. И причина этого очень очевидна. Существует так много приложений, которые вы можете запускать на Nvidia CUDA. Мы поддерживаем каждый этап жизненного цикла ИИ. Мы работаем с каждой платформой обработки данных. Мы ускоряем научные решатели всех видов. И поэтому охват приложений настолько велик, что, как только вы устанавливаете GPU Nvidia, срок их полезного использования невероятно высок. Это также одна из причин, почему цена Ampear, которые мы отгрузили около шести лет назад, растет в облаке. И все это стало возможным в основном потому, что установленная база высока, маховик работает, охват разработчиков велик. И когда все это происходит, и мы постоянно обновляем наше программное обеспечение, стоимость вычислений снижается. Сочетание ускоренных вычислений, которые значительно ускоряют приложения. Между тем, поскольку мы продолжаем развивать и обновлять программное обеспечение в течение его жизненного цикла, вы получаете не только первоначальный всплеск, но и постоянное снижение стоимости ускоренных вычислений с течением времени. И мы готовы развивать, готовы поддерживать каждый из этих GPU в мире, потому что все они архитектурно совместимы. Мы готовы делать это, потому что установленная база настолько велика. Если мы выпускаем новую оптимизацию, она приносит пользу миллионам. Это применимо ко всем в мире. Это сочетание динамики заставляет архитектуру NVIDIA расширять свой охват, ускоряя свой рост, одновременно снижая стоимость вычислений, что в конечном итоге стимулирует новый рост. Итак, CUDA находится в центре этого. Но наше путешествие, которое могло бы начаться 25 лет назад. GeForce. Я знаю, сколько из вас выросли с GeForce. GeForce — самая большая маркетинговая кампания Nvidia. Мы привлекаем будущих клиентов задолго до того, как вы сможете позволить себе это сами. Ваши родители платили. Ваши родители платили за вас, чтобы вы стали клиентами Nvidia. И каждый год они платили год за годом, пока однажды вы не стали удивительным ученым-компьютерщиком и не стали настоящим клиентом, настоящим разработчиком. Но это дом, который построил GeForce 25 лет назад. Мы начали наше путешествие, которое привело к CUDA. 25 лет назад мы изобрели программируемый шейдер. Совершенно неочевидное изобретение, чтобы сделать ускоритель программируемым. Первый в мире программируемый ускоритель, пиксельный шейдер 25 лет назад. Это побудило нас исследовать дальше и дальше, через 20 лет, через 5 лет, изобретение CUDA. Одна из самых больших инвестиций, которые мы сделали, и мы не могли себе ее позволить в то время. и она поглотила подавляющую часть прибыли нашей компании — это было взять CUDA на спинах GeForce в каждый компьютер. Мы посвятили себя созданию этой платформы, потому что мы так сильно верили в ее потенциал. Но в конечном итоге преданность компании ей, несмотря на трудности в начале, вера в нее каждый день на протяжении тринадцати поколений или 20 лет, теперь у нас установлена CUDA повсюду. Пиксельный шейдер привел, конечно, к революции GeForce. А затем 10 лет назад, около 10 лет назад, восемь лет назад, мы представили RTX, полный редизайн нашей архитектуры для современной эпохи компьютерной графики. GeForce принес CUDA в мир. Поэтому GeForce позволил Алексу Круэвки, Ильясу Сусвееру, Джеффу Хинтону, Эндрю Ангу и многим другим обнаружить, что GPU может быть их другом в ускорении глубокого обучения. Это положило начало большому взрыву ИИ. 10 лет назад мы решили, что объединим программируемое затенение и представим две новые идеи. трассировка лучей, аппаратная трассировка лучей, что невероятно сложно сделать. И новая идея в то время, представьте себе около 10 лет назад, мы думали, что ИИ революционизирует компьютерную графику. Точно так же, как GeForce принес ИИ в мир, ИИ теперь вернется и революционизирует то, как делается компьютерная графика в целом. Ну, сегодня я покажу вам кое-что из будущего. Это наше следующее поколение графических технологий. Мы называем это нейронным рендерингом. Слияние, слияние 3D-графики и искусственного интеллекта. Это DLSS 5. Посмотрите на это. Тепло. Тепло. Тепло. Тепло. Это невероятно? Компьютерная графика оживает. Что мы сделали? Мы объединили управляемую 3D-графику. Истину виртуальных миров, структурированные данные, запомните это слово, структурированные данные виртуальных миров, сгенерированных миров. Мы объединяем 3D-графику, структурированные данные с генеративным ИИ, вероятностными вычислениями. Одно из них полностью предсказательное, другое — вероятностное, но высокореалистичное. Мы объединяем эти две идеи. Объединяем эти две идеи, управляемые структурированными данными, идеально управляемые и при этом генерируемые одновременно. И в результате контент красив, удивителен, а также управляем. Эта концепция слияния структурированной информации и генеративного ИИ будет повторяться в одной отрасли за другой. Структурированные данные — основа надежного ИИ. Ну, это вас немного напугает. Я переверну слайд. И не ахайте. Итак, мы пройдемся по схеме до конца времени. Это мой лучший слайд. Каждый раз, когда я спрашиваю команду: "Какой мой лучший слайд?". Повторно это был он. Они говорят: "Не делай этого, Дженсен. Не делай этого". Я сказал: "Нет, эти места свободны для некоторых из вас. Так что это ваша плата за вход. Итак, это структурированные данные. Вы слышали о них. SQL, Spark, Pandas, Velox, некоторые из этих очень-очень важных очень больших платформ. Snow, snow, uh, snowflake, data bricks, EMR, Amazon EMR, um, Azure, Fabric, Google Cloud, BigQuery. Все эти платформы обрабатывают фреймы данных. Эти фреймы данных — гигантские электронные таблицы, и они содержат всю информацию жизни. Это структурированные данные, истина бизнеса. Это истина корпоративных вычислений. Ну, теперь ИИ будет использовать структурированные данные, и нам лучше ускорить их до предела. Раньше это было нормально, и мы, конечно, ускоряли бы структурированные данные, чтобы делать больше. Мы могли бы делать это дешевле. Мы могли бы делать это чаще в день и поддерживать работу компании в гораздо более синхронизированном режиме. Однако в будущем эти структуры данных будут использоваться ИИ, а ИИ будет намного быстрее нас. Будущие агенты также будут использовать структурированные базы данных. А затем, конечно, неструктурированная база данных, генеративная база данных. Эта база данных представляет собой подавляющее большинство мира. Векторные базы данных, неструктурированные данные, PDF, видео, речи, вся информация мира. Около 90% того, что генерируется каждый год, — это неструктурированные данные. До сих пор эти данные были совершенно бесполезны для мира. Мы читаем их, помещаем в файловую систему, и все. К сожалению, мы не можем их запрашивать. Мы не можем их искать. Это сложно сделать. И причина этого в том, что нет простого индексирования неструктурированных данных. Вы должны понимать их смысл, их назначение. И теперь у нас есть ИИ, который делает это, точно так же, как ИИ смог решить проблему мультимодального восприятия и понимания, вы можете использовать ту же технологию мультимодального восприятия и понимания, чтобы прочитать PDF, понять его смысл и из этого смысла встроить его в более крупную структуру, которую мы можем искать, в которую мы можем запрашивать. NVIDIA создала две фундаментальные библиотеки. Точно так же, как мы создали RTX для 3D-графики, мы создали QDF для фреймов данных, структурированных данных. Мы создали QVS для векторных хранилищ, семантических данных, неструктурированных данных, данных ИИ. Эти две платформы станут двумя самыми важными платформами в будущем. Я очень рад видеть их внедрение в глобальную сеть, эту сложную сеть систем обработки данных мира. И причина этого в том, что обработка данных существует уже давно, и поэтому так много разных компаний, платформ и услуг. Нам потребовалось много времени, чтобы глубоко интегрироваться в эту экосистему. Я очень горжусь работой, которую мы здесь делаем. И сегодня мы объявляем о нескольких из них. IBM, изобретатель SQL, одного из самых важных предметно-ориентированных языков всех времен, ускоряет Watson X data с помощью KUDF. Давайте посмотрим на это. 60 лет назад IBM представила System 360, первую современную платформу для универсальных вычислений, положив начало вычислительной эре, затем SQL — декларативный язык для запроса данных без необходимости пошаговой инструкции компьютеру, и хранилище данных. Каждая из основ современных корпоративных вычислений. Сегодня IBM и NVIDIA переосмысливают обработку данных для эры ИИ, ускоряя SQL-движки IBM Watson X. Data с помощью библиотек вычислений на GPU Nvidia. Данные — это истина, которая придает ИИ контекст и смысл. ИИ нуждается в быстром доступе к огромным наборам данных. Современные системы обработки данных на ЦП не справляются. Nestle принимает тысячи решений по цепочке поставок каждый день. Их витрина данных от заказа до кэша агрегирует каждое событие заказа и доставки по всем глобальным операциям в 185 странах. На ЦП Nestle обновляла витрину данных несколько раз в день. С ускоренным Watson X data, работающим на GPU Nvidia, Nestle может выполнять ту же рабочую нагрузку в пять раз быстрее при 83% более низкой стоимости. Следующая вычислительная платформа прибыла. Ускоренные вычисления для эры ИИ. NVIDIA ускоряет обработку данных в облаке. Мы также ускоряем обработку данных локально. Как вы знаете, Dell является ведущим мировым производителем компьютерных систем, а также одним из ведущих мировых поставщиков хранилищ, и они работали с нами над созданием платформы данных Dell AI, которая интегрирует QDF и QVS для создания ускоренной платформы данных. Ну, для эры ИИ, и это пример того, что они сделали с NT data, огромным ускорением. Это облако Google Cloud, и Google Cloud, как вы знаете, мы работаем с Google Cloud очень давно. Мы ускоряем Vertex AI Google, теперь мы ускоряем BigQuery — очень важный фреймворк и очень важную платформу, и это пример нашей совместной работы со Snapchat, где мы сократили их затраты на вычисления почти на 80%. Когда вы ускоряете обработку данных, когда вы ускоряете вычисления, вы получаете выгоду от скорости, вы получаете выгоду от масштаба, но самое главное, вы также получаете выгоду от стоимости. И все это объединяется в одно. Изначально это называлось законом Мура. Закон Мура заключался в удвоении производительности каждые пару лет. Это другой способ сказать, что пока цена остается примерно той же, и большинство компьютеров остаются примерно теми же, вы также получаете удвоенную производительность каждый год или снижаете стоимость вычислений каждый год. Ну, закон Мура исчерпал себя. Нам нужен новый подход. Ускоренные вычисления позволяют нам совершать эти гигантские скачки вперед, и, как вы увидите позже, поскольку мы продолжаем оптимизировать алгоритмы, а Nvidia — это компания, занимающаяся алгоритмами. Поскольку мы продолжаем оптимизировать алгоритмы, и поскольку наш охват так велик, а наша установленная база так велика, мы можем снижать стоимость вычислений, увеличивая масштаб, увеличивая скорость для всех непрерывно. Это Google Cloud. Вы можете увидеть эту закономерность, которую я только что упомянул. Я просто хотел показать вам три версии этого. Nvidia создала платформу ускоренных вычислений с набором библиотек поверх нее. Я привел три примера. RTX — один из них. QDF — другой. KVS, и мы покажем еще несколько. Эти библиотеки находятся поверх нашей платформы. Но в конечном итоге мы интегрируемся в мировые облачные сервисы, в мировых OEM-производителей и другие платформы, которые я покажу, вместе мы сможем охватить мир. Эта закономерность Nvidia, Google Cloud, Snapchat будет повторяться снова и снова. И это выглядит примерно так. И вот один пример. Nvidia с Google Cloud. Мы ускоряем Vertex AI. Мы ускоряем Bitquery. Мы ускоряем. Мы очень гордимся работой, которую мы проделали с Jackson XLA. Мы невероятны в PyTorch. Мы единственный ускоритель в мире, который невероятен в PyTorch и невероятен в Jackson XLA. И клиенты, которых мы поддерживаем, Base 10s, Crowd Strikes, Puma, Salesforce, это не наши клиенты, но это клиенты, разработчики, с которыми мы интегрировали технологии NVIDIA, которые мы затем можем разместить в облаках. Наши отношения с поставщиками облачных услуг по сути заключаются в том, что мы приводим к ним клиентов. Мы интегрируем наши библиотеки, ускоряем рабочие нагрузки и размещаем этих клиентов в облаках. И поэтому, как вы можете видеть, большинство наших поставщиков облачных услуг любят работать с нами. И они всегда просят нас разместить следующего клиента в своем облаке. И я просто хочу сообщить вам, что клиентов много. Мы ускорим всех. И поэтому будет много-много клиентов, которых мы сможем разместить в вашем облаке. Просто будьте терпеливы с нами. И вот Google Cloud. Это AWS. Мы работаем с AWS очень давно. И одна из областей, одна из вещей, которая меня очень волнует в этом году, — это то, что мы принесем OpenAI в AWS. И это приведет к огромному потреблению облачных вычислений в AWS. Это расширит охват, расширит вычисления OpenAI. И, как вы знаете, они полностью ограничены вычислительными мощностями. И поэтому AWS, мы ускоряем EMR, мы ускоряем SageMaker, мы ускоряем Bedrock. NVIDIA глубоко интегрирована в AWS. Они были нашим первым облачным партнером, Microsoft Azure. Суперкомпьютер NVIDIA A100 был первым, который мы построили для Nvidia. Первый, который мы установили, был в Azure. И это привело к успешному партнерству с OpenAI, но мы работаем с Azure уже довольно давно. Мы ускоряем Azure Cloud, теперь это их AI Foundry, мы тесно сотрудничаем, мы ускоряем Bing Search, мы работаем с ними над регионами Azure. Это одна из областей, которая невероятно важна, поскольку мы продолжаем расширять ИИ по всему миру. Одна из возможностей, которую мы предлагаем, — это конфиденциальные вычисления. В конфиденциальных вычислениях вы хотите убедиться, что даже оператор не может видеть ваши данные. Даже оператор не может касаться или видеть ваши модели. Конфиденциальные вычисления. GPU NVIDIA — первые в мире, которые делают это. Теперь они могут поддерживать конфиденциальные вычисления и защищенное развертывание этих очень ценных моделей OpenAI и моделей Anthropic в облаках и различных регионах, и все это благодаря нашим конфиденциальным вычислениям. Конфиденциальные вычисления очень важны. И вот пример того, с какими клиентами мы работаем. Synopsys, наш отличный партнер. Мы ускоряем все их рабочие процессы EDA и CA. А затем мы разместились в Microsoft Azure. Мы были первым клиентом Oracle в области ИИ. Большинство людей подумали бы, что мы были их первым поставщиком. Мы были их первым поставщиком, но мы были их первым клиентом в области ИИ. Я очень горжусь тем, что впервые объяснил Oracle облака ИИ, и мы были их первым клиентом. С тех пор они действительно взлетели. Мы разместили там множество наших партнеров. Core Coher и Fireworks, и, конечно же, очень известный OpenAI, отличное партнерство с Core Core. Они первое в мире облако, созданное на основе ИИ. Компания, которая была построена с единственной целью — предоставлять, размещать GPU, поскольку эра ускоренных вычислений появилась, и размещать облака ИИ. У них есть несколько фантастических клиентов, и они невероятно растут. Одна из платформ, которая меня очень волнует, — это Palunteer и Dell. Три наши компании сделали возможным создание совершенно нового типа платформы ИИ, платформы онтологии Palunteer и платформы ИИ. И мы можем развернуть эти платформы в любой стране, в любом изолированном регионе, полностью локально, полностью на месте, полностью в поле. ИИ может быть развернут буквально везде, без нашей возможности конфиденциальных вычислений, без нашей способности создавать сквозную систему, а также предлагать весь стек ускоренных вычислений и ИИ от обработки данных, будь то векторы или структуры, до ИИ, это было бы невозможно. Я хотел показать вам эти примеры. Это наши особые рабочие отношения с мировыми поставщиками облачных услуг, и многие, все они здесь, и я получаю выгоду от того, что вижу их во время тура по заводу, и это просто невероятно захватывающе. Я просто хочу поблагодарить всех вас за усердную работу. Что сделала NVIDIA, так это, и вы увидите эту тему снова и снова. NVIDIA вертикально интегрирована, первая в мире вертикально интегрированная, но горизонтально открытая компания, и причина, по которой это необходимо, очень проста. Ускоренные вычисления — это не проблема чипа. Ускоренные вычисления — это не проблема системы. В ускоренных вычислениях не хватает одного слова. Мы просто больше не говорим его. Ускорение приложений. Если бы я мог заставить компьютер работать быстрее, это называлось бы ЦП. Но это исчерпало себя. Единственный способ ускорить приложения в будущем и продолжать добиваться огромного ускорения, огромного снижения затрат — это ускорение приложений или предметно-ориентированное ускорение. Я вставил эту фразу в начале, и поэтому это стало ускоренными вычислениями, и именно поэтому NVIDIA должна быть библиотекой за библиотекой, доменом за доменом, вертикалью за вертикалью. Мы — вертикально интегрированная вычислительная компания. Другого пути нет. Мы должны понимать приложения. Мы должны понимать домен. Мы должны фундаментально понимать алгоритмы. И мы должны выяснить, как развернуть алгоритм в любом сценарии, в котором он хочет быть развернут. Будь то центр обработки данных, облако, локально, на периферии или в роботизированной системе. Все эти вычислительные системы разные. И, наконец, системы и чипы. Мы вертикально интегрированы. Что делает это невероятно мощным, и причина, по которой вы видели все слайды, заключается в том, что NVIDIA горизонтально открыта. Мы работаем и интегрируем технологии NVIDIA в любую платформу, в которую вы хотите, чтобы мы интегрировались. Мы предлагаем вам программное обеспечение. Мы предлагаем вам библиотеки. Мы интегрируемся с вашей технологией, чтобы мы могли предоставить ускоренные вычисления всем в мире. Ну, эта GTC — действительно отличное подтверждение этого. Знаете, большую часть времени, большую часть времени вы видите, как я говорю об этих вертикалях, и я привожу примеры, но в каждом отдельном случае, будь то автомобильная промышленность, финансовые услуги, самый большой процент участников этой GTC — из индустрии финансовых услуг. Я знаю. Я надеюсь, что это разработчики, а не трейдеры. Ребята, вот что я хотел сказать. И поэтому в аудитории представлены поставщики Nvidia upstream и downstream от нашей цепочки поставок. И мы работаем, мы думаем о нашей цепочке поставок upstream и downstream. И просто так захватывающе, что вся наша upstream цепочка поставок в прошлом году, независимо от того, являетесь ли вы 50-летней компанией, у нас есть 70-летние компании. У нас есть 150-летняя компания, которая теперь является частью цепочки поставок Nvidia и сотрудничает с нами либо upstream, либо downstream. И в прошлом году у вас был рекордный год, не так ли? Поздравляю. Мы на верном пути. Это начало чего-то очень, очень большого. И поэтому, если вы посмотрите на ускоренные вычисления, мы теперь установили вычислительную платформу. Но чтобы активировать эти вычислительные платформы, нам нужны предметно-ориентированные библиотеки, которые решают очень важные проблемы в каждой из вертикалей, которые мы обслуживаем. Вы видите, как мы обслуживаем каждую из них. Автономные транспортные средства, наш охват, наша широта, наше влияние. Невероятно. У нас есть отдельная дорожка для этого. Финансовые услуги. Я только что упомянул алгоритмический трейдинг, который переходит от классического машинного обучения с ручным инжинирингом признаков, называемого квантовым, к тому, что теперь суперкомпьютеры изучают огромные объемы данных, самостоятельно открывая инсайты и закономерности. И поэтому это проходит через глубокое обучение и момент трансформации. Здравоохранение проходит через свой момент ChatGPT, очень захватывающая работа, которую мы там делаем. У нас есть отличная дорожка для ключевых докладов. У нас есть отличная дорожка для ключевых докладов. Кимберли Пал ведет отличную дорожку для ключевых докладов по здравоохранению. Мы говорим о физике ИИ или биологии ИИ для открытия лекарств, агентах ИИ для обслуживания клиентов и поддержки диагностики, и, конечно же, физическом ИИ, роботизированных системах. Все эти различные векторы ИИ имеют разные платформы, которые предоставляет NVIDIA. Промышленность. Мы полностью перестраиваем и начинаем самое крупное строительство в истории человечества и в большинстве отраслей мира, строим фабрики ИИ, строим заводы по производству чипов, строим компьютерные заводы, представленные здесь сегодня. Медиа и развлечения, игры, конечно, платформа ИИ в реальном времени, чтобы мы могли обеспечить перевод и поддержку трансляций, а также живые игры и живое видео. Огромное количество этого будет дополнено ИИ. У нас есть платформа под названием Hollow Scan Quantum. 35 различных компаний здесь строят с нами следующее поколение гибридных систем Quantum GPU. Розничная торговля и потребительские товары используют Nvidia для цепочки поставок, создавая системы покупок с генеративным ИИ, агентов ИИ для поддержки клиентов. Много работы делается здесь. Индустрия стоимостью 35 триллионов долларов. Робототехника. Индустрия стоимостью 50 триллионов долларов в производстве. Nvidia работает в этой области уже десять лет, создавая три компьютера, фундаментальные компьютеры, необходимые для создания роботизированных систем. Мы интегрированы и работаем практически с каждой компанией, которую мы знаем, занимающейся созданием роботов. У нас здесь на выставке 110 роботов. И телекоммуникации, примерно столько же, сколько мировая индустрия ИТ, около 2 триллионов долларов. Мы видим, конечно, базовые станции повсюду. Это одна из мировых инфраструктур. Это была инфраструктура последнего поколения вычислений. Эта инфраструктура будет полностью переосмыслена. И причина этого очень проста. Эта базовая станция, которая делает одно — базовая станция, в будущем станет платформой инфраструктуры ИИ. ИИ будет работать на периферии. И поэтому много отличных обсуждений. И наша платформа там называется Aerial или AI RAM. Большое партнерство с Nokia, большое партнерство с T-Mobile и многими другими. В основе нашего бизнеса, все, что я упомянул выше, вычислительные платформы, но очень важно, наши библиотеки CUDA X, наши библиотеки CUDA X — это алгоритмы, алгоритмы, которые изобретает Nvidia. Мы — компания, занимающаяся алгоритмами. Вот что делает нас особенными. Вот что позволяет мне заходить в каждую из этих отраслей, представлять будущее и иметь лучших ученых-компьютерщиков мира, описывающих и решающих проблемы, рефакторящих их, перевыражающих их и превращающих их в библиотеку. У нас так много, я думаю, на этой выставке мы анонсируем сто, сто библиотек, около семидесяти библиотек, возможно, сорок моделей, и это только на выставке. Мы постоянно обновляем их. Мы постоянно обновляем их. Библиотеки — это драгоценные камни нашей компании. Это то, что позволяет этой платформе, вычислительной платформе, быть активированной для решения проблемы, оказания влияния. Одна из самых больших, одна из самых важных библиотек, которые мы когда-либо создавали, cuDNN CUDA Deep Neural Networks. Она полностью революционизировала искусственный интеллект, вызвав большой взрыв современного ИИ. Позвольте мне показать вам короткое видео о CUDA X. 20 лет назад мы создали CUDA, единую архитектуру для ускоренных вычислений. Сегодня мы переосмыслили вычисления. Тысяча библиотек CUDA X помогают разработчикам совершать прорывы в каждой области науки и техники. CU opt для оптимизации решений. CU litho для вычислительной литографии. CDSS для прямых разреженных решателей. Coup equivariance для нейронных сетей, учитывающих геометрию. Aerial для AI RAM. Warp для дифференцируемой физики. Пара кирпичей для геномики. В их основе лежат алгоритмы, и они прекрасны. Вау. Тепло. Тепло. Тепло. Тепло. Тепло. Тепло. Тепло. Тепло. Все, что вы видели, было симуляцией. Часть из этого были принципиальные решатели, фундаментальные физические решатели. Часть из этого были суррогаты ИИ, физические модели ИИ, а часть — модели физического ИИ-робототехники. Все было симулировано. Ничего не было анимировано. Ничего не было артикулировано. Все было полностью симулировано. Вот что фундаментально делает Nvidia. Именно через связь понимания алгоритмов с нашими вычислительными платформами мы можем открыть, разблокировать эти возможности. Nvidia — это вертикально интегрированная вычислительная компания с открытой горизонтальной интеграцией с миром. Итак, это CUDA X. Ну, только что вы видели множество компаний. Вы видели Walmart, и вы знаете, есть L'Oreal и невероятные компании, известные компании JP Morgan и Ro, и это компании, которые определили общество до сегодняшнего дня. Toyota здесь. Это одни из крупнейших компаний в мире. Также верно, что есть множество компаний, о которых вы никогда не слышали. Это компании, которые мы называем AI natives. Множество небольших компаний. Этот список огромен. Я не мог, это лишь крошечная, крошечная часть. И я не мог решить, показать вам больше или меньше. И поэтому я сделал так, чтобы вы не могли видеть ничего, и никто не обиделся. Однако в этом списке есть множество новых компаний. Есть компании, например, вы, возможно, слышали о паре из них — OpenAI, Anthropic, но есть множество других, есть множество других, и они обслуживают разные вертикали. Что-то произошло за последние два года, особенно в прошлом году. Мы работаем с AI natives давно, и в прошлом году это просто взлетело, и я объясню вам, почему это произошло. Эта индустрия взлетела, 150 миллиардов долларов инвестиций в венчурные инвестиции в стартапы, крупнейшие в истории человечества. Это также первый раз, когда масштаб инвестиций перешел от миллионов долларов, десятков миллионов долларов к сотням миллионов долларов и миллиардам долларов. И причина этого в том, что это первый раз в истории, когда каждой из этих компаний нужны вычисления, и очень много их. Им нужны токены, очень много их. Они либо создадут, построят и создадут токены и сгенерируют токены, либо они будут интегрировать, добавлять ценность к токенам, доступным, созданным Anthropic, OpenAI и другими. И поэтому эта индустрия отличается во многих отношениях, но одно, что очень ясно, — это влияние, которое они оказывают, невероятная ценность, которую они уже доставляют, вполне ощутима. AI natives. Все потому, что мы переосмыслили вычисления. Точно так же, как во время революции ПК было создано множество новых компаний. Точно так же, как во время интернет-революции было создано множество компаний, а мобильные облака — множество компаний. У каждой из них были свои стандарты, и все, о чем мы говорим, — это один из основных стандартов, который только что произошел. Невероятно важно. И в этом поколении у нас также есть большое количество очень, очень особенных компаний. Мы переосмыслили вычисления. Логично, что появится множество новых важных компаний, влиятельных компаний для будущего мира. Google, Amazon, Meta — влиятельные компании, которые появились в результате последнего сдвига вычислительной платформы. Мы сейчас находимся в начале нового сдвига платформы. Но что произошло за последние пару лет? Ну, мы наблюдали, как вы знаете, мы работали над глубоким обучением и ИИ, большим взрывом современного ИИ. Мы были прямо там, на месте, и мы продвигали эту область довольно давно. Но почему последние два года? Что произошло за последние два года? Ну, три вещи. ChatGPT, конечно, положил начало эре генеративного ИИ. Он способен не только понимать, воспринимать и понимать. Он также способен переводить и генерировать уникальный контент. Я показал вам слияние генеративного ИИ с компьютерной графикой, и это оживило компьютерную графику. Вы, ребята, каждый в мире должен использовать ChatGPT. Я знаю, я использую его каждое утро. Использовал его много сегодня утром. И поэтому ChatGPT был генеративным ИИ, эрой. Второе, кстати, генеративные вычисления по сравнению с тем, как мы раньше занимались вычислениями. Это не так, генеративный ИИ — это возможность программного обеспечения, но он глубоко изменил то, как выполняются вычисления. Вычисления раньше были основаны на поиске, а теперь они генеративные. Держите эту мысль в уме, когда я буду говорить о некоторых вещах, и вы поймете, почему все, что мы делаем, изменит архитектуру компьютеров, как предоставляются компьютеры, как будут строиться компьютеры и что вообще означает вычисление. Генеративный ИИ, конец 2023 года, 2023 год, следующий этап — ИИ-рассуждение 01, и затем он взлетел с 03. Рассуждение позволило ему размышлять, думать про себя, планировать, разбивать, разбивать проблемы и разлагать проблему, которую он не мог понять, на шаги или части, которые он мог понять. Он мог основываться на исследованиях. 01 сделал генеративный ИИ надежным и основанным на истине. Это привело к тому, что ChatGPT просто взлетел. И это был очень, очень важный момент. Количество входных токенов, необходимых для производства, и количество выходных токенов, которые он сгенерировал для рассуждения, модель была немного больше, она, конечно, могла иметь гораздо большие модели, модель 01 была немного больше, не намного больше, но ее использование входных токенов для контекста и выходных токенов для мышления значительно увеличило объем вычислений. Затем появился Code Interpreter — первая агентная модель. Он мог читать файлы, кодировать, компилировать, тестировать, оценивать, возвращаться и итерировать. Code Interpreter революционизировал разработку программного обеспечения. Как вы все знаете, 100% сотрудников NVIDIA используют комбинацию CL или часто все три. Code Interpreter, Codeex и Cursor повсюду в Nvidia. Нет ни одного инженера-программиста сегодня, которому не помогал бы один или несколько ИИ-агентов, помогающих им кодировать. Code Interpreter полностью революционизирует новый поворот, и впервые. Вы не спрашиваете ИИ "что, где, когда, как". Вы просите его создать, сделать, построить. Вы просите его использовать инструменты, учитывать ваш контекст, читать файлы. Он способен агентски разбивать проблему, рассуждать о ней, размышлять о ней. Он способен решать проблемы и фактически выполнять задачи. ИИ, который мог воспринимать, стал ИИ, который мог генерировать. ИИ, который мог генерировать, стал ИИ, который мог рассуждать. ИИ, который мог рассуждать, теперь стал ИИ, который может фактически выполнять работу. Очень продуктивную работу. Объем вычислений за последние два года. Мы знаем, что все в этой комнате знают, что спрос на вычисления для GPU Nvidia зашкаливает. Спотовые цены стремительно растут. Вы не могли найти GPU, если бы попытались. И тем не менее, в то же время мы отгружаем GPU в огромных количествах, а спрос продолжает расти. Есть причина для этого. Этот фундаментальный поворот. Наконец, ИИ способен выполнять продуктивную работу, и поэтому наступил поворотный момент в области инференса. ИИ теперь должен думать. Чтобы думать, он должен делать инференс. ИИ теперь должен действовать. Чтобы действовать, он должен делать инференс. ИИ должен читать. Чтобы сделать это, он должен делать инференс. Он должен рассуждать. Он должен делать инференс. Каждая часть ИИ, каждый раз, когда ему нужно думать, ему нужно рассуждать, ему нужно действовать, ему нужно генерировать токены, ему нужно делать инференс. Это уже далеко за пределами обучения, это в области инференса. Таким образом, наступил поворотный момент в инференсе в то время, когда количество токенов, объем вычислений, необходимых для этого, увеличился примерно в 10 000 раз. Теперь, когда я объединяю эти два факта с тем, что за последние два года спрос на вычисления увеличился в 10 000 раз, а объем использования, объем использования, вероятно, увеличился в сто раз. Люди слышали, как я говорил, что, по моему мнению, спрос на вычисления увеличился в миллион раз за последние два года. Это то чувство, которое есть у всех нас. Это то чувство, которое есть у каждого стартапа. Это то чувство, которое есть у OpenAI. Это то чувство, которое есть у Anthropic. Если бы они только могли получить больше мощности, они могли бы генерировать больше токенов. Их доходы выросли бы. Больше людей могли бы этим пользоваться. Чем более продвинутым, чем умнее мог бы стать ИИ. Мы сейчас находимся в этой системе положительного маховика. Мы достигли этого момента. Наступил поворотный момент, поворотный момент инференса. В прошлом году в это время я сказал, что там, где я стоял в тот момент, мы видели около 500 миллиардов долларов. Мы видели 500 миллиардов долларов очень уверенного спроса и заказов на Blackwell и Reuben до 2026 года. Я сказал это в прошлом году. Теперь я не знаю, чувствуете ли вы то же самое, но 500 миллиардов долларов — это огромный доход. Никто не впечатлен. Я знаю, почему вы не впечатлены. Потому что у всех вас был рекордный год. Ну, я здесь, чтобы сказать вам, что прямо сейчас, где я стою, через несколько коротких месяцев после GTCDC, через год после прошлой GTC, прямо здесь, где я стою, я вижу до 2027 года по крайней мере 1 триллион долларов. Теперь, имеет ли это смысл? И именно об этом я буду говорить остальное время. На самом деле, мы будем в дефиците. Я уверен, что спрос на вычисления будет намного выше, чем это. И есть причина для этого. Итак, первое — мы проделали большую работу за последний год. Конечно, как вы знаете, 2025 год был годом инференса Nvidia. Мы хотели убедиться, что мы не только хороши в обучении и пост-обучении, но и невероятно хороши на каждом этапе ИИ, чтобы инвестиции, сделанные в нашу инфраструктуру, могли масштабироваться так долго, как они захотят ее использовать. И срок полезного использования инфраструктуры Nvidia будет долгим, и поэтому стоимость будет невероятно низкой. Чем дольше вы можете ее использовать, тем ниже стоимость. Нет никаких сомнений в том, что системы Nvidia — это самая дешевая инфраструктура, которую вы можете получить для инфраструктуры ИИ в мире. И поэтому первая часть прошлого года была посвящена ИИ для инференса, и это привело к этому поворотному моменту. Одновременно мы были очень рады в прошлом году, что Anthropic пришел в Nvidia, что MSL Meta SL выбрал Nvidia, и в то же время, и как группа, это представляет одну треть мировых вычислений ИИ. Модели с открытым исходным кодом достигли границы, и это буквально повсюду, и Nvidia, как вы знаете, сегодня мы единственная платформа в мире, которая работает с каждой областью ИИ во всех этих моделях ИИ в языке, биологии, компьютерной графике, компьютерном зрении, речи, белках, химикатах, робототехнике и других, на периферии или в облаке, на любом языке. Архитектура Nvidia универсальна для всего этого, и мы невероятны для всего этого. Это позволяет нам быть самой дешевой, самой надежной платформой, потому что, когда вы строите эти системы, как я уже упоминал, триллион долларов — это огромный объем инфраструктуры. Вы должны быть полностью уверены, что триллион долларов, который вы вкладываете, будет использован, будет производительным, будет невероятно экономически эффективным и будет иметь полезный срок службы так долго, как вы можете видеть эти инвестиции в инфраструктуру, которые вы можете сделать на Nvidia. Вы можете сделать с полной уверенностью. Мы теперь доказали, что это единственная инфраструктура в мире, с которой вы можете пойти куда угодно в мире и строить с полной уверенностью. Вы хотите разместить ее в любом из облаков, мы рады этому. Вы хотите разместить ее локально, мы рады этому. Вы хотите разместить ее в любой стране, где угодно, мы рады поддержать вас. Мы теперь вычислительная платформа, которая работает со всем ИИ. Ну, наш бизнес уже начинает показывать, что 60% нашего бизнеса — это гиперскейлеры. Топ пять гиперскейлеров. Однако даже в этих топ пять гиперскейлерах часть из них — это внутреннее потребление ИИ. Внутреннее потребление ИИ — очень важная работа, такая как Rexus, переходит от рекомендательных систем на основе таблиц, коллаборативной фильтрации и фильтрации контента. Она переходит к глубокому обучению и большим языковым моделям. Поиск переходит к глубокому обучению и большим языковым моделям. Почти все эти различные рабочие нагрузки гиперскейлеров теперь переходят к рабочей нагрузке, для которой GPU Nvidia невероятно хороши. Но помимо этого, поскольку мы работаем с каждой лабораторией ИИ, поскольку мы работаем с каждым, мы ускоряем каждую модель ИИ, и поскольку у нас есть большая экосистема AI natives, с которыми мы работаем, которых мы можем привести в облака, эти инвестиции, какими бы большими они ни были, какими бы быстрыми ни были вычисления, будут потреблены, и это составляет 60% нашего бизнеса. Остальные 40% — это просто везде. Региональные облака, суверенные облака, корпоративные, промышленные, робототехника, периферия, большие системы, суперкомпьютерные системы, маленькие серверы, корпоративные серверы. Количество систем, невероятно. Разнообразие ИИ также является его устойчивостью. Широта охвата ИИ — его устойчивость. Нет сомнений, что это не технология для одного приложения. Это теперь фундаментально. Это абсолютно новый сдвиг вычислительной платформы. Ну, наша задача — продолжать развивать технологии, и одна из самых важных вещей, которую я упомянул в прошлом году, — это то, что прошлый год был годом инференса. Мы посвятили все. Мы пошли на огромный риск и переосмыслили, пока Hopper был на пике, и он просто кипел. Мы решили, что архитектура Hopper, MVL link by 8 должна быть выведена на новый уровень. Мы полностью переработали систему, полностью дезагрегировали вычислительную систему и создали MVLink 72. Способ его сборки, производства, программирования полностью изменился. Grace Blackwell MVLink72 была огромной ставкой, и это было непросто ни для кого, и многие из моих партнеров здесь, в комнате. Я хочу поблагодарить всех вас за усердную работу, которую вы проделали. Спасибо. MVLink72 MV FP4 не просто FP4 точность, FP4 — это совершенно другой тип тензорного ядра и вычислительного блока. Мы продемонстрировали, что можем выполнять инференс NVFP4 без потери точности, но с гигантским приростом производительности и энергоэффективности. Мы также смогли использовать MVFP4 для обучения. Итак, MVLink72, MVFP4, изобретение Dynamo, Tensor RTLM, множество новых алгоритмов. Мы даже построили суперкомпьютер, чтобы помочь нам оптимизировать ядра и оптимизировать наш полный стек. Мы называем его DGX Cloud. Мы инвестировали миллиарды долларов в возможности суперкомпьютеров, чтобы помочь нам создать ядра, программное обеспечение, которое сделало инференс возможным. Ну, результаты сошлись, и люди говорили, люди раньше говорили мне, но Дженсен, инференс — это так просто. Инференс — это предельно сложно. Инференс — это предельно важно, потому что он приносит вам доход. И вот результат. Это из SemiAnalysis. Это самое большое и всеобъемлющее исследование ИИ-инференса, которое когда-либо проводилось. И то, что вы видите здесь слева, на этой стороне, — это токены на ватт. Токены на ватт важны, потому что каждый центр обработки данных, каждый завод по определению ограничен мощностью. Фабрика мощностью один гигаватт никогда не станет двумя. Это физически ограничено законами атомов, законами физики. И поэтому в этом гигаваттном центре обработки данных вы хотите получить максимальное количество токенов, что является производством, продуктом этой фабрики. Поэтому вы хотите быть на вершине этой кривой настолько высоко, насколько хотите. Ось X — это интерактивность, скорость инференса, скорость каждого инференса. Чем быстрее вы можете делать инференс, тем быстрее вы можете, конечно, реагировать. Но очень важно, что чем быстрее вы можете делать инференс, тем больше модели, тем больше контекста вы можете обрабатывать, тем больше токенов вы можете обдумать. Эта ось — это то же самое, что и ум ИИ. И поэтому эта ось — это пропускная способность ИИ. Это интеллект ИИ. Обратите внимание, чем умнее ИИ, тем ниже ваша пропускная способность. Имеет смысл? Вы думаете дольше. Хорошо? И поэтому эта ось — это скорость. И я вернусь к этому. Это важно. Это то, где я пытаю всех вас. Но это слишком важно. Каждый генеральный директор в мире, вы наблюдаете, каждый генеральный директор в мире будет изучать свой бизнес отныне так, как я собираюсь описать, потому что это ваша фабрика токенов. Это ваша фабрика ИИ. Это ваш доход. В этом нет никаких сомнений в будущем. И поэтому это пропускная способность. Это интеллект. Лучшая производительность на ватт при заданной мощности центра обработки данных. Чем выше пропускная способность, тем больше токенов вы можете произвести. С этой стороны — стоимость. Обратите внимание, Nvidia имеет самую высокую производительность в мире. Никто не удивится. Они удивятся тому факту, что за одно поколение, в то время как закон Мура дал бы нам через транзисторы 50% — в два раза больше закона Мура, вероятно, дал бы нам в полтора раза больше производительности. Вы бы ожидали от Hopper H200 в полтора раза больше. Никто бы не ожидал в 35 раз больше. Я сказал в прошлом году в это время, что Grace Blackwell NVLink 72 от Nvidia обеспечивал 35-кратную производительность на ватт. Никто мне не поверил. А затем вышел SemiAnalysis, и Дилан Пател процитировал. Он обвинил меня в занижении. Он обвинил меня в занижении. Он сказал: "Дженсен занизил. На самом деле это 50 раз". И он не ошибается. Он не ошибается. И поэтому наша стоимость за токен, да, наша стоимость за токен самая низкая в мире. Вы не можете ее превзойти. Я говорил раньше, если у вас неправильная архитектура, даже если она бесплатна, она недостаточно дешева. И причина этого в том, что независимо от того, что произойдет, вам все равно придется строить гигаваттный центр обработки данных. Вам все равно придется строить гигаваттную фабрику. И эта гигаваттная фабрика в течение 15 лет, рекламируемая по всей этой гигаваттной фабрике, стоит около 40 миллиардов долларов. Даже когда вы ничего на нее не ставите, это 40 миллиардов долларов. Вам лучше убедиться, что вы поставили лучшую компьютерную систему на эту вещь, чтобы вы могли иметь лучшую.
Стоимость токена. Стоимость токена Nvidia мирового класса. По сути, в данный момент недосягаема. И причина этого истинна из-за экстремального дизайна кода. И поэтому я очень рад, что он назвал нас. Был Царь Обезьян, Царь Токенов. Ну, мы берем, мы берем все наше программное обеспечение, как я, как я вам сказал, мы вертикально интегрируемся, но горизонтально открываемся. Мы вертикально интегрируемся, горизонтально открываемся. Мы интегрируем все наше программное обеспечение и все наши технологии, однако мы можем упаковать это и интегрировать в мировых поставщиков услуг инференса. И эти компании растут так быстро. Они растут так быстро. Фейерверки. Лин здесь вместе. Они просто растут невероятно быстро. В сто раз за последний год. Они — фабрики токенов. И эффективность, производительность и способность производства токенов для их фабрик — это все для них. И вот что произошло. Мы обновили их программное обеспечение, ту же систему. И обратите внимание на их скорость токенов. Невероятно. Разница до того, как Nvidia обновила все, и все наши алгоритмы и программное обеспечение, и все технологии, которые мы применяем, в среднем около 700 токенов в секунду увеличились почти до 5000, в 7 раз больше. И вот в чем невероятная мощь экстремального дизайна кода. Ранее я упоминал важность фабрик. Это важность фабрики. Ваш центр обработки данных, раньше это был центр обработки данных для файлов. Теперь это фабрика для генерации токенов. Ваша фабрика ограничена, несмотря ни на что. Все ищут землю, энергию и оболочку. Как только вы ее построите, вы будете ограничены по мощности. В рамках этой инфраструктуры с ограниченной мощностью вам лучше убедиться, что ваш инференс, потому что вы знаете, что инференс — это ваша рабочая нагрузка, а токены — это ваш новый товар, а вычисления — это ваш доход, который вы хотите обеспечить, чтобы архитектура была максимально оптимизирована. В будущем каждая CSP, каждая компьютерная компания, каждая облачная компания, каждая компания в области ИИ, каждая компания в целом будет думать об эффективности своих фабрик токенов. Это ваша фабрика в будущем. И причина, по которой я это знаю, заключается в том, что все в этой комнате питаются интеллектом. И в будущем этот интеллект будет дополнен токенами. Итак, позвольте мне показать вам, как мы сюда попали. 6 апреля 2016 года, десять лет назад, мы представили DGX1, первый в мире компьютер, разработанный для глубокого обучения. Восемь GPU Pascal, соединенных NVLink первого поколения. 170 терафлопс в одном компьютере. Первый в мире компьютер, разработанный для исследователей ИИ. С Volulta мы представили NVLink Switch. 16 GPU, соединенных полным каналом связи "все ко всем", работающих как один гигантский GPU. Гигантский шаг вперед, но размеры моделей продолжали расти. Центр обработки данных должен был стать единым вычислительным блоком. Так Melanox присоединился к Nvidia. В 2020 году DGXA100 Super Pod стал первым суперкомпьютером на GPU, сочетающим архитектуру масштабирования вверх и масштабирования вширь. NVLink 3 для масштабирования вверх, Connect X6 и Quantum Infiniband для масштабирования вширь. Затем Hopper, первый GPU с FP8 Transformer Engine, который положил начало эре генеративного ИИ. NVLink 4, Connect X7, Bluefield 3 DPU, Quantum Infiniband второго поколения. Это произвело революцию в вычислениях. Blackwell переопределил архитектуру систем суперкомпьютеров ИИ с NVLink 72. 72 GPU, соединенных NVLink spine, 130 терабайт в секунду пропускной способности "все ко всем". Вычислительные лотки интегрируют Blackwell GPU, Grace CPU, Connect X8 и Bluefield 3. Масштабирование вширь осуществляется через Spectrum 4 Ethernet. С тремя законами масштабирования в полном разгаре, предварительное обучение, пост-обучение и инференс, а теперь и агентные системы, спрос на вычисления продолжает расти экспоненциально. И теперь Vera Rubin, разработанная для каждого этапа агентного ИИ, продвигающая каждый столп вычислений, включая CPU, хранилище, сети и безопасность. Vera Rubin NVLink 72, 3,6 эксафлопс вычислений, 260 ТБ/с пропускной способности NVLink "все ко всем", движок, ускоряющий эру агентного ИИ. Стойка Vera CPU, разработанная для оркестровки и агентных рабочих нагрузок. Стойка STX, хранилище, разработанное для ИИ, построенное с Bluefield 4. Масштабирование вширь с помощью Spectrum 4 Ethernet с копакеджированными оптическими модулями, повышающее энергоэффективность и отказоустойчивость. И невероятное новое дополнение — стойка Gro 3 LPX. Тесно связанная с Vera Rubin, LPU Gro с массивной SRAM на чипе, ускоритель токенов для уже невероятно быстрой Vera Rubin. Вместе в 35 раз больше пропускной способности на мегаватт. Новая платформа Vera Rubin. Семь чипов, пять стоечных компьютеров, один революционный суперкомпьютер ИИ для агентного ИИ. В 40 миллионов раз больше вычислений всего за 10 лет. Теперь, в старые добрые времена, когда я говорил о Hopper, я показывал чип. Это просто очаровательно. Это Vera Rubin. Когда мы думаем о Vera, когда мы думаем о Vera Rubin, мы думаем о всей системе, вертикально интегрированной полностью с программным обеспечением, расширенной от конца до конца, оптимизированной как одна гигантская система. Причина, по которой она разработана для агентных систем, очень ясна, потому что для агентов, конечно, самая важная рабочая нагрузка — это мышление, большая языковая модель. Большие языковые модели становятся все больше и больше и больше. Они будут генерировать все больше и больше токенов все быстрее, чтобы они могли думать быстрее. Но им также придется получать доступ к памяти. Они будут очень сильно нагружать память. KV-кэш, структурированные данные, QDF, неструктурированные данные, QVS. Они будут очень сильно нагружать систему хранения данных, поэтому мы переизобрели систему хранения данных. Они также будут использовать инструменты, и в отличие от людей, которые более терпимы к медленным компьютерам, ИИ хочет, чтобы инструменты были максимально быстрыми. Эти инструменты, веб-браузеры в будущем, они также могут быть виртуальными ПК в облаке. Эти ПК должны быть, и эти компьютеры должны быть максимально быстрыми. Мы создали совершенно новый CPU. Совершенно новый CPU, разработанный для чрезвычайно высокой однопоточной производительности, невероятно высокого вывода данных, невероятно хорошей обработки данных и экстремальной энергоэффективности. Это единственный в мире CPU для центров обработки данных, который использует LPDDR5, LPDDR5 и невероятную однопоточную производительность и производительность на ватт, которая не имеет себе равных. И поэтому мы построили это, чтобы оно могло идти вместе с остальными стойками для агентной обработки. И вот оно. Это Grace Blackwell. О нет, Vera Rubin. Где она? Вот она. Итак, это система Vera Rubin. Обратите внимание, с прошлого раза 100% жидкостное охлаждение. Все кабели убраны. То, что раньше занимало 2 дня установки, теперь занимает два часа. Невероятно. И поэтому время производственного цикла значительно сократится. Это также суперкомпьютер, который охлаждается горячей водой 45°, что снимает нагрузку с центра обработки данных, снижает все затраты и всю энергию, используемую для охлаждения центра обработки данных, и делает ее доступной для системы. Это секретный соус. Это единственная компания в мире, которая сегодня построила шестое поколение системы коммутации масштабирования вверх. Это не Ethernet. Это не Infiniband. Это NVLink. Это шестое поколение NVLink. Это безумно сложно сделать. Ну, это безумно сложно сделать. В целом. И я просто очень горжусь командой. NVLink полностью охлаждается. Это совершенно новая система Gro. И я покажу вам немного больше о ней. Эта система. Восемь чипов GU. Это LP30. Мир никогда не видел ничего подобного. Все, что мир когда-либо видел, это V1. Это третье поколение. И мы уже в массовом производстве. И я покажу вам больше об этом через секунду. Первый в мире коммутатор CPO Spectrum X. Это также находится в полном производстве. Копакеджированные оптические модули. Оптика поступает непосредственно на этот чип, напрямую взаимодействует с кремнием. Электроны преобразуются в фотоны и напрямую подключаются к этому чипу. Мы изобрели технологию процесса с TSMC. Мы единственные, кто сегодня производит ее. Это называется CPO. Это совершенно революционно. Nvidia находится в полном производстве Spectrum X. Это система Vera. Вдвое большая производительность на ватт по сравнению с любыми CPU в мире сегодня. Она также находится в производстве. Ну, знаете, мы никогда не думали, что будем продавать CPU отдельно. Мы продаем много CPU отдельно. Это уже точно будет многомиллиардный бизнес для нас. Так что я очень, очень доволен нашими архитекторами CPU. Мы разработали революционный CPU, и это CX9 с CPU Vera, Bluefield 4 STX, нашей новой платформой хранения данных. Итак, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Вот что происходит, когда вы Вот что происходит, когда вы не практикуетесь. Хорошо. Итак, вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый товар, и, как и все товары, когда он достигает перегиба, когда он становится зрелым или становится зрелым, он сегментируется на разные части. Низкая скорость с высокой пропускной способностью может использоваться для бесплатного уровня. Следующий уровень может быть средним уровнем. Большая модель, возможно, более высокая скорость, конечно, большая контекстная длина ввода. Это переводится в другую цену. Вы можете видеть из всех различных услуг, эта бесплатна. Это бесплатный уровень. Первый уровень может стоить 3 доллара за миллион токенов. Следующий уровень может стоить 6 долларов за миллион токенов. Вы хотели бы иметь возможность продолжать двигать эту границу, потому что чем больше модель, тем умнее, чем больше контекстная длина входных токенов, тем более релевантной, чем выше скорость, тем дольше вы можете думать и итерировать более умные модели ИИ. Так что это о более умных моделях ИИ. И когда у вас есть более умные модели ИИ, каждый из этих кликов позволяет вам увеличить цену. Так что это 45 долларов. И, возможно, однажды появится премиальная модель, которая позволит вам премиальную услугу, которая позволит вам генерировать невероятно высокие скорости токенов, потому что вы находитесь на критическом пути, или, возможно, вы проводите действительно долгое исследование, и 150 долларов за миллион токенов — это просто не имеет значения. Итак, давайте переведем это. Предположим, вы, как исследователь, использовали бы 50 миллионов токенов в день по цене 150 долларов за миллион токенов. Как оказалось, как исследовательская группа, это даже не имеет значения. Итак, мы считаем, что это будущее. Вот куда хочет идти ИИ. Вот где он находится сегодня. Ему пришлось начать здесь, чтобы установить ценность и установить его полезность и становиться все лучше и лучше. В будущем вы увидите, что большинство услуг охватывают все это. Это Hopper. Hopper начался, и я переместил график. Это 50. Это 100. Hopper выглядит так. И вы ожидали бы, что Hopper следующего поколения будет выше, но никто не ожидал бы, что он будет настолько выше. Это Grace Blackwell. Что сделала Grace Blackwell, так это увеличила вашу пропускную способность на бесплатном уровне. Однако там, где вы в основном монетизируете свою услугу, она увеличила вашу пропускную способность в 35 раз. Это ничем не отличается от любого продукта, который производит каждая компания. Чем выше уровень, тем выше качество, тем выше производительность, тем ниже объем, тем ниже емкость. И поэтому это ничем не отличается от любого другого бизнеса в мире. И теперь мы можем увеличить этот уровень в 35 раз. И мы представили совершенно новый уровень. Это преимущество Grace Blackwell. Огромный скачок по сравнению с Hopper. Ну, вот что мы делаем с Окей. Итак, это Grace Blackwell. Хорошо. Позвольте мне просто сбросить, сбросить это. И это Vera Rubin. Хорошо. Теперь просто подумайте, просто подумайте, что произошло на каждом уровне. На каждом уровне, на каждом уровне мы увеличили пропускную способность. И на уровне, где у вас самая высокая ASP и самый ценный сегмент, мы увеличили ее в 10 раз. Это тяжелая работа. Это невероятно сложно сделать здесь. Это преимущество EVL 72. Это преимущество чрезвычайно низкой задержки. Это преимущество экстремального дизайна кода, которое позволяет нам сдвинуть всю область вверх. Теперь, что это значит с точки зрения клиента в итоге? Предположим, я взял бы все это и просто, знаете ли, умножил бы это на Предположим, я взял бы 25% своей мощности, использовал бы ее на бесплатном уровне, 25% своей мощности на среднем уровне, 25% своей мощности на высоком уровне и 25% своей мощности на премиальном уровне. У моего центра обработки данных всего гигаватт. И поэтому я решаю, как я хочу распределить. Бесплатный уровень позволяет мне привлечь больше клиентов. Это позволяет мне обслуживать моих самых ценных клиентов. И комбинация, продукт всего этого позволяет вам, по сути, ваши доходы, доходы, которые вы можете получить, предполагая этот упрощенный пример, позволяет Blackwell генерировать в пять раз больше доходов. Vera Rubin генерировать в пять раз. Да. Так что, если вы Reuben, вы должны добраться туда как можно скорее. И причина этого в том, что ваша стоимость токенов снижается, а ваша пропускная способность увеличивается. Но мы хотим еще больше. Мы хотим еще больше. Итак, позвольте мне просто показать вам это снова. Это, как я вам сказал, эта пропускная способность требует тонны флопсов. Эта задержка, эта интерактивность требует огромного количества пропускной способности. Компьютеры не любят экстремальное количество флопсов, экстремальное количество пропускной способности, потому что на чипах есть только ограниченная площадь поверхности, которую имеют любые системы. И поэтому оптимизация для высокой пропускной способности и оптимизация для низкой задержки на самом деле являются врагами друг друга. И вот что произошло, когда мы объединились с Grok. Хорошо. И поэтому мы приобрели команду, которая работала над чипами Grok, и лицензировали технологию, и мы работаем вместе теперь над интеграцией системы. Вот как это выглядит. Итак, на самом ценном уровне, на самом ценном уровне мы теперь увеличим производительность в 35 раз. Теперь эта очень простая диаграмма раскрыла вам именно причину, по которой Nvidia так сильна в подавляющем большинстве рабочих нагрузок до сих пор. И причина этого в том, что здесь, наверху, пропускная способность так важна. NVLink 72 меняет правила игры. Это именно правильная архитектура, и ее даже трудно превзойти, даже когда вы добавляете к ней Grok. Однако, если бы вы расширили эту диаграмму далеко сюда и сказали, что вы хотите иметь услуги, которые обеспечивают не 400 токенов в секунду, а тысячу токенов в секунду, вдруг NVLink72 исчерпает свои возможности, и он просто не сможет туда добраться. У нас просто недостаточно пропускной способности. И вот здесь появляется Grok, и вот что происходит, когда мы расширяем это. Так что это выходит за пределы Спасибо. выходит за пределы даже пределов того, что может сделать NVLink72. И если бы вы сделали это, перевели это в доходы по сравнению с Blackwell, Vera Rubin — это 5x. Если большая часть вашей рабочей нагрузки — это высокая пропускная способность, я бы придерживался только 100% Vera Rubin. Если большая часть вашей рабочей нагрузки — это кодирование и генерация токенов для высокоценного инжиниринга, я бы добавил Grok. Я бы добавил Grok примерно к 25% моего общего центра обработки данных. Остальная часть моего центра обработки данных — это все 100% Vera Rubin. И это дает вам представление о том, как вы бы добавили Grok к Vera Rubin и еще больше расширили ее производительность и ценность. Вот что происходит. Vera, это контраст. Причина, по которой Grok был для меня так привлекателен, заключается в том, что их вычислительная система — это процессор детерминированного потока данных, он статически компилируется. Он планируется компилятором, то есть компилятор определяет, когда данные, когда выполнять вычисления, вычисления и данные прибывают одновременно. Все это делается статически заранее и полностью планируется в программном обеспечении. Нет динамического планирования. Архитектура разработана с огромным количеством SRAM. Она разработана только для инференса. Эта одна рабочая нагрузка. Теперь эта одна рабочая нагрузка, как оказалось, является рабочей нагрузкой фабрик ИИ. И поскольку мир продолжает увеличивать количество высокоскоростных токенов, которые он хочет генерировать с помощью суперумных токенов, которые он хочет генерировать, ценность этой интеграции будет только расти. И поэтому это два экстремальных процессора. Вы можете видеть один чип 500 мегабайт, один чип Vera Rubin, один чип Reuben 288 гигабайт. Потребовалось бы много чипов Grok, чтобы вместить размер параметров Reuben, а также весь контекст, который должен идти вместе с ним, KV-кэш, который должен идти вместе с ним. Так что это ограничивало способность Grok действительно выйти на массовый рынок, действительно взлететь, пока у нас не появилась отличная идея. Что, если мы полностью разделим инференс с помощью программного обеспечения под названием Dynamo? Что, если мы перестроим способ выполнения инференса в конвейере, чтобы мы могли поместить работу, которая идеально подходит для Vera Rubin, а затем выгрузить декодирование, генерацию, низкую задержку, часть рабочей нагрузки с ограниченной пропускной способностью для Grok, и таким образом мы объединили два процессора с экстремальными различиями: один для высокой пропускной способности, один для низкой задержки. Это все равно не меняет того факта, что нам нужно много памяти. И поэтому Grok, мы просто добавим кучу чипов Grok, что увеличит объем памяти. И поэтому, если вы можете представить себе модель с триллионом параметров, мы должны хранить все это в чипах Grok, однако она находится рядом с Nvidia Vera Rubin, где мы можем хранить огромные объемы KV-кэша, которые необходимы для обработки всех этих агентных систем ИИ. Это основано на идее этого агрегированного инференса. Мы выполняем предварительное заполнение, это легкая часть, но мы также тесно интегрируем декодирование. Таким образом, часть внимания при декодировании выполняется на Nvidia Vera Rubin, которая требует много математики, а часть прямой сети, часть декодирования выполняется на Vera Rubin, на Grok. Оба работают в тесной связке через сегодняшний Ethernet со специальным режимом для снижения задержки примерно вдвое. И эта возможность позволяет нам интегрировать эти две системы. Мы запускаем Dynamo, эту невероятную операционную систему для фабрик ИИ поверх нее. И вы получаете 35-кратное увеличение. 35-кратное увеличение. Не говоря уже о дополнительных новых уровнях производительности инференса для генерации токенов, которых мир никогда не видел. Итак, это оно. Это Grok. Системы Vera Rubin, включая Grok. Я хочу поблагодарить Samsung, которая производит для нас чип Gro LP30, и они работают изо всех сил. Я очень ценю вас. Мы находимся в производстве с чипом Gro, и мы отправим его во второй половине, вероятно, примерно в третьем квартале. Хорошо. Grock LPX, Vera Rubin, знаете, трудно представить себе больше клиентов. И действительно здорово то, что раннее тестирование Grace Blackwell было очень сложным из-за объединения NVLink 72, но тестирование Vera Rubin проходит невероятно хорошо, и на самом деле Сатья, я думаю, уже написал, что первая стойка Vera Rubin уже работает в Microsoft Azure, и поэтому я очень рад за них. Мы просто продолжим выпускать эти системы. Мы теперь создали цепочку поставок, которая может производить тысячи таких систем в неделю, по сути, гигаватты фабрик ИИ в месяц в рамках нашей цепочки поставок. И поэтому мы будем выпускать эти стойки Vera Rubin, пока мы выпускаем стойки GB300. Мы находимся в полном производстве. CPU Vera невероятно успешны. И причина этого в том, что ИИ нуждается в CPU для использования инструментов, а CPU Vera идеально подходит для этого. Невероятно для следующего поколения обработки данных. CPU Vera идеален. CPU Vera плюс Bluefield 4 STX, наша новая платформа хранения данных. Хорошо, это четыре стойки, и каждая из этих стоек подключена, стойка NVLink. Я уже показывал вам это раньше. Она очень тяжелая и с каждым годом становится все тяжелее. потому что, я думаю, там с каждым годом становится все больше кабелей. И поэтому, это стойка NVLink. Мы также использовали эту технологию, потому что она настолько эффективна для создания центра обработки данных с этими кабельными системами, структурированными кабелями. Поэтому мы решили сделать это и для Ethernet. Итак, это Ethernet, 256 узлов с жидкостным охлаждением в одной стойке. И она также подключена с помощью этих невероятных разъемов. Вы хотите увидеть Reuben Ultra. Итак, это вычислительный узел Reuben Ultra. В отличие от Reuben, который вставляется горизонтально, Reuben Ultra входит в совершенно новую стойку. Она называется Kyber, которая позволяет нам подключить 144 GPU в одном домене NVLink. И вот стойка Kyber, я могу ее поднять, я уверен, но я не буду. Она довольно тяжелая. Это один вычислительный узел, и он вставляется в стойку Kyber вертикально. Вот куда он подключается. Это межплатная панель. Четыре верхних разъема NVLink стойки Kyber вставляются и подключаются к этому. И это становится одним из узлов. И каждая из этих стоек — это другой вычислительный узел. И вот удивительная часть. Это межплатная панель. А сзади межплатной панели, вместо кабельной системы, которая имеет свои ограничения в том, как далеко мы можем прокладывать кабели, медные кабели, у нас теперь есть эта система для подключения 144 GPU. Это новый NVLink. Он также устанавливается вертикально и подключается к межплатным панелям сзади. Вычисления спереди, коммутаторы NVLink сзади. Один гигантский компьютер. Итак, это Reuben Ultra, как я уже упоминал. Как я уже упоминал. Как насчет того, чтобы убрать это? Мне нужны остальные мои слайды. >> О, он спускается. Хорошо. Спасибо, Джанин. Это то, что происходит, когда вы Не торопитесь. Просто не поранитесь. Вы видели этот слайд. Вы знаете, только на ключевом докладе Nvidia вы увидите слайд прошлого года, представленный снова. И причина этого в том, что я просто хочу дать вам знать, что в прошлом году я сказал вам кое-что очень, очень важное. И это так важно. Стоит повторить вам снова. Это, вероятно, самый важный график для будущего фабрик ИИ. И каждый CEO, каждый CEO в мире будет отслеживать его. Будет очень глубоко изучать его. Он намного, намного сложнее этого. Он многомерный. Но вы будете изучать пропускную способность и скорость токенов ваших фабрик ИИ. Пропускная способность, скорость токенов при той же мощности, потому что это вся мощность, которая у вас есть. Пропускная способность и скорость токенов для ваших фабрик навсегда. И этот анализ напрямую приведет к вашим доходам. То, что вы сделаете в этом году, точно отразится в следующем году как ваши доходы. И этот график — это все. И я сказал, что на вертикальной оси, на вертикальной оси, спасибо вам. На вертикальной оси — пропускная способность. На горизонтальной оси — скорость токенов. Сегодня я покажу вам это, потому что мы можем увеличить скорость токенов, и потому что размеры моделей увеличиваются, потому что длина токена, контекстная длина, в зависимости от разных классов разных вариантов использования приложений, продолжает расти от, возможно, 100 000 токенов входной длины до, возможно, миллионов. Длина входных токенов растет, а также длина выходных токенов. И все это в конечном итоге влияет на маркетинг и ценообразование будущих токенов. Токены — это новый
И сегодня мы объявляем о целом ряде новых партнеров. Как вы знаете, мы давно работаем над беспилотными автомобилями. Настал момент GPT для беспилотных автомобилей. Теперь мы знаем, что можем успешно управлять автомобилями автономно. И сегодня мы объявляем четырех новых партнеров для платформы Nvidia, готовой к работе с роботакси. BYD, Hyundai, Nissan, Ji — все вместе, 18 миллионов автомобилей, производимых каждый год. присоединяются к нашим предыдущим партнерам: Mercedes, Toyota, GM. Количество автомобилей, готовых к работе с роботакси, в будущем будет невероятным. И мы также объявляем о крупном партнерстве с Uber. В нескольких городах мы будем развертывать и подключать эти готовые к работе с роботакси автомобили к их сети. И, таким образом, целый ряд новых автомобилей. У нас есть ABB, Universal Robotics, CUKA, так много робототехнических компаний здесь, и мы работаем с ними над реализацией наших моделей физического ИИ, интегрированных в систему симуляции, чтобы мы могли развернуть этих роботов на производственных линиях повсюду. У нас здесь Caterpillar. У нас даже есть T-Mobile. И причина в том, что в будущем радиовышка, которая раньше была радиовышкой, станет воздушной ИИ-RAM от NVIDIA. И, таким образом, это будет робототехническая радиовышка. Это означает, что она может анализировать трафик, выяснять, как регулировать формирование луча, чтобы сэкономить как можно больше энергии и увеличить как можно больше детализации. Здесь так много человекоподобных роботов, но один из моих любимых, один из моих любимых — это робот от Disney. Знаете что? Позвольте мне просто показать вам несколько видео. Давайте посмотрим на это первым. Первый глобальный вывод физического ИИ в масштабе здесь. Автономные транспортные средства. И с NVIDIA Alpamo автомобили теперь обладают способностью к рассуждению, помогая им безопасно и разумно работать в различных сценариях. Мы просим автомобиль комментировать свои действия. >> Я перестраиваюсь вправо, чтобы следовать своему маршруту. >> Объяснять свое мышление при принятии решений. >> В моей полосе стоит припаркованное в два ряда транспортное средство. Я объезжаю его. >> И следовать инструкциям. >> Привет, Mercedes. Можешь ускориться? >> Конечно, я ускорюсь. >> Это век физического ИИ и робототехники. По всему миру разработчики создают роботов всех видов. Но реальный мир чрезвычайно разнообразен, непредсказуем, полон крайних случаев. Данных реального мира никогда не будет достаточно для обучения каждому сценарию. Нам нужны данные, сгенерированные ИИ и симуляцией. Для роботов вычисления — это данные. Разработчики предварительно обучили фундаментальные модели мира на видео в масштабе интернета и демонстрациях человека и оценивают производительность модели, чтобы подготовить их к постобучению. Используя классическую и нейронную симуляцию, они генерируют огромные объемы синтетических данных и обучают политики в масштабе. Чтобы ускорить работу разработчиков, Nvidia создала открытый исходный код Isaac lab для обучения и оценки роботов в симуляции. Newton для расширяемой и ускоряемой GPU дифференцируемой физической симуляции. Cosmos world models для нейронной симуляции и Groot open robotics foundation models для рассуждения роботов и генерации действий. Имея достаточно вычислительных ресурсов, разработчики повсюду устраняют разрыв в данных физического ИИ. Paratas AI обучает своего робота-ассистента в операционной в NVIDIA Isaac Lab, умножая свои данные с помощью NVIDIA Cosmos World models. Skilled AI использует Isaac Lab и Cosmos для генерации данных постобучения для своего мозга Skilled AI. Они используют обучение с подкреплением, чтобы укрепить модель в тысячах вариаций. Humanoid использует Isaac Lab для обучения политик управления всем телом и манипуляциями. Hexagon Robotics использует Isaac Lab для обучения и генерации данных. Foxcon донастраивает модели Groot в Isaac Lab, как и Noble Machines. Disney research использует свой физический симулятор Chamino в Newton и Isaac lab для обучения политик для своих роботов-персонажей во всех вселенных. Da Does >> дамы и господа Олаф >> does проходит через Newton Newton работает. >> Вау. >> Omniverse работает. Олаф, как дела? >> Я так счастлив сейчас, что встречаюсь с тобой. >> Я знаю, потому что я дал тебе твой компьютер, Jetson. >> Что это? Ну, это у тебя в животе. >> Это будет потрясающе. >> И ты научился ходить внутри Omniverse. >> Я люблю ходить. Это намного лучше, чем ездить на олене, глядя на красивое небо. И это было благодаря физике, используя этот решатель Newton, который работает поверх Nvidia Warp, который мы совместно разработали с Disney и DeepMind, что позволило тебе адаптироваться к физическому миру. Посмотри на это. >> Не говоря уже о том, насколько ты умный. >> Я снеговик, а не снег. Можете себе это представить? Будущее Диснейленда. Все эти роботы, все эти персонажи бродят вокруг. >> О, >> знаете, я должен признать, я думал, ты будешь выше. Честно говоря, я никогда не видел такого низкого снеговика. >> Нет. >> Эй, знаешь что. Хочешь мне помочь? >> Ура. >> Хорошо. Обычно я закрываю основное выступление, рассказывая вам, что я вам сказал. Мы говорили об инференсе и рефлексии. Мы говорили об ИИ-фабрике. Мы говорили о революции открытых агентов, которая происходит. И, конечно, мы говорили о физическом ИИ и робототехнике. Но знаете что, почему бы нам не позвать друзей, чтобы они помогли нам закончить? >> Конечно. >> Хорошо, играй. Давай. >> Завершение симуляции. Привет. Есть кто-нибудь здесь? Основное выступление закончено. Все сказано. Дженсен наметил путь вперед. ИИ-фабрики оживают. Агенты учатся управлять с помощью открытых моделей для роботов. Теперь мы разберем все. Вычисления взорвались. То, что мы видели от CNN до открытых агентов, работающих по всей стране, но им нужна сила для удовлетворения спроса. Итак, мы увидели проблему, она была блестящей. Мы увеличили вычислительные мощности в 40 миллионов раз. Но когда-то в эпоху ИИ обучение было парадигмой. Конечно, оно учило модели, как инференс управляет всем миром, теперь показывает нам, кто является барами при 35-кратном снижении стоимости, Blackwell делает токены поющими видео, короля инференса. Да, наши фабрики когда-то занимали годы, поставщики тянули стойки и шестерни. Строились медленно, шаг за шагом. Не было четкого способа масштабировать этого зверя. DSX и Dynamo знают, что делать. Превращая мощность в доход. Агенты раньше ждали и смотрели, теперь действуют автономно. Но если они когда-нибудь попытаются отклониться, безопасные когти заблокируют и скажут «нет». Nemo claws там, чтобы охранять курс. И да, мои друзья, это открытое горе. Машины, которые думают, и дроиды, которые бегают. Это не кино. Все началось. Alamo диктует условия. Это момент GPT для ботов из симуляционных улиц. Теперь смотрите, как они едут. Поднимите руки за физический ИИ. Промышленная эпоха. Стройте то, что было раньше. Теперь мы строим для ИИ. Еще больше Vera Rubin плюс Grog создают всплеск инференса, объедините их, и теперь льется наличность, мы строим новую архитектуру каждый год, потому что когти продолжают кричать «больше токенов здесь», ИИ-стеки для всех, так что давайте все съедим пятислойный торт. Момент яркий, путь ясен, потому что открытые модели привели нас сюда. Когда данных не хватает, нет споров, мы просто генерируем больше с помощью вычислений. Роботы учатся без ошибок, подпитывая четыре закона масштабирования. Будущее здесь, не хотите ли прийти и посмотреть? Добро пожаловать, добро пожаловать всем на GTC. Хорошо, отличного GTC. Помашите. Спасибо всем. Я только что встретил.