Transcription
Если ИИ — это ракета, то что делает AMD стартовой площадкой? >> Мы накопили огромное количество интеллектуальной собственности и технологий. >> Как вы видите развитие этого в ближайшие пару лет или в более отдаленной перспективе? >> Я думаю, вы увидите, как гораздо больше инференса переместится на периферию. >> Всем привет, очень рад сегодняшнему разговору, поскольку мы погружаемся в видение и стратегию AMD в области ИИ с настоящим инсайдером. Рейн, как у тебя дела? >> У меня все хорошо, спасибо. Спасибо, Эван. >> Ну, спасибо, что пришли. Я очень ждал этого разговора. Прежде чем мы перейдем к деталям, возможно, представьтесь, расскажите о своей роли и о общей картине. Что AMD делает в области ИИ прямо сейчас? >> Конечно. Меня зовут Рамен Роуан, и я возглавляю группу в группе ИИ в AMD. >> И что AMD делает в области ИИ прямо сейчас? Ну, у нас есть продукты, которые могут ускорять ИИ от конечной точки до центров обработки данных. Так, на конечной точке у нас есть ИИ, работающий в беспилотных автомобилях, в спутниках, даже на Марсе, на марсоходе, в больницах, занимающийся аналитикой и геномной аналитикой и тому подобным, а затем у нас есть ИИ-ПК на ноутбуках и настольных компьютерах на периферии, а затем большие GPU Instinct в центрах обработки данных. Вау, это потрясающий портфель, потрясающая широта технологий, и центральное место в этом видении занимает открытый исходный код, что очень впечатляет. Возможно, расскажите об этом и о том, как AMD подходит к этому, возможно, несколько иначе, чем другие. >> Да, во-первых, весь наш стек является открытым исходным кодом. Так, программное обеспечение Rockm, которое является нашим программным стеком для программирования наших GPU, изначально было специализированным для HPC, поскольку AMD очень сильна в HPC. У нас есть два или три самых больших суперкомпьютера в мире. А затем, около трех лет назад, мы адаптировали его для ИИ, который использует, знаете ли, типы данных меньшего размера, такие как FP8, FP4, а не FP64, как в HPC. Таким образом, мы выпустили наш первый ИИ-GPU в 2023 году и адаптировали Rockham для всего стека ИИ, и все это с открытым исходным кодом. И мы также очень быстро поняли, что компании фактически используют программное обеспечение с открытым исходным кодом, например, если вы посмотрите на Open AAI, они используют свою собственную ветку BLM, которая является программным обеспечением с открытым исходным кодом для обслуживания инференса, а XAI использует свою собственную ветку SG lang, которая является еще одним программным обеспечением с открытым исходным кодом. Поэтому мы очень быстро начали работать с сообществом открытого исходного кода. Мы предоставляем им машины для ежедневного CI/CD и работы над поддержкой всех функций и всего остального, и это просто супер важно не только для предприятий, но даже для больших ИИ-лабораторий, все используют открытый исходный код. >> Абсолютно. И вы много говорите не только об этом программном инновации, но и о сочетании ее с лидерством в аппаратном обеспечении, огромной синергией. Как это проявляется в реальной производительности? Мы выпустили наш первый GPU в 2023 году и начали его продавать в 2024 году, и, по сути, мы прошли от 0% доли рынка до 5% доли рынка в наш первый год в области ИИ против самых мощных GPU. Верно. Так что мы чрезвычайно конкурентоспособны. Наши клиенты — не мелкие компании. Это, знаете ли, Open AIs и Metas мира. >> Да. Это потрясающе. И у вас так много разработчиков, так много примеров того, где синергия аппаратного и программного обеспечения уже принесла результаты. Можете ли вы рассказать о каких-либо историях или анекдотах, примерах, где вы получаете действительно измеримые приросты производительности или эффективности? >> Во-первых, наши GPU не просто конкурентоспособны в вычислениях, они фактически превосходят по памяти и пропускной способности памяти. Это связано с тем, что мы накопили огромное количество интеллектуальной собственности и технологий в области чиплетов. А именно, мы чиплетизируем наши устройства. Это не просто два с половиной D, как у нас есть иерархия памяти и ввод-вывод на первом этаже, а вычисления на втором этаже. И это позволяет нам упаковать гораздо больше вычислений в одно и то же устройство и разместить гораздо больше HBM. Просто чтобы дать вам представление, когда вышел наш первый ИИ-GPU, MI300X, у нас было 192 ГБ HBM, а у самого большого, лучшего, номер один GPU было всего 80 ГБ. Так что мы были примерно в два с половиной раза больше по объему памяти и более чем в 1,6 раза больше по пропускной способности, и, очевидно, LLM чрезвычайно требовательны не только к памяти, но и к пропускной способности памяти, по крайней мере, для стороны декодирования LLM, которая очень интенсивно использует пропускную способность памяти, и именно поэтому нас так быстро приняли Microsoft, Open AAI и Metas мира. Итак, это комбинация аппаратного и программного обеспечения, верно? Потому что затем, с точки зрения программного обеспечения, все движется очень быстро, но, честно говоря, состояние искусства в программном обеспечении больше не является проприетарным, нет проприетарного режима, это действительно открытый исходный код, это то, что делают VLM и SGANG, ни один проприетарный стек не может сравниться, они движутся слишком быстро. Так что с точки зрения программного обеспечения мы используем нашу память и пропускную способность памяти, одновременно идя в ногу с состоянием искусства, потому что мы напрямую работали и разрабатывали с открытым исходным кодом. >> Фантастика. И очевидно, что Frontier Labs и другие делают большие ставки на AMD для ИИ, и многое из этого происходит благодаря партнерству, которое действительно помогает формировать ваше будущее. Есть ли какие-либо уроки или идеи относительно этих партнерств и философии партнерства, которую вы продвигаете? Это действительно ключ к любой разработке продукта. Вы хотите работать очень тесно с пользователями вашей технологии, будь то клиенты или партнеры, и понимать пробелы, которые они видят, и заполнять эти пробелы. Итак, мы понимаем пробелы, работаем с ними, работаем с внутренней командой инженеров, предлагаем решения, и решения, которые клиенты действительно хорошо принимают. Мы их реализуем. >> Да. Возвращаясь к основам. Мне нравится. Вы упомянули, что технология AMD находится на Марсе. Я люблю эту аналогию. Я тоже фанат космических технологий. Так что, если ИИ — это ракета, то что делает AMD стартовой площадкой? Знаете, что такое центр управления полетами? У вас есть люди, партнерства, платформы. >> Я бы сказал, что стартовая площадка — это сообщество. >> Это действительно сообщество, сообщество открытого исходного кода, без них ничего бы не взлетело в данный момент. Опять же, было время, когда проприетарное программное обеспечение было единственным доступным и, следовательно, самым передовым. Это время давно прошло. И действительно, без открытого исходного кода ничего этого не могло бы произойти. Да, у нас есть отличные технологии. Да, у нас есть преимущества в чиплетах и 3D-упаковке и всем таком, но без сообщества открытого исходного кода ничего из этого не взлетело бы. >> Да, это фантастично наблюдать. Давайте поговорим о Rockom 7, вашей платформе для разработчиков. Она как бы эволюционировала из стека программного обеспечения для ИИ во что-то гораздо большее. Возможно, расскажите об этой эволюции, о том, где она находится и куда движется. >> Конечно. Итак, Rockom 7 — это большое изменение, поскольку мы полностью перестроили Rockam. Мы сократили его, сделали модульным. Сейчас он полностью открыт. Он находится на GitHub под названием The Rock. Так что это AMD The Rock, и вы можете установить только те части, которые вам нужны. И в то же время мы идем в ногу с потребностями. Так что у нас есть полный корпоративный стек ИИ. Когда корпоративная компания покупает наш GPU, что они делают? Им нужен способ запустить этот стек и начать распределять рабочие нагрузки и эффективно использовать GPU каждый час дня, верно? Итак, у нас есть полнофункциональный корпоративный стек, который также является открытым исходным кодом, который доступен. Мы фактически объявили о его широкой доступности только сегодня. Так что у нас есть блог на нашем сайте со всеми ссылками, необходимыми для доступа к нему. И еще одна большая вещь, которую мы делаем в Rockcomm 7, это также наверстать упущенное в новом тренде, который заключается в распределенном инференсе и дезагрегированном инференсе, потому что теперь, когда Frontier Lab выполняет инференс по крайней мере так же много, как и обучение, если не больше, эффективность инференса стала большой проблемой, и одна вещь, которую действительно поняло сообщество открытого исходного кода, заключается в том, что, дезагрегируя префил и декод. Префил — это часть LM, которая анализирует ваш запрос, который может быть, например, целой книгой для резюмирования, а декод — это часть, где он просто генерирует. Дезагрегируя эти две фазы и запуская их на разных пучках GPU, вы фактически получаете гораздо более высокую эффективность, потому что это просто специализированные рабочие нагрузки, которые вы не хотите запускать на одном и том же GPU, потому что они начнут мешать и замедлять друг друга. Так что это дезагрегированный инференс, и мы также включаем распределенный инференс в Rockcomm 7, который включает в себя, например, смесь экспертов, где вы можете запускать разных экспертов на разных GPU, вы объединяете экспертов и запускаете их на разных GPU, а затем вам приходится заботиться обо всем общении GPU-GPU, GPU фактически общаются напрямую, минуя весь сетевой стек, работающий на CPU. Так что все это идет с Rockcomm 7. >> Это фантастика. Есть ли какие-либо конкретные отрасли или рабочие нагрузки, которые, по вашему мнению, получат наибольшую выгоду и выделятся? >> Определенно LLM. Это один из основных сценариев использования, хотя мы также запускаем такие вещи, как диффузионный поиск, реклама, у нас есть клиенты сейчас действительно по всему спектру, генерация видео, генерация изображений, но многое из этого основано либо на внимании, либо на диффузии, либо просто на классическом ML для поиска рекомендаций. Это рабочие нагрузки, на которых мы в основном сосредоточены. >> Итак, очевидно, что конкурентная среда в области ИИ, и снижение затрат на развертывание имеет решающее значение. Стоимость владения находится под пристальным вниманием. Как вы думаете, как Rock 7 помогает организациям и предприятиям достичь этих целей? Стоимость очень, очень важна для наших клиентов. Для инференса, как и для обучения, вам просто нужно попытаться добиться максимальной утилизации ваших GPU. Это включает в себя использование как можно большего количества HPU, но также и использование как можно большего количества вычислений в GPU и генерацию токенов очень, очень быстро для вычислений и энергопотребления, которое у вас есть. Верно? Так что такие вещи, как распределенный инференс, в основном предназначены для оптимизации ROI. Так что это снижает стоимость за токен, по сути. Есть ли реальные примеры или эталонные показатели, демонстрирующие экономическую эффективность? Если вы выполняете инференс LLM старым способом, то есть так, как мы делали это 12 месяцев назад, по сравнению с использованием дезагрегированного и распределенного инференса на кластере GPU, вы, вероятно, можете сократить стоимость токена где-то между 10, 20, 30 раз. >> От 10 до 30 раз. Вау. Это блокбастер. Удивительно. Итак, немного отойдем от настоящего, происходит много интересного, но, возможно, расскажите о будущем вычислений ИИ. Как вы видите развитие этого в ближайшие пару лет или в более отдаленной перспективе? Есть ли какие-либо идеи, которыми вы можете поделиться? >> Я думаю, что в области инференса, честно говоря, поскольку периферийные устройства становятся все более и более мощными, я думаю, вы увидите, как гораздо больше инференса переместится на периферию. Через несколько лет мобильные телефоны будут обладать такой же мощностью, как и GPU в центре обработки данных сегодня. Так что да, вот как я это вижу. Я вижу, что инференс будет все больше и больше перемещаться на периферию, на конечную точку, и в конечном итоге, в более долгосрочной перспективе, даже обучение с помощью федеративного обучения, верно? Это больше похоже на 10 лет, возможно, с этого момента. Но я не думаю, что мы будем продолжать это неустойчивое потребление гигаватт для ИИ. Все это снизится, точно так же, как Cray потреблял 100 000 ватт, а теперь он потребляет четыре ватта в вашем кармане при в шесть миллиардов раз большей мощности. Это то, что произойдет и с ИИ. >> О, фантастично наблюдать. Итак, если бы мы могли перенестись в 2028 год, как в фильме «Назад в будущее», и какой этап или прорыв вы бы увидели, сигнализирующий о том, что видение ИИ действительно ожило? Что бы вы хотели представить там в будущем, в 2028 году? >> Я думаю, что единственное, что я хочу увидеть к 2028 году, это то, что ИИ докажет теорему, которую люди никогда не доказывали. >> Вау. Это был бы крупный прорыв. >> Как одна из >> одна из тысячелетних проблем или что-то в этом роде, или найти объединение теорий, которые Эйнштейн не мог, как бы прийти к квантовой гравитации или что-то в этом роде, что было бы фантастикой. >> Ну, это было бы, я не думаю, что нам даже нужен AGI, чтобы получить такие прорывы. Говоря о будущем и других темах, которые могут быть актуальны, вы думаете, мы увидим квантовые вычисления в реальном масштабе и с реальной пользой, реальным использованием в нашей жизни? Я знаю, что вы участвуете в различных... >> в наше время. >> Я скептически настроен, честно говоря. Я думаю, мы увидим много улучшений в квантовых вычислениях. Но одна из самых больших проблем в квантовых вычислениях заключается в том, что эти кубиты на самом деле не стабильны вообще, потому что вы знаете, они находятся в квантовом состоянии. Если они взаимодействуют с любой другой частицей, они коллапсируют. Поэтому они должны быть в вакууме. Они должны быть близки к абсолютному нулю. Вы не должны пропускать электромагнитные волны, потому что это похоже на фотон, попадающий в вашу частицу. Это очень, очень прихотливо, очень, очень чувствительно. Я думаю, мы все еще довольно далеки от того, чтобы иметь стабильные квантовые биты. >> Ну, это будет увлекательно наблюдать, это точно. Говоря о технологиях, которые меня волнуют, я недавно приобрел ИИ-ПК, работающий на AMD, и я делаю много классных локальных вещей, связанных с редактированием, видео и ИИ локально. >> Так что я в восторге. Но я технарь. Стал ранним последователем. Думаете ли вы, что ИИ-ПК действительно взлетят? Возможно, мы увидим больше на CES в январе, или, знаете ли, это все еще в основном история о центрах обработки данных и облаке? >> Скорость улучшения сделает ИИ-ПК через несколько лет, скажем, через год или два. Я думаю, что ИИ-ПК будут такими же мощными, как GPU в центрах обработки данных, возможно, трех-четырехлетней давности. >> И эта тенденция будет ускоряться. Да, я полностью верю, что это взлетит. >> Ну, приятно знать, что инвестиции были сделаны правильно. И последний вопрос: вы думаете, мы находимся в пузыре ИИ? Все СМИ и журналисты очень увлечены этой темой, или мы смотрим на рост, который действительно подкреплен фундаментальными изменениями? Происходит большой сдвиг в вычислениях, и это, по сути, превращает обычные алгоритмы, такие как оптимизационные алгоритмы, и даже алгоритмы, которые мы никогда раньше не могли написать в обычных, знаете ли, процессорных программах. Мы превращаем эти алгоритмы в глубокое обучение, и причина, по которой мы превращаем их в глубокое обучение, заключается в том, что глубокое обучение почти на 100% параллелизуемо. Алгоритмы, которые у нас были раньше, имели, скажем, около 20% последовательной части, и именно поэтому с многопоточностью мы никогда не могли улучшить более чем в 5 раз, если это 20% последовательных, 80% параллельных, лучшее, что вы можете сделать, используя максимальную многопоточность, это избавиться от 80%, но у вас все еще есть глубина 20%, поэтому вы ускоряете ее в 5 раз. С алгоритмами глубокого обучения у вас этого нет, это почти все параллельно, и вы можете ускорить алгоритм в 100 раз, тысячу раз, миллион раз, миллиард раз. Вы можете продолжать, и именно поэтому мы не просто ускоряем алгоритмы, как в HPC и всем таком, превращая части в глубокое обучение, но мы создаем новые алгоритмы, которые мы никогда раньше не могли сделать, такие как распознавание изображений, генерация видео, LLM. Все это требует сдвига в вычислениях, и я не думаю, что мы в пузыре. Я думаю, мы просто переходим к новому типу вычислений. Это в конечном итоге успокоится. Мы все еще находимся в экспоненциальной фазе. Это в конечном итоге стабилизируется через несколько лет. Да, есть много волнения. Возможно, есть некоторое чрезмерное волнение в отдельных частях рынка, но в целом я не думаю, что мы находимся в пузыре, который лопнет через год или два. Я в это не верю. Ну, я мог бы слушать вас часами, но, к сожалению, я должен вас отпустить. Большое спасибо за ваши идеи, взгляд инсайдера и краткий взгляд в будущее AMD. Я очень ценю это. >> Спасибо. Спасибо, Эван.