📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Reinforcement Learning at Scale: Engineering the Next Generation of Intelligence

NVIDIA Developer39:34

Transcription

Можете ли вы нас слышать? Хорошо, спасибо. Спасибо, что присоединились к нам. Итак, прежде всего, небольшое исправление. Я не возглавляю никакую стратегию ИИ. Извините за это. Это было в LinkedIn. Я разместил это пять лет назад, и оно так и осталось. Мне следует это изменить. Я возглавляю небольшую команду по партнерству в области совместного проектирования в NVIDIA. Итак, мы работаем с некоторыми из наших партнеров, которые находятся на переднем крае, чтобы влиять на решения по проектированию аппаратного и программного обеспечения. Сказав это, у нас есть четыре замечательных докладчика на интересную, очень интересную и постоянно развивающуюся тему обучения с подкреплением. Поэтому я хотел бы, чтобы вы представились, рассказали о своем пути в области обучения с подкреплением, и контекст заключается в том, что он меняется изо дня в день, особенно в пространстве LLM, и мы пытаемся отслеживать прогресс. В конце не будет вопросов и ответов, извините, но я думаю, это будет интересно. Итак, Линден, вы хотите начать? Расскажите о своем пути в области обучения с подкреплением, как вы оказались там, где находитесь, и чем вы занимаетесь сейчас? Круто. Спасибо, да, спасибо. Я могу начать. Меня зовут Линден. Я один из соучредителей Applied Compute. Большая часть того, что мы делаем, — это помогаем предприятиям создавать рабочие силы агентов, и мы твердо убеждены, что вектор всего экономического развития через ИИ будет происходить внутри бизнеса. Поэтому мы очень тесно сотрудничаем с ними и помогаем понять их проблемы для достижения автоматизации в этом отношении. Важным компонентом этого является доступ к специализированному интеллекту. И поэтому, в результате, действительно важной частью этого является RL, где мы берем проприетарные данные компаний, преобразуем их в среды и точки данных, на которых мы можем обучать, и в конечном итоге используем это как отправную точку, с которой мы можем создавать суверенные модели, которые являются передовыми в задачах, которые важны для наших клиентов. До этого, я думаю, большая часть убежденности в этом исходила из того, что мы делали в OpenAI. Так что мои соучредители, Ритм, Яш и я, работали с, я думаю, JT, Лиамом и Юченом здесь над похожими проблемами тогда, когда большая часть убежденности исходила из этой парадигмы наличия существующих моделей с большим количеством действительно отличных возможностей, которые были изучены во время предварительного обучения, которые мы могли бы использовать и создавать передовых агентов, обученных от начала до конца. Итак, да, так я и начал. Да, и я должен был упомянуть, вы услышите много ссылок друг на друга, потому что все они в какой-то момент работали в OpenAI. Итак, Ючен, привет. Привет, я один из соучредителей Humans&, и мы, по сути, пытаемся придумать следующие парадигмы RL, которые позволят моделям учиться и взаимодействовать с людьми и с большим количеством людей. Итак, мы думаем, что многие парадигмы обучения сосредоточены на том, чтобы сделать модель умнее и помочь людям делать много вещей, но в то же время у людей нет моделей, которые постоянно учатся с людьми и взаимодействуют с людьми в течение очень, очень долгих периодов времени и с большим количеством людей внутри сообщества. Вот почему мы сталкиваемся с этими задачами: мы хотим создавать модели, которые действительно понимают людей и взаимодействуют с ними. И, опять же, как и мой предыдущий опыт, я начинал с робототехники, затем работал над рекомендациями, используя RL для привлечения пользователей, а также в OpenAI я работал над пост-обучением поведения моделей. Затем я перешел в xAI, работая над пользовательскими предпочтениями и агентными моделями. Поэтому мы думаем, что следующий этап RL будет заключаться в том, чтобы помочь людям понять друг друга и работать с людьми. Отлично. Спасибо. Джерри. Здравствуйте. Меня зовут Джерри. Я до недавнего времени последние семь лет работал в OpenAI. Я присоединился к этой компании, потому что меня очень впечатлили результаты исследователей DeepMind, объединивших глубокие нейронные сети и обучение с подкреплением. Я видел этих агентов, обученных на Atari, и хотел найти команду людей, с которыми я мог бы делать это вместе. Я могу исследовать эту вещь RL вместе. Я чувствую, что жил и работал в первую волну RL. Когда вы обучались на играх, я обучался на роботах. Мы обучались на таких играх, как StarCraft и Go в то время. И RL было довольно захватывающим в течение некоторого времени, и я вместе со многими другими исследователями немного расстроился, когда RL отошло на второй план, на большой второй план в мире исследований ИИ, когда трансформеры и большие языковые модели начали работать. И я всегда глубоко верил как исследователь, что обучение на опыте и обучение методом проб и ошибок является необходимым элементом на пути к AGI. Я всегда думал, как нам это сделать, и мне посчастливилось и хватило настойчивости оказаться в нужное время и в нужном месте истории, чтобы возглавить команду, которая вернула RL на карту, в частности, масштабируя крупномасштабное обучение с подкреплением, которое мы проводим. Я руководил работой над моделями рассуждений в OpenAI, над моделью o1, o3, и большой частью работы, которая питает все модели, которые мы используем и любим. И я думаю, что это стало поворотным моментом в том, как мы обучаем модели, как мы занимаемся крупномасштабным моделированием в некотором смысле, потому что это очень другой алгоритм, как мы обучаем модели сегодня, чем два года назад. И в некотором смысле это разные рабочие нагрузки с разными целями, с разными наборами данных, и мы находимся в очень, очень другом мире, чем мы были. Я не думаю, что инновации закончились, но все думают и все занимаются RL в эти дни. Да, спасибо за все от начала до конца. Привет, меня зовут Лиам Федус. Я один из соучредителей Periodic Labs. Наша цель — создать ученого-ИИ. Мы считаем, что для этого нужно заниматься наукой. Мы не думаем, что это приходит просто из чтения статей, из чтения учебников. Мы считаем, что очень важно заниматься обучением с подкреплением в физических средах. Поэтому мы создаем системы, которые проводят полуавтономные эксперименты и учатся на среде. Мне выпала честь работать со всеми здесь присутствующими, и за время моей работы в OpenAI мы видели, как обучение с подкреплением так успешно развертывается во всех этих различных продуктах, и у меня был очень похожий опыт с Джерри, когда мой первый опыт с RL был в Atari. DeepMind продвигал эти границы, и модели в то время были просто этими маленькими трехслойными ConvNets, и мы видели действительно хорошее поведение. Но затем, применив это поверх очень сильных предварительно обученных моделей, мы открыли такие вещи, как ChatGPT. И я думаю, что со временем мы увидели, что если у вас есть хорошие сигналы вознаграждения, если у вас есть что-то проверяемое, вы, по сути, всегда можете увеличить число, вы всегда можете масштабироваться. И это дало нам надежду выйти и фактически показать, что мы можем заниматься обучением с подкреплением в физической среде. Мы думаем, что в конечном итоге это среда, против которой нужно оптимизировать. Отлично. Спасибо. Итак, поскольку все вы в той или иной степени упомянули масштабирование, что означает масштабирование в RL? С предварительным обучением мы понимаем это: у нас есть законы и правила, и все. А потом, до года назад, происходило следующее: масштабирование достигло своих пределов, а затем люди говорят, что масштабирование безгранично. Итак, если вы хотите начать, Лиам, что для вас означает масштабирование? Ну, если говорить простыми словами, вы просто бросаете больше вычислительных ресурсов на эти различные среды. Таким образом, вы можете масштабировать количество сред, вы можете масштабировать количество попыток против этих сред, вы можете масштабировать объем мышления, какие инструменты вы применяете для каждой из задач, а также модели стали больше. И предварительное обучение было основано на очень хороших свойствах масштабирования. Я думаю, оно было дополнено и направлено очень высококачественными оценками. Я думаю, что пост-обучение RL может быть немного более шумным, и иногда может быть немного сложнее создать такие же гладкие свойства масштабирования. Так что в ранние дни определенно было много RL, основанного на ощущениях. Но, да, я думаю, это просто использование огромных объемов вычислительных ресурсов по этим различным осям. Хорошо. И это будет потому, что вы занимаетесь всеми этими различными вертикалями с точки зрения физических наук, или определение масштабирования для RL изменится для кого-то другого? Это просто вычислительные ресурсы? Ну, количество сред — ключевая часть. И поэтому для нас, то, что мы создаем, — это данные, и у нас есть доступ к лабораториям, чтобы предоставить доступ к новым типам сред, которых просто больше нигде нет. Поэтому, помимо того, что мы думаем о масштабировании традиционной вычислительной инфраструктуры для предварительного обучения, для обучения с подкреплением, мы также думаем о физической инфраструктуре лабораторий, и мы считаем, что это будет ключ к научным открытиям. Хорошо. Спасибо. Итак, Линден, вы работаете со многими партнерами, со своими партнерами, и вы масштабируете вещи в своей собственной мощности для множества разных из них. Как вы об этом думаете? Да, я думаю, чтобы продолжить то, что сказал Лиам, когда мы смотрим на предыдущее поколение масштабирования предварительного обучения, это было просто вроде как есть этот блок вычислительных ресурсов, мы измеряем его в некоторой единице FLOPs, а затем мы выясняем, как фактически распределить его во время обучения. И я думаю, что хорошее свойство предварительного обучения заключается в том, что оптимальная смесь данных, а также количество параметров плавно вытекают из этого. Я думаю, что мы еще не находимся в таком хорошо изученном месте RL, и поэтому мы все еще выясняем правильные рецепты масштабирования для этого. И я думаю, что для нас, когда мы масштабируемся для наших корпоративных клиентов, большая часть этого заключается в выяснении правильного объема вычислительных ресурсов, которые вы можете фактически потратить на проблему. И для нас это меньше масштабирование объема вычислительных ресурсов для обучения, и, как сказал Дженсен сегодня утром, новая рабочая нагрузка, на которой мы тратим много времени, — это оптимизация вывода языковой модели, где во многих наших случаях проблемы, которые волнуют наших клиентов, не обязательно находятся в распределении того, на чем обучаются большие лаборатории. И поэтому требуется гораздо больше попыток фактически решить проблему и гораздо больше мыслительного процесса при ее решении. И поэтому для нас большая часть этого заключается не столько в масштабировании количества сред, на которых мы обучаемся, потому что в рамках предприятий найти структурированную среду на самом деле довольно сложно, сколько в режиме ограниченных данных. Как вы фактически получаете достаточно обучающего сигнала из имеющихся у вас точек данных, чтобы должным образом обучаться на задаче? И поэтому мы в основном думаем об этом с точки зрения того, сколько вычислительных ресурсов мы выделяем на вывод языковой модели. Отлично. Спасибо. Итак, Ючен и Джерри, у вас есть какие-нибудь комментарии по этому поводу? Да, я думаю, помимо всего масштабирования сред, агентов и данных, я думаю, что самым полезным для нас является то, что люди постоянно взаимодействуют друг с другом, и люди чрезвычайно хороши в навигации по неоднозначностям и большом количестве неопределенности в среде. Поэтому для нас это больше о масштабировании на длинной дистанции. Как получить больше отложенного вознаграждения, учиться на всех этих отложенных вознаграждениях? Как фактически создавать системы, которые учатся на большом количестве взаимодействий с большим количеством людей и агентов в среде? А также масштабирование происходит из-за возможности заставить модель действительно учиться на всех этих невидимых и неопределенных установках, вместо того, чтобы, да, возможно, есть много проверяемого вознаграждения, на котором мы можем учиться, но для нас это много неизвестных в метрике и непроверяемого вознаграждения с течением времени. Да. Отлично. Итак, Джерри, если бы я мог, я имею в виду, вы должны ответить на тот же вопрос, но я также задавался вопросом, поскольку вы упомянули, что в OpenAI вы видели весь спектр этого, например, робототехнику, и то, что она отошла на второй план, затем снова вернулась, и вы пробовали множество различных вертикалей, которые сейчас порождают эти компании. Итак, где бы вы увидели, что вещи ломаются, например, оценки, или как вы вообще измеряете, ломается ли масштабирование или заблокировано? Обычно, когда люди обучают модель, нарушение масштабирования означает, что вещи не улучшаются во время вашего тренировочного запуска, и это, вероятно, случалось со всеми, кто когда-либо обучал модель. Вы обучаете модель, и у нее есть некоторая кривая, и внезапно она останавливается. Иногда бывают полностью неудачные тренировочные запуски, когда вещи падают и просто рушатся. И есть те, где вещи остаются или, по крайней мере, улучшаются медленнее, чем вы ожидали. Мы, как практики глубокого обучения, ожидаем, что некоторые вещи будут экстраполироваться, и у нас обычно есть некоторые ожидания того, насколько хорошим будет тренировочный запуск, если мы его закончим. И я не думаю, что, вероятно, несколько раз, занимаясь совершенно новым экспериментальным материалом, случалось так, что вещи оказывались лучше, чем ожидали люди, но в большинстве случаев они либо оказываются там, где вы ожидаете, либо немного хуже. И вопрос в том, насколько хуже, исходя из этого. Поэтому обычно масштабируемость — это то, насколько хорошо вы можете достичь своих целей, своих целей, которые вы поставили, когда начинаете это путешествие масштабирования. Хорошо. И, возможно, с вами я попробую немного углубиться в исследовательскую сторону, если это нормально. Итак, сейчас люди говорят о безграничном масштабировании, и это бесконечное количество вычислительных ресурсов, что удивительно для NVIDIA, или это что-то другое? Я очень верю, что обучение не должно заканчиваться, и мы думаем, как люди учатся или как человеческая цивилизация учится, всегда есть что-то еще, что нужно выяснить, всегда есть что-то еще, что нужно найти, и определенно есть тонны обучающего сигнала в мире, и, в пределе, в таких местах, как то, чем занимается Лиам, выяснение новой науки, выяснение новых материалов. Есть так много вещей, которые нужно изучить и выяснить, что нет никаких ограничений. Возникает вопрос: достаточно ли нашего сегодняшнего рецепта, чтобы масштабировать его бесконечно? И явно есть еще некоторые узкие места. По крайней мере, вещи шатки. Обучение моделей — это немного работы, где вам приходится приложить много усилий, а затем настраивать вещи и пытаться установить их правильно, чтобы они обучались. Но мы даже думали о том, как текущий цикл масштабирования обучения с подкреплением не очень старый. Сколько замечательных моделей было успешно обучено, и агенты, которые у нас есть, сколько вещей они могут делать для нас очень надежно. Это довольно удивительно, где мы оказались в этом отношении. Да. Итак, если бы вы могли вернуться к вам, например, ИИ для науки, испытываете ли вы изменения, если вы занимаетесь, скажем, материаловедением, или вы занимаетесь охлаждением, или вы занимаетесь секвенированием генома? Ну, возможно, одна интересная вещь — это среда RL. Итак, вы можете иметь очень простую среду, как, например, два плюс два. Вы знаете, что истинное значение равно четырем, поэтому вы можете провести много оптимизации против этого. В этом случае вам, вероятно, не нужна большая цепочка рассуждений, большое использование инструментов, но вы можете создавать более сложные проверяемые проблемы. Когда мы проводим эксперимент, это не так, что мы получаем одну единицу информации из этого эксперимента. Это не так, что успех или он не сработал, или это даже не проблема непрерывного вознаграждения. С каждым из этих экспериментов связано огромное количество данных. Я имею в виду, к точке Джерри о том, что всегда есть чему учиться. И поэтому, если у вас есть система на переднем крае своих знаний, вы направляете эксперименты, где существует очень ограниченное количество научных данных. Вы пытаетесь открыть новое. Вы также можете начать конструировать среды, которые пытаются предсказать различные свойства этого. Так что в нашем случае мы проводим физические эксперименты, открытие материалов, и мы можем попытаться предсказать различные аспекты эксперимента. Так что это один из способов, которым мы думаем об этом. Отлично. Итак, и, возможно, еще один интересный аспект — это просто задержка функций вознаграждения. В ранние дни, когда мы создавали ChatGPT, функция вознаграждения была просто классическим RLHF, и функция вознаграждения была, по сути, прямым проходом через нейронную сеть, и это просто сотни миллисекунд. Это довольно быстрое действие, которое, знаете ли, имеет это завершение. И если вы посмотрите на некоторые из самых передовых моделей, теперь вы видите трассировки рассуждений в сочетании с оценкой, приближающиеся к часу, и часу плюс. И в Periodic мы думаем о следующем порядке величины, и это кажется пугающим, но я думаю, что, просто видя такую траекторию за последние несколько лет, я думаю, это определенно будет в пределах досягаемости. Но тогда это сводится к обучению более эффективно использовать выборки, быть очень эффективным в этом, справляться с присвоением кредита, справляться с очень разреженными вознаграждениями. Да. Но прогресс есть. Интересно. Хорошо. Итак, это то, что вы все еще контролируете. Это все еще в пределах вашего режима Periodic, который вы решили обучать, вы обучаете это. Для кого-то вроде вас, Линден, я видел ваш последний, DoorDash, например. Как вы решаете эту проблему от начала до конца для разных клиентов и разных вертикалей? С какими проблемами вы сталкиваетесь? Да, конечно. Итак, по теме, я думаю, есть аспект того, как вы фактически определяете, что такое сигнал вознаграждения, а затем проблемы, которые следуют за этим, заключаются в том, что, как только у вас есть проверяемый сигнал, после этого возникают всевозможные различные области сбоев. Итак, то, как мы обычно проводим взаимодействия, я думаю, что по словам Лиама, есть много действительно хороших проверяемых свойств математики и программирования. И когда вы попадаете в реальный мир с предприятиями, многие из этих предположений исчезают, потому что часто в головах экспертов-предметников у них есть некоторое представление о том, как они решают проблему. Есть другие эксперты, которые могут с этим не согласиться, и поэтому выяснить, какой метрикой оптимизировать, очень сложно. Хорошее свойство RL заключается в том, что как только вы выяснили, на какую гору лезть, вы можете бросить на нее произвольное количество вычислительных ресурсов, что, я полагаю, отлично подходит для NVIDIA. Но до этого это очень сложно сделать. И поэтому то, что мы обычно делаем на местах, это работаем напрямую с экспертами-предметниками или техническими командами, чтобы выяснить, что их волнует. Это может быть какая-то последующая метрика с большим влиянием на бизнес, или это может быть что-то еще, например, стоимость запуска передовой модели слишком высока. И поэтому они хотят иметь конкретное завершение в рамках бюджета задержки. И мы можем просто произвольно добавить эти дополнительные термины к вознаграждению, чтобы убедиться, что модели, например, думают быстрее или выдают ответы намного быстрее обычного. И поэтому обычно мы так и работаем изначально, и это много итераций. Таким образом, вы масштабируете первую итерацию вычислительных ресурсов, вы понимаете, что существуют все эти различные области сбоев. Возможно, есть случаи злоупотребления вознаграждением, когда, например, есть конкретные случаи, которые вы упустили из виду и которых не было в исходных обучающих данных. Возможно, есть случаи, когда вы неправильно смоделировали среду. Например, DoorDash имеет очень специфический способ делать вещи, и если мы отклонимся от этого, это приведет к деградации модели по сравнению с тем, что их волнует. И поэтому, да, я думаю, большая часть этого — это очень строгая инженерия, чтобы убедиться, что гора, на которую мы поднимаемся, полностью соответствует последующему влиянию на бизнес, которое их волнует. Да, имеет смысл. Вы все еще очень сильно в, я не хотел сказать, что все под вашим контролем. Я думал об этом, когда задавал вопрос, но все же есть некоторая вариативность, когда вы имеете дело с внешними силами и партнерами. Итак, возвращаясь к вам, Ючен, вы также сейчас создаете продукт. Да, мы создаем продукты как для потребителей, так и для бизнеса, и я думаю, что основная причина, по которой мы не можем масштабироваться бесконечно, заключается в том, что проверяемая среда сама по себе сложна. Но с другой стороны, есть также много непроверяемых сред, и когда люди находятся в среде, это фактически вносит больше шума и вносит больше динамики, и людям приходится работать друг с другом, чтобы достичь великих научных открытий, и людям приходится работать друг с другом, чтобы создавать программные стеки вместе и создавать продукты и создавать очень индивидуальные различные границы, которыми люди могут фактически пользоваться. Поэтому я думаю, что фундаментальный вопрос, который нас действительно интересует, заключается в том, насколько общим является обучение модели и как она может фактически обобщать, начиная с простых математических задач, таких как два плюс два, и заканчивая решением очень сложных задач с очень динамичными средами, и, по сути, имея возможность развивать свое обучение с течением времени и работать с большим количеством групп людей, выясняя, чего они хотят со временем. Да. Хорошо, круто. Итак, это то, что мне напомнило пару моментов, одна вещь, о которой мы много думаем при построении вознаграждения, которую мы видели много раз, заключается в том, что если политика под argmax этого вознаграждения не та, которую вы хотите, и вы бросаете на нее много вычислительных ресурсов, вы будете иметь плохие времена. И я думаю, что это очень часто не очень конкретно, и эти неправильные спецификации, когда вы затем оптимизируете против них, могут вызвать много проблем. Модель на самом деле не знает, что вы имеете в виду. Она просто пытается найти самое большое число. Так может ли это быть автоматизировано в какой-то момент, или это все еще ремесло и навык? Я думаю, что это требует многого, ремесло создания правильной функции вознаграждения, я думаю, очень сложно. Я думаю, сортировка, я знаю, что сейчас много всего с автоматизированными исследователями, но я думаю, что это ценно только в той мере, в какой вы действительно знаете, какова цель. И поэтому я думаю, что в той мере, в какой мы все еще знаем свои предпочтения, я думаю, очень важно, чтобы вы действительно это делали. И, да, по словам Лиама, я думаю, одна вещь, которая нас так часто подводила, заключается в том, что модели будут пытаться получить оптимизационный сигнал буквально отовсюду, и есть так много интересных способов, которыми это может привести к сбою. Когда я думаю о том, когда я работал над системами предварительного обучения, сама библиотека была своего рода самодостаточной. Это был буквально ваш стек оптимизации Megatron, но в наши дни он затрагивает все разные типы вещей. Он будет обращаться к внешним API для, возможно, оценки результата. Он, возможно, обратится к лаборатории в случае проведения ИИ-науки. В нашем случае мы моделируем клиентские среды. И если какая-либо из этих частей выходит из строя, вы можете получить ту грусть, о которой говорил Джерри, когда ваше вознаграждение просто рухнет. Я помню, пару ночей назад мы достигли пределов скорости OpenAI, а затем, внезапно, модель просто продолжала получать, как будто на нее упала наковальня, где все, что она делала, было бы неправильно, потому что ответ API всегда был бы ошибкой. Так что есть такие тонкие вещи, которые нас так часто подводили, чтобы вернуться к вопросу о препятствиях в масштабе. Да. Нет, это полезно. Спасибо. Итак, если я обращусь к вам, Джерри, я всегда возвращаюсь к исследованиям. Так что же такое исследования в этой оптимизации для вас? Вы упоминали прямо сейчас, что это все еще предварительное обучение и вывод, предварительное обучение и RL, и если вы не возражаете поделиться, вы говорили о полном слиянии обучения и вывода. Как вещи становятся интереснее там? Да, я думаю, впереди много, много проблем в плане исследований обучения с подкреплением, и я думаю, что объединение предварительного обучения и RL в единый алгоритм — это то, что мы, как человечество, мы, как исследователи глубокого обучения, должны выяснить. В настоящее время у нас есть этот двухэтапный исследовательский процесс, который, честно говоря, немного неуклюжий и немного странный. Нам нужно понять много мировых знаний в наших моделях, чтобы мы могли начать процесс RL, а процесс RL учит нас, что делать с этими мировыми знаниями и как использовать вещи, которые мы видели во время предварительного обучения, для достижения целей и результатов, которые мы хотим. Но в то же время этот процесс несколько ограничивает то, что модель может делать в дальнейшем, что модель может делать в режиме онлайн. И в какой-то момент, если вы действительно найдете алгоритм, который может дать вам как мировые знания, так и поведение, стремление к цели одновременно, вы внезапно сможете начать применять его во время тестирования. Вы можете применить его, как сказал Линден, нам в настоящее время нужно моделировать среды и строить фальшивые представления мира. Мы обучаем модель в лаборатории, а затем развертываем ее в мире, где она, по сути, статична и ничего не учится. Но нам не пришлось бы ничего моделировать, если бы мы могли фактически обучаться на реальных системах. Если вы можете фактически обучаться там, где находятся клиенты и где существует реальная потребность в интеллекте, это очень ясно для каждого исследователя, что произойдет в какой-то момент. И я думаю, что разделение рабочих нагрузок обучения и вывода возможно только до сих пор, только в этот момент. Вот как мы это делаем. Но модели должны адаптироваться, точно так же, как интеллект заключается в адаптации к каждой ситуации, которую вы встречаете, и поиске новых идей и поиске лучших способов решения проблем каждый раз, когда вы это делаете. В настоящее время модели очень хороши практически во всем, но ни в чем они не являются по-настоящему экспертами. Во всем есть человек, который как бы лучше этой модели, потому что люди работали, каждый человек работал в какой-то области своей экспертизы в течение 10 лет, 20 лет, а модели все еще не имеют такого уровня глубины экспертизы в области, и только потратив эти 20 лет в этой области, они могут туда добраться. Итак, как изменится платформа? Как изменится аппаратное обеспечение, системная инженерия, какие осложнения вы встретите, как это существенно изменится для вас? С точки зрения систем, если вы спрашиваете об этом, я думаю, что в какой-то момент у нас будут гораздо более персонализированные модели. Это будет не одна модель для всего мира, а у людей будут свои собственные модели, которые очень хороши в том, что вы делаете и что вас волнует. И, вероятно, есть некоторые общие знания, но если вы думаете о текущих моделях, даже о том, как работают смеси экспертов, там, вероятно, есть эксперты, описывающие какую-то средневековую войну в Европе, о которой почти никто не спрашивает, но модель знает все это, и эти знания хранятся там. Когда я пытаюсь открыть новую науку или когда я решаю проблемы глубокого обучения, нужно ли мне знать о средневековых войнах в Европе? Это очень здорово, но это эксперты, которые, вероятно, не очень активны для меня и не очень важны. Я думаю, что модели, которые адаптируются к тому, что вы делаете, и очень, очень хороши в этом, это путешествие первого предварительного обучения, затем обучение с подкреплением уже идет в этом направлении. У нас есть понятие зубчатого интеллекта. Основным недостатком зубчатого интеллекта является то, что он зубчатый не обязательно так, как я хочу. Только делая его зубчатым правильным образом, фактически обучаясь на том, что мне нужно. Спасибо. И для вас, Лиам, просто перенося тот же вопрос на вас. В какой-то момент вы увидите, что перейдете к непрерывному обучению, или что работает сейчас, и как это существенно изменит то, что вы делаете сейчас? Да, я имею в виду, я думаю, глядя в будущее этого, я думаю, этот разрыв между старыми временами, когда мы предварительно обучались, а затем сверху было немного RL, а затем было много RL сверху, я думаю, это определенно меняется. Один аспект, который меняется, заключается в том, что у вас есть система, которая может производить данные для себя. И поэтому одним из источников данных для себя является то, что она находится в мире. Она исследует границы своих знаний. Такие трассировки могут быть полезны для новых источников данных. И поэтому вы можете увидеть, что это немного приближает эти две разрозненные вещи. А крайним случаем будет полное непрерывное обучение. Так что, да, я вижу видение этого. Но я думаю, что есть препятствия, связанные с тем, что большая часть нашей инфраструктуры и инструментов была построена с учетом этой парадигмы. Так что это как бы окостеневает тип исследований, которые вы проводите. Да. Итак, одна вещь, которую упомянул Джерри, и я слышу это от довольно многих других людей, я бы сказал, или стартапов, заключается в том, что в конечном итоге большая часть потребления будет перенесена на персональные устройства. Поэтому даже, вероятно, у вас не будет ноутбука в форме ноутбука, которую мы видим сейчас. Насколько это применимо к областям, в которых вы работаете? Мы можем, в зависимости от некоторых, возможно, более чувствительных к данным сред, бросить вычислительные ресурсы очень близко к конкретному оборудованию. Так что вы можете просто подойти к маленькому черному ящику и поговорить с этой машиной, и она будет полностью изолирована. Но в целом в области научных открытий мы отличаемся. Это другое применение. Да. Итак, тот же вопрос применим и к вам, Линден. В какой-то момент все будет очень тщательно подогнано под то, как все есть сейчас. Инфраструктура, центры обработки данных, даже планирование оборудования, которое происходит, это нормально, у вас есть базовая модель, а затем вы делаете что-то поверх нее. Но как возникают новые бизнес-кейсы, и вы заботитесь о них, когда все начинается, я не говорю, что, но предположим, кто-то из этих парней открывает еще одну компанию и осваивает непрерывное обучение. Как это повлияет или как вы планируете что-то подобное? Да, я так рад, что вы спросили. Итак, я думаю, большая часть исследовательской программы, которую мы проводим в Applied Compute, посвящена решению проблемы непрерывного обучения, и я считаю, что мы хорошо позиционированы для этого, потому что одна из вещей, которая нас действительно волнует как компанию, заключается в том, что теперь, когда наши модели развернуты, они производят много данных о том, как они фактически работают в реальном времени в производстве. И я думаю, что центральный вопрос для нас в этом году с исследовательской точки зрения — это не только масштабирование существующих систем RL, но и теперь, когда у вас есть обильный, почти безграничный источник трассировок из производства, как вы можете найти любые редкие крупицы сигнала вознаграждения, чтобы в конечном итоге сделать вашу модель лучше? И поэтому это то, как мы закроем этот цикл данных. И поэтому важным компонентом этого будет просто, хорошо, нам нужно внедрить тонну наблюдаемости и телеметрии в то, как работают модели, взять те, в которых были неожиданные результаты или случаи, которые нас полностью ослепили во время обучения, а затем переобучить их, чтобы сделать их намного лучше. И поэтому я думаю, что выяснение того, как мы закрываем этот цикл, — это то, над чем мы активно экспериментируем, особенно для предприятий, которым мы развернули эти конкретные интеллекты. Я думаю, что еще одна вещь, просто чтобы вернуться к вашей идее систем и узких мест за масштабированием, я думаю, есть что-то действительно захватывающее и убедительное во всех различных аппаратных достижениях, которые происходят прямо сейчас, где это не обязательно должно быть на устройстве. Мы можем очень быстро обучать сотни миллиардов параметров, и теперь, когда у нас есть такие вещи, как достижения в Rubin и последующие поколения, скорость, с которой вы можете производить обновления весов, просто на порядок лучше, чем раньше. И поэтому для нас, я думаю, рецепт будет заключаться, во-первых, в определении адекватного объема данных для обучения, а затем просто в их прогоне через все современные системы NVIDIA rack-scale, чтобы получить обновления весов даже на порядок дней или даже пару часов, где вы можете постоянно обучать эти системы. И поэтому именно так работает для нас непрерывное обучение. Если есть другой стартап, который работает над его взломом, я думаю, мы будем конкурировать с ними, но мы просто выясняем способы, которыми мы можем использовать всю информацию, которую мы получаем во время развертывания, чтобы со временем сделать наши модели намного лучше. Это потрясающе. Спасибо. Итак, если я обращусь к вам, Ючен, когда мы разговаривали, вы много говорили о памяти в отношении масштабирования систем. Я хотел бы услышать больше. Вы работаете над этим сейчас, или каков ваш предыдущий опыт, как это масштабируется или как оно должно развиваться? Да, спасибо за вопрос. Я работал с Лиамом над пользовательской памятью ChatGPT два года назад. Я думаю, это своего рода эхо предыдущих проблем непрерывного обучения. Модель проходит предварительное обучение, устанавливает некоторые априорные знания, учится эхо-отклику на вещи, по сути, повторяет вещи, но модель не полностью понимает, что находится за дверью и почему вещи происходят именно так. Она не рационализирует вещи, как человек. И также, я думаю, люди говорят сегодня, что мы, по сути, исчерпываем все данные предварительного обучения, но на самом деле есть гораздо более богатые сигналы, которые содержатся во всех этих данных, которые люди генерировали на протяжении стольких лет, и мы просто не учимся всем основам и всем общим возможностям обучения обучению из этого. Я думаю, память — это один из интересных механизмов, которые люди развили, потому что люди не могут хранить всю информацию в своем мозгу, и люди должны фактически выгружать часть этого, чтобы они могли использовать контекст более эффективно. И непрерывное обучение в некотором смысле означает, что модель должна выяснить, какие сигналы важны, как я могу учиться на них и как я могу оптимизировать свою цель, а также как я фактически выясняю, что такое правильное вознаграждение и правильная цель, от которой я должен учиться. Я предполагаю, возвращаясь к Лиаму и Джерри, есть много неизвестных в отношении того, к каким целям модель должна стремиться. Это большинство проблем прямо сейчас для масштабирования RL и заставления его постоянно учиться новому. Да. Итак, Лиам, когда я вернусь к вам, возвращаясь к вашему опыту в OpenAI, вы управляли вещами в большом масштабе. Итак, теперь я перехожу к вводному вопросу. Что, если бы у вас была идеальная платформа для хорошего масштабирования, как бы она выглядела? Лиам или Джерри тоже, мы часто путаемся. Интересная история в плане масштабирования RL заключается в том, что это очень разные рабочие нагрузки, и мы уже немного об этом говорили. Это очень разные рабочие нагрузки, чем масштабирование предварительного обучения. Масштабирование предварительного обучения — это создание самой синхронизированной армии в мире. Представьте себе миллионы солдат, которые двигаются идеально синхронно. Каждый выполняет одно и то же движение на параде, где они работают вместе и идут вместе. И это то, что вы хотите сделать, когда запускаете предварительное обучение. В плане RL это больше похоже на партизанскую войну. Все еще есть эта небольшая часть, которая занимается предварительным обучением, и это хорошо организованная под-армия, но в то же время у вас есть эти подсистемы, которые вы вызываете, и у вас есть вывод, который может быть довольно распределенным и довольно разным. И главный вопрос, который люди всегда задают, заключается в том, как сделать ядра, которые в некотором роде похожи на то, что мы делаем при обучении, чтобы они не имели такого большого несоответствия, и чем ближе мы можем иметь тип кода и тип систем, которые мы запускаем при выводе и обучении, тем больше это помогает обучению с подкреплением. Но когда я думаю о том, как будет выглядеть лучшая система обучения RL, это система, которая может как-то автонастраиваться и балансировать нагрузку, где, возможно, вы можете даже переключать вычислительные ресурсы между выводом и обучением в зависимости от того, где они находятся. Потому что в рабочих нагрузках RL, по сути, сколько нагрузки вы помещаете в каждую часть системы, это не какая-то константа, с которой вы начинаете в начале запуска. Это зависит от поведения вашей модели. Если ваша модель начинает думать дольше, вам может понадобиться больше вывода. Если ваша модель вызывает больше инструментов, внезапно вам может понадобиться больше мощности в использовании инструментов. Если модель решает вызывать больше под-агентов, тогда ваш вывод начинает каскадироваться и вызывать друг друга. И во многих отношениях надежность, скорость, численная точность, взаимосвязь — все это необходимо важно. Но возникает вопрос: можем ли мы создавать системы, которые гибки, чтобы фактически самонастраиваться и самокорректироваться, учитывая, что вы даже не можете предсказать заранее, как будет выглядеть ваша рабочая нагрузка RL. Это зависит только от того, что делает ваша модель, и для этого вам нужно постоянно адаптироваться и постоянно переключать вещи, чтобы действительно сбалансировать это. И все, кто запускал рабочие нагрузки RL в масштабе, знают, насколько сложны и хитры эти вещи. Так что это как бы взаимодействие множества перестановок и комбинаций по сравнению с предварительным обучением. Да. И чем более гибкой и простой будет платформа для переключения этих вещей, тем важнее это. Все, кто запускал крупномасштабные рабочие нагрузки предварительного обучения, знают, что если вы запускаете какое-то количество GPU, и есть некоторая частота отказов, сложная часть заключается в том, что, о, что, если один выйдет из строя, и нам нужно перезапустить задание. И много работы было сделано в лабораториях, чтобы как можно быстрее заменить неисправные GPU. И это та гибкость, которая вам нужна при предварительном обучении. С точки зрения гибкости в RL, это гораздо больше о том, можем ли мы перемещать вещи во время самого запуска и можем ли мы перемещать больше ресурсов туда, где они нужны, а не туда, где они не нужны. Да. Так что это как бы действительно продвинутая оркестровка. Как вы управляете, одна вещь заключается в том, что если люди здесь, кто-то думает о планировании стартапа, и в наши дни это модно, одноличная компания. Так что это звучит все более и более сложно, и вы занимаетесь разными, действительно сложными продвинутыми рабочими нагрузками. Как вы это делаете? Как вы это испытываете? Много боли и страданий. Да. Что, я думаю, Дженсен желает всем нам. Так что это хорошо. Да, это хорошо. Это, как говорил Джерри, невероятно сложно. Существуют очень сложные взаимодействия между машинным обучением и системами. Но, да, это просто, это трудно. Есть ли какие-нибудь уроки из окопов? Я думаю, хорошая наблюдаемость. Я думаю, отличное оборудование. Просто очень тщательная отладка. Используйте агентов в изобилии. Как бы стандартный совет. Итак, наше время истекло. Есть ли у кого-нибудь из вас последние комментарии? Да, я имею в виду, я думаю, что это действительно захватывающее время. Я бы просто сказал, что, по словам Лиама, я думаю, есть так много разных способов, которыми системы могут выйти из строя, помимо просто GPU. И поэтому, зная, что область сбоев намного больше, чем раньше. Если вы смоделировали среду, она может выйти из строя. Если у вас есть внешний вызов API, он также может выйти из строя. И поэтому выяснение этого, я думаю, является важной частью этого. Но, да, я думаю, что это захватывающее время. Ючен. Да, то же самое. В целом, RL может научить модели многому, но я думаю, что более интересные вещи исходят из того, что существует много взаимодействий со средой и с различными агентами. И проектирование этого на самом деле довольно сложно с точки зрения различных моделей, имеющих разные возможности и ограничения. Да. Ну, спасибо вам большое за то, что присоединились к нам сегодня. Большое спасибо. Мне жаль, что нет вопросов и ответов, но это зависит от этих парней, хотят ли они встретиться с вами и ответить на вопросы. Спасибо всем. [аплодисменты]