Transcription
И я и скептиков становится постепенно всё меньше и меньше. Я думал, ты скажешь всё больше из них. Мы разберёмся в том, как рассуждают reasoning lm. Очень грубо говоря, а reasonнгing модели - это модели, которые немножко думают перед тем, как начать говорить. Это неплохое качество и для людей. Вот уже лучше 95% людей получается, да? Ага. Выкусили AI, скептики. Чему всё-таки учат ль модели? Действительно, изюминка обучение с подкреплением заключается в том, что она может найти что-то совершенно новое, научиться решать задачу лучше, чем вот любой существующий человек, как бы, на Земле. Нужна правильная система мотивации. Как ты, э, реворновишь, настолько твоя модель и будет хорошей. Ничего непонятно, но очень интересно. Походу Егора нужно харить в Openi. Это мы после выпуска обсудим.
Всем привет. С вами подкаст Подлодка и его ведущая Егор Толстой. Это я и Катя Петрова. Всем привет. Я очень рад тому, что в чате у нас, а, в чате нашего подкаста "Я и скептиков" становится постепенно всё меньше и меньше. Я думал, ты скажешь всё больше жизни? Нет, всё меньше. А те, которые остаются и продолжают накидывать на выпуски, связанные с Иемям, а у них есть одно замечательное свойство. их рассуждения ломаются где-то на втором шаге. Поэтому сегодня, чтобы они поняли, что как а кожаные мешки они окончательно проиграли кремнеевы, мы разберёмся в том, как рассуждают reasoning lm. И для этого мы позвали к нам в гости Евгения Никишина, исследователя из Open AI, которые как раз-таки выпустили первую рассуждающую модель, который работает там над масштабированием рининг модели и тест компьютером. А, Женя, привет. А, привет. Э, спасибо большое за приглашение. Надеюсь, что у нас будет очень интересная дискуссия и, может быть, поменьше станет AI скептиков. Э, но в худшем случае как бы дам почву для размышления. Супер, супер. Я на это очень рассчитываю. Перед тем, как мы начнём разговаривать про тему выпуска, можешь немного рассказать про себя? Как вообще так получилось, что ты оказался в Openя и там тренируешь модели?
Да. А я учился в бакалавриате в МГУ. А, и где-то в середине второго курса как-то понемножку стал слышать про вот AI и машинное обучение. И вот сначала как бы просто вот слышал, потом взял пару каких-то курсов, потом поступил на кафедру, которая занималась машинным обучением. Там понемногу стал а [музыка] учить какие-то основы машинного обучения. А во время магистратуры в высшей школе экономики и колтехи я начал по чуть-чуть заниматься какими-то научными исследованиями. Мне это показалось э интересным. А и затем а я а решил поступить в аспирантуру. Вот в аспирантуре я занимался, уже стал как бы уже стала темой моей диссертации обучения с подкреплением Reinforcement Learning, который мы сегодня будем обсуждать, который является компонентом при обучении reasoning моделей. И после того, как я закончил аспирантуре, аспирантуру в а университете Монреале, а я а собеседовался в разные компании. А, и вот, к счастью, сложилось так, то, что, а, собеседование в OpenI прошло хорошо, а, а, там, как бы набирали людей с релевантным опытом, как бы там как раз вот а да, а, возрастал интерес к рейнингу, а, и взяли меня и вот уже начиная где-то с прошлого октября, а, работаю там, а над улучшением разниных моделей и думая над тем, вот какой будет там вот следующий generation resonли.
Очень круто. А раз уж ты рассказал, что работаешь над резнинг моделями, давай попробуем нашим слушателям дать такую сначала самую-самую теоретическую базу. Что вообще такое модели и чем они отличаются от других классов лмок?
Да ну. А, очень, грубо говоря, а reasonнгing модели - это модели, которые немножко думают перед тем, как начать говорить. Вот. В целом это неплохое качество и для людей. Вот уже лучше 95% людей получается. Ну, то есть выкусилиа скептики. Ну, то есть, да, вот есть традиционный класс лмов, которые как бы вот ты им даёшь какой-то запрос, и они тут же начинают генерировать токены, слова в ответ на запрос. Вот. А reasoning модели они, а, как правило, какое-то количество времени думают. А, и вот только после того, как они подумали, они начинают выдавать ответ. И, наверное, как можно догадаться, эта способность думать, она может быть полезна, когда а на вход модели даётся какой-то, может быть, не очень простой вопрос. Вот. То есть, если спросить у модели там, как дела, ну, наверное, а модель может как-то сразу начать, а, отвечать. А, а если спросить модели, а, вот можешь мне решить какое-то вот там сложное сложное там уравнение, то им может быть полезно а немножко подумать перед тем, как давать решение на уравнение.
Можно уточняющий вопрос? А что мы понимаем под словом думать, когда говорим об лмках? Ведь они всё, что могут - это генерировать токены, да? Что такое значит думать?
в контексте современных рининг моделей, как правило, это тоже, а, какие-то токены, а просто они не сразу напрямую отвечают на вопрос, а, и иногда они как бы вот, а, скрываются от, э, юзера, а, и вот только после того, как она, а, потратит какой-то вот, не знаю, бюджет этих токенов на то, чтобы подумать, а она начинает вот выдавать ответ. То есть, наверное, если посмотреть на чат GPT, то там как бы, если использовать такой вотнг, рассуждающую модель, а то, а, вот, как правило, там какое-то количество времени модель сначала думает, и там, ну, э, изначально, насколько я помню, просто вот полностью скрывался этот ch of, так называемый. А сейчас вроде бы там можно как-то его как-то на него посмотреть, но суть в том, что это такие вот может быть вспомогательные какие-то токены, которые вот не напрямую отвечают на вопрос, а вот помогают модели а сформулировать более аккуратный ответ там, да, для наших слушателей, которые никогда не видели, как рассуждение выглядят, а мне кажется, у дипсика довольно классно это сделано. Они выводят абсолютно всю цепочку рассуждений, которая у них есть. То есть, по-моему, они никак её не слопывают. Поэтому можно прямо в живом виде смотре в в лайфтайме смотреть, как модель думает. И там довольно прикольно это выглядит. Я когда первый раз это увидел, помню, прямо такой был прямо вау эффект.
А вот ещё вопрос. Ты упомянул как раз chфо. Не знаю, может быть, на него на этот вопрос проще будет попозже раскрыть, когда пойдём в деталь того, как это работает. Но зато сейчас, а насколько а можно, ну, в общем, не знаю, похожий получается результат, ээ когда мы просто промтированием за пытаемся заставить модель думать, потому что, да, вот этот вот chin ofфот в какой-то момент стал очень популярной практикой в написании промтов.
Да, да, действительно, это правда. Мне кажется, что статья про Chain of thought, может быть, читателям будет, слушателям будет полезно дать какой-то бэкграунд. Вот в, если я правильно помню, в а 2022 году вышла статья, а про chin of где, а показывалось, что вот если запромтить модель и особенным способом попросить её, условно говоря, думать, а, stepп-бастеп, а, пошагово, а, перед тем, как она, а, выдаст ответ, а, то, а, модели, а, демонстрировала, а лучше результаты, а, чем модель без такого как бы промптирования. Вот. И, наверное, а главное отличительная а черта а вот таких современных моделей, а, заключается в том, что модели заключается в том, что, а, они упрощают, э, может быть интерфейс для, а, пользователей. То есть раньше нужно было вот как-то, а, как-то вот прямо по-особенному запромть. Это вот как бы а возлагалось, получается, на человека, который пользуется лмкой. А теперь как бы они могут самостоятельно а подумать, как бы, а проще стало пользоваться этими этими моделями. Ну и как бы, разумеется область тоже эволюционировалась. сейчас не достигают как бы лучших результатов.
Угу. Ну, то есть, но по факту механика по сути одна работы получается, да? Можно так ска Мне кажется, да, похоже, похоже. А у меня тогда связанный вопрос. А вообще когда и за счёт чего случился прорыв в том, что вот были у нас обычные модели, но которые ты мог сказать действую степ byстп, и вдруг появились рассуждающие модели, собственно, что этот прорыв обусловило, когда он произошёл, почему все вокруг начали говорить про ризанинг внезапно.
Да. А, ну, наверное, так вот сразу такой сайд комен, что в науке, на самом деле, прогресс он происходит такой вот он он постепенно аккумулируется и просто в какой-то момент а он [музыка] аккумулируется настолько, что как бы достигается какой-то вот большой артефакт, и всё-таки вау, вот это вот классный артефакт. Вот вот это классная модель. Но а вот хочу перед тем, как отвечать на вопрос, а отметить то, что как бы ну довольно много а исследований про рининг было до непосредственного вот этого прорыва, но а прорыв, думаю, а заключался в прорыв произошёл, получается, в сентябре а прошлого года, а когда а вышла модель ОО1. И это, а, считалось прорывом. Это вот так встрясло многих, потому что эта модель обладала такой характеристикой, что а чем дольше она думает, тем а более аккуратный ответ она получает. Вот, то есть был достигнут так называемый test time compute scalen. А вот как бы подумать, это вот а эквивалентно, наверное, а тому, что ты больше тратишь компьюта во время применения модели. Вот. И вот time compute scal означает то, что как бы чем дольше мы думаем, а чем больше мы тратим test of time компьютера, а тем, а более аккуратные результаты получаются. И вот, наверное, до этого а таких моделей не было, и поэтому это считается таким большим э прорывом.
Угу. Вот я не знаю, насколько было понятно про про тест and computing. Вот, наверное, это для меня уже такая очень привычная терминология, но может быть для слушателей может быть полезно как-то что-то объяснить, поэтому а рад рад а что-то ещё добавить.
А, да нет, в целом в целом кажется логика понятная. Раньше у нас, э, в целом модель Ну, а, да, давай попробую объяснить, как я себе это представляю. До появления ренинг моделей у нас по сути не было никаких способов повлиять на качество генерации модели моделью ответа, кроме того, как правильно её запромптить. В целом, сколько у тебя там параметров было в модели на этапе обучения, ты с этим ничего не сделаешь. Сейчас у нас появился ещё один ползунок, который мы можем выкручивать. Если хотим получить более качественный ответ от модели, мы можем сделать так, чтобы она думала дольше по времени. Соответственно, мы потратим больше текенов на рассуждение. Это выйдет дороже, потому что видеокарточки дольше покрутятся. Ну и ответ будет, скорее всего, более качественным.
Да, да, примерно. А добавил бы, что, может быть, в дополнение к тому, чтобы, а, больше токенов потратить, можно было бы модель просто как бы раз прогнать, а потом выбрать, а, лучший ответ. Но дальше там как бы возникают вопрос: а каким образом выбирать наиболее лучший? И вот если эту модель каким-то образом давать юзерам, то а получается, да, нужно как вот там раз э её прогонять, а тут как бы вот просто а в таком таком вот естественном каком-то интерфейсе взаимодействия с человеком, модель просто вот дольше думает, а она вот как бы получается ей не нужно там а несколько ответов выдавать, она выдаёт один, но который как бы будет более точным. Вот. И да, а действительно, ты правильно сказал то, что у нас появился такой вот новый ползунок вот test time compute scalen а вдобавок к другим способам а улучшения моделей, а которые которые раньше были. Вот можно про это немножко поговорить. Вот были, а, была вот парадигма, а, в искусственном интеллекте, а, довольно продолжительное, а, количество времени, несколько лет, что вот люди поняли, что, ну, очень, грубо говоря, а если правильно обучать модель, то можно как бы её качество скелить с там набором параметров, а, с количеством данных, а, которые они поглощают и это было такое, может быть, а compute scalen, а вот теперь вот появился test compute scalen, и это вот обозначило новую такую парадигму в AI.
Угу. А можно ещё перед тем, как вперёд не ушли? Сори, мы просто несколько раз говорили о том, что вот ризинг модели позволяют получить ответ лучшего качества. А можем ещё поговорить чуть-чуть про то, какого что именно заключается в этом лучшем качестве. У нас целый выпуск был про то, как измерять качество модели. Я тут скорее, может быть, на какую-то конкретику сдеть. Например, кто-то говорит о том, что вот именно ризанг модели могут решать логические задачи, условно, да, вот раньше 2 + 2. Вот можем ли как-то вот так попробовать категоризировать?
Да, да, да. Супер. Ну вот действительно, что такое более аккуратный ответ? Э, наверное, зависит от, э, задачи, которые мы решаем. Если мы решаем какую-то, ну, простую математическую задачу, а то как бы что такое правильный или неправильный ответ? А часто это такой тривиальный вопрос, как бы там, ну, не знаю, вот уравнение решил, там, ну, там есть правильный, неправильный ответ. А дальше есть там, ну, не знаю, какие-то науки, допустим, физика, там тоже как бы а более объективная оценка вот правильности моделей. А бывают области, где где более субъективная оценка качества моделей. Вот, не знаю, вот, э, допустим, если написать, если дать задачи, дать задачу написать письмо, вот, или написать какой-то текст в целом, а, не знаю, какое-то, э, романтическое письмо, вот, э, ну, вот что такое вот хорошее, что такое плохое, это вот всё очень субъективно. Вот. А и посему, да, как как минимум можно сказать про то, что, а, в таких объективных э вещах модель просто стали модели просто стали более аккуратными. А, но а насколько я помню, когда вышел вышла модель там О1, там был какой-то блокпост, и там были какие-то, э, объективные, так называемые, эвалы, вот какие-то бенчмарки, на которых измеряется качество моделей, которые были связаны с а wн с написанием текстов, и там тоже каким-то образом это помогало. Вот это отвечает на вопрос.
Окей. Смотри, а можешь тогда немного рассказать ещё про О1? Что вот в подходе к обучению О1 отличалось от других моделей, что именно там появились вот эти вот способности к улучшенному рассуждению?
Да. Ну, а, наверное, э особенность подхода, а, обучения О1 модели, а, заключалась в том, что, а, при её обучении использовался, а, reinforcement learning, а, по-русски, наверное, это обучение с подкреплением. Это такая, а, под веветка, а, машинного обучения, под наука в искусственном интеллекте. а которая [музыка] учит модель а путём пя ошибок а вот модель она а каким-то а образом а что-то пытается э сделать и дальше а вот она получает сигнал то что ты сделала это хорошо или это плохо вот И можно про это, а, побольше поговорить, но, а, думаю, что вот это было как-то, а, отличительной способностью, а, отличающей чертой, а, модели ОО1, а, в то время как, наверное, много других подходов, они не делали подобную ставку на reinforcement learning. И вот оказалось, что вот такая ставка, она оказалась выигрышной.
А другие подходы это какие?
А, ну вот можно, например, а, взять и собрать просто датасет, а, где будет как бы на вход задача, на выход, а, ответ, а, и перед ответом будет какая-то вот цепочка рассуждений, которые как бы там, допустим, написал человек или, например, а, сгенерируя модель, а человек как бы разметил вот это вот было правильное правильный шаг в цепочке рассуждений или неправильный. Вот. Но понятное дело, что а такой подход он как бы а там есть botlк - это человек. То есть э собирать такие данные - это дорого. Вот собирать такие данные требуют как бы вмешательства а человека. А, и, ну, сложно, может быть, это не невозможно, но просто сложнее и, может быть, дороже таким образом обучить модель. Но как бы в теории, наверное, возможно. Вот. А при обучении с подкреплением, а, модель сама каким-то образом а пытается попробовать. вот, а, получает, э, награду, получает какой-то фидбэк и, э, на основе этого фидбека, а, улучшает свою способность рассуждать.
А, слушай, а есть ли сейчас какие-то другие рассуждающие модели, которые вот не на реинформент лернинге обучены не с его помощью, а вот с помощью каких-то других подходов или в итоге всё индустрия сконвержилась в обучение с подкреплением?
А, ну вот есть Deeps модель, у них есть какой-то репорт, где они говорят про детали обучения этой модели. И вот там, что интересно, это то, что они сначала учат модели, сначала учат одну модель с помощью обучения с подкреплением, а затем они учат вторую модель дистилировать ответы первой. То есть а первая модель учится вот таким образом, как мы только что обсудили. А вторая модель, она обучается путём того, что она спрашивает у первой модели: "Вот, чтобы ты ответила". А потом пытается как бы сымитировать то, что первая модель на генерировала. Вот. И как бы, ну вот с одной стороны как бы можно сказать, что вот это, а, там был задействован было задействовано обучение с подкреплением, а с другой стороны как бы, ну, вот это только вот посредственно оно было задействовано. Вот вторая вот эта модель, она обучалась а вот с помощью дистилляции, да. Вот есть есть такой дата point, который вот как бы интересный.
А вот я не знаю, насколько это относится к разнице в подходах к обучению и к подкреплению, но это тоже просто ты продиптик сказал. И я вспомнила, что я слышала, что они писали о том, что а как раз вот в ризанинг моделях, если не ограничивать модель в том, на каких языках она рассуждает, она начинает прыгать с одного языка на другой. Вот мне интересно, что-то с этим знанием сделали полезного? Может быть, ей вывели какой-то язык, на котором модели привычнее думать и лучше получается результаты.
Да, да, это действительно было довольно потежно. Вот когда я читал статью, а я такой: "О, а забавно, я думаю, наве". Ну я как бы не знаю детали а датасетов, которые использовали DeepsК. Там довольно довольно размыто написано. Но я могу предположить, что, может быть, они использовали какую-то смесь китайского и английского в своих датасетах. Вот. И поскольку, а, если я правильно помню, из деталей статьи, а, там не было особо никаких вот действительно ограничений на непосредственно цепочку рассуждений. Вот. Э, ну, получилось так, что вот каким-то образом модель [музыка] стала смешивать языки, просто потому что, наверное, она как бы достигала правильного ответа. И, э, если правильный ответ был достигнут, то, ну, давайте просто увеличим вероятность генерации такой вот цепочки рассуждений, как бы это, ну, это а обозначалось как правильная цепочка рассуждений. А, и вот, наверное, такой вот несколько смешной сайдэффект возник.
А так, короче, давай пора закопаться чуть поглубже. И про реформен learning хочется коро короче разобраться поглубше. Можешь поподробнее рассказать и про идею, и про отличие отvised unsed learning?
Ну, это я готов часами. обучение с подкреплением - это, а, с одной стороны как бы область науки, а с другой стороны это постановка задачи, а с третьей точки зрения - это эбор подходов, набор методов. А, но как правило, когда говорят про reinforcement learning, имеется в виду, что вот модель AI обучается путём пробы и ошибок. Вот, наверное, проще всего будет понять, что происходит, сравнив с другими областями AI supervised learning и unsupervised learning. Вот в supervis learning, а, как правило, наверное, это обучение с учителем, да, обучение без учителя. А в обучении с учителем, как правило, модель учится следующим образом. У нас есть датасет, а, в котором есть, а, код и есть, а, желаемый выход. А, а, ну, там опустим детали, как этот датасет собирается. Как правило, там, может быть, человек отмечает, э, какие правильные выходы для какого-то входа. Ну, вот есть такой вот датасет. А там могут быть много миллионов датапоинтов в этом датасете. А, но а суть в том, что, да, вот есть для каждого входа, а желаемый выход, и модель просто учится на этом датасете и, э, во время, собственно, применения этой нейросети, а, каким-то образом по новому входу, который она раньше не видела, пытается предсказать, какой был бы ответ. Вот, чтобы сделать дискуссию чуть менее абстрактной, а можно привести пример вот с обучением там, а, нейросетей для, а, распознавания картинок. Вот там, а, можно собрать такой набор данных, где у нас будет, а, на вход какая-то картинка, а на выходе а будет написано как бы, что находится на этой картинке. Там вот на картинке номер один находится корка, на картинке номер два находится собака, а на картинке номер три находится жираф. Вот и модели как бы для каждого входа, для каждой как бы будущей картинки учатся, а учится предсказывать, э, вот что на ней находится. Вот это вот э такая вот одна, а, стандартная стандартная парадигма в машинном обучении. Вот обучение с подкреплением, сорри, а обучение с учителем. А, а вторая тоже классическая парадигма, обучение без учителя, unsupervised learning, а, заключается в том, что, а, мы просто собираем большой большой большой, а, набор данных и, а, каким-то образом пытаемся, а, ну, выцепить закономерности из этого набора данных. Самый классический пример - это то, как происходит предобучение вот large моделей. А, собственно, выбирается большой большой большой большой набор текста. Как бы нет никаких вот как бы разметок вот там что в этом тексте находится как бы там, ну да, просто вот такая а набор строк, вот набор документов. А, и дальше вот модель, а, по, не знаю, каким-то словам, которые она наблюдает в тексте, учится предсказывать следующее слово, следующий токен. А, и за счёт такого обучения она в целом что-то понимает про то, как устроен язык. А, и вот появляются у неё вот возможности как бы говорить. А-а, и благодаря вот такой парадигме, благодаря лернингу, а, по большей части были вот достигнуты, э, такие модели, как там GPT 1 2 3 4. А, а, вот, а, это, собственно, обучение с без учителя. И, наконец, как бы отвечая на изначальный вопрос, а обучение с подкреплением построено так, что у нас, э, для каждого действия, а, которое совершает вот модель, а, у нас даётся какой-то фидбэк, а он как бы не обязательно нолик, не обязательно единичка, это может быть что угодно. Это такая вот относительная мера качества того, насколько было хороший произведено хорошее действие. А вот и модель просто этот фидбэк часто называется а наградой. Вот а за каждое своё действие ты получаешь какую-то награду. Там вот хорошие действия, они ведут к положительным наградам, а а плохие действия они ведут к отрицательным наградам. И модель учится как бы максимизировать эти награды, а производить такие действия, которые приведут как бы к наилучшему результату. Вот. А это такая вот абстрактная, может быть, а постановка задачи. И, собственно, наука, а она изучает эту постановку задачи и предлагает какие-то методы для решения такой задачи. А, и, наверное, вот я вижу, что у тебя какое-то смущение на лице. Можно, э, попытаться попытаться чуть развить тему и, а, копнуть вглубь.
Да, смотри, я я скорее пытаюсь Нет, концепция понятна, вообще отлично объяснил, спасибо. А я пытаюсь понять следующее, почему как вообще reinforcement learning связан именно с reasoningмоделями? Всё, что ты описываешь, кажется применимо и для обучения модели, которая будет не рассуждать, а просто сразу же генерировать токены на выходе. Типа, почему срtник вот этот этому прорыву помог вообще? Почему так?
Угу. Угу. Да. А-э, действительно, reinforcement learning может быть применёна к, а, большому другому, а-а, количеству задач, не только для, аэ, обучения резнинг моделей, но, в частности, для рининг-моделей, а, это было а полезно, потому что это помогло избежать, а, того, что я вот чуть раньше а упоминал, где вот нужно каким-то образом там собирать э данные человеком, размечать, э какие вот цепочки рассуждения были полезны, а а какие нет. А вот это а обучение с подкреплением помогает избежать а этого а шага путём того, что э модели ставится задача, она там что-то, а рассуждает, рассуждает, вот это вот такое действие производит э рассуждение. И дальше, а она, а, выдаёт какой-то ответ. Если ответ правильный, то она награждается. Если ответ неправильный, то модель как бы не награждается или там какое-то негативное награду получает.
Сейчас, а можно тут уточняющий вопросик? Я всё равно тут немножечко недопонимаю. Вот мы говорим, что не нужно как раз размечать, ну, потому что нам как раз разметка нужна, чтобы сказать правильно или неправильно. Вот. И тут как раз мы тоже говорим, если модель по что-то выдала, там шаг размышления, да, верно, мы её награждаем, но нам же, чтобы понять, надо ли наградить и насколько наградить, нам же всё равно какая-то должна быть система награждения. Ну, в смысле, откуда берутся эти правила.
Ага. Ага. Действительно, действительно, это хорошее замечание. А нужно человеку всё ещё как бы установить вот эту систему а наград. Вот. А, а, и, э, утверждение заключается в том, что, а, установить такую систему наград для большого класса задач может быть проще,
чемчем раз. Да. Дададада. Да. Ну, это как раз по сути, мне кажется, программирование уже сюда очень хорошо подходит. Тебе гораздо проще дать модели, я не знаю, Жень, поправь меня, но условно говоря, дать модели в самом простом случае компилятор, которому ты будешь отдавать сгенерированный моделью код и смотреть, скомпилировался он или нет, чем ручками присылать ей много-много вариантов решения задачи, где у тебя будет какой-то код помечен как неработающий, а какой-то как работающий.
Да, действительно, действительно. И вот сейчас одно из довольно популярных применений таких вот моделей — это как раз для написания кода, потому что, ну, код он тоже относится, может быть, к таким более каким-то объективным штукам. Там вот можно как бы посмотреть, твоя программа она вот верная или неверна выполнять задачу.
А вот ещё вопрос тогда про связь рининга как раз и реинфорсмент роллинга. Про то, что Егор спрашивал. Ещё раз вот тут можно прояснить. То есть награждение происходит, то есть у нас есть этап рассуждений, а есть этап ответа. Да. И я так понимаю, что награждение происходит именно в момент, не только в момент ответа, а в момент типа рассуждения, да? Ну то есть как вот если посмотреть на многие из статей, они поощряют а действительно рассуждения, а да, которые которые привели к правильному ответу. И таким образом как бы модель более вероятно в будущем после обучения ризонингу будет выдавать э правильные цепочки рассуждения и правильные ответы. То есть да, а и то и то а вознаграждается.
Слушай, а давай попробуем ещё приземлить рель на какие-то побольше реальных примеров, чтобы там и у нас, и у слушателей картинка сложилась в голове. Вот можешь прямо, не знаю, взять какие-нибудь домены, на которых можно обучать модель, давать правильный результат и рассказать, как вот такая реинфорсмен функция для них выглядела бы.
Угу. Первый пример, который приходит в голову — это какие-то, может быть, игры. Вот я не знаю, насколько это вот относится к а категории реальных или нереальных, но вот а исторически reinforcement learning очень часто применялся к а тому, чтобы научить компьютера играть в игры. Вот это могут быть какие-то игры типа там шахмат. Э, э, один из прорывов, э, в обучение с подкреплением, был, когда вышла программа Alpha Go. Э, вот там она играла в игру Go, которая, а, для слушателей, которые они никогда не слышали, ну, вот в каком-то очень-очень далёком приближении похоже там, может быть, на шашки. Вот. Но ладно, я думаю, то, что это не очень справедливое э сравнение, но это такая настольная игра, где нужно а камни а выкладывать и а согласно каким-то правилам как бы э больше территории получать. Кажется, го среди довольно популярно среди айтишников, типа. Ну да, дада, да, да. Часто один из примеров — это вот какие-то игры, и там награда она простая: ты либо выиграл, либо проиграл. И как бы в играх ещё такая, а, есть приятная особенность, то, что там, ну, если ты поиграл и, э, не выиграл, то ничего страшного. В этой нет, э, у этого нет никакой реальной стоимости. Там вот э вот компьютер прогнать, вот это вот вот вся э стоимость.
Другой пример, который на другом конце, может быть, спектра реальности, это, ну, вот можно взять и в теории, а, обучить с помощью обучения с подкреплением, аэ, какого-то такого агента, а, который за тебя будет продавать или покупать а какие-то акции. Вот. И тогда награда — это, условно говоря, количество денег, которые, а, агент, э-э, для тебя сделал. А там, а, можно как бы, э, а, э, дискуссию вести, насколько это действительно а хорошая идея, потому что агент в обучении с подкреплением обучается путём проб и ошибок. И для того, чтобы ему научиться делать что-то хорошо, ну, ему нужно некоторое количество ошибок всё-таки совершить. А, и вот дальше это вопрос уже для пользователя, как бы, хочет ли он, э, потерять какое-то количество денег для того, чтобы агент обучился. Ну, два таких. А представили лица, да, представили лица тех, кто обучил модель и увидел, что всё, что она делает, это скупает S&P 500 и держит 10 лет. Угу. как единственное разумное поведение. Дадада. Ну я бы я бы не был удивлён, если бы это был бы такой, может быть, первый какой-то локальный максимум, которому бы сошлась модель, потому что действительно говорят, что это хорошая идея. Я слышала в беспилотниках ещё используется, но только я не понимаю во, ну не во всех классах задач или во всех. Да, да, но здесь я уже здесь я уже совсем не знаю. Вот.
Слушай, а где Сейчас попробую сформулировать вопрос. А где границы применимости, условно говоря? А возьмём даже те же самые игры. Альфа Go такая довольно простая игра. Простая в плане набор правил, довольно небольшой. Аа при этом у нас есть более сложные игры. Не знаю, возьмём, а Doom etрal, а любой Doom, где ты делаешь очень-очень много разных действий, но всё равно в конце ты получаешь какой-то детерминистический результат. Ты типа либо победил, либо проиграл. А вот может ли такая сложная функция, как игровой движок, а служить для обучения с подкреплением или нет? То есть вот не знаю, понятно объяснил или нет. Короче, хочу какие-то границы применимости нащупать.
А, да, действительно, я думаю, что можно вполне себе обучить агента ARL, а на Doom Eternal. И, а, я думаю, что если контрастировать это с GO, то они сложные по-разному. Вот в го действительно очень простые правила, но так называемый branchн фактор очень большой. Что значит branchнфактор? Вот а го доска она, если я правильно помню, как бы 19 на1 клеток. Вот это вот опять же для слушателей, которые не знакомы. Вот в шаптах там 8 на8 клеток, а в Гох19. И получается как бы, когда ты думаешь, какой тебе следующий а ход а совершить, а то тебе нужно вот а вот э у тебя пространство выбора, пространство поиска оно вот 19х19. Ну сколько 19х на19? Это, по-моему, там один, ну, примерно 400. Вот. Да. Вот в таком, чтобы проще рассуждать, вот приблизим мы это четырёхстами. Вот, э, в каждой в а каждый набор, а в каждый во время каждого шага у тебя примерно 400 разных альтернатив. Вот. И как бы делаешь первый ход 400 альтернатив, второй ход примерно 400 альтернатив, третий ход 400 альтернатив. И получается там после трёх ходов как бы а количество возможностей это там а 400 в третьей степени. А дальше а игры они может быть, я не знаю, а сколько они а длялятся, как правило, но запросто могу себе представить, что там как минимум 100 шагов там они могут длиться. И вот 400 получается нам нужно возвести её в сотую степень. И вот это получится количество а возможных а получается игр. Вот количество возможных как бы траекторий, которые может игра принять. И есть какое-то такое утверждение, что количество возможных как бы состояний в а игре го, оно превышает а количество атомов во Вселенной. Ну, в общем, а всё это к чему я говорю? К тому, что типа очень большое пространство поиска, вот очень большой вот этот вот branchн фактор. Вот и по и это а делает игру go сложной. Вот. Поэтому там в 2015 году, а, когда вышла статья Альфа Го, это вот считался такой вот, а, прорыв, то, что вот она могла победить, э, а, чемпиона, а, мира, человека. А в этой игре а не было ожидание, что, может быть, ещё там, а, 5-10 лет потребуется для этого. Вот в то время как в Doom Eternal, я думаю, что тоже есть сложность, но она другого рода. в Doom Eternal как бы на вход подаётся, наверное, в самом, если наивно пытаться решать задачу, то, наверное, там подаётся как бы вот картинка, а что ты видишь? И, э, большая часть сложности, тебе нужно будет просто модель научить понимать, что происходит на экране. Вот. То есть, э, а, более как бы, аэ, если использовать терминологию, то нужно, а, в дополнение, а, ко всему решать задачу perception. Вот. То есть, э, модель, когда необычная, она вообще ничего не знает про мир. Вот ей нужно будет понять, что там вот вот этот, ээ, а, плохиш, если там он в тебя стреляет, то а у тебя уменьшается там здоровье, э, и в итоге ты проиграешь игру. Вот. А, а вот если ты подберёшь вот этот вот не знаю, там щиток вот или там какой-то что-то другое, там плюсик, то у тебя увеличится здоровье, увеличится там броня, а это тебе помогает, а, э, в итоге как бы пройти игру, а, получить положительную награду. Вот. И я думаю, то что и там, и там, а, обучение с подкреплением, а, применимо. А я думаю, просто как бы алгоритмам, а нужно было бы применять, наверное, разные алгоритмы, которые бы вот первая она в первом случае с Го нужен был бы алгоритм, который умел бы хорошо каким-то образом справляться с таким вот большим пространством поиска. А во втором случае какой-то алгоритм, который умел бы и какую-то нейросеть, которая умела бы в итоге хорошо решать задачи вот perception, там вот распознавать разные разные э там объекты и но как бы в целом и там и там реинфорсмен применим.
Угу. О'кей, спасибо. Я примерно понял. А ещё я вспоминаю, что когда-то читал разбор как раз там той самой игры Альфаго с там чемпионом мира пого. А, и там было там были такие мысли, что в какой-то момент модель начала, короче, когда модель начала побеждать, а игрок-человек очень сильно удивлялся тому, какие конкретно стратегии она выбирала. Это были ходы, которые он вообще никогда в жизни не видел, которые казались абсолютно алогичными, поэтому он не очень понимал, как на них реагировать, и она его удивляла и побеждала этим. Поэтому вопрос, наверное, такой: а вот чему всё-таки учат модели? Следованию каким-то привычным стратегиям поведения или поиску новых? То есть вот как в итоге обычно себя модели ведут, да?
А-а, действительно, изюминка, аэ, обучения с подкреплением заключается в том, что она может найти что-то совершенно новое, что-то совершенно экстраординарное, а, что раньше не было известно человеку. То есть во многом как бы человек сам учится путём проб и ошибок. И вот как бы потом, когда он чему-то научился, а в стандартных парадигмах, э, искусственного интеллекта, он может там, не знаю, а показать, а, я и модели, как ей нужно жить, как ей нужно решать задачи. Но как бы при обучении стандартными парадигмами машинного обучения, а модель как бы как говорится as good as human data. То есть, а если человеческая разметка заряжала какие-то неточности, то модель тоже, скорее всего, воспроизведёт эти неточности. Если а модель а обучалась на человеческих данных там в том числе, а при альфа, а в том числе при игре FGO, то, как правило, а, ну, она не может стать прямо сильно лучше, чем, а, люди, э, на партиях, а, которых она обучалась. Вот. А при обучении с подкреплением модель сама а-э вот свои собственные как бы попытки делает, а и получает какой-то вот фидбэк. А и за счёт того, что а модель а самостоятельно а пробует разные действия, а она может попробовать такое действие, которое раньше никакой человек не пробовал. И если оно в итоге приведёт к успеху, если оно в итоге приведёт к положительным наградам, то а модель вполне себе может а это выучить. И получается, а именно это и произошло в альфа. Вот она, а путём того, что из-за того, что она обучалась с с помощью обучения с подкреплением, она нашла какие-то совершенно новые стратегии. которые, э, которые были раньше там, ну, неизвестны человечеству. И когда модель в первый раз их демонстрировала, там люди такие, что вообще происходит, она, может быть, сошла с ума, вот сбой в программе. Потом оказалось так, что, а, это была просто а совершенно новая стратегия, которая просто никогда раньше никем не использовалась. И вот только после того, как модель выиграла, люди такие: "О, а вот оказывается это было вот вот таким просто долгосрочным, а, может быть, планированием. Это вот было такой вот какой-то новой стратегией, про которую мы раньше не знали. Вот. И это действительно то, может быть, чем меня привлёк reinforcement learning, то, что вот если обучать модели таким образом, они могут а получить что-то, что было бы лучше, чем вот какое-то знание, которое вот никогда раньше человек его не получал. а-а, а научиться решать задачу, а лучше, чем вот любой существующий человек, как бы на Земле.
У очень реально вдохновляюще звучит, потому что действительно может что-то супер необычно открыться. Я как раз в это время, пока погуглила, ну ладно, не погуглила, да, по чат GPTшила по поводу беспилотников, меня просто очень интересовало применение Ль там. И там как раз история про то, что полезен, потому что можно обучать всяким непредвиденным, чрезвычайным ситуациям. Именно потому, что разметки нет для этого, а там аллей на дорогу выбежал. Ну вот мало такого. А вот пнинг может помочь в этом. Но у меня в общем возник следующий вопрос в связи с этим тоже на понимание того, как это работает. Я сей по пути попробую сформулировать. А вот чтобы как бы правильные как бы эффективно модель обучалась, ну, нужна правильная система мотивации, чтобы существовало. Меня всё в этот шаг беспокоит, что нам не просто нужно научиться награждать, а нам нужно правильно награждать на каждом шагу, условно. Вот если я представляю игру в шахматы, допустим, я вообще не умею играть в шахматы, но очень упрощаю. Вот у нас есть какой-то шаг. И если у нас система мотивации какая-то очень тупая, серия, твою фигуру не съели, это значит плюс 100, то это может быть не очень ээ корректная история, ведь иногда выгоднее отдать свою фигуру. Вот из этого вопрос, наверное, такой: насколько является ли вот это создание правильных правил? Насколько это критично? Оно, ну, наверное, критично, но насколько, может быть, это, видимо, одна из тех проблем, над которыми бьются, чтобы сделать ли более эффективным?
Да, да, да, это очень хороший вопрос. И действительно, как бы, условно говоря, как ты рестановишь, настолько твоя модель и будет хорошей. Вот, вот как бы мне даже особо добавлять ничего не нужно к этому примеру. Вот в шахматах, если установить награду каким-то образом, которая будет вот поощрять, а, пошрять э поведение, которое, а, ведёт к тому, что игрок, а, не жертвует фигуры, то это может быть, э, как бы хорошо, краткосрочно, но приведёт к тому, что стратегия долгосрочная, она будет такой, а, ну, может быть, очень defensive, очень консервативной. и в итоге будет проигрывать. Вот иногда потому что всё-таки шаптах нужно не только защищаться, но и как-то атаковать. А вот и в этом а плане действительно как бы ну чрезвычайно важно установить правильную награду. Вот и ну консексиматами вот ну думается, что правильная награда — это всё-таки а выигрыш а или нет. Вот. Ам, и, ну, в конкретный шаг, ты же не знаешь, ты же не можешь в конкретный шаг всё просчитать до конца. И то есть получается, что просто то, что в конце, оно типа перевесит шаги. Ну да. Да. И оно как бы, видимо, там же есть какие-то веса. Ну, в итоге, да, да. И вот там, ну, вот это уже какие-то такие более технические детали, но вот там есть техники, как условно говоря, а, с самого конца. А, не знаю, как на русском это объяснить. Propagate, вот этот reво понять, что привело к такому конечному результату. Ну и вот, наверное, аналогия хорошая. А как, как про это можно думать? Это вот, э, не знаю, если думать в контексте работы, вот если думать про менеджера, а менеджер, наверное, он своих работников должен э ну это очень сложно, но как бы, наверное, стоит больше счёт [музыка] нужно поощрять, а результаты вот, а не активность. То есть можно там поощрять, чтобы там работник там сидел много-много часов на работе. Но если это не приводит к результатам, то это, ну, плохая система мотивации. А в то время как если а это вот такой пример, когда а ты думаешь, что, может быть, если ты будешь это поощрять, то это приведёт к результатам, но лучше поощрять напрямую результаты. Вот. Вот мне кажется, Угу. такую аналогию можно думать. Ээ и вот похожим образом, а происходит с искусственным интеллектом. Если будешь попрашивать не то, то как бы модель будет делать не то. Угу.
Я поняла. Тогда ещё следующий вопрос. А когда вообще выгодно поощрять не только результат? Ну, в смысле, тогда в играх кажется, зачем поощряться эти промежуточные состояния, если реально решает только результат партии?
Угу. Ну вот в контексте сейчас надо, надо надо подумать в контексте с играми а можно попытаться какие-то а ивристики придумать, чтобы а чтобы а поставить какие-то промежуточные а шаги. Вот, чтобы чтобы именно reворт, а функция пошила какие-то промежуточные шаги. А, но как бы это уже на свой страх и риск. Вот. Но, да, может быть, они действительно приведут к тому, что будет попроще учиться, но вот будет риск, а того, что а того, что как бы модель научится, а не так, а как ты предвидела, а максимизировать эту награду. Вот. Но, э, для того, чтобы как бы вот как-то был сигнал для обучения, помимо вот, э, того, что ты получаешь в самый последний момент, вот существуют просто некоторые методы, а, в обучении с подкреплением, а, а, которые называются, а, temporal difference, а, методы, а, которые позволяют тебе, условно говоря, а, каждый момент времени а построить некоторое ожидание. Вот. Вот думаешь, вот сейчас вот, а, наверное, это хорошая такая вот такое хорошее расположение доски. Вот я думаю, что если я буду продолжать играть, а, начиная отсюда, то, а, я, а-а, я достигну успеха. Вот. И вот можно как бы таким вот хитрым, а, рекурсивным способом использовать вот эти вот temporal difference методы, которые я только что назвал, которые будут позволять тебе строить вот а оценку хорошести а твоей текущей позиции. Вот. Но это уже как бы в такие технические детали мы пойдём. Я, а, с радостью, а, готов, э, про это рассказать, но не знаю, насколько это будет вот прямо интересно слушать нам вот такие вот подробности.
Не, если что интересно, вообще углубляйся. У нас люди привыкли, нече ничего непонятно, но очень интересно. Да, да, да. Не, ну вот, да, есть такая такой концепт в reinforcement learningнге, который называется value функция. А и она, а, собственно, а, а, в каждый момент времени говорит тебе, какая будет ожидаемая награда. А если ты вот с такого-то состояния начнёшь совершишь такое-то действие и дальше будешь действовать согласно той стратегии, которая у тебя была, а и а вот эту value функцию можно обучать, а путём того, а что, а, использовать её саму, но из будущего. А что это значит? Вот, допустим, у нас есть шахматная партия, она длится там, допустим, 30 ходов. Вот. А и получается у нас там, а, ну, если 30 ходов чёрных и белых, то у нас получается будет примерно 60 разных состояний доски. Вот. И, ну, условно говоря, там, а, вот эту для того, чтобы обучить, аэ, value функцию, для того, чтобы обучить оценку успеха в на бак на номер 20 внутри этой партии, можно использовать её же оценку, а, но во время шага номер 21. Вот. И вот таким образом, как бы вот рекурсивно мы можем, а с самого конца партии вот я не знаю русское слово, пропагет э сигнал до начала. Вот.
А у меня тогда сейчас у меня тут, ну, не то, что заключительно, мне кажется, у меня всё соединится пазл. А зачем, в чём преимущество для вот, ну, назовём системы обучения иметь эти сигналы посередине? Типа вот ты как раз упомянул где-то, что может будет эффективнее учиться. Что это значит? Ага. Нам каким-то образом нужно понимать, а какие действия в итоге привели к а чтобы логики типа училась, да? Чтобы как бы училась именно как это, ну, да, нам нам нужно понимать вот какие наши действия, они в итоге были полезны для достижения успеха, а какие нет. И вот эти эти методы, они как раз позволяют решать эту задачу. Вот понимание. А вот мы наделали много всего, да, по ходу нашей партии. Вот что было декомпозиция, типа. Да, да, да, да, да. Ой, о'кей. Да, мне кажется, что теперь встала на свои места. Ага. Мне кажется, ещё один пример тоже Жень. Поправь меня, прав я или нет. Но опять же, если мы возьмём а обучение программированию, то у тебя комплексные задачи какие-то состоят из нескольких шагов. Условно говоря, ты хочешь получить рабочий веб-сайт, тебе сначала там, не знаю, должен сгенерироваться какой-торпateт общий, который собирается, добавится какая-то фича, которая тоже компилируется и так далее достижения итогового результа результата. И здесь ты тоже можешь вот этой лиф функции оценивать много шагов, которые тебя в итоге приводят к конечному результату. Плюс, опять же, оценивать не только сам факт компиляции, но ещё какие-то параметры. Например, не знаю, линтер можешь подключить, который тебя даже в компилирующемся коде умеет там оттенки хорошести отличать.
Именно так. Именно так. Ээ, действительно, там, э, вот сложные какие-то программистские задачи. Там, наверное, они состоят из многого количества шагов. Вот. И и, ну, по ходу Егора нужно харить в Open. Aй, вот всё правильно говоришь. А это мы после выпуска обсудим. А, смотри, а давай я бы хотел попробовать теперь, э, вернуться кризаниing моделям. А и мне, наверное, было бы очень интересно послушать прямо такой детальный, э, рассказ про то, как именно выстроен пайплайн обучения таких моделей, что происходит под капотом, какие вот там value функции на самом деле используются. Поясню, откуда вопрос. А-а, типа на примере модели, которая умеет играть только в Alльpha Go. Всё понятно. Но, блин, О1 она умеет и в не в Alльфаго Go, а в го. О1 у тебя и в го может поиграть, и в шахматы, и код написать, и борщ тебе порассуждать, как самый лучший приготовить, и миллион задач сделать. Это что, типа, миллион value функций? А что там реинфорсится вообще? Короче, ничего непонятно. Расскажи.
Угу. Угу. Да-да, понимаю вопрос. Действительно, вот прикольно то, что раньше вот эти вот reinforcement learning system, они были как-то заточены под одну конкретную задачу, а а теперь они получаются такие вот а общие системы, которые и то, и другое а имеют. Вот. А, ну да. А, наверное, один из таких вот артефактов знания, вот это технический репорт технический репорт псик, э, в котором вот можно как раз подчерпнуть э какие-то какие-то методы того, как обучаются эти модели. Я думаю, то, что пайeline там был выстроен примерно таким образом. А имеется какая-то, а, какая-то, а, базовая модель, а, а, там, ну, вот для людей, которые знают, там, можно взять там ламу, а можно взять какую-то просто вот такую вот модель, которая стандартную лмку. А, и дальше вот установить процесс, а, где на вход модели будут подаваться какие-то задачи. Это может быть там, я не знаю, вот в литературе часто используются какие-то математические, кодерские задачи. Вот можно установить вот пайплайн, где на вход будут подаваться именно такие задачи. А модель будет рассуждать, рассуждать. А какие-то рассуждения будут приводить к успеху, а и мы в таким в таком случае будем будем поряд подобное рассуждение, а или же для задачи а какое-то количество рассуждений, какое-то количество попыток её решить, какое-то количество траекторий будут приводить к неуспеху. Вот. И там вот, ну, в частности dipek, а они, а, е, есть как бы опция либо не награждать, а просто их выкидывать, либо можно награждать негативно. Вот. И, э, вот если правильно помню, то deep псик они награждали негатив, вот неправильное рассуждение. Вот. И, а, э, э, после этого, а, а, наверное, как бы можно а каким-то образом эту а модель ну посмотреть на неё. Вот можно померить качество моделей и если качество удовлетворяющее, то, а, собственно, дать пользоваться людям. Ну, вот это вот как бы очень такой вот поверхностный пайплайн. -э несколько, ну, и части из него — это вот как бы, наверное, взять какую-то уже, а, существующую модель, а потом обучить её с помощью reinforcement лернинга, а выдавать рассуждение, э, и потом как бы после того, как мы удостоверили, что она хорошая, а нам нас удовлетворяют как бы числа на А, evaluations, а мы её как бы деплом юзером.
Угу. О'кей. А такой вопрос, э, что вообще эффективнее брать и обучать модель с нуля как думающую или брать какую-то существующую модель и вот её дофантюнивать, чтобы она думать училась?
Да. Ну, э, наверное, можно как бы такой мысленный эксперимент представить, ээ, а вот если бы мы учили модель вот прямо совсем с нуля, а рассуждением. Вот модель, которая вот совсем необычная, вот мы взяли совершенно рандомные весы. Она никогда раньше не виде
видел, не видела текст. Вот, скорее всего, сначала она будет выдавать просто какой-то шум, просто какие-то, какие-то, какие-то токены, которые, ну, вот вообще не информативные. Ты её спрашиваешь там, не знаю, в чём смысл жизни или там просишь её там, ну да, какую-то задачу по программированию решить. Она такая: "О, ну, а она, она начнёт тебе там восклицательный знак, там какие-то абсолютно случайные а токены выдавать. Вот. И понятное дело, что в таком случае там преобладающее большинство, скорее всего, типа просто все траектории, они не приведут к успеху, они не приведут к желаемому результату. Вот для того, чтобы просто у модели был шанс а получить какие-то положительные награды, а решать, решать, решать задачи правильно, а хотя бы иногда. Вот.
Ну, наверное, по-хорошему было бы инициализировать её вот не совсем с нуля. А ещё вопрос. Я всё зацепилась. Меня слишком заинтересовало, и я всё зацепила за эти систему мотивации и как они строятся. Мне почему-то кажется, что вот это супер интересный домен. Вот мы немножечко поговорили про то, как это может быть там с задачами программирования. В общем, более понятно с с какими-то задачами, где есть более объективный результат. Но в целом, вообще, как вот устроено награждение за успешные рассуждения? Что именно считается успехом? А вот говорили про написание романтического письма, например. Здесь у меня вопросики. А, ну да, действительно, как бы, ну, часть пайплайна - это нужно каким-то образом а установить, установить систему наград, э, и для доменов, где, ну, да, вот каких-то там более объективных науках там, а более очевидно, а для а более субъективных доменов это менее очевидно. Вот. И это просто как бы такая активно развивающаяся область науки. Мне кажется, там как бы явно не сказано последнее слово. А я думаю, как бы, вот сейчас ээ активно люди ведут исследования а про то, что делать. Э, я я, может быть, видел какие-то статьи. А я думаю, то, что это просто как бы люди понимают, что это такое ограничение. Вот. И это, а, да, а вопрос как бы научный открыт. Угу.
А кто вообще, как называется? Вот у вас есть в Open AI человек, кто сидит, придумывает этим правила, пишет веса. Что это за роль? А если у нас человек, а я в той части организации, которая как бы, а в под в подкоманде, которая непосредственно за reinforcement learning отвечает. Вот. А, и, э, ну, какие-то, да, нужно каким-то образом как бы поставить задачу, а нужно каким-то образом, а, собрать датасет, нужно каким-то образом, э, установить reward функцию. Ну, да, кто-то, наверное, должен это делать. Я просто какие-то захотелось креативные название, да, придумать эти роли. Ну, о'кей.
М, ещё вопрос. Мы в самом начале поговорили уже про chain of thought и в целом то, что механика одна. А вот такой уточняющий вопрос: насколько вообще модели, которые именно уже были, а в общем, learning модели, а которые с Reinforcement Learning были обучены, насколько они умнее, насколько лучше получаются результаты, чем chain of просто обычные модельки с chain of thoughts, которые работают? Я думаю, то, что они умнее, а просто потому, что а ну вот если смотреть на какие-то на какие-то предыдущие статьи, то а есть результаты, которые демонстрируют вот модель, которая была обучена reinforcement learning, а и сравнивается с моделями, которые просто были каким-то образом запромчены. Вот. И, а, если правильно всё было сделано, то, как правило, получается так, что, э, что вот эти reasoning модели, они а всё-таки получше, просто потому, что вот предобученные модели, они, а, может быть, не так явно а были обучены э там решать какие-то задачи. Вот. И то есть это по сравнению с моделью, которая не запромчена, промрование улучшает результаты. Но поскольку, а, а, это всё ещё такая вот базовая, просто предобученная модель, а, ну, вот то, что я видел в литературе, это то, что скорее они, а, проигрывают reasoning моделям.
Кажется, мы уже довольно много поговорили про то, как устроено обучение моделей. А давай немного поговорим про то, что происходит под капотом, когда пользователь обращается к reasoning модели. А как вообще процесс рассуждения под капотом работает? Да. А когда модель вводит свой запрос в чат, в интерфейс для использования модели, она начинает рассуждать, а, ну вот, да, у пользователя есть опция либо как-то, может быть, взглянуть на эти рассуждения, либо он просто может такой: "Ну ладно, я пойду там на кофе попью, пока она там рассуждает, а если там запрос особенно сложный". И после того, как она там, а, нарассуждалась, подумала, сформулировала, а, мысль, она начинает выдавать ответ. Вот. И почему я, э, сказал про кофе? Потому что сейчас как будто бы есть такой класс моделей, а, которые вот deep research, они кажется, называются. И эти deep research модели, они могут прямо вот э ну очень а долго а там а работать, прежде чем они выдадут э какой-то ответ. Но при этом из-за того, что они вот там могут запросто просто 15 а минут там что-то как-то работать, э им можно давать вот прям а совершенно нетривиальные задачи. Вот. Но, а отвечая на изначальный вопрос, эти модели, они, а, с точки зрения юзера, они вот просто какое-то время, а, берут, а, на то, чтобы работать, прежде чем они выдают, а, а, ответ, прежде чем они дают результат.
Так, ну, с точки зрения пользователя, да, с точки зрения модели, то есть как это выглядит, она ты в неё пришли твои токены на инпут, она сгенерировала текст рассуждения и его снова себе закинула в цикле на инпут или как это работает? Ну вот много моделей, они, а, действительно вот такие авторегрессионные, а, как они называются? Авторегрессионные, потому что они, а, собственно, а генерируют, э, последовательность токенов. И вот во время инференса они вот получили там на вход, допустим, там, ну, 50, а, токенов. И вот они как бы такие вот там пятьдесят первый сгенерировали, потом засунули это как бы как вход, пятьдесят второй засунули как вход, пятьдесят третий и так далее. Вот. И получается вот этот а да, chain of thought - это просто этот же вот набор токенов, которые она как бы последовательно там генерирует и и выдаёт результат.
List ради. Стоит отметить, что а есть какие-то а модели. А насколько я слышал от Гугла. Вот у них как будто бы была недавняя презентация про то, что они используют так называемые диффузионные, а языковые модели, а которые а не то чтобы прямо вот явно а авторегрессионные, они как бы а генерируют сразу такой вот блок а текста. А не обязательно вот как бы один one token at a time не обязательно вот там вот токен один сгенерировали, там скормили его обратно на вход. Вот а такой вот альтернативный подход есть про ээ с использованием а так называемой диффузии. Вот это какая-то техника в машинном обучении. Вот. Но суть заключается в том, что она как бы вот сразу выдаёт а блок текста. Вот. И а такое тоже возможно. Вот это такое, а скорее новшество в искусственном интеллекте. Пока что это, аэ, не особо не не сильно заисследование заисследованная, а, область, эээ, использования вот таких вот диффузионных моделей, но, а, как бы вот такая опция есть, и как будто бы там были тоже неплохие результаты. Вот когда модель генерировала вот, да, не авторегрессионно.
А как вообще регулируется и определяется, сколько должно рассуждение длиться, сколько в нём шагов, сколько токенов поправить? Это, не знаю, какой-нибудь там контроллер внутри модели есть, который говорит, там, типа, не трать больше 200.000 токинов на рассуждение или оно само как-то работает. Ну вот прелесть, да, заключается в том, что а оно само как-то работает. То есть, ну, наверное, есть какое-то прямо физическое ограничение. Вот, э, у у всех моделей есть так называемая длина контекста. Вот это, условно говоря, сколько они токенов а на сколько предыдущих токенов они могут как бы глядеть, когда генерируют следующий токен. Вот. Наверное, есть какие-то ограничения, которые а были бы связаны с а этим. Вот. А, но думаю, что как бы в зависимости от вопроса, в зависимости от того инпута, который даёт пользователей, а пользователь модель сама определяет, сколько ей нужно как бы подумать, а для того, чтобы а выдать какой-то ответ.
О'кей. О'кей, понял. А так смотри, а правильно ли я понимаю? Ну даже не так. А есть ли какие-то техники, которые позволяют решить проблему окна контекста? Я не знаю, может быть, какая-то внешняя память, куда шаги рассуждений записываются? То есть есть ли что-то вот интересное вокруг этого? Да, это интересный вопрос. А я не знаю, есть ли в литературе какие-то вот такие интересные комбинации. Это кажется какой-то естественной идеей. И может быть, сейчас вот ээ академический research он каким-то образом а исследует ээ это эту комбинацию подходов. Вот. А э я думаю, что а какие какие у меня первые мысли? А, ну вот если действительно, а будет продуктивно думать дольше, чем длина контекста, то как будто бы заиспользовать вот эти такие техники, которые как бы, ну, может быть, сохраняют в какой-то там, не знаю, на жёсткий диск, а, или там в оперативную память эти COT. А, наверное, это было бы полезно. Мне пока вот, да, неизвестно каких-то вот таких статей. а, которые а подобным занимаются, но как будто бы вот довольно довольно а естественная а идея.
О'кей. Аа буквально пару месяцев назад, наверное, а ресерчеры из Apple выпустили статью под названием, по-моему, "Иллюзия мышления", Illusion of Thinking. И что? Я деталей статьи не помню. Мы её в ссылке обязательно приложим. Но там, насколько я помню, идея была примерно такая. А, чуваки взяли разные модели, аа дали им разные логические задачи, которые вроде как не использовались в процессе обучения, и очень внимательно изучали саму вот Chain of Thought, который получался. А, и вывод, который они сделали, то, что модели на самом деле не мыслят, а создают иллюзию мышления, условно говоря, не понимают задачи, а пытаются воспроизвести то, как выглядит логика. Аа и делают вывод, что так и так настоящего мышления в reasoning моделях нет. Короче, расскажи, что думаешь про эту статью? Правда это? Неправда это вообще? Стоит ли ей верить? Да. Но, а, ну, во-первых, что что стоит отметить про такие исследования, это то, что они фундаментально носят не как бы а quantitative характер, а qualitative. Вот, э, на русской както можно произвести качественный, количественный. Вот, то есть это смотрит именно не на какие-то, а, там, э, конкретные числа, на каких-то конкретных бенчмарках, а они скорее, а, смотрят на какое-то вот, ээ, может быть, качественное поведение модели. Вот. И, а, когда, а, занимаешься подобным родом исследованием, как бы всегда а стоит помнить, что там фактов есть множество интерпретаций. Вот. А это, наверное, первая мысль, а, очень такая философская. А вторая мысль, она, а, про то, что действительно сейчас как бы, ну, вот, а, этиинг модели - это новинка. А вот там, да, вот появилось это LLaMA 1 в сентябре. Потом, если я правильно помню, весной вышло RLAIF от DeepMind, потом чуть позже вышла от Anthropic и от Гугла модель. Вот. И, э, времени так-то не очень много прошло для того, чтобы как бы вот как-то их понять, а как-то, а, как-то узнать вот как они по-настоящему работают. Вот. И, а, это всё, а, открытые вопросы. А я видел эту статью от Apple, видел точно также и другие, которые задаются похожим вопросом и приводят к качественно другим заключениям про то, что вот там reasoning модели они умеют вот ну они действительно может быть какие-то вот а паттерны, которые были а в предобучающих данных апе переиспользуют, но может быть они умеют это переиспользовать э по-новому. Вот как а человек а раньше не делал или как, э, а не было в аэ обучающих данных. Вот. А посему, как бы, я думаю, что на это стоит смотреть как на диалог такого научного коммьюнити, где просто предлагаются разные viewpoints и для каждого viewpoint приводится какие-то какие-то данные. то, что вот посмотрите, а вот мы сделали то-то и вот нам кажется, что а у модели вот такой а вот такое поведение, другая научная группа, она а мы у нас вот такие вот данные. И э мы, собственно, а пришли к другим выводам. И вот как бы это вот научная дискуссия таким вот образом бурлит. Вот. И через некоторое время, а, может быть, устанавливается консенсус. Вот. Поэтому, что я хочу сказать, типа вот на вот там, а действительно есть какое-то количество статей, которые утверждает, что там reasoning он там это всё не настоящее, это всё от лукавого, это всё иллюзия. Вот на каждую из них есть там статья про а то, что это на самом деле всё, а всё настоящее. Вот эта модели каким-то образом находит новые, а, стратегии, а, для обучения. А, и как бы, я думаю, это пока что просто открытый вопрос, потому что, опять же, а не было достаточно времени для того, чтобы как бы учёным а посмотреть, а, достаточно на эти модели. Вот. Мне кажется, вот интуитивно, может быть, это не очень как бы по-научному, но вот мне просто кажется, что вот из-за той изюминки в обучении с подкреплением, которое мы обсуждали, а что она может находить какие-то, а, собственные новые решения, которые были раньше, э, ну, которые, которые люди не знают. Вот у моделей есть как бы, ну, действительно такой нетривиальный шанс, а-э, найти какие-то совершенно новые решения, вот, э, которые которые не были доступны в аэпечающих данных.
Вопрос ещё такой, кажется, что все думающие такие модели, они генерируют явно больше символов, токенов текста, чем обычные. Пусть, может быть, не показывают этого, поэтому хочется поговорить про деньги. Вот как вообще в случае reasoning моделей устроен прайсинг, что оценивается. Также токены и, допустим, токены, которые продумание и про ответ, может, они как-то по-разному а тарифицируются. Да, да. Я на самом деле вот с этим плохо знаком, но что я видел, а это то, что а действительно даже для обычных а моделей а часто а цена за какие-то входные а токены а отличается от цены за а токены, которые на выходе. Вот. А и посему, э, опять же, я не знаю, но как бы предположу, что поскольку эти токены как бы используют, э, поскольку эти модели используют больше токенов на выходе для того, чтобы сформулировать как бы более качественный ответ, вот наверное прайсинг меняется соответствующим образом и как бы решает для себя а использовать использовать эту модель или нет. Нужно просто взвесить вот насколько для тебя важно получить вот именно более правильный ответ или как бы получить ответ быстрее или дешевле. Вот. А вот вот такие вот какие-то а первые мысли, которые приходит в голову.
Интересно будет потом посмотреть, может там какая-нибудь зависимость начинается просто от, ну, условно, от количества токенов, потому что как будто бы, если она просто прямая, там как-то суперкратно может порастаять. Ну, не знаю, не знаю. Подписка есть. О, доступно. Полетели. Хорошо, тогда следующий логичный вопрос. После прайсинга денег нет. Вот есть ли хорошие open sourceные модели, которые можно у себя захостить? А, и второй, ну, следующий вопрос, насколько есть ли разница у reasoning моделей в плане требования к ресурсам или это всё зависит только от параметров моделей, а тут опять же они просто дольше думают, поэтому как бы разница к это к параметрам системы нету. Ну, конечно, самое первое, что приходит в голову - это модель от DeepMind, которая выложена в Open source. А я я не смотрел самостоятельно, но могу предположить то, что там а просто доступен а доступны вот эти вот веса модели, а которые можно каким-то образом загрузить, захостить у себя локально и использовать для того, чтобы ей, а, посылать посылать какие-то запросы, получать какие-то ответы, а или при желании, а, наверное, её даже можно каким-то образом fine-tune, дообучать на каком-то маленьком количестве данных, которые были бы специфично, а, для а ну вот а задачи, а которые которые а ты как пользователи а в которых ты заинтересован а как пользователь. Вот это а первое, что приходит в голову. А есть ли какие-то альтернативы, которые доступны? Пока больше ничего не приходит, э, в голову. Вот. То есть, а я бы, не знаю, спросил у какой-то из моделей, вот что сейчас доступно. Может быть, модель сделала бы Deep Research для меня. Вот. Ну вот вот первое, с чего если бы мне нужно было начинать, то, может быть, первое, с чего бы я начал, это вот, да, это а RLAIF модель. Там, по-моему, ещё буквально на днях Qwen выпускал, тоже китайская Alibaba, тоже модель, если я не ошибаюсь, у нас в чатиках шарили. Действительно, действительно была reasoning модель и действительно была от них был от них какой-то technical report. Думаю, что она действительно тоже доступна в open source. Может быть, она у меня в голове чуть меньше отложилась, просто из-за того, что была либо, э, ниже бенчмарки, числа на бенчмарке были или или просто из-за того, что они были вторые, э, среди open sourceных моделей.
Кстати говоря про как раз open sourceные модели, репорты, а, и вообще различия моделей, какие, вот если говорить именно про способность рассуждений, которые есть у модели, какие вообще параметры на это влияют больше всего или не знаю, если перефразировать, ээ чем больше параметров у модели, тем больше, тем лучше она рассуждает, насколько это верно? Ну, как бы вот, э, и да, и нет. Обычно аналогия, которую я привожу в таком случае- это две аналогии привожу в таком случае. Вот первое - это вот есть слон, у которого мозг прямо ну очень большой. А а есть человек, у которого мозг поменьше. А но при этом а там человек умеет писать, а слон, ну скорее не умеет. Вот. Я я не то, чтобы я не думаю, что я скажу, что там человек просто э умнее, а, чем слон. Я думаю, на каких-то задачах там навигации, может быть, слон будет умнее, а на каких-то там задачах, не знаю, записать интервью с подлодкой, а человек справится лучше. Вот. Ну вот такая вот аналогия приходит в голову, что мозг у человека меньше, чем у слона, но при этом на большом количестве задач может быть человек справляется в среднем и лучше. Вот это первая аналогия. А вторая такая историческая аналогия - это то, что даже если не смотреть на reasoning модели, а на обычные модели, то вот по-моему, в каком году вышло GPT-3, а там, наверное, в двадцать первом или что-то такое, а двадцатом, может быть, а той модели известно, что было типа 175, а миллиардов параметров, а и модель, ну, могла делать какие-то, а, вещи, а, достигала какие-то числа, а, на наборе бенчмарков для того, чтобы померить качество. Вот. В то же время в 2025 году есть большое количество такой моделей, которые размеры там 1 миллиард параметров, там 8 миллиардов параметров от той же, а, от того же Гугла, от той же, аэ, от той же меты. Вот. И, э, ну, я уже, конечно, не помню точные номера, э, не точные числа на бенчмарках, но вот, э, почти, наверное, эти модели, они на большинстве бенчмарков лучше, чем вот та вот модель с 175, а, миллиардами, а, параметров. Вот. А, и из этого можно какой-то извлечь урок, то не только количество параметров важно, но также важно там, не знаю, техники, которые используются для обучения, а данные, а, на которых, э, обучаются модели. Может быть, такие там какие-то были ещё архитектурные инновации, а, которые позволили как бы использовать параметры лучше. И я думаю, то, что всё то, что я говорю, оно точно также и а и а относится к reasoning моделям. Вот. И последнее, наверное, то, что добавлю это то, что Но тем не менее, а вот если посмотреть на там, а, текущее поколение моделей, а там всё-таки как бы есть, а, там модель, а, one billion parameters, типа 1 миллиард, 8 миллиардов, а, ну, и сколько там много миллиардов, 70, по-моему. Вот. И всё-таки вот среди одного класса моделей, а если они правильно обучены, то вот наблюдается такая вот наблюдается скорее положительный тренд, а в качестве, но при этом они, конечно, а дороже. Вот поэтому поэтому как бы ответ такой: и да, и нет. Вот, то есть не только а количество параметров важно, но если использовать эти параметры как бы а правильно, то это может часто привести к а лучшим результатам.
А с точки зрения архитектур модели, есть ли какие-то, я не знаю, там под архитектуры, которые, не знаю, специально для reasoning модели используют? Вот мне приходит в голову статья, наверное, от Meta, которая предлагала, а, ну, как бы, а, идею новую, а, использовать архитектуру, в которой, э, как бы процесс размышления он будет происходить как бы не в пространстве токенов, а вот просто где-то внутри в таком латентном пространстве. модели. А, то есть как это лучше объяснить? А, а, во-первых, человек, когда думает, он может там, да, а, думать путём того, что он там разговаривает, а он может там что-то писать на листочке, а он может как бы там вот как-то как-то а думать, но не обязательно это вербализировать. Вот. То есть животные, они тоже как бы э умеют думать. Вот. М они не обязательно обладают языком, но при этом вот что-то там вот происходит у них в голове. И вот эта архитектура, которую предлагали исследователи из Meta, а она, а, наверное, э подобную подобный аналогии как бы inspired, а, и, а, э, пытается сделать так, чтобы модели рассуждали как бы не только а путём того, что выдавали какие-то дополнительные токены, а ещё А я не знаю, либо это было вдобавок, либо, а, э, как альтернатива, но, в общем, а, просто вот размышлять там, а, в пространстве каких-то внутренних активаций, там, не знаю, если, а, если делать аналогии с человеком, то просто а да, вот какие-то там просто вот мысли внутри модели будут. Вот я, э, мне казалось, а, после того, как я мельком просмотрел эту статью, то, что там результаты были не слишком сильные, они были типа нормальные, они, может быть, были похожие на какие-то альтернативы, с которыми они сравнивали. А, но я думаю, то, что ну, ценна идея. Вот. И я думаю, то, что, ну да, с первой попытки не получилось, но может быть, будет какая-то другая группа исследователей, которая, а тоже какие-то, может быть, возьмёт эту идею, э, немножко её, а, по, э, не знаю, помассажируют вот каким-то какие-то другие, может быть, похожие техники используют, вот, и получат новые результаты. Вот. Ну вот этот а интересный интересный data point, который приходит в голову. Интересная статья вот особенность архитектуры для reasoning. Ага.
А про reasoning ещё а одну тему хотел обсудить. А если представим, что модель, а, я не знаю, для того, чтобы обучить модель, ещё дополнительно придумали какие-то функции, вложили время на то, чтобы научить её хорошо рассуждать в какой-то конкретной области, например, программирование. Насколько вот полученные моделью навыки рассуждения в этом домене могут переноситься на другие домены тоже? Или, например, математика. А последнюю там неделю все обсуждают то, как аэ там современные модели получили там от Гугла, от OpenAI и получили золотые медальки на э там международном соревновании по математике. Вот насколько стоит э а насколько стоит приходить к выводам, что если модели стали лучше решать уравнения, то они стали лучше рассуждать и в каких-то других областях тоже? Это, думаю, тоже открытый вопрос. И там явно не сказано последнее слово. Мы можем как бы на этот счёт порассуждать. А вот можно, а, можно подумать, как бы вот если есть человек там математик, вот он много учится математике, то, э, полезны ли эти или там учится играть в шахматы, а полезны ли эти знания для принятия решений в каких-то других областях жизни? Ну вот есть, не знаю, Гарри Каспаров, который известный гроссмейстер, вот который после, а, после этого стал заниматься какой-то другой деятельностью, которая не связана с шахматами, но она как будто бы часто приводит в пример, а какие-то, может быть, шахматные аналогии. Мне кажется, он всё-таки как-то вот видит мир, а видит в мире какие-то, может быть, паттерны похожи. Вот точно так же там с математиком, а математиками. Вот. Но есть такое вот интуитивное ощущение, что, э, это вот не то, чтобы прямо напрямую, а, полезно там в там юриспруденции или в какой-то другой а э области, но может быть вот там, а обучение математики может э развивать какую-то в целом а логику а и это может помогать в каких-то других жизненных ситуациях. Вот. И вот с моделями, как будто бы, э, тоже это такой вот открытый вопрос. А я, аэ, ну, наверное, зависит от того, как бы, насколько похожи, аа, задачи, э-э, которые, которые использовались для обучения, которые а которые используются для применения как бы а модели. Вот. Но это всё, как правило, ещё очень сложно мерить. И поэтому, а, может быть отчасти, но вот как бы очень чёткого ответа на это как будто бы нет, и там требуется, а, дополнительное исследование.
О'кей, принимается. И, э, напоследок я хотел ещё немного поговорить про, опять же, про вот то, что мы уже затрагивали, про то, какие открытые области сейчас есть, какие самые горячие, короче говоря, как а тема будет развиваться дальше. А, наверное, я бы отдельно послушал, поспрашивал тебя про то, какие перспективы ты видишь у reinforcement learning, какие там есть сейчас такие большие заметные тренды, на чем больше всего бьются лабы. А, и отдельно про рассуждающие модели, что здесь можно ожидать. Наверное, сначала отвечу на вопрос про reasoning модели, а поскольку он, наверное, чуть-чуть попроще. А, ну вот в AI в целом, а, в последние, а, в последние года, а, был тренд, что вот всё старались scale, а, там вот старались там количество данных scale, старались scale размеры, а, модели, там вот train там time, computer. Вот сейчас модели, а сейчас вот научили модели, а test compute scaling, а, и, э, научили модели как бы думать какое-то время. Вот если если использовать тот же чат GPT, то там модель она думает, может быть, вот и она думает сколько там, какое-то количество секунд, может быть, там минут. Вот если использовать если использовать там deep research модель, то она, по-моему, думает, может быть, 15 минут. Вот. А было бы классно, если бы мы могли там вот прям очень сложную задачу дать модели, она там автономно поработала бы, ну, не знаю, в день, а пришла, а, и пришла к, ну, не пришла, но пришла к тебе, а, назад с результатами, э, для вот этой очень сложной задачи, э, и сделала бы это там без ошибок. Вот. То есть, э, а, ну, наверное, логично предположить, что вот тренд с test compute scaling а будет продолжаться. Вот. И хотелось бы как бы всё более сложные, а, а-э, задать, чтобы модели решали, а, и как бы более автономно их решали, потому что, ну, текущее поколение моделей, оно всё-таки, а, оно всё-таки иногда совершает ошибки. Вот хочется, чтобы э ошибок было меньше. Вот аналогию, которую часто приводят, это то, что вот человек будет таким вот менеджером а разных э там моделей. Он там будет какие-то таски давать, вот, а модель будет какое-то время над ними работать и возвращаться назад с результатами. И вот человек будет как бы вот такой вот, да, вот менеджер там 100, а, стажёров. А вот это про reasoning модели, а про а обучение с подкреплением, а про reinforcement learning а поинтереснее. [музыка] довольно долгое количество времени reinforcement learning research он был сфокусирован на, наверное, двух доменах. Вот. Первый домен - это игры, а второй домен - это, а, робототехника. А и а когда вот вышли, а вышла статья AlphaGo в 2015 году, ещё перед этим была статья про Deep Q Network, а, которая играла в э различные Atari игры, а, и училась это делать как бы самостоятельно, путём того, чтобы получала на вход просто вот вот пиксели вот. Вот. И училась максимизировать награду. В 2013 году это вот был Big deal. Это считалось прорывом, потому что, ну, казалось, что это очень сложно. А, и вот после вот этих двух больших результатов в тринадцатом, пятнадцатом году, а, область обучения с подкреплением стала использовать, а, а, стала использовать часто вот игры в качестве, а, домена. И наверное, в году двадцатом, может быть двадцать третьем, стало понемножку появляться ощущение, что что-то мы слишком долго исследовали игры. Вот как бы учить агентов играть в игры - это, ну, хорошо, но а в целом было бы полезно, чтобы э они умели решать и какие-то такие более практические задачи. Вот. И когда вот в конце двадцать второго года вышло LLaMA 2, вот было известно, что а один из компонентов, а один из компонентов а обучения этой модели был так называемый RLHF, reinforcement learning from human feedback, типа обучение с подкреплением по ответам человека. Вот. А очень много следователей а туда а э перешли в в вот эту а под область перешли. Вот. И, э, наверное, это было обусловлено тем, что, да, вот было желание, а, а, было желание, каким-то образом, а, ну, поиследовать что-то новое, что было бы не играми. А вот сейчас вышло LLaMA 1 и стало и да, тоже было сказано в блокпосте, что это было достигнуто обычно с подкреплением, и многие исследователи как будто бы туда своё внимание перенаправили. Вот. А куда это будет э развиваться? Я думаю, то, что академический research ещё в продолжительное время будет смотреть на reasoning модели, потому что всё-таки есть некоторый, а, ну, gap между тем, что известно в индустриальных лабах и то, что известно как бы научному сообществу. А, но также думаю, что по-прежнему будут продолжать использоваться эти техники для того, чтобы учить роботов делать какие-то задачи. Вот. Э, вот, э, да, есть, есть целая под область robotics, про которую мы почти не говорили, но а там а как бы прогресс идёт вот я бы сказал медленно, но верно. Вот там просто вот они взаимодействуют уже там с роботами, с физическими такими роботами, которые там в реальном мире учатся. И из-за того, что они учатся в реальном мире, а не в виртуальном, там как бы всё гораздо сложнее. Там цикл итерации э побольше из-за того, что там человеку нужно самостоятельно там выставлять робота для того, чтобы он начинал учиться. Но а как бы там идёт прогресс и а reinforcement learning там активно используется. И я бы не был удивлён увидеть там в течение ближайших лет какие-то какие-то прорывы а в применении RL для Robotics. Вот. Но, а опять же RL - это очень такая, а, а, широкая, а, постановка задачи, а большая наука, а большой набор техник, вот, и, а, будет много других как бы применений, которые, да, мы пока не обсуждали.
О'кей. А-а, о'кей. А на этой ноте про то, что теперь нам надо откладывать деньги не только на оплату подписки чат GPT, но ещё и на то, чтобы через 3-4 года, наверное, пойти купить себе хорошего домашнего робота, обученного на с помощью подкрепления. Мы будем подводить чертой этому выпуску. А сегодня мы обсудили сразу две большие темы. Мы поговорили и про reasoning модели, и про, а, обучение с подкреплением, потому что они связаны довольно-таки тесно. А, и мне кажется, получилось супер клёво. Поэтому, Жень, спасибо тебе большое за то, что пришёл к нам и поделился своим опытом, притом постарался его рассказать так, чтобы было понятно даже нам с Катей. А, спасибо большое за приглашение. Мне было очень приятно поговорить. очень looking forward смотреть, как каким получится выпуск. А получится топовым наши я, короче, наши я и скептики скажут: "Егор, у меня к тебе традиционный вопросик". Э, давай. А что тебе нравится больше, чем хорошенечко готовиться к выпуску, готовить отличный структурированный план? задавать классные вопросы, комментарии, высказывать свои идеи и тем самым медленно, но верно прокладывать таки себе дорожку в Open AI. Больше этого, дорогие друзья, мне нравится работать в самой лучшей компании в мире под названием Jet Brains. Э, привет всем коллегам. Аа вот, а на самом деле мне нравится, когда вы слушаете наш подкаст на Ютубе, в подкастных приёмниках, в телеге, вообще, где угодно слушаете, ставите лайки. приходите к нам в канал и задаёте классные, интересные вопросы, которые мы потом передаём гостям, набрасываете на выпуски, хвалите их, пишите странные кринжовые комментарии в Ютубе. Но самое главное, мне нравится, когда вы наш подкаст ходите и рекомендуете всем своим друзьям, коллегам, мамам, папам, братьям, сёстрам, а незнакомцам в метро, короче говоря, всем рекомендуете. Это очень греет сердце. И на этом всё. Всем спасибо и всем пока-пока. Пока-пока.