Transcription
Студент PhD в UC Berkeley смог воспроизвести момент "аха" в Deep Seek на своей модели, и оказывается, это можно сделать всего за 30 долларов. Так что это на самом деле значит? Что этот человек достиг? Давайте разберем все по порядку.
Итак, позвольте мне немного подробнее рассказать о моменте "аха", прежде чем я покажу, как студент из Berkeley смог его воспроизвести.
Особенно интересным явлением, наблюдаемым во время обучения DeepS R10 (помните, это версия без настройки под инструкции), является возникновение момента "аха". Этот момент, как показано в таблице 3, происходит в промежуточной версии модели. В этот период она учится выделять больше времени на размышления о проблеме, переоценивая свой первоначальный подход. Это поведение не только свидетельствует о растущих способностях модели к рассуждению, но и является захватывающим примером того, как обучение с подкреплением может привести к неожиданным и сложным результатам.
И это ключевой момент. Это действительно то, что, я думаю, мы увидим гораздо больше в будущем этих LLM. У вас будет базовая LLM, обученная как обычно, а затем второй уровень, о котором только что говорил Дарио, CEO Anthropic, который представляет собой слой обучения с подкреплением, по сути, дающий правильные награды за правильные или неправильные ответы.
Теперь вот в чем дело: эта награда может быть четко определена только тогда, когда мы действительно знаем ответ на что-то — математика, логика, программирование. Но если вы просто попросите его заняться креативным письмом, то на открытый вопрос нет правильного ответа, и я коснусь этого немного позже.
Итак, это Япан, надеюсь, я правильно произношу ваше имя. Он студент PhD в UC Berkeley. Всего несколько дней назад он опубликовал этот твит: "Мы воспроизвели Deep Seek R10 в игре Countdown, и это просто работает через RL (обучение с подкреплением). Модель на базе 3B (3 миллиарда параметров) развивает способности к самопроверке и поиску самостоятельно. Вы можете испытать момент "аха" сами за менее чем 30 долларов. Вот код, вот что мы узнали".
Хорошо, позвольте мне объяснить, что все это значит. Одним из основных прорывов в статье Deep Seek было то, что они назвали моментом "аха", когда у модели появилась эта новая способность к глубокому мышлению. Они узнали, что через обучение с подкреплением модель начала развивать внутренний монолог и способность к размышлению самостоятельно. Им нужен был действительно хороший набор данных, и поэтому обучение с подкреплением действительно особенное.
Это тот же метод, который позволил AlphaGo из DeepMind обыграть лучших игроков в го в мире, не видя ни одной игры с аннотированными людьми. Она просто научилась играть в го самостоятельно, и это то, что они смогли показать в статье Deep Seek, имея очень четкую функцию награды. Модель смогла научиться думать.
Что подразумевается под функцией награды? Это простой способ сказать модели, правильно ли она ответила или нет. Теперь, если у вас есть очень открытый вопрос, то это действительно сложно сделать. Примером открытого вопроса может быть что-то вроде "Какой цвет лучший?" — на это нет правильного ответа, это просто мнение. Однако для математики, логики, рассуждений, программирования — это все области, в которых обычно есть очень определенный ответ. И когда у вас есть определенный ответ, вы можете сказать модели: "Да, ты ответила правильно" или "Нет, ты не ответила правильно", и тогда модель может просто пробовать снова и снова, пока не начнет отвечать правильно чаще, чем нет.
Итак, теперь, когда вы это понимаете, представьте, что вы берете эту концепцию и применяете ее в очень узком смысле, чтобы достичь момента "аха". Они сделали это с помощью игры Countdown. Игра Countdown — это игра, в которой игроки комбинируют числа с помощью базовой арифметики, чтобы достичь целевого числа. Здесь есть определенно правильный ответ, и с этим они могут создать очень четкий сигнал награды для модели.
Давайте посмотрим на пример того, как это выглядит на практике. Итак, вот пользователь, использующий числа 19, 36, 55 и 7, чтобы создать уравнение, равное 65. Ассистент: "Позвольте мне решить это шаг за шагом". Он проходит через множество итераций — это внутренний монолог — и затем дает окончательный ответ, и это правильный ответ.
Если вы хотите поиграть с Deep Seek R1 и другими замечательными открытыми моделями, вы можете сделать это на Amazon Bedrock от AWS. И особая благодарность AWS за спонсирование этого видео.
Итак, DeepS R1, как дистиллированные версии, так и полная версия, теперь доступны на Amazon Bedrock. Amazon была одной из первых компаний, которая имела четкое видение многомодельного будущего, и они удваивают свои усилия, добавляя Deep Seek. Теперь вы можете развернуть модели Deep Seek R1 как на Amazon Bedrock, так и на Amazon SageMaker AI.
Широкий и глубокий ассортимент моделей в Amazon Bedrock позволяет вам выбрать точные возможности, которые лучше всего соответствуют вашим уникальным потребностям. Все дело в выборе, и с Amazon Bedrock вы можете независимо оценивать свои взаимодействия с моделями, безопасность, контроль и легкость развертывания. Ознакомьтесь с Deep Seek R1 на AWS прямо сейчас, я оставлю ссылки в описании ниже.
Итак, вот рецепт, которому мы следуем: алгоритм Deep Seek R1. Учитывая базовую языковую модель, подсказки и истинную награду, мы запускаем RL, применяем его к игре Countdown. Результаты: это просто работает. По сути, что они обнаружили: с хорошей базовой моделью и обучением с подкреплением с очень четкой функцией награды модель начнет думать самостоятельно.
И это так безумно, чтобы об этом думать, особенно потому, что они смогли достичь этого в такой узкой области. Итак, возможно, это будущее. Мы говорили о тестовом обучении в прошлом, и все больше людей начинают говорить об этом прямо сейчас. Это, по сути, способность модели во время вывода корректировать свои собственные веса модели на основе подсказки.
Представьте, что это комбинируется с обучением с подкреплением во время тестирования. Я даже не знаю, возможно ли это, я просто спекулирую, но представьте себе комбинацию этих вещей, в которой у вас могут быть невероятно маленькие модели, решающие действительно сложные задачи, потому что они так специфически настроены под любую задачу.
Итак, давайте пройдемся по процессу. Модель начала с "пустых" выходов, что означало, что она была совершенно неверной или бессмысленной, но постепенно развила тактики, такие как пересмотр и поиск. И это произошло естественно, без толчков, без необходимости говорить: "Вот как думать об этом". Она просто пришла к этому мышлению.
В следующем примере модель предложила решение, самопроверила и итеративно пересмотрела, пока не сработало. Он также предоставляет ссылку на Weights and Biases, где вы можете увидеть полные эксперименты, если хотите углубиться в это.
Итак, вот как это выглядит: вы можете на самом деле увидеть производительность с течением времени, каждый из шагов обучения с подкреплением. Теперь одно из открытий заключается в том, что качество базовой модели имеет ключевое значение. Он пробовал на Quen 2.5 с 0.5B, 1.5B, 3B и 7B. 0.5B просто угадывает решение и останавливается, но как только они достигли 1.5B и выше, модель начала учиться искать, самопроверять и пересматривать свои решения.
Итак, что мы видим здесь: эта бордовая линия — это 0.5B, модель, которая не была достаточно хороша, чтобы достичь этой способности к мышлению. Мы видим небольшое увеличение производительности, а затем она выравнивается. Однако другие модели действительно резко поднялись, и, как мы видим, чем больше модель, тем лучше их производительность в целом.
Таким образом, начальное качество модели действительно важно, и либо базовая модель, либо модель с инструкциями работают. Модель с инструкциями учится быстрее, но сходится примерно к той же производительности, что и базовая. Выходы модели с инструкциями более структурированы и читаемы, поэтому дополнительная настройка инструкций не требуется, что поддерживает решение по дизайну R1.
Теперь помните, что R10 — это не модель с настройкой под инструкции. Итак, с Deep Seek у вас есть две модели: базовая неуправляемая R10 и просто R1 после того, как они внесли последние штрихи.
Итак, что мы видим здесь в желтом: это базовая модель, которая начинает немного хуже, но в конечном итоге оказывается в том же месте. А серый начинает немного лучше и снова оказывается в том же месте. Он также обнаружил, что фактический алгоритм обучения с подкреплением, который вы используете, на самом деле не имеет большого значения, что действительно интересно. Это такие классные находки, и Deep Seek все это запустил.
И это сила открытого кода. Теперь, очевидно, были люди, которые уже знали об этом, но как только статья Deep Seek была опубликована, как только люди увидели, насколько хороша эта модель и как ее можно воспроизвести, все начали экспериментировать. Сила открытого кода.
Итак, он продолжает: конкретный алгоритм обучения с подкреплением не имеет большого значения. Мы пробовали POO, GRPO и Prime, длинную цепочку размышлений, и все они, похоже, хорошо работают. У нас не было времени на настройку гиперпараметров, поэтому не хочу делать количественные выводы о том, какой алгоритм работает лучше.
И поведение рассуждений модели очень зависит от задачи. Для Countdown модель учится искать и самопроверять, однако для умножения чисел модель вместо этого учится разбивать задачу, используя правило распределения, и решать ее шаг за шагом.
Так интересно, что она действительно меняет свое поведение в зависимости от задачи. Вот почему я возвращаюсь к вопросу: а что если будущее — это действительно очень маленькие модели, выполняющие все это обучение с подкреплением, вычисления во время тестирования, обучение во время тестирования в момент вывода? Это так здорово думать об этом. У нас будут сотни, тысячи, миллионы этих крошечных моделей, которые могут быть гипернастроены под очень специфические сценарии.
Теперь оговорка, которую он оставляет в конце: это было проверено только на задаче Countdown и не на общем рассуждении. Мы ограничены вычислениями.
Теперь в этой теме автор ответил на множество вопросов, и я хочу рассмотреть некоторые из них, чтобы дать вам еще больше деталей о том, насколько это действительно круто.
Итак, есть ли какие-либо идеи о том, почему Open Llama достигает высокой длины ответа, но низких оценок? Open Llama не любит генерировать токены EOS, и поскольку мы не реализовали остановку после SL ответа, модель часто не может завершить работу. Мы не сообщали о результатах Open Llama в Twitter, так как считаем, что результаты значительно улучшатся, как только мы решим эту проблему.
Итак, снова, не имеет значения, к какой модели вы применяете эту технику, не имеет значения, какую технику обучения с подкреплением вы используете. Конечно, будут небольшие оптимизации здесь и там, но это так захватывающе, потому что это такая обобщенная возникающая способность от обучения с подкреплением.
Хорошо, еще один вопрос: к какому размеру модели и алгоритму относится упомянутые 30 долларов? Это 3B модель, модель с 3 миллиардами параметров, POO обучение с подкреплением, и это занимает 10 H100 часов, что составляет 30 долларов.
Еще один вопрос: есть ли у вас какие-либо наблюдения относительно изменений длины цепочки размышлений во время обучения? Есть ли график, показывающий увеличение длины цепочки размышлений во время обучения? Отличный вопрос. Ранние результаты показывают, что 3B модель изначально уменьшает длину вывода для правильного форматирования, а затем увеличивает длину цепочки размышлений для лучшей производительности. Вот как это выглядит: сначала длина вывода уменьшается, затем модель учится длинной цепочке размышлений, и она остается примерно равной, может быть, немного снижается со временем.
Теперь вот интересный вопрос: считаете ли вы, что цифры из оригинальной статьи о стоимости обучения правдоподобны? Да, с использованием смеси экспертов и fp8 (плавающая точка 8) это ожидаемо, и именно это Дарио, CEO Anthropic, только что сказал в своей статье.
Итак, если вы хотите поиграть с этим, он открыл все исходные коды, это называется Tiny Zero. Я оставлю ссылку на GitHub ниже. Набор данных, веса и смещения, все доступно. Открытый код побеждает. Если вам понравилось это видео, пожалуйста, поставьте лайк и подпишитесь, и увидимся в следующем видео.