📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

“Multistep Distillation via Moment Matching”: Faster Generation in Few Steps

LiSearch42:14

Transcription

Всем привет. Сегодня мы обсудим матрицу моделей работы для шагов. Это довольно старая статья, опубликованная в 2024 году. Ух, так что основная причина, по которой я хочу обсудить ее сегодня, заключается в том, что в 2026 году она была доработана в целом, они перенесли этот метод на модели скорости, и с этой точки зрения интересно посмотреть, потому что они как бы напоминали нашу функцию потерь, которую мы представили во всех идеальных обратных преобразованиях для различных языковых моделей, но да, и я хотел включить это в эту презентацию, на которую меня пригласили на выступление, которое будет в читательской группе об этих моделях, и поэтому я представлю эту часть там. Так что сегодня мы просто обсудим, как они реализовали это для демо-изображений для мотивации и фона. Затем после этого я, да, основная причина и основная цель этого раздела — показать вам, в чем проблема диффузионных моделей и что именно изучают диффузионные модели, чтобы генерировать гипо-образцы, а затем мы обсудим основной подход к обучению сопоставления изоляции, а затем перейдем к экспериментальной части и что-нибудь сделаем. Итак, давайте начнем с мотивации и того, что на самом деле пытается решить эта статья, заключается в том, что глубокие модели являются передовыми моделями для генерации высококачественных зомби, но их основная проблема, их основной недостаток заключается в том, что они начинаются с чистого шума, а затем обрабатывают шум, изображение, а затем получают высококачественный образец, но вам, чтобы получить его, приходится делать много прямых проходов, что на практике может быть довольно дорого. Поэтому статья пытается ввести части сопоставления дистилляции, которые используют проходы поддержки для генерации образцов. Так что да, основная причина, основная цель этой статьи — просто встроить много шагов в некоторый процесс генерации по шагам. И чтобы понять, почему мы решили дистиллировать наши модели, я кратко представлю фон моделей и попытаемся объяснить, почему они на самом деле так хороши в плане генерации. Итак, в основном модели, это основной процесс джинна. Мы определяем некоторый прямой процесс, где у нас есть чистое изображение, обозначенное X, а затем мы используем некоторый образец из гауссова распределения и шумное чистое изображение и получаем некоторое T, и основная цель модели — CG шум. Поэтому мы представляем некоторую функцию шума нашей модели, которая принимает на вход шумовой образец и пытается предсказать чистую версию этого изображения, и эта функция потерь является своего рода функцией потерь MC, а оптимальная функция потерь MC — это условное математическое ожидание. Да, условное математическое ожидание, где у нас есть условие D2, и эти условные математические ожидания будут на самом деле интегралом этого распределения xer. Итак, оставшееся видение заключается в том, что мы, основываясь на композиции, пытаемся усреднить все изображения в нашем многообразии данных и дать нам, что означает это среднее. Мы можем использовать это правило смещения, чтобы получить это уравнение, и это уравнение на самом деле означает следующее. Итак, у нас есть распределение данных, а затем у нас есть распределение шума, которое является своего рода весовым коэффициентом каждого изображения. Что это значит? Это означает, что мы взвешиваем на основе t и как бы взвешиваем каждое изображение в нашем многообразии данных, а затем нормализуем центр. Это означает, что у нас есть своего рода точка, а затем C далеко от изображений, и, вероятно, мы будем взвешивать каждое изображение в нашем многообразии данных одинаково, равномерно, и это означает, что мы даем каждому образцу одинаковый вес. Итак, в основном, потому что ZT и это начальное распределение являются своего рода экспонентой от расстояния Q до UT и X, но когда мы приближаемся к многообразию данных, ближе, мы будем взвешивать каждый образец, каждый образец в многообразии данных, чтобы понять, в каком направлении он должен двигаться. Когда t близко к многообразию данных, мы придаем больший вес точкам, расположенным рядом с этой точкой, и мы придаем небольшой вес этим точкам в многообразии данных, где мы не генерируем, которые мы не симулируем какую-либо из этих промежуточных частей, и, вероятно, анализ может быть выведен с следующим предположением, где мы видели, что наше распределение данных является своего рода распределением данных, основанным на некоторых образцах из данных, своего рода изображением в нашем наборе данных, но это распределение может быть записано в следующей форме, и его довольно легко решить, просто потому, что это распределение данных, этот интеграл суммируется в суммы, и здесь у нас есть нормальное распределение t, и если вы попытаетесь вывести это дальше, у вас будет что-то вроде экспоненциального BT минус AT минус ATC с некоторым фактором, и это означает, что когда T далеко от распределения D, то для каждой точки X у нас есть своего рода равный вес для каждого X, и это означает, что мы просто пытаемся взять среднее всех изображений. Например, в этом случае у нас есть изображения лиц. Одно дерево — это довольно мощное многообразие данных, мы просто возьмем среднее всех изображений в наборе данных. Но затем мы приближаемся к многообразию данных. Например, в этом случае для этого ZT у вас больше веса для этого изображения, потому что CT находится ближе к этому изображению, и меньше веса для этих изображений, и поэтому в этой точке модель предсказывает направление к этому изображению, и в конечном итоге у нас есть что-то вроде этого. И главный вывод этой части заключается в том, что в основном из-за того, что модель генерирует идею условного математического ожидания, у нас есть своего рода целые распределения, но это не так, и это основная причина, потому что мы не можем сделать несколько, потому что мы получим изображения такого рода, и на самом деле то, что мы хотим, мы хотим взять образцы из этого распределения, а не усреднять все изображения из набора данных, и это основная мотивация статьи. Итак, основная идея статьи заключается в том, что вместо предсказания условного условия вы как бы хотите, чтобы модель предсказывала некоторую точку распределения образцов, где она находится в другом, которое мы назовем генеративной моделью. Итак, у нас есть уменьшенная модель, которая производит условный сценарий, и то, что мы хотим, мы хотим усреднить все образцы из этого распределения, а не то, что мы хотим взять образцы из распределения, и это может сработать просто потому, что когда у вас есть то, что мы не знаем, и поэтому то, что модели GP пытаются изучить с помощью нейронных сетей, заключается в том, что, например, у вас есть своего рода это распределение bod x при условии t, и когда мы пытаемся предсказать значения, используя наши модели принятия решений, вы усредните все моды, и вы получите своего рода эту точку, но вместо этого мы хотим взять образцы из распределений. Это означает, что мы берем образцы своего рода этого места ближе к распределению мод, а не мы можем использовать любое, мы можем даже использовать одну процедуру генерации, чтобы сгенерировать все изображения из набора данных. Итак, да, это основная идея, и авторы сказали, что когда у нас есть идеальное приближение апостериорного распределения, то ожидаемое значение на основе этого генеративного распределения, которое предсказывает наша модель, вы вводите условное ожидаемое значение на основе распределения Q. Снова, я думаю, что это распределение бизаров, когда распределение, которое генерирует каждый, равно истинному распределению, и эти два ожидания будут равны друг другу. Сама статья, конечно, не предоставила, поэтому я попытался сделать это сам, и на самом деле это немного. Здесь нам просто нужно определить, просто написать определение этой области унификации, а затем просто использовать экран, и в этой конкретной модели, как истинное распределение, и в конечном итоге мы получим политику. Итак, главное, что да, что мы на самом деле хотим сделать, это изучить это распределение, и это означает, что если мы изучим решение, мы можем использовать процедуру генерации для генерации наших под, но главный вопрос, как его изучить. Итак, авторы предлагают следующую идею. Мы хотим максимизировать значения между двумя распределениями, а затем, если наша модель будет производить образцы, файл данных. Итак, да, так что основная функция потерь, которую мы возвращаем в файл. Итак, я уверен, что хочу сопоставить условную унификацию, и мы делаем это, используя следующую функцию класса. Итак, да, снова основная идея, мы берем образец T. Итак, мы можем получить T, используя ту же процедуру, что и модель. Имеет экранный образец X, шум с результатом. Затем мы можем получить некоторое X к использованию нашей генеративной модели. А затем мы можем получить некоторое Z S из нашего ST, о T Z, а затем в конечном итоге мы оптимизируем это с помощью фиксации. Итак, первый, да, я следую этим sl, на самом деле есть откат. Первый откат заключается в том, что на практике предложение упоминает, что это остается более стабильным, если мы предположим, что S зависит от параметров модели, что, да, обозначено как яблоко. Это означает, что если мы возьмем градиент этой функции потерь, этот градиент войдет внутрь этого, да, если мы возьмем градиент этого по этой функции потерь. Поскольку f не зависит от этого параметра, мы можем просто взять градиенты внутри этого n, и поэтому мы хотим это сделать. Итак, главный вопрос здесь, почему мы не можем просто напрямую оптимизировать эту функцию потерь, потому что когда объявление не зависит от объявления, главное, что зависит от данных и как обновляется наш генератор, это наш генератор в конечном итоге, используя этот сильный, потому что это вообще не зависит, и если каким-то образом он получит какие-либо градиенты от этого sh, главная проблема в том, что мы берем квадратный корень из этой нормы между двумя словарями, и мы можем аппроксимировать пример, используя мульти, но это должно быть смещенное оценивание, потому что это не линейная функция этого члена. Так что это как бы ваша первая сила, чтобы избежать взятия функции потерь MSC, и можно вывести альтернативную функцию стоимости, которая даст те же радиусы, но позволит линейные оси по отношению к. Итак, да, основная идея — проверить градиенты. Поскольку этот член не зависит от эпи внутри этого любого из них, и градиент этой части будет как два или умножить на этот член, и умножить на два, это сокращается, и затем в конечном итоге у нас будет что-то вроде этого градиента функции потерь. И здесь у нас есть удвоение значения x, и удвоение x, и просто потому, что мы можем аппроксимировать его одним образцом модели, и в конечном итоге у нас будет стандартная функция потерь. Эта функция потерь имеет те же радиусы, что и эта функция потерь, предполагает, что этот член не зависит от эпи, и в конечном итоге эта функция потерь также пытается сопоставить здесь, это где наша зависимость, и это в основном так, что в конечном итоге это ожидаемое значение будет затененным, и это на самом деле то, что мы хотим, чтобы изображение. Итак, у вас будет что-то, что дистиллирует, если у вас есть матрица дистилляции здесь, тогда у вас есть, что для производства распределения 18 дано положительное. Итак, да, главный вопрос, мы пытаемся аппроксимировать эту технологию, и на самом деле она основана на супер, и ее можно аппроксимировать с помощью ошибки обучения. Просто потому, что модели DJ в оптимальном случае точно, если это просто удовлетворяется некоторыми моделями, которые принимают оценку, как получить оценку. Итак, вы сначала предлагаете, чтобы вы ваш проект. Первый — вспомогательный. Итак, мы обучим дигма-модели принятия решений на основе образцов из нашего воспроизводимого нашего генератора, и когда это уменьшение оптимально, у нас будет вариант дополнительного, а затем эта процедура обучения довольно проста, просто это процедура, как в моделях GA. Мы обучаем генератор на основе центральных генераторов, а затем обновляем наш генератор на основе этого менее дорогого. Другой подход, который предлагают авторы, — это сделать что-то вроде функции, если что-то еще, которую вы опишете немного дальше. Итак, первый подход, как я уже упоминал ранее, использует дополнительную дополнительную модель. Алгоритм довольно прост. У нас есть, как я уже упоминал, своего рода вырезка t из наших данных. Итак, у нас есть X, мы можем использовать процесс диффузии, чтобы получить ZT, я сгенерирую модель и получу XT, а затем возьму образец теста, зашумляя его, и, да, затем это зависит от того, что мы хотим обновить. Итак, если это порядок, основанный на дополнительной модели диффузии, то мы даем ей образцы теста, дополнительную модель принятия решений, обозначенную GF, а затем используем ее по порядку порядка, так что это будет GP set, и MSC должно происходить, когда возврат — обновить исходную модель, мы как бы увеличиваем дополнительную модель принятия решений и затем используем нашу исходную неформальную функцию ее в транспонированном субградиенте между и разницей между этими двумя моделями, это модель и модель, и, как упомянуто. Итак, да, это была первая и вторая часть, которую также предлагает автор, — использовать своего рода функцию мгновенного класса. Основная идея в том, что мы не хотим обучать модель, потому что это своего рода концепция, и как мы можем избежать обучения модели, — это использовать следующее условие. У нас есть предварительная модель, и что мы можем сделать, мы можем дать этой модели образцы из нашего генератора, и основная идея заключается в том, что если эти образцы из нашего генератора идеально сгенерированы из нашего приблизительного распределения из нашего многообразия данных, и эта функция будет равна нулю, градиент этой функции будет равен нулю, потому что наше предположение заключается в том, что наши модели, и это означает, что новые образцы из нашего генератора, любые новые сигналы для обновления этих параметров, и поэтому как бы мгновенная функция класса основана на этом. Итак, да, мы пытаемся оптимизировать вариант потерь модели-учителя на основе примеров генератора, но на практике они показывают, что если функция работает хуже, чем алгоритм, который использует дополнительную модель диффузии, поэтому я не буду подробно описывать этот алгоритм, но да, основное видение заключается в этом. Итак, да, это была основная идея. Основная идея — сопоставить вращательные значения между распределением, которое производит распределения, вещи из нашего набора данных. Перейдем к экспериментальной части. Первый интересный экспериментальный результат, который был обнаружен, заключается в том, что мы можем в алгоритме следовать этому в тестах, мы можем сделать это двумя способами. Во-первых, мы можем использовать распределение ser, которое используется при попытке сгенерировать некоторые образцы из моделей. Это своего рода, у нас есть XT из нашей генеративной модели, верно? И у вас есть it, и мы можем получить тесты на основе этих двух точек, или мы можем просто использовать обычную диффузионную модель, где мы просто приближаем это изображение к этому. И первый подход был условным, условным сэмплированием, а второй подход был безусловным сэмплированием. И я впервые упомянул, что в большинстве шагов эти два подхода не совпадают, но когда мы используем подход, второй условный подход работал хуже, чем условный, верно? Так что это условное сэмплирование, насколько я помню, с использованием восьми шагов, вы знаете, они генерируют эти образцы. Как вы можете видеть, безусловное субтекстовое что-то вроде, во-первых, оно как бы схлопывается, потому что оно генерирует почти идентичные изображения, а второе — это качество этих изображений, и это интересный результат, потому что, например, в подходе DMB они используют второй, затем условную процедуру, и в то время, когда она была опубликована, большинство передовых подходов. Итак, да, результаты довольно хорошие, часто упоминаются как хорошие. Это предварительно обученная модель, и они дистиллировали диффузионную модель, используя восемь, четыре шага и шаг, и вы можете видеть, что она была моделью-студентом, она работает даже лучше, чем обученная модель-учитель, и результаты Netflix, и главный вопрос, почему, как симулировать, мы используем в этой дистилляции знания из нашей модели-учителя, а затем генератор может работать лучше, чем модель-учитель, это своего рода интересный вопрос, но мы обсудим это немного дальше, авторы предлагают этот граф. В сравнении с несколькими методами, в одношаговой генерации их методы как бы ухудшаются, но когда вы начинаете использовать процедуру сэмплирования, результаты становятся лучше. Итак, да, в большем масштабе. Итак, результаты ключей такие же, как и на предыдущем слайде. Да, снова с шагами модели и модель-учитель даже с четырьмя шагами, а также интересное сравнение между альтернативной процедурой, это также в презентациях, и мгновенной процедурой, мы используем своего рода, это отлично. Итак, модель для обновления нашего генератора, и, как вы можете видеть, альтернативная процедура работает лучше, но они упоминают, что spur был лучше для мгновенной модели, но, насколько я помню, в области изображений, которую она исследует с помощью общих матриц для оценки, вероятно, больше зависит. Итак, основной способ, которым методы работают лучше, чем мгновенные методы на практике, и здесь приведены некоторые образцы из генерации. Они довольно хорошие. Еще одно интересное наблюдение заключается в том, что если вы используете своего рода мгновенную функцию потерь, то эта функция потерь может дать вам некоторую информацию о том, насколько хорошо ваш генератор работает. Изначально вы генерируете свою хорошую производительность и мгновенную функцию, и во время процедуры обучения мгновенная функция потерь становится лучше, и в следующей части, где они дистиллировали модель дистилляции, они используют мгновенную функцию потерь в качестве метрики для измерения как производительности модели. Также учитываются торговые пути, что когда счет фит, когда вы пытаетесь увеличить свой счет руководства, ваш счет фит, как правило, ухудшается, а также ваш, но ваш прием, конечно, становится лучше. Итак, да, и последняя экспериментальная часть — это текст в изображение, конечно, они используют разное руководство для альтернативной и мгновенной процедуры, и лучший подход использует ноль и альтернативную процедуру, и получает все глубокое и спящее, что довольно хорошо, я имею в виду, что это лучше, чем модель. О, да, давайте сделаем некоторые выводы и обсудим некоторые интересные выводы. Итак, да, во-первых, я упоминал ранее, что модель-студент на практике превосходит даже модель-учитель. Главный вопрос, почему, потому что для того, чтобы украсть нашего генератора, мы не используем никакой дополнительной информации, мы просто используем наш тренер. Основная причина в том, что мы как бы имеем наше априорное распределение, например, гауссово распределение, когда мы хотим генерировать наши изображения, мы как бы должны интегрировать все, но когда мы делаем некоторую дискретизацию этой процедуры, и мы должны это сделать, потому что нам нужно решить интеграл, мы получаем некоторую ошибку дискретизации. Это первая проблема, и вторая проблема заключается в том, что модель не идеальна, и это означает, что для идеального моделирования, идеального интеграла для каждой точки траектории, если вы начинаете с этой точки или с этой точки, идеальная диффузия должна привести к некоторой точке к той же точке в траектории, но из-за некоторых ошибок в пересечении интеграла и неидеальной модели из разных точек траектории это может привести к разным точкам, как в многообразии данных. Итак, да, основная проблема с распределением и дистиллированной моделью, используя меньшее количество шагов, вы можете сделать больший шаг, больше шагов, и, по крайней мере, вы, во-первых, меньше ошибок, меньше ошибок, и, да, это как бы вы начинаете свою генерацию, используя, например, дистиллированный генератор, вы можете получить некоторые точки, и главное, что вы хотите гарантировать, но ожидаемое значение действительно будет равно для модели принятия решений, и поэтому у вас нет ошибок дискретизации, и это основная причина, почему она должна работать лучше, чем обычная диффузия. Большинство. >> Да, окончательный вывод заключается в том, что авторы вводят новый объектив на момент публикации. Они также ввели два варианта, где в первом варианте вы пытаетесь изучить некоторую вспомогательную информацию, и это влияние дает вам лучшие результаты. Но если вы хотите или ограничены некоторыми вычислительными ресурсами, то вы, вероятно, захотите использовать второй вариант. Вам не нужно обучать дополнительную модель, но это приведет к худшим результатам, но на практике почти все используют вспомогательный шумоподавитель для изменения. И подход, я думаю, что он производит что-то еще к тому времени, когда я построил подход к политике, а не проблему, я бы сказал, в отличие от вещей, заключается в том, что после публикации этого метода DMD2 был опубликован в программе Европы 2024 года прямо сейчас, и он показал довольно хорошие результаты всего за один шаг генерации, и поэтому все обращают внимание на дистилляцию стилей, и, вероятно, на дистилляцию совпадений, но идея все еще довольно интересна. Итак, да, основная причина, по которой я хочу обсудить эту статью, как я уже упоминал ранее, заключается в том, что в 2026 году в марте они представили новую статью, где они перенесли идею моментации из нового пространства в дистиллированное пространство, а затем они дистиллировали свою модель с помощью этих дистиллированных моделей, используя свой метод. Я был как бы в статье, они напоминают наши идеальные методы, некоторую, хорошо, некоторую специфическую функцию потерь, они напоминают некоторую специфическую функцию потерь в нашем методе, и интересно увидеть связь между этими дистиллированными и методами, да, нашим методом, который был опубликован в ICML 2026, и я хочу обсудить это в этом докладе, но затем меня пригласили на некоторую дистилляцию, которая будет называться в понедельник 18 мая. Поэтому я оставил эту часть в этой презентации, которую я представлю в понедельник, потому что я думаю, что она там более подходит, но все же интересно увидеть наш канал. Поэтому мы приглашаем вас. Вот ссылка на встречу с каналом prof, и да, это все, я думаю. Спасибо за ваше внимание, и мы будем рады видеть вас в следующий понедельник.