Transcription
Представьте, что одна фраза заставляет искусственный интеллект рисовать именно то, что у вас в голове, а не почти. В конце этого ролика вы научитесь писать такие подсказки: сколько раз искусственный интеллект не понял вас. В этом уроке я покажу формулы промтинга, после которой искусственный интеллект перестаёт гадать и начинает слушаться.
Это часть курса по самой лучшей онлайн-программе для генерации любого контента. Называется она Vivaii. Ссылку найдёте под этим видео. Она позволяет генерировать контент, в том числе без цензуры. Курс размещён на моём бусе. Его стоимость всего 500 руб. Ссылка под видео.
После подписки вы получите уникальный подарок, огромную таблицу по промнженирингу для AI Creator, которая закрывает все вопросы по промнгу и весит почти 1 Гб. Если промты расплывчаты, вы теряете время и деньги на неудачных генерациях. Сегодня вы узнаете, как прописывать промт, и вас будут спрашивать: "Это снято камерой?" Смотрите до конца и узнаете, где взять шаблон прота для любых сцен. Там будет и свет, композиция, движение камеры, эмоции, стиль, всё, что необходимо для правильной генерации.
Итак, начинаю свой урок по пронтнженирингу. Ребята, привет. нейрограф на связи. Курс по Виви специально для вас, часть вторая, второй урок. Так что мы с вами продолжаем. Сегодня будет очень-очень интересно и основополагающей, так сказать, правильная, нужная база, которой не хватает иногда даже технически продвинутым специалистам, которые себя таковыми считают. Некоторые не могут правильно сформулировать текстовую подсказку, написать правильный промт. Именно так и называется способ взаимодействия с нейронными сетями. Мы ставим им задачу словами с помощью семантики и получаем результат. На сегодняшний день также мы можем уже и корректировать изображение, да и видео тоже. То есть мы говорим: "Замени, пожалуйста, очки персонажу на красный цвет". Он был жёлтый, теперь хотим красный. Или смени цвет одежды или одежду как таковую. Сегодня мы этого вопроса касаться не будем. Я имею в виду редактирование с помощью семантики. А вот о базовом составлении промта, о том, как это правильно делать, как это автоматизировать и также о том, как снять промт с иззображения для того, чтобы учиться дальше промтнженирингу, так это правильно называется. Мы сегодня с вами и поговорим. Меня зовут Сергей Нейрограф. Давайте начинать.
Если вы ещё по какой-то причине не подписаны на самые лучшие ресурсы по искусственному интеллекту в сфере искусства, они находятся в Telegram, то рекомендую вам это сделать, потому что, скорее всего, вы пропускаете очень много важного и интересного. Это Telegram-канал Нейрограф, где нас уже огромное количество, 26.000 почти. Здесь я ежедневно размещаю максимально полезные посты. Это новости, инструменты, их обновления, промты, различные хаки, свои кейсы, чужие кейсы. Подписывайтесь, ребят, ссылка под этим видео.
И второй ресурс - это чат нейроделы. Самое большое русскоязычное сообщество, где собираются все те, кто интересуется генеративным искусством. Здесь все необходимые ветки для того, чтобы вы могли найти ответы на все свои вопросы. Здесь вы можете разместить свои работы, изображения, видео, музыку, задать по этим темам вопросы и получить ответ. если у вас возникают какие-то сложности в генерации, а также поговорить, например, по вопросам монетизации, как зарабатывать на искусственном интеллекте. Ссылочки все под видео. Наряйте, а я продолжу.
Итак, перед вами алгоритм создания промкта. Но сразу же хочу сказать о том, что, конечно, сегодня мы и погенерируем с помощью этого алгоритма. Кроме того, я вам дам свой чат GPT, в котором вы сможете просто положить изображение, снять промт. Ну и, конечно, мы научим это делать. ViV наш любимый. Внутри это тоже там всё сделаем.
Итак, первое и самое главное, нужно сформулировать цель. Для чего эта картинка? В принципе, если побаловаться, это просто одно. Но, например, у нас есть задача сделать обложку для чего-то, например, для вашего журнала или вашей книги. Или, может быть, вы хотите сделать главную страницу вашего сайта, но не саму страницу, а изображение к ней. Второе - это рекламное изображение. Это совершенно другое. Там должно быть определённое пространство, место. В общем, здесь нужно подумать. Второй фон для видео. Такое часто очень используется. Почему? Потому что, например, сейчас активно уже используют в телевизионном производстве. Генерируется фон, и актёры на этом фоне уже что-то делают. Возможно, это будет аватар, возможно, это будет референс, просто как идея. То есть поймите, для чего вам это нужно.
Следующий пункт. Важный носители формат. Где будет размещаться ваше изображение? Как правило, если вы генерируете для изображения как базовое для дальнейшего использования при генерации видео, это будет соотношение сторон 16x9. То есть так мы смотрим телевизор или смотрим на компьютере. Дальше это один к одному. Очень часто это используется, например, в таких мессенджерах, как Telegram или WhatsApp или, например, в том же Instagram. Ну и 9 на16 - это один из распространённых форматов вертикального изображения и видео, которое используется, например, в сторисах, в том же Telegram, в том же Instagram там или ещё где-то в том же ВКонтакте.
Теперь давайте перейдём к главному объекту. Что это будет? Да, вот у нас уже есть понимание, как делать. Но теперь что мы генерируем? Кто главный объект? Это может быть предмет какой-либо, да? Естественно, если это человек, то у него должен быть возраст, пол, тип, и у него какой-то типаж, да, он какой? Старый, молодой, и, соответственно, какие-то у него ключевые признаки могут быть ещё, да, например, там рыжие волосы или там одна рука, на которой красные волосы. Так вот, и, естественно, у неё есть какая-то ещё поза. Поза она может, э, показать настроение персонажа. Вот этот момент, конечно, вам нужно продумать.
Теперь, что будет в контексте? Давайте подумаем. Это какая локация? где он находится, в каком времени, да, что там у него за спиной, в какое время года он действует, да, я уже сказал про сезон, какая может быть погода, какое у него окружение и настроение сцены, это мрачная атмосфера готического замка или, например, это радостная зелёная полянка, по которой бегают счастливые дети, а рядом с ними такие же счастливые собачки.
Пятый пункт - это стили и референсы. То есть это художественное направление, о котором тоже важно знать и понимать. Мы делаем, например, деловой портрет мужчины- это фотореализм в каком-то, а, тёмном ключе, да, в низком ключе, как вот мой портрет вот здесь. Или это наоборот, соответственно, какая-то иллюстрация. Это, например, какой-то стиль анимации, например, аниме или стиль Pixar или ещё какой-то стиль. Ну или очень популярные 3D. Конечно, это допустимые авторские стили, да. Здесь вопрос этики уже размывается, и мы, наверное, можем с вами использовать всё подряд. То есть любого художника сейчас можно скопировать, просто взяв референс.
Теперь давайте поговорим о моей любимой теме - это композиция. То есть какова крупность кадра, да? То есть наш персонаж, который находится в кадре, например, человек, он какой? У него крупный план, у него план по поясу или он в полный рост? Он сбоку, камера сзади или сверху, как это всё на располагается в кадре. Правила третей. Если не знаете, что это такое, поизучайте. Центрирование, симметрия, диагонали и пустоты в кадре. Это наука, с которой вам нужно познакомиться, если вы хотите постигать азы генерации изображения. Правильно. У этого есть правила, поэтому им нужно учиться.
Камера и оптик. Зачем нам-то про это знать? Дело в том, что технический аспект очень сильно влияет на генерацию изображения, да и вообще создание атмосферного изображения или видео, потому что техника позволяет создавать, например, глубину резкости для того, чтобы подчеркнуть акцент на персонаже и, наоборот, размыть, например, задний план, сделать его таким красивым, расплывчатым, опять же, для того, чтобы поставить акценты на передних планах. Ну и, конечно, это перспектива кадра, это зернистость кадра. Об этом мы с вами, конечно, будем тоже разговаривать.
Пункт номер восемь. Освещение. Важнейший фактор в генерации изображений и вообще в создани визуального контента. Какой свет? Откуда он направлент? Какого качества этот свет? Он мягкий или жёсткий? Какой источник этого цвета? Натуральный или искусственный? Окно, неон или это закат, так называемый золотой част, направление этого освещения? Ну и, конечно, время суток. С этим обязательно вам надо знакомиться, учиться, чтобы спокойно этим оперировать в процессе создания контента. Это очень важно, друзья мои.
И, конечно, существует правила. Это два-три доминирующих цвета и один акцентный в процентном соотношении. Например, один доминирующий цвет занимает там 60-70%. Второй дополнительный цвет процентов 20 и третий, например, акцентный процентов 5 или 10. Это номера цветов. Конечно, знать их не нужно. Да. Можно взять всё в том же Phothшоop. Сейчас уже нейронки с этим работают. Они понимают номера цветов: контраст, температура, эмоциональный тон. Всё это создаёт цвет, который создаёт восприятие зрителя. Его настроение, оно управляет им.
Детализация и фактура. Пункт 10. Минимализм или насыщенность? Что это будет? Да какие будут фактуры? Например, металл, кожа, стекло. Каков уровень детализации и фактуры объектов? Это очень важно.
Негатив исключения. Иногда при в процессе генерации изображения видео мы получаем то, чего не должно быть в кадре. И, к сожалению, от этого иногда очень сложно избавиться. И в этом случае мы можем просто написать, что нам не нужно это в кадре. Мы не хотим, чтобы там были какие-то артефакты, например, какие-то лишние предметы, детали изображения, что-то, какие-то искажения в анатомии. Это всё раньше отдельно прописывалось негативным промтом, так называемым. Сейчас нейронки с этим уже работают гораздо лучше. Пальцев всегда пять. Но тем не менее, если вы хотите что-то исключить, чего-то не должно быть, вы можете об этом написать. Но это лучше делать после получения первых итераций изображений или видео.
Технические параметры. Этот аспект важен только для тех, кто, э, работает на специализированном софте, который достаточно сложен и особо-то он сейчас не нужен. Я этот пункт включил сюда специально, потому что некоторые пункты здесь нам понадобятся. Например, это UPSCE, управление резкостью, так называемый Ctrlnet, контрольные сети, о которых мы обязательно поговорим. И, конечно, Loraра. Это всё технические параметры, но такие тонкости технические, как количество шагов, guidance scale, cfg, так называемый сит, идентификационный номер изображения, всё это вам пока не нужно. И в принципе для старта вы можете просто галочку себе в голове поставить. Мы в дальнейшем частично коснёмся этих параметров. Если софт, который, например, называется conf UI, выйдет на какой-то другой уровень, станет более friendendly, да, они к этому сейчас стремятся, мы эти параметры, наверное, будем обсуждать. Но раньше они активно использовались на таких моделях, как, например, SDXL, Stable Diffusion. Там и до сих пор сейчас это всё живёт.
Ну вот тринадцатый пункт - это как раз про итеративность. Мы после генерации понимаем, проверяем, подходит ли нам генерация под задачу, нужно ли что-то там изменить конкретно. Преследуем ли мы нашу цель? Да, достигаем ли мы её, тот ли формат, всё ли читается и хорошо просматривается на изображении, исходя из нашей задачи? Есть ли место под текст в генерации? Нужно ли будет, например, делать Outpaint на изображении для того, чтобы потом туда разместить текст, например, для обложки для вашего видео? Ясна ли фокусировка на изображение? То есть поставлены ли правильно акценты на изображении, которые мы получили при генерации. Учитывайте, это важно. Ну и итеративность, её никто не отменял. Ну, как минимум для выбора, ну, и вообще, в принципе, для получения оптимального результата. Три-шесть вариаций сейчас работают достаточно хорошо. То есть мы меняем какие-то параметры в промтинге или в технических настройках системы и фиксируем удачные сетапы, где-то их сохраняем, например, на борде в VIV. Там это делается всё очень хорошо и удобно.
И как раз сейчас давайте этим займёмся. Но перед этим я хочу сказать, что, конечно, в наших уроках я буду рассматривать промтинг и для видео, и частично какие-то вещи отсюда туда, а, так сказать, мигрируют. Об этом мы тоже будем говорить. У нас будет отдельный урок по видео по промнгу, и он будет как раз следующий. Сейчас мы с вами фиксируемся по поводу генерации изображений. Это база, которая до сих пор ещё нужна и долго ещё будет нужна для генерации ваших классных, я надеюсь, хитовых видео.
Давайте пойдём в Vivви. Прежде чем мы начнём с вами генерировать на базе только что представленные схемы, а и ещё попозже мы поденерируем также на базе другого средства, так сказать, хочу сказать о том, что все эти ключевые тексты, да, вот все эти основные параметры вы найдёте под этим видео. То есть вы можете просто использовать их, просто поглядывая туда. сохранив в качестве текста или используя эту табличку, которую вы сейчас видели, я её тоже сохраню под этим видео.
Итак, друзья, прежде чем мы начнём генерацию, давайте посмотрим ещё раз на структуру. И я сделал для вас выстраданную уже годами структуру, которая приносит мне наиболее релевантные результаты при генерации изображений. Я прошёл от первых генераций на Stable Diffusion 1.5 в различных итерациях и изменениях промта. И сейчас я вам представлю выжимку такую, которая поможет вам быстро ориентироваться в создании промтов. Вы, пожалуйста, не игнорируете домашнее задание, а оно будет в формате составить на основании моего шаблона несколько вариантов промтов. Сначала по структуре, потом полный промт, потом сокращённый. И после 20-350 раз у вас в голове сформируется структура, с помощью которой вы свободно можете ориентироваться и описывать сцену и переносить из головы её на в генерацию.
Давайте посмотрим, что я имею в виду. Итак, структура промта. Как мы и договаривались, носитель и формат, это пускай у нас будет вариант для Instagram. В данном случае мы рассматриваем пример. Пост для Instagram соотношение сторон один: од, размер 1080x1080 пикселей. В данном случае это не промт, ребята, это понимание того, для чего мы это делаем. То есть мы не пишем это в промте, это важно очень. Здесь, в этом случае, начинается промт. Главный объект какой? Девушка, 25 лет, азиатская внешность. Сидит в расслабленной позе на подоконнике, задумчиво смотрит в окно. Одета в уютный вязанный свитер оверсайз кремового цвета. в руках держит чашку с дымящимся чаем. Уже такая атмосфера прорисовывается. Контекст и фон. Интерьер современной квартире в стиле лофт. За окном дождливый вечер в мегаполисе. Видны размытые огни небоскрёбов. На подоконнике стоит пара небольших суккулентов в бетонных горшках. Это цветы такие, если что. Так вот, ребята, мы все движемся как раз к этой погоде в осень на дворе. Но во всяком случае, на момент записи этого видео, ну, ничего с того времени не изменилось. Если вы смотрите это через год, промтинг остаётся промтингом. Это искусство формулировать мысли, которые потом мы видим в генерациях, в изображениях и в видео.
Стили и референсы. Какие отсылки? Что мы хотим? Это у нас прежде всего фотография. Мы хотим получить фотореалистичность. Мы так и пишем: фотореализм. Стиль напоминает работы фотографа Александра Микелетто. Посмотрите, кто это.
Композиция. Как всё организовано в кадре. Во-первых, это средний план. Объект расположен под правилу третей. Что такое правило третей? Вот здесь вы сейчас и видите на схеме. Это, э, экран, условно говоря, разделён на три части двумя линиями от краёв и, соответственно, по вертикали правило третей - это ближе к краю. Вот эта линия в данном случае вот овал размещён здесь. Давайте я здесь ещё нарисую и поставлю значок правила третьей. Правило третьей - это принцип композиции в визуальном искусстве, такой как фотография, живопись или дизайн и, конечно, кино. Оно предполагает, что изображение следует мысленно разделить на девять равных частей с помощью двух горизонтальных и двух вертикальных линий, расположенных на расстоянии 1/3 от краёв. Ключевая идея - это размещение важных элементов композиции вдоль этих линий. В данном случае вот такой художник в возрасте сидит и пишет что-то. Размещение важно, потому что это пересечение этих линий, так называемые зрительные центры или точки силы. Это делает изображение более сбалансированным, динамичным и интересным для зрителя, чем простое центрирование объектов. Это, ребята, основы композиции, которые вам надо знать. Я просто дал такой небольшой ликбес, он базовый, вам точно пригодится. Обязательно используйте правила Трите, если нет специальной задачи, центрировать объект, поставить в центре акцент. Хорошо. Надеюсь, это усвоили. Едем дальше.
Когда я записываю свои уроки, я максимально перфекционен и прикладываю огромное количество усилий. Если вас не затруднит, подпишитесь, пожалуйста, на этот канал, поставьте лайк, нажмите колокольчик, если не затруднит, опять же, напишите какой-нибудь комментарий. Надеюсь, вам это будет несложно. А я продолжу дальше. Как я сказал, слева остаётся пустое пространство. В примере было справа. Идеально подходящее для размещения текста и логотипа. Это мы уже сейчас про ту девушку азиатскую, если что.
Камера и оптика снята на объектив 50 мм с диафрагмой 1,8. Почему диафрагма 1,8? Вам, ребята, тоже в этом надо разбираться. Потому что чем больше открыта диафрагма у фотоаппарата, тем больше мы получаем глубину резкости. Размытый фон. Камера на уровне глаз. Ilevelevel, мягкий фокус на фоне с эффектом боки от городских огней или Бато, как говорит. Лёгкая плёночная зернистость.
Теперь давайте посмотрим свет. Мы хотим уют, поэтому у нас мягкий рассеянный свет от окна падает на модель сбоку в комнате горит торшер с тёплой лампой, создавая уютные блики на волосах и свитере.
И теперь давайте поговорим про настроение. В данном случае это решается с помощью цветовой палитры помимо композиции и персонажа. Доминирующие цвета кремовый. Вот здесь пример. И это код, который вы можете посмотреть, например, в Photoshop. Второй глубокий синий, тёплооранжевый от лампы. Вот такой настроение умиротворяющее, меланхоличное, уютное.
И теперь детализации фактуры. Высокое детализацию мы хотим чётко видна фактура ввязанного свитера, капли дождя на стекле, пара чашки. Это компоненты, которые дают вот это состояние. Ну и ограничение не включать других людей, то есть девушка одна, избегать искажений, пропорции лица и рук.
Теперь мы хотим из этого всего сделать выжимку. Нам не нужно заголовки вот эти вставлять в промт, главный объект, контекст, фон, стиль, референс. Хотя можно и оставить, но некоторые нейронки не очень любят длинные пром. Поэтому мы возьмём сокращённый вариант без направляющих заголовков. Вот, собственно, та самая выжимка на русском и на английском. Обязательно рекомендую размещать прот в модели в нейронке на английском языке. Да, некоторые говорят, что да, эта нейронка хорошо работает с русским, хорошо, но это нам только так кажется. Что-то даёт какой-то результат, нас вроде как устраит. Но английский работает точнее. Это важно. Для избежания повторных генераций нам нужно быстрее, чтобы не останавливать творческий процесс. И ещё более сокращённый вариант, который иногда требуется для быстрых итераций. Фотореализм. Девушка азиатятка, 25 лет в кремовом свитере сидит с чашкой чая у окна в лофте. То есть всё объединено. За окном дождливый вечерний мегаполис. Средний план. Правила третей. Свет мягкий, боковой от окна и тёплый от лампы. Палитра кремовый синий, оранжевый. Уютное меланхоличное настроение, высокая детализация фактур без искажений. Это, знаете, как самри такое, когда вот много текста, мы с вами выжимаем, а, соответственно, и получаем то, что мы хотим. На самом деле здесь можно двигаться примерно вот как раз от этого пункта. То есть мы сначала берём краткий вариант без детализации, да, который у нас есть в расширенном промте. То есть мы здесь пишем интерьер современной квартиры. Значит, за окном дождливый вечер в мегаполисе, размытые окна небоскрёбов. Да, вот этого всего здесь нет по сути, да. Мы можем просто попробовать посмотреть, что у нас получается в минимальном формате.
И вот как раз здесь-то у нас и подключаются наши модели, нейронные сети, с помощью которых мы это и будем реализовывать. Итак, передо мной программа VV пустой борт. Если вы смотрите этот курс со второго урока, то рекомендую посмотреть первый. Там я показал, как что работает, как пользоваться этим бордом, где что нажимать. Итак, достаём сначала промт, нажимаем, появляется модуль промта, выделяем промт по умолчанию и вставляем сюда наш промт. Это сокращённая версия. Давайте удалим здесь один к одному пост. И сейчас мы с вами как раз и решим эту задачу. У нас с вами один к одному, соответственно, нужно получить изображение. Хорошо, как нам с вами получить итерации? Какие модели мы с вами можем использовать? Хочу сказать, что а здесь есть практически все модели, кроме Morney, которая пока ещё не работает по апи вот как раз в таких программах типа Vivi, Cria и других. Но тем не менее мы сможем с вами получить итерации, да. Для этого мы должны пойти и посмотреть модельки, которые у нас есть. Можно пойти таким же способом, нажав правой кнопкой мышки, получив меню, перейдя в image model, и здесь посмотреть модели, которые генерируют из текстов изображения. Generate from text. Давайте посмотрим, что здесь есть. Reif появилась вот как раз очень хорошая модель. Давайте её возьмём. Будем использовать сразу же. Мы возьмём другие модели. Посмотрим опять сюда же идём. Image model generate HFELD image тоже неплохо работает с реализмом. Её возьмём дальше по такому же принципу мы посмотрим, какие модельки ещё нам могут здесь подойти. Давайте возьмём Imagine четвёртый. Очень неплохо работает с реализмом. То есть мы понимаем, что это реализм, и нам нужны реалистичные изображения. Давайте смотреть, что у нас здесь ещё. Image model Flx Pro Ultra делает очень реалистичные, максимально похожие на реалистичную жизнь изображения. Мы продолжим. Мастик хорошо очень делает или мистик. Кому как удобнее вам тоже запомните, пожалуйста, что это работает с реализмом. И давайте Minim Max Image 01. Эти модели все работают хорошо с реализмом. Давайте мы организуем наше пространство таким образом, чтобы быстро видеть картину, да, получаемых изображений вот в одном пространстве, видимом. Итак, у нас шесть моделей.
Теперь мы с вами можем настроить каждую из них по соотношению сторон. Как вы помните, для того, чтобы это сделать, нужно нажать на этот блок, на этот узел, и мы получаем здесь настроечку. Да, вот в данном случае аспект рейша, соотношение сторон все представленные в модели RIF, пожалуйста, один к одному. HXF image мы можем также здесь с вами посмотреть и выбрать. Здесь это в цифрах обозначено, то есть это не в пропорциях. Вот здесь 1.536 на 1536. Хорошо, двигаемся дальше. Myстик смотрим здесь соотношение сторонation. Здесь то же самое. Давайте Square возьмём один к одному. И здесь ещё можно выбрать качество. Давайте 4К возьмём максимально и модель будет реализмом. Вот такие здесь настройки. Здесь также можно выбрать движок. Давайте возьмём, э, например, Magnific Sharpy. Максимально будет такое детализированное изображение. И пойдём в Google Imagine Ford четвё. Здесь возьмём резолюцию повыше 2К. Модель пускай будет ультра хорошего качества, да, она ещё больше даст максимальный реалистичный результат. Мы с вами уже здесь получаем все настройки и Flx Pro 1 Ultra. Соотношение один: О, здесь все возможные есть. И выходной формат PNG. Как вы видите, все настройки, ну, плюс-минус повторяются, за исключением некоторых моделей.
Теперь наша задача подключить промт к модулю генерации, к узлу. Как вы видите, вот промт розовенький и такой же розовенький вход есть и в модели. Это выход, это промт. отдаём, подключая его вот таким вот проводочком. Как мы с вами научились это делать? Как вы заметите, в большинстве э узлов есть reference имидж, то есть мы можем подать сюда стилевое изображение, которое ещё больше направит генерацию изображения в нужное нам русло. Мы пока этого делать не будем. Нам нужно то, что нам нужно, наша идея. Хорошо, давайте быстренько я сейчас всё подключу, и мы быстро всё с вами-то и сгенерируем.
Хорошо, мы с вами пока генерировать не будем, как это ни странно, а просто возьмём сейчас вот что сделаем. Мы возьмём, выделим это всё, нажмём Command C, Command V и ещё раз вставим весь рабочий процесс вот сюда, да? То есть мы получаем с вами ещё один вариант, но здесь мы с вами поставим уже промт, расширенный этого изображения нашей азиатской девушки, чтобы сравнить, что у нас получится в случае в сравнении с коротким промтом. Давайте удалим промт короткий и, э, вставим сюда тот самый большой промт. Теперь преимущество как разви в том, что мы можем выделить все модели сразу же, да, и начать генерацию. Выделяем все вместе, получаем общую стоимость 118 кредитов и нажимаем на генерацию. И у нас запускается генерация. Ну, во-первых, мы итерием, да, мы можем несколько моделей попробовать с коротким промтом и с длинным промтом. И ждём, когда у нас всё получится, чтобы сравнить, и уже получаем быстро первые генерации.
Генерация произошла, ушло примерно где-то минута. Все модели с разной скоростью генерируют. Это связано с тем, что у всех моделей разное разрешение. Давайте смотреть. Это модель Rif. Модель очень неплоха. Давайте посмотрим, что здесь есть. Итак, я вам напомню, какой у нас с вами промт. Это один к одному. Футериализм. Девушка азиатка 25 лет. Хорошо. Кремовый свитер есть. Кремовый. Сидит за чашкой чая у окна в лофте. Лофт есть, окно есть. За окном дождливый вечерний мегаполис. Мегаполис видно. Средний план. Правило третье здесь не соблюдается. По центру свет мягкий, боковой от окна и тёплый от лампы. Боковой есть, от лампы есть. Палитро кремовый есть. Синий есть, оранжевый на заднем плане есть, уютное меланхоличное настроение, высокая детализация фактур без искажений. В принципе, всё есть практически хорошо. Единственное, здесь не работает правило третей. Чего не скажешь про следующее изображение. Здесь как раз с этим всё гораздо лучше. Давайте посмотрим. Здесь есть те самые небоскрёбы. Здесь есть девушка, меланхоличное настроение. Гораздо лучше здесь всё отрабатывается.
Это Hixfield Image и Myстик. То же самое, очень хорошо. Правила третей здесь есть. Мне очень нравится, как это сделано.
Здесь получилось чуть-чуть завалилась стена, но такой эффект бывает от объектива. Искажает иногда перспективу. И давайте посмотрим следующее.
Google Imagent четвётый очень хорошо справился. Мне очень нравится правила третей. Вот это тилоранжевый эффект такой киношный. Здорово. Нигде не было сказано, что она сидит и смотрит в окно в данном промте.
Ну и, соответственно, здесь это у нас Flx Pro 1.1 Ultra. Он отличается от всех моделей, что у него очень высокое разрешение. Единственное, что мне здесь не нравится, да, что здесь нет размытого фона. Да, мы можем добиться такого изображения, если будем фотографировать, просто зажав диафрагму, сделав её маленькой. В таком случае глубины резкости не будет. Но здесь есть и другие проблемы. Это, например, странная батарея. Вот такая, какие-то здесь штуки. В общем, мм у Флакса в данном случае есть плюсы и минусы. Я бы не стал брать это изображение.
Minim Max Image One. Здесь очень неплохо получилось. Именно такое меланхоличное, задумчивое состояние. Правило третей в наличии, светильничек есть, всё хорошо, свитер, текстурки, всё прекрасно. Я надеюсь, что вам в данном случае вот этот подход понятен, да, и вы быстро посмотрев все изображения, можете выбрать что-нибудь для себя. В данном случае я бы, возможно, остановился на минимаксе.
Ну, именно MySстик. Давайте посмотрим, что у нас получилось на расширенном промте. А здесь всё гораздо лучше. Мы закроем эту задачу. Давайте посмотрим, а что же нам даёт более детализированный промт. Ещё раз вспомним главный объект: девушка 25 лет. Есть азиатская внешность, есть. Сидит в расслабленной позе. Отлично. Очень расслаблен. На подоконнике здесь добавлено. Задумчиво смотрит в окно. Направляющая, да? То есть она сидит на подоконнике и смотрит в окно. Она одета в уютный вязанный свитер overсайз кремового цвета. Он большой, он даже ей на ноги налезает этот свитер. Он интерьер современной квартиры в стиле лофт. Ну, здесь этого не видно, но, в общем-то, неплохо. За окном дождливый вечер в мегаполисе, есть такой. Видны размитные огни небоскрёбов. Такие есть. На подоконнике пара суккулентов в бетонных горшках. Есть такие, есть. А в том изображении не было, потому что мы про них не говорили. Стиль фотореализм прекрасный, напоминающий работы фотографа Александра Микалетта. Композиция средний план. Хорошо. Объект расположен по правилу третей слева. Слева остаётся пустое пространство для текста, остаётся вот здесь. Камера снята на объектив 50 мм с диафрагмой 1,8. Это даёт нам как раз глубину резкости, оставляя главный объект в резкости. То есть здесь размыто фон, здесь в резкости. Ещё и тень видна такая классная. Здесь мягкий фокус на фоне с эффектом боке от городских огней. Есть такой. Лёгкая плёночная зернистость. Давайте посмотрим. Ну, наверное, есть. Тут сложно на мониторе. Я вот особо здесь не вижу в данном случае. Мягкий рассеянный свет от окна падает на модель сбоку. Есть такой. Ну вот на неё ещё и падает мягкий свет от светильника, да, от жёлтого, которого в кадре нет. Торшер с лампой создаёт уютные блики. Да, они блики создают, но Торшера мы не видим. Если у вас такая задача есть, то надо либо её решать, либо оставлять так, как есть, если очень нравится. Приглушённая тёплая палитра с доминирующими цветами: кремовый, пожалуйста. Вот он свитер, вот этот глубокий, синий такой тиловый, классно получился. И тёплый оранжевый. Как раз киношный такой эффект и даёт. Настроение умиротворённое, с меланхоличное, высокая детализация, видна фактура свитера. Очень хорошо. Капли дождя на стекле имеются, пара чашки не имеется, к сожалению. А ещё зато имеется косяк на пальцах. Вот здесь то, что я говорил. Хотя, может быть, это мне так кажется, пальца четыре, наверное, всё-таки нормально. Хорошо, никаких проблем особых в этом изображении я не увидел, кроме пара. Да, здесь можно это дорисовать, просто догенерировать. В дальнейшем мы с вами это научимся делать.
Я давайте сейчас пробегусь по основным изображениям остальным, и дальше вы сможете этот борт сами проанализировать. Ссылку на него найдёте под этим видео. Очень неплохо получился Хиксфилд со своим изображением. Смотрите, как симпатично. Да, очень мне нравится Myсти Stick. Очень-очень круто получилось, да, опять же, пара нету здесь от чашки, но меланхоличность такая есть. Вот это как цвета здесь перекликаются. Вот эти бакешные огонёчки, вот этот фонарь тёплый. Очень-очень киношная картинка такая получилась. Что у нас MinМК даёт? Тоже очень здорово. Вообще MinМК очень хорошо работает. Смотрите, какая такая композиция. Чуть-чуть ножка зашла под горшок, да, но не критично, да? Чуть-чуть пар такой гипертрофированный от чая идёт, да, как в такой волосяной, что ли. Но это тоже всё решается. Ну, композиция хороша, правила третий, всё в наличии. Вот здесь тоже очень здорово получилось. Это у нас Flux Pro Ultra. Здесь очень вообще детализация хорошая. Идеально практически всё получилось здесь. Да, тут с ногой небольшая проблема что-то или так от цветка сумка какая-то, но детализация очень высокая. И здесь баке тоже появилась классная. И это у нас Google Imagine 4. Да, немножко так за окном стоит фонарь, а так всё в порядке.
В данном случае мы получили очень неплохие результаты, в принципе, во всех нейронках, но для этого и есть итеративность как в различных моделях. То есть мы используем разные модели, так и в количестве генераций. Да, мы можем использовать по истечении времени какую-то одну или две модели, когда вы поймёте и наработаете навык, что вот эта модель в вашем случае работает хорошо. И уже на уровне модели вы осуществляете этерации в количестве генерации. Например, одна-две генерации не получились, третья, пятая будет лучше. Ну, естественно, там придётся что-то дорабатывать уже отдельными частями на изображение.
Ну и теперь давайте я поделюсь с вами двумя классными хаками. Об одном из них уже, скорее всего, некоторые из вас знают. Это скраббинг промта, так называемый. То есть нам нужно описать изображение по принципу, которому я вам сейчас показал. Для этого есть два способа. У меня есть GPT настроенный, которому вы отдаёте изображение. Он даёт описание вам пром поображению. Также мы сейчас прямо здесь настроим штатными средствами примерно ту же самую задачу. Давайте займёмся. Например, у нас есть вот такое очаровательное изображение, которое нам нужно описать. Ну, во-первых, вы, конечно, можете потренироваться это сделав, пропустив через структуру, которую я вам сейчас показал, рассказал о ней. Это очень важный момент тренироваться самостоятельно, чтобы у вас структура в голове вырабатывалась. Я знаю, большинство людей на начальном этапе начинает грешить и уходят, например, в чат GPT, просит: "Опиши мне это изображение". В этом есть определённый смысл только тогда, когда вы можете проконтролировать то, что вам даст GPT или другая языковая модель, которая, кстати, есть, естественно, в Viве тоже мы сейчас ей воспользуемся.
Хорошо, мы берём это изображение, размещаем это изображение здесь на борде, просто перетаскиваем, получаем его как файл. Теперь нам нужно это изображение описать прямо здесь. Давайте мы это и сделаем. Для этого здесь есть специальный модуль, который мы сейчас с вами настроим. Открываем меню и находим модуль Image Describer. Вот он второй. Давайте просто попробуем. Воспользуемся штатными настройками. Нажимаем на image describer. И вот здесь в окне мы, во-первых, видим модель, которая используется. Это языковая модель. Это модуль языковой модели, которую мы с вами можем выбрать. Пожалуйста, вот здесь давайте, например, мы остановимся на Open AG GPT5. Последняя модель. А у всех у них цена одна, один кредит. И здесь есть у нас текст, который описывает задачу, как нужно описать это изображение. Давайте посмотрим, что здесь есть. Он ему предлагает стать опытным аналитиком по изображениям, которому получено предоставить подробные, точные и полезные описание изображений. Ваша цель- сделать визуальный контент доступный с помощью чётких всесторонних описаний текста. Будьте объективными, фактическим используя чёткий описательный язык, организовать информацию от общего до конкретного тра-ля-ля-ля-ля-ля. То есть здесь, на самом деле, такое общая задача, которая касается больше как бы как специалиста. Вы специалист, вот вы нам и опишите. У нас немножко по-другому всё, как вы видели, да? А-э, ранее я объяснил, у нас есть конкретные задачи: персонаж, фон, контекст, стиль. Вот это-то нам и нужно, но всё-таки давайте попробуем, посмотрим, что он умеет делать. Подключились, нажимаем на Run Model, и начинается генерация с использованием GPT5. Давайте посмотрим, что нам здесь дано. Итак, на изображении изображена безмятежная сцена женщины и большая белая кошка. Ну, какая-то кошка похожа на пуму, возможно, и позирует рядом, на гладком фоне персикового цвета. У женщины зачёсанные назад светлые волосы, глаза закрыты, на ней просторное мягкое платье персикового цвета. Большая кошка нежно прижимает морду к её голове. Приглушённые гармоничные цвета подчёркивают спокойствие и элегантность в минималистичной художественной эстетике. В принципе, неплохо имеет место на жизнь.
Но мы пойдём с вами ещё одним путём. Давайте мы откроем ещё раз image describer. И здесь мы просто немножко изменим задачу. Давайте скопируем весь этот текст, точнее вырежем его. Идём в переводчик, переводим на русский и развернём текст. Кое-что мы тут оставим. Вы эксперт по анализу изображений, которому поручено предоставлять подробные, точные и полезные описания изображения. Вот это всё мы теперь убираем и здесь напишем, чтобы он следовал нашим инструкциям, которые мы ему предоставили. Здесь я добавил, что точное и полезное описание изображений для генерации изображений. То есть для чего мы получаем это. Следуй инструкциям, представленным здесь. И сюда мы вставляем наши инструкции, которые у нас уже есть. Смотрите, ребят, что здесь получается. Да, важный момент. Я прошу нейронку использовать примеры, которые у нас с вами есть. То есть я говорю, значит, следую инструкциям, представленным здесь. носителей формат. Например, пост для Instagram соотношение сторон один: од, пусть анализирует главный объект, например, и он должен использовать эту структуру примера, которая нам подходит. Контекст фон, например, опять же то, что подходит нам. Итак, соответственно, мы это и используем. То есть мы ещё добавим, давайте вот что здесь получается, следу инструкциям и примерам структуры подсказок, представленным здесь. Дальше мы берём всё вот это дело и копируем. идём сюда модель instruction. То есть мы даём нашей модели инструкцию, как она должна действовать, и вставляем сюда этот промт. Всё. Теперь у нас этот имиджбер будет действовать согласно этой задаче, да. Поэтому сохраните, пожалуйста, этот рабочий процесс у себя, и он вам вот этот describer, он вам пригодится. Либо вот этот текст, ну, который вы получите опять же под описанием под этим видео.
Сейчас мы берём, протягиваем сюда. У нас здесь всё хорошо, всё сохранено. Давайте попросим модель нам ответить на наш вопрос уже с другой точки зрения. Да, мы получаем с вами совершенно другой ответ. Мы можем с вами дописать здесь вот что. Пиши сначала на русском, потом на английском, чтобы нам быстро оценивать то, что нам предоставляет нейронка, не заглядывая в переводчик, если вы не знаете английский. Я исправляю задачу, снова копирую этот текст, возвращаюсь в Viвиi, меняю здесь задачу нейронки, инструкцию и, соответственно, снова генерирует. Но он может сгенерировать много текста, для него это не проблема. То есть в окно всё это войдёт. Итак, мы в данном случае получаем фотография для портфолио квадратный формат, да? То есть он оценил описание: молодая женщина европейской внешности с гладко зачёсанными светлыми волосами, чего не было здесь. Она стоит, закрыв глаза, к ней нежно прижимается белая пантера. Стоит или не стоит, тут вопрос. Да, возможно стоит, а возможно и лежит. Женщина одета в мягкий нежно-розовый жакет с широкими лацканами. Это детали, которых не было. Пантеры выглядит спокойной и ласковой, прильнув головой к плючу женщины. Хорошо.
Теперь мы давайте вот что сделаем. Мы, допустим, с этим совсем согласны. Мы можем, например, здесь взять, просто скопировав этот, соответственно, промт. Ну, для этого можем два раза кликнуть. Раскрывается всё окно по, э, у узлу, да, вот здесь. И давайте скопируем этот промт, просто сгенерируем, посмотрим, что у нас получится в какой-нибудь нейронке. Давайте берём промт, вставляем сюда нашу текстовую задачу, идём в модели. Давайте HXF Image возьмём. Давайте возьмём из моделей RIF. Давайте возьмём, например, ещё модель Cdream Tex to Image. Свежая модель. Ну и давайте ещё нанобанан возьмём. Хорошо, я, пожалуй, переставлю вниз для лучшего визуального восприятия, так сказать, чтобы оценить промт. Ещё раз скажу, два раза щёлкаем сюда. Давайте пройдёмся, посмотрим по настройкам. У нас здесь мы хотим, допустим, пускай не квадрат, а что-нибудь другое, например, вертикальное какое-то, да? Например, что-то для рилсов. Ну, пусть 1.536 на 2.48. Ф. Давайте поставим здесь 9х16. Cдрим давайте поставим тоже 9х16. Выберем сайз, например, четвёртый самый большой. Чем мы хорош Cдрим? Он нам даст 4К формат, то есть максимально большой. И здесь мы, соответственно, нанобанам там особо выбора не даёт, к сожалению. Пенжи, как карта ляжет, что называется. Выделяемся и отправляемся на генерацию.
Итак, результат мы получаем. Как вы видите, Хиксфилд очень круто справился с этой задачей. Наверное, всё-таки больше к такой реалистичной женщине похоже, необработанной. Нанобана. Такое ощущение, что случайно кто-то подошёл сзади. Ну, тоже прикольно так получилось, в принципе. Хорошо. И вот здесь тоже нормально достаточно шумок такой появился. Это у нас CDAM to Image. В целом, все модели справились неплохо. Давайте посмотрим, что у нас было на исходнике. Такая Анастасия Волочкова со своим котом. И вот Хиксфилд, мне кажется, достаточно успешно справился. Да, кремовый и не кремовый здесь цвет, но всё в дальнейшем мы с вами научимся это редактировать. В целом, я думаю, вам принцип понятен.
Ну и в завершении этого видео я вам дам очень простой способ быстрой оценки изображений с помощью GPTS, чата GPT. Ссылку на эту штуку вы найдёте под этим видео. А для этого мы возьмём с вами какое-либо изображение. Например, я рекомендую вам для вдохновения использовать сайт Pinterest, например, вот здесь я и нашёл это изображение. Давайте попробуем что-нибудь проанализировать. Чем бы нам не взять вот это наивное доброе изображение? Мы просто перетаскиваем в окно GPT. После того, как изображение подгрузится, нажимаем на кнопку отправить. Ничего писать не нужно. Получаем промт быстро и эффективно. Женщина с платиными волосами, а, собранными в пучок, с в розовом костюме и очках, сидит на огромном фантастическом крокодиле, покрытым зелёным и розовым хом. Есть такое. Она спокойно разговаривает по телефону. Фон нейтральный, студийный, стиль, сюрреализм, цифровая живопись, мягкое рассеянное освещение, фронтальный ракурс. Постельная палитра. Хорошо. Берём это всё за основу в виде промта. Идём в наш второй урок. Модуль промт. Вставляем сюда этот промт. Теперь, чтобы нам 20 раз не искать все эти модели, мы просто берём эти, копируем. Command C, Command V. Чуть-чуть поудобнее сюда вставляем. И давайте я вам покажу ещё один более эффективный способ, который я, собственно, здесь не указал. Сносим вот это всё. И для того, чтобы нам скопировать, естественно, все связи, мы скопируем это вместе с модулем пром Command C Command V. У нас скопировалась вся структура. Удаляем предыдущий промт из окна промта из узла и вставляем новый промт, который мы с вами и увидели там, да, девушка с крокодилом. Выделяем все и запускаем генерацию. Run selected. 51 кредит. Цена очень хорошая, на самом деле, за столько генераций. Давайте посмотрим, что получится.
Так, мы получили достаточно странные генерации от Хиксфилда. Да, здесь он не очень силён, потому что он работает с людьми, и вы уже это видите. Риф достаточно странный выдал результат. А вот CДAM нам дал то, что нужно. Здесь раскрывается как раз потенциал Риф. Итеративность визуальная наглядная сразу в нескольких моделях. Ну и нанобана, в принципе, тоже неплохо. Даже вот такие вот грибочки нам тут подрисовал. Ну, конечно, Cдam вне конкуренции.
Итак, дорогие мои, я надеюсь, вам этот урок, даже если вы уже более-менее опытный, понравился, потому что здесь интересная структура. Она выработана мной не одним днём, не одним месяцем, а годами, и даёт очень хороший результат. Так что пользуйтесь текстовую структуру составления таких вот промтов и ссылку на чат GPT с моим генератором промтов, скрайбером, вы найдёте под этим видео. А в следующем видео мы с вами начнём по такому же принципу изучать генерацию видео. Это будет очень интересная тема. Мы коснёмся как и составления промтов, так и генерация из изображений в видео. Поэтому обязательно следите за выходом третьего урока. Ну а я с вами прощаюсь. Не забывайте выполнять домашнее задание. Практика это самое важное в нашем деле, иначе вы так и останетесь теоретиком. как это делают многие. Надеюсь, вы учитесь не для этого. Составьте несколько промтов обязательно по структуре. Затем попробуйте сделать это по памяти, просто свизуализировав какую-то сцену, не просто взяв это из, скажем, референса, но потом уже, используя референс, попробуйте описать, а, с помощью моей структуры этот референс, ну, и с помощью структуры генерации изображений по скраббингу, да, так сказать, забрав текст с изображения, попробуйте сгенерировать похожие изображение.
Итак, ребят, урок закончился. Надеюсь, что эта теория и практика была вам полезна. Если это так, подпишитесь на канал и поставьте лайк. Ну и напишите что-нибудь в комментах. Не забывайте подписываться на мой Telegram-канал, на Telegram чат нейроделый. Ссылку на полную версию этого курса на бусте вы найдёте под этим видео. До встречи, ребята, на курсе по Виви. Ну и здесь на YouTube. Пока-пока.