📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Claude Code + Gemini Video Analysis | Full Setup + Skill

Eric Tech14:35

Transcription

В этом видео я покажу вам, как именно мы можем обрабатывать любые видео с помощью ИИ с Gemini и Claude. Потому что сейчас у нас может быть ИИ, который фактически принимает текст, скриншоты или аудиофайлы, но он никогда не брал ничего о видео, потому что есть кадры, есть действия, в видео происходит много всего. И имея видеофайл, который мы можем передать ИИ, и ИИ может понять, обобщить его для вас и обработать это для вас, это изменит правила игры. Более того, если вы посмотрите на одно из видео, которое я сделал, я просто предоставил клип, и он смог сгенерировать для меня TLDR, краткое изложение этого видео, а также дал мне временные метки того, что именно произошло в каждой сцене. Так что это очень подробно, и мы можем сделать это полностью, используя код Claude и Gemini с его собственной моделью понимания видео. Итак, сказав это, если это звучит интересно, давайте перейдем к видео. Теперь, прежде чем мы начнем, вы можете задаться вопросом, почему мы не должны использовать код Claude для обработки видео, а почему мы должны использовать Gemini вместо этого? Ну, ответ таков. Для Anthropic здесь вы можете видеть, что Claude по умолчанию не имеет возможностей обработки видео. Но Gemini имеет эту функцию. Итак, что здесь происходит, это то, что если у вас есть видео, вы хотите, чтобы Claude его обработал. И, по сути, то, что Claude делает в фоновом режиме, это фактически берет видео, которое у вас есть, и использует скрипт Python, чтобы разбить его на разные изображения и попытаться использовать эти изображения, верно? Так что анализируйте видео с помощью Claude. Обходной путь здесь — разбить видео на разные изображения или разные кадры, транскрибировать аудио отдельно. Вы можете видеть, что это должно быть сделано отдельно по сравнению с тем, что делает Gemini, Gemini имеет эту встроенную функцию. Вы просто загружаете видео, и Gemini фактически поймет или обобщит видео для вас и передаст его обратно Claude, чтобы вы могли использовать Claude здесь для выполнения дальнейших действий. Итак, по сути, что делают другие люди с этой комбинацией, они используют Claude, верно? Как ваш фронтенд, верно? Где вы сможете передать видео в Claude. Claude вызывает Gemini, чтобы прочитать видео, получить анализ Gemini, верно, из этого видео, а затем пишет код или может выполнять любые действия на основе этого анализа, который предоставляет Gemini. И это, по сути, то, как мы можем объединить Claude и Gemini, используя это для понимания видео и выполнения дальнейших действий. Итак, сказав это, давайте посмотрим, как мы можем настроить эту комбинацию для подключения Claude или кода Claude к пониманию видео Gemini. Итак, в этом случае, что мы собираемся сделать здесь, это я перейду в свой Visual Studio Code, который вы можете видеть здесь. И, по сути, что я хочу сделать здесь, вы можете видеть, у меня есть папка под названием папка Claude Co-work, или в данном случае просто куча клипов. И, по сути, что я хочу сделать здесь, вы можете видеть, что эти клипы здесь для имени файла видео здесь, я хочу, чтобы Gemini фактически читал каждый клип, как бы смотрел, обрабатывал его, как бы происходило на самом деле внутри каждого клипа, и пытался обобщить это, передать это в код Claude, и код Claude здесь переименует каждый из них, верно, коротко и лаконично, используя правильные ключевые слова, так что в будущем я буду точно знать, глядя на имя файла, я буду точно знать, о чем этот клип, верно? Так что, по сути, это то, что я хочу сделать: использовать понимание видео Gemini, чтобы понять видео, использовать код Claude, чтобы переименовать эти файлы, и в конечном итоге сократить их, чтобы мы могли преобразовать их в словарь, который мы сможем использовать, чтобы посмотреть на имя файла, чтобы точно знать, о чем видео. Хорошо, так как у нас уже есть клипы, верно, здесь есть вся папка, содержащая все клипы, которые мы хотим, чтобы Gemini посмотрел. Итак, первое, что мы сделаем, это создадим навык, чтобы Gemini мог подключиться к нашему коду Claude. И прежде всего, что мы сделаем здесь, это я возьму всю эту страницу для понимания видео о том, как она фактически взаимодействует с API Gemini. Я нажму "просмотреть markdown", и вы увидите, что мы получаем полный markdown. Я просто скопирую всю эту страницу, перейду в код Claude, и я просто буду использовать здесь создатель навыков, верно? Чтобы посмотреть на это. Итак, я хочу, чтобы вы посмотрели на весь этот файл markdown. И, по сути, так мы создадим навык, который сможет фактически взять клип, такой как MP4 или любой другой видеофайл, и просто передать его Gemini для понимания и обобщения видео. Так что, по сути, это то, что я хочу сделать. Я хочу, чтобы вы создали навык, который поможет нам обобщить это видео. Хорошо? Итак, входные данные — это видео, выходные данные — это обобщение того, что произошло в видео. Создайте навык, а затем, как только вы создадите навык, пожалуйста, скажите мне, какая именно информация вам нужна, где мне установить API-ключи, и тогда мы сможем заставить это работать. Итак, я предоставлю этот запрос, и я просто попрошу Claude фактически создать навык на основе этого файла markdown. И сразу же, вы можете видеть, что он просит нас сгенерировать API-ключ для Gemini, и более того, вы можете видеть, что для стиля API, хотим ли мы использовать генерацию контента, которая является стабильной версией, или использовать бета-версию. Итак, я выберу стабильную версию здесь. И здесь я выберу "ввести". И с точки зрения деталей вывода, насколько подробным должно быть обобщение видео? Итак, короткое и подробное, или только краткое обобщение, или только подробный разбор, как полный пошаговый разбор временных меток. Теперь это зависит от вас. Я просто выберу короткое и подробное, так что оба, как два предложения TLDR, за которыми следует разбивка временных меток для ключевых событий. Таким образом, вы не теряете никакого контекста, но у вас также есть обобщение наверху. И это также дает коду Claude возможность обобщить и решить: "Хорошо, как мы сможем переименовать этот файл, верно?". Итак, я выберу "ввести" для этого. И с точки зрения источника видео, что должен принимать навык, только локальный файл, или он также может принимать URL-адрес YouTube. Я выберу, чтобы это было открыто, так что у нас будут локальные файлы, а также URL-адрес YouTube. Итак, я нажму "ввести" для этого. И куда должно идти обобщение? Итак, должно ли это быть файл плюс чат или только чат? Итак, в данном случае я сохраню чат. Хорошо. Итак, я просто нажму "ввести" здесь. И я отправлю ответ, и тогда он начнет его обрабатывать. Хорошо. А пока я перейду по этой ссылке и попытаюсь получить API-ключ для всего этого API Gemini. Итак, в данном случае я перейду по этой ссылке прямо здесь. И это, по сути, будет наша Google AI Studio. Итак, вы можете видеть здесь, это наша Google AI Studio. И все, что нам нужно сделать, это просто создать API-ключ. Я создам новый ключ прямо здесь. И с точки зрения проекта, просто создам новый проект, если вы еще не создали проект. Итак, я выберу свой проект под названием Eric Tech и просто дам ему имя. На этот раз это будет понимание видео, верно? И мы просто создадим ключ. И прежде чем мы пойдем дальше, вот, по сути, ценообразование на основе API разработчика Google Gemini. Итак, вот разбивка затрат. Итак, я думаю, что Gemini 2.0 flash больше не поддерживается, но, по сути, если вы используете, скажем, 2.5 Pro или 2.5 flash или даже последнюю модель 3.1 flash, вы можете видеть, что это стоит столько, верно? Итак, примерно около 2 долларов за 1 миллион токенов. Но вы можете видеть, что примерно за 2-минутное видео, верно? Используя, скажем, 2.5 flash, например, стоимость составит примерно 0,009 доллара. Так что меньше цента за весь анализ. Так что 1 миллион токенов здесь — это на самом деле много. Так что вы можете видеть, что всего за 2-минутное видео, вероятно, потребуется лишь малая часть этого миллиона токенов. Так что вот сколько это стоит. И чтобы подтвердить, я также задал тот же вопрос Claude. И тогда Claude провел исследование, вы можете видеть, что исследование стоимости для 2-минутного видео составляет это. И тогда это будет обобщено до менее чем или в данном случае около 1 цента по более дешевой цене, как использование 2.5 flash, но если вы используете последнюю модель или самую новую модель, такую как 3.5 flash, тогда это будет 6 центов, верно? Около 6 центов за всего 2-минутное видео, что все еще меньше доллара, что очень дешево. Итак, что мы собираемся сделать здесь, это мы посмотрим, как мы можем это использовать. Итак, здесь вы можете видеть, что я фактически дал инструкции переместить этот навык в текущий проект. Итак, у меня есть этот навык обобщения видео, который он создал, и здесь вы можете видеть, что внутри него есть файл .env. Итак, что мы собираемся сделать здесь, это по умолчанию он использует 3.5 flash, но если вы хотите изменить его на что-то более дешевое, например, 2.5 flash, мы также можем это сделать. Итак, я выберу использование более дешевого варианта здесь. И тогда с точки зрения API-ключа, потому что мы уже получили его, мы скопируем его и сохраним в моем файле .env здесь. Хорошо, так что, как только все будет настроено, следующее, что мы сделаем, это запустим этот навык, этот навык обобщения видео, который мы только что создали, и используем его для обобщения видео. Так что именно это я и сделал. Я фактически предоставил фактический запрос, так что внутри я не уверен, что здесь происходит, но, по сути, я просто запускаю навык {slash} video summary и предоставляю этот клип, верно? Этот видеоклип, и просто ввожу его, и здесь вы можете видеть, что это то, что он обобщил. Итак, он вызывает Gemini под ним, и здесь вы можете видеть, что это TLDR. Итак, это 7-секундное анимированное логотипное раскрытие для Clock Co Work, и здесь вы можете видеть, что это временная метка, верно? И если вы фактически закроете это и посмотрите на клип, я покажу вам еще раз. Вот как выглядит клип, верно? Итак, вы можете видеть, что это клип, и это просто логотип, показывающий, а затем у нас также есть наш шар Clock Ball, анимированный. Так что, по сути, это то, что у нас есть. Теперь, здесь вы можете видеть, что мы можем сделать с этим, это потому, что цель здесь состоит в том, что мы хотим переименовать все из них. Итак, я создал новый рабочий процесс навыка под названием clip rename workflow, и под ним фактически используется навык video summarize и вызываются разные под-агенты с динамическим рабочим процессом, чтобы фактически разветвиться и запустить его, верно? Итак, здесь вы можете видеть, как это выглядит. Итак, я фактически создал навык, верно, под названием summarize rename workflow. И здесь вы можете видеть, что он принимает папку с файлами MP4. И он вызывает этот рабочий процесс здесь, чтобы разветвить множество под-агентов здесь. Для каждого под-агента здесь он возьмет клип, хорошо? Он обобщит его, попытается использовать этот навык для обобщения видео с помощью Gemini, а затем он даст пять вариантов названия того, как мы должны его назвать. Затем у нас есть другой под-агент, который просматривает сводку, а также варианты названий, которые он дал. И тогда он проголосует за основные победы того, как мы должны назвать этот файл. Затем он приступит к переименованию этого файла и обобщению всего. Итак, в этом случае, что мы собираемся сделать здесь, это я запущу новую сессию Claude, и здесь вы можете видеть, что это вся папка. Итак, я уже сделал первый файл. Так что это просто для тестирования, так что вы можете видеть, что он вызвал Claude logo review particle bots. Итак, следующее, что мы сделаем здесь, это мы сделаем это для остальных 17 файлов, которые у нас есть здесь. Итак, я запущу рабочий процесс под названием clip rename workflow прямо здесь, и я просто передам всю эту папку. И теперь, если я запущу это, и это просто запустит множество под-агентов, чтобы разветвиться и попытаться запустить это. >> Прежде чем вернуться к руководству, я хочу показать вам кое-что, что я недавно тестировал, потому что это решает проблему, которую я постоянно вижу у небольших команд и внутренних инструментов. Итак, по сути, многие компании в конечном итоге управляют всем через Google Sheets. Лиды, отслеживание клиентов, утверждения, все это медленно превращается в одну гигантскую электронную таблицу. И это работает, но в конечном итоге лист становится беспорядком, потому что теперь у всех в команде есть доступ к необработанным строкам, формулы редактируются случайно, и нетехнические люди ненавидят его использовать. Это, по сути, то, что пытается исправить Good Taco. Итак, что я собираюсь сделать, это подключить одну из моих существующих Google Sheets, и вместо того, чтобы перестраивать все с нуля, я просто опишу приложение, которое я хочу, простыми словами. Например, я могу сказать, что хочу более чистый интерфейс для отслеживания клиентов, назначения статусов и фильтрации проектов. И он генерирует реальное внутреннее приложение поверх электронной таблицы. И приятная часть в том, что данные по-прежнему находятся в Google Sheets. Так что я не мигрирую базы данных и не переписываю свой рабочий процесс только для тестирования чего-либо. Good Taco, по сути, действует как слой сверху, который дает команде гораздо более чистый интерфейс для работы. Так что вместо того, чтобы направлять людей непосредственно в электронную таблицу, где они могут случайно что-то сломать, я могу просто поделиться приложением с командой, и они будут взаимодействовать с ним вместо этого. Честно говоря, это кажется гораздо более практичным, чем тратить недели на создание внутренних панелей мониторинга или пользовательских административных панелей для рабочих процессов, которые уже существуют в таблицах. У них есть бесплатная пробная версия, если вы хотите протестировать ее сами. Так что я оставлю ссылку в описании. Хорошо, давайте вернемся к делу. Хорошо, теперь вы можете видеть, что динамический рабочий процесс запускается. И теперь давайте посмотрим, если вы действительно хотите увидеть весь рабочий процесс с множеством агентов, работающих, и каков статус. Просто введите workflows прямо здесь, в терминале. И вы можете видеть, что это тот, который мы сейчас запускаем. Вы можете видеть, что у нас одновременно работает 63 агента. Итак, в данном случае, если я нажму "ввести", вы можете видеть, что у нас есть разные фазы. Итак, первая фаза — это обобщение, которое фактически передает каждый клип Gemini для его обобщения. Итак, вы можете видеть здесь, что все завершено. Затем он перейдет к стадии два, которая фактически генерирует заголовки для каждого клипа на основе обобщений, которые дает Gemini. Затем, как только это будет сделано, здесь вы можете видеть, что у нас также есть рецензент, который будет просматривать каждый клип, верно? И на основе обобщения и вариантов заголовков, которые он генерирует. И в конечном итоге он переименует эти файлы, верно? Итак, пока вы можете видеть, что это файлы, которые сейчас будут переименованы. И те, которые отмечены галочкой, фактически успешно переименованы. Итак, теперь, если я открою это, верно? Открою файловый менеджер. И я просто нажму на одну из сцен. Например, это мужчина открывает почтовый ящик, но вы можете видеть, что мужчина фактически открыл почтовый ящик и забрал письма. Так что это довольно точно описывает то, что делает это видео в данный момент, и оно дает разные названия, и, по сути, название здесь — это именно то, что являются объекты и что они фактически делают внутри него. Хорошо, так что это, по сути, то, как вы можете использовать Claude, а также понимание видео Gemini, чтобы обрабатывать видео с помощью Gemini, и иметь Gemini, чтобы давать ответ или обобщение Claude, и иметь Claude для выполнения некоторой постобработки, такой как переименование файлов, или использовать это для отладки или любых действий или сценариев использования, которые вы фактически хотите сделать. И теперь это часть рабочего процесса. Итак, если вы заинтересованы в получении навыка, обязательно оставьте комментарий или, в данном случае, проверьте описание ниже для навыка для этого видео, и я обязательно размещу этот навык. Так что, в основном, это все для этого видео. Если вы нашли ценность в этом видео, пожалуйста, поставьте лайк этому видео, рассмотрите возможность подписки на больше контента такого рода. Сказав это, я увижу вас в следующем видео.