Transcription
Что происходит, ребята? Итак, недавно я предоставил своим кодинг-агентам, таким как Cloud Code и Gemini 3, доступ к их собственным инструментам браузера на компьютере, и теперь они могут автоматизировать что угодно. Эта новая система предоставления кодинг-агентам доступа к их собственным инструментам браузера и автоматизированным рабочим процессам создает совершенно новые автоматизации, которые буквально никогда не были возможны раньше. Они также работают круглосуточно и без выходных, улучшая себя на лету. И самое приятное то, что я нашел решение сделать это без каких-либо затрат. И ни один другой эксперт по ИИ в Интернете не показал вам то, что я собираюсь показать вам сегодня. В этом видео я объясню, как инструменты браузера Aentic на самом деле работают в рамках, которые я создал, под названием II framework, и почему это сделает кучу людей действительно, действительно богатыми, применяя эти новые типы агентов к бизнесу. После этого мы вместе создадим наш первый агентный ИИ-рабочий процесс, который получает доступ к собственному браузеру, выполняет команды самостоятельно и улучшает себя самостоятельно. Вам не нужно знать, как кодить, чтобы следить за этим учебным пособием. Я разработал это конкретное видео максимально дружелюбным для новичков, потому что, проработав в сфере ИИ последние 3 года, я с абсолютной уверенностью говорю вам, что это изменит всю экономику и является будущим автоматизации ИИ. И к концу этого видео вы настроите своих агентных компьютерных агентов вместе со мной. Меня зовут Кевин. Я основатель Creator OS, которая является операционной системой ИИ, управляющей всеми этими агентными рабочими процессами, которые специально разработаны для конкретных бизнес-сценариев. И это просто выведет все на совершенно новый уровень. И я думаю, что лучший способ объяснить вам, насколько мощным станет будущее автоматизации с этими инструментами браузера, — это просто показать вам одного из агентов, над которым я работаю, чтобы полностью автоматизировать исходящий охват в Instagram. Это то, что я называю моим агентом продаж в Instagram. И этот агент работает так: он будет использовать всю базу данных теплых лидов. Теперь эти теплые лиды — это люди, которые взаимодействовали с нашими постами в прошлом, то есть ставили лайки, делились или комментировали. И это означает, что эти люди, которым мой агент теперь отправляет DM, на самом деле являются очень теплыми лидами, которые потенциально могут быть заинтересованы в том, что я могу предложить. И платформы, такие как ManyHat или API Instagram, буквально не предлагают такой функции. Они предлагают, например, функцию «комментарий в DM». Но это выводит все на совершенно новый уровень, потому что мы парсим людей, которые взаимодействовали с нашими постами. Затем мы получаем информацию об их профиле и обогащаем эту информацию о профиле. Затем мы передаем ее этому агентному агенту, который имеет доступ к своему собственному браузеру, и затем он автономно будет запускать эту кампанию DM от нашего имени несколько раз в день. Теперь это также ускоренная версия, чтобы показать вам, как работает эта первоначальная система. Но агент также использует браузер, как обычный человек, добавляя определенные блоки и определенные паузы между исходящей кампанией, чтобы нас не заблокировали в Instagram, и чтобы мы могли масштабировать это для множества клиентов. И то, как агент затем показывает нам всю свою работу, — это наличие доступа к нашей базе данных. Как только он завершит рабочий процесс, который вы только что видели, он просто добавляет свои результаты в карточку агента DM в Instagram, чтобы мы могли отслеживать его производительность, не наблюдая, как агент выполняет эту задачу. И таким образом, это очень масштабируемо для наших ИИ-агентств. Хорошо. Теперь я проведу вас через презентацию, которая подробно расскажет, как это работает, какой технологический стек необходим для настройки. И я просто хочу также сообщить вам, что кодовая база операционной системы Agentic, которая имеет этого агента DM в Instagram, на самом деле доступна в моей академии без кода на School. Так что, если хотите, зайдите туда, возьмите всю кодовую базу, и таким образом у вас будет настроен пример Instagram. Итак, сегодняшний обзор будет следовать этой дорожной карте из шести шагов. Мы разберем технологический стек, который фактически создает весь рабочий процесс автономного браузерного агента. Затем я объясню, как мы используем нечто под названием headless browser, и как headless browser агенты по сравнению с компьютерным использованием Cloud Code, которое мы видим, или любыми другими основными решениями, на самом деле хуже, чем решение с headless browser, которое я покажу вам сегодня. Я проведу вас через II framework и как это на самом деле заставляет наших headless browser компьютерных агентов, знаете ли, выполнять всю эту работу последовательно, а также улучшать себя. Итак, я сделаю все возможное, чтобы объяснить, как работает этот фреймворк. А затем мы перейдем к конкретному рабочему процессу, и я покажу вам, как этот конкретный рабочий процесс на самом деле работает, закулисье того, как агент думает о необходимых шагах для выполнения действий. А затем мы подробно рассмотрим, что именно мы будем создавать вместе, а именно агент продаж в Instagram, который вы видели в начале этого видео. После этого мы с вами вместе создадим этот первый агентный рабочий процесс браузера компьютера. Итак, давайте перейдем к остальной части разбора. Ставьте лайк и подписывайтесь, и давайте сделаем это, детка. Итак, технологический стек, который я рекомендую использовать здесь, ребята, это Cursor в качестве среды IDE, Claude Code и API Anthropic, которые мы будем использовать для нашего рабочего процесса. А затем мы будем использовать нечто под названием Playwright MCP server. Playwright — это приложение Microsoft, которое позволяет выполнять любые задачи браузера в Интернете. Приятно то, что Playwright полностью бесплатен. Он с открытым исходным кодом и работает совершенно уникальным образом по сравнению с традиционным способом, который все остальные показывают вам сегодня. А затем, когда у вас есть вся эта настройка в вашей среде Cursor, вы можете войти в любого поставщика, любое программное приложение, которое вы хотите автоматизировать. Так что вы хотите войти, например, в Gmail, и тогда ваши Playwright-агенты будут иметь доступ к вашему логину в Gmail, или Instagram, или Facebook, или буквально любому типу программного обеспечения, которое вы хотите автоматизировать. Теперь я также добавил этого слона, потому что это наша база данных, наша база данных Postgress. Поэтому, когда наши агенты фактически проводят автоматизацию, мы хотим, чтобы они сохраняли свои результаты в базе данных, потому что тогда мы можем показать на фронтенде, что на самом деле происходит, и таким образом у нас есть очень простой процесс отладки, потому что выходные данные, которые мы получаем, — это единственное, что нам нужно для ручного улучшения рабочего процесса. Однако агент также автономно улучшает себя на основе предоставленных вами целей. Теперь я хочу объяснить, почему инструмент компьютерного использования Cloud Code на самом деле не то, что мы используем, и почему мы используем Playwright + API Anthropic для получения очень последовательных результатов по сравнению с агентами с ИИ-зрением. Итак, первая причина, по которой этот рабочий процесс изменит правила игры, заключается в том, что Playwright-агент на самом деле не видит экран, а видит экран как код, и его способность понимать код по сравнению с пониманием изображений на экране намного лучше. Надежность этого составляет 99,9%. И он делает это, понимая различные CSS-селекторы на странице и выбирая именно то, что мы ему поручаем выбрать. Другое преимущество этого рабочего процесса заключается в том, что когда ваш Playwright-агент сталкивается с ошибкой, у него есть команда сделать снимок экрана браузера, и он сделает этот снимок экрана и отправит его обратно в наш API Anthropic. Агент Anthropic затем прочитает браузер. Допустим, он пытался нажать на кнопку, но не может найти кнопку. Затем он делает снимок экрана, отправляет его обратно в Anthropic. Anthropic затем читает снимок экрана и инструктирует Playwright-агента, как правильно выбрать нужный элемент на экране. Как только это решение будет фактически решено, рабочий процесс, использующий II framework, сохранит этот запуск. И таким образом, в упрощенном виде, вот как работает II framework для автономных браузерных агентов. Итак, давайте предположим, что мы выполняем автоматизацию email-скрейпинга для мгновенного исходящего трафика. В папке информации MD находятся навыки Cloud Code, и в этом навыке мы будем инструктировать его, как именно мы хотим, чтобы этот рабочий процесс работал. Итак, агент напишет что-то вроде: «Это автоматизированный рабочий процесс для скрейпинга лидов. Вот как это сделать». И то, что делает эта папка информации MD, — это отслеживает все предыдущие запуски. Так что, скажем, я запускал этого агента 100 раз. После этих 100 запусков сам агент сможет самостоятельно улучшить папку информации MD, чтобы он реже сталкивался с ошибками. Агенту также будет предоставлен скрипт реализации на Python. Скрипт Python — это фактический код, который агенту нужно выполнить, чтобы этот рабочий процесс работал. И в этом случае он фактически отправляет ему инструкции по коду, к которым имеет доступ Playwright MCP. И чтобы настроить вашего агента в этом примере, у него будут инструкции по коду из скрипта Python. У него будет доступ к базе данных через API базы данных, и у него будут учетные данные для входа в любое приложение, к которому нам нужно предоставить ему доступ. Итак, когда этот агент фактически запускается, он либо преуспевает, либо терпит неудачу. Если он преуспевает, это означает, что весь этот рабочий процесс фактически был выполнен, и результат рабочего процесса будет сохранен в базе данных. И, например, успешный запуск для email-скрейпинга до email-выхода — это отслеживание всех лидов и того, какие лиды были связаны до сих пор, какие лиды открыли свою электронную почту до сих пор. Но предположим, агент запускает автоматизацию и сталкивается с ошибкой. Ну, в этом случае агент может просто сделать снимок экрана и отправить его обратно в API Anthropic, который затем перепишет папку информации MD, когда он найдет решение. И таким образом система просто продолжает работать. Теперь давайте подробно разберем этот конкретный пример. Итак, мы начнем с файла. Итак, мы начнем с файла information MD. Другой способ думать об этом — это мозг наших ИИ-агентов, и он будет иметь цель рабочего процесса, контекст рабочего процесса и изученные ограничения или память. он будет иметь постоянную память, основанную на предыдущих запусках. Итак, в этом примере, скажем, мы парсили стоматологов в Торонто. И стоматологи, которых мы парсим, скажем, после 10 запусков столкнулись с парой ошибок в некоторых из этих запусков. Ну, агент фактически отправит информацию архитектору ИИ-агента, который затем использует скрипт реализации на Python для выполнения кода. Скрипт Python объясняет, как использовать инструменты Playwright MCP, которые используют живой Интернет для выполнения любой задачи. Если процесс работает, он возвращается к агенту-архитектору, и этот цикл просто продолжает работать по любому графику, который мы хотим. Если он не работает, то агент делает снимок экрана и отправляет его обратно в папку информации MD, чтобы он записал новое ограничение и снова попробовал весь рабочий процесс. Итак, теперь давайте поговорим о конкретном сценарии использования, который мы будем создавать сегодня, а именно о системе вовлечения лидов в Instagram. Итак, база данных генерации лидов находится в той же базе данных, в которой этот агент будет выполнять свои задачи и хранить свои результаты. И эта база данных может хранить всех людей, которые, например, поставили лайк нашим постам в Instagram. Таким образом, эта система будет хранить лиды от имени агента, а затем мы можем обогатить эти лиды, пропустив их через другой тип скрейпинга, чтобы получить информацию об их профиле, их местоположении, любые другие детали, которые могут быть связаны в их биографии. Это позволяет нам писать индивидуальные исходящие сообщения этим новым лидам. И вот как работает эта система: мы предоставляем агенту-архитектору доступ для входа в нашу учетную запись Instagram, а затем он будет использовать файлы cookie и сохранять файлы cookie, чтобы каждый раз, когда мы хотим запустить эту систему DM в Instagram, она просто появлялась, и нам никогда больше не придется входить в систему или выполнять 2FA. И снова со временем этот конкретный рабочий процесс определит определенные ограничения. Так что после некоторого времени работы я могу рассказать вам об ограничениях. Итак, каждый аккаунт Instagram может отправлять до 200 исходящих сообщений на аккаунт Instagram. До 10 DM в час, чтобы вас не заблокировали. Теперь давайте поговорим о том, как эта система агентных инструментов браузера будет расширяться на любой автоматизированный рабочий процесс, который мы можем себе представить. Итак, в предыдущем примере я показал, что мы вошли в Instagram, а затем работали над этим рабочим процессом, пока он не был доведен до совершенства, пока он не работал идеально, как в примере, который мы видели во вступлении, а затем мы просто дали ему работать. Ну, а теперь представьте, что мы делаем это для Gmail, мы делаем это для Shopify, мы делаем это для наших инвестиций, мы делаем это для создателей OnlyFans. Список можно продолжать. И точная же настройка работает для каждого из этих рабочих процессов, где мы передаем учетные данные доступа, то есть API-ключи или информацию для входа, агенту-архитектору, который будет иметь цели, контекст и ограничения указанного рабочего процесса. Затем он будет использовать токен сессии, к которому у него есть доступ, чтобы войти к этому поставщику услуг и выполнить любое решение, которое мы хотим. И вот это то, что превращает то, что раньше было невозможно с помощью программной автоматизации, в возможности впервые. Да? Итак, это были все вещи, которые были невозможны через простой API-ключ. Нам нужны были API-ключи плюс учетные данные пользователя и доступ к браузеру компьютера. Теперь, ребята, мы можем вместе создать ваш первый агентный компьютерный агент с нуля. Теперь есть два способа, которыми вы можете следить за этим с этого момента. Если вы являетесь частью No Code Academy, у вас будет доступ к кодовой базе Agentic OS. Так что вы можете зайти и взять ее. А если вы не хотите присоединяться к академии, то в описании ниже я привел системный запрос для настройки вашей IDE в Cursor, replit, VS Code, где угодно, чтобы подготовить ваш II framework, чтобы вы могли следить за этим. Это название репозитория, к которому у вас будет доступ, под названием Agentic OS Academy. И я просто нажму «создать репозиторий». Как только ваша электронная почта получит доступ к этой кодовой базе, вы сможете использовать ее точно так же, как я показываю вам здесь. И поэтому, как только вы получите доступ к этой кодовой базе, все, что вам нужно сделать, это нажать «использовать этот шаблон», создать новый репозиторий, и таким образом вы станете владельцем интеллектуальной собственности этой кодовой базы самостоятельно. Так что у меня не будет доступа к тому, что вы создадите дальше, и у вас будет вся эта кодовая база, которая включает в себя агента Instagram. Итак, когда это произойдет, мы перейдем в раздел кода. Мы нажмем на фрагмент кода HTTPS и скопируем этот URL. Когда мы зайдем в Cursor, вы, ребята, нажмете «клонировать репозиторий». Вы вставите ссылку, которую получили с GitHub. И агент просто начнет создавать это. Теперь следующее, что нам нужно сделать, это создать нашу папку. Так что я бы назвал это вашей папкой Agentic OS. Выберите ее в качестве места назначения репозитория, и он клонирует весь репозиторий. Если мы откроем папку реализации, мы увидим, что у нас есть конфигурации DM в Instagram, а если мы откроем папку инструкций, мы увидим, что у нас есть руководство по инструкциям для агента DM в Instagram. Итак, теперь все, что нам не хватает, это некоторые зависимости. Теперь, что я также сделал, ребята, это добавил набор лидов для Instagram, которые вы сможете использовать, чтобы ваш агент действительно был настроен и работал. И когда он правильно использует эти лиды, вы можете настроить автоматизацию, чтобы передавать ему лиды, которым вы действительно хотите отправлять DM. Так что я рекомендую сначала использовать те, которые находятся в кодовой базе, потому что это просто сэкономит вам время на полную настройку вашего агента. Итак, первый запрос, который мы отправим, — это «настроить рабочий процесс DM агента Instagram». Нам нужно установить зависимости для Playwright. А затем мне нужно войти с помощью 2FA, когда вы запустите браузер для агентного рабочего процесса. И мы делаем это потому, что когда агент фактически, знаете ли, сделает это за нас, он сохранит эту сессию JSON в коде. И таким образом этот агент может открывать Instagram неоднократно. Итак, теперь мы просто установим зависимости. Итак, установка Playwright, Python, браузера Chromium, и это создаст папку ENV или папку секретов, где будут храниться наши учетные данные Instagram. А затем он запустит весь браузер для нас. Так что мы можем вынести этот канал сюда, и это должно показать нам, что именно происходит в терминале с кодинг-агентом и что он на самом деле делает. И поэтому мы можем сделать это немного больше для вас, ребята, тоже. Так что мы можем видеть все, что происходит. Браузер Chromium теперь установлен, и он только что создал папку ENV. И поэтому в папке ENV запрашивается ваше имя пользователя Instagram и ваш пароль Instagram. Так что я быстро добавлю это, а затем перейдем к следующему шагу. Хорошо, ребята. Итак, теперь произойдет следующее: агент буквально просто откроет страницу Instagram. И мне пришлось остановить агента, потому что я хотел показать вам, как это работает. Итак, теперь мы сделаем следующее: я нажму «перейти». И агент должен просто открыть этот браузер от нашего имени. Хорошо. Итак, здесь мы видим на экране, что агент входит на веб-сайт одного из моих клиентов. Так что m77.shop — это имя пользователя в Instagram. И мы можем видеть здесь, что он успешно вошел в систему. И поэтому, если мы фактически закроем половину экрана и посмотрим, что происходит в Cursor, мы увидим, что браузер теперь запущен, и он будет использовать DM, которые мы ему дали, или лиды, которые мы ему дали, чтобы немедленно начать отправлять DM. Так что я больше не касаюсь экрана. Он просто продолжает работать. Он выбирает новый аккаунт. И мы увидим, что этот агент теперь найдет аккаунт и начнет отправлять DM. Правильно. Итак, он нашел этот аккаунт, Aush Tayagi или кто бы это ни был, открыл их разговор в DM в Instagram, написал наше индивидуальное сообщение, и наше индивидуальное сообщение в настоящее время гласит: «Имя пользователя, мы создали мгновенный сервис для Instagram. Он автоматизирует DM в масштабе. Он персонализирует. Он отправляет персонализированные сообщения с помощью ИИ и бронирует звонки, пока вы спите». Теперь вы можете зайти в скрипт Python в II framework для этого агента и изменить то, что именно вы хотите, чтобы он говорил. Но теперь, когда вы это настроили, этот агент затем уйдет на сон примерно на 60 секунд. Так что теперь он обновляет страницу справа. Он возвращается на главную страницу DM в Instagram. Он теперь находит следующий лид в последовательности, который IG. Давайте посмотрим, кто этот человек. Мы получили IG от Gazelle или Gazelle. Он теперь отправит им точно такое же DM. Вот так. И он будет делать это снова и снова, пока мы не пройдем либо всех лидов, либо не достигнем ограничения Instagram, которое составляет 200 сообщений в день или 10 сообщений в час. И вся эта информация передается в журналах слева. И это агентный фреймворк, который я создал для инструментов браузера, чтобы они были очень мощными, когда мы даем их кодинг-агентам. И теперь мы можем программировать любую автоматизацию в Интернете, что я собираюсь показывать вам гораздо больше, теперь, когда вы знаете, как это работает. Надеюсь, вам понравилось. Увидимся в следующий раз.