Transcription
ИИ. ИИ. ИИ. ИИ. ИИ. ИИ. Знаете, более агентурный. Агентурные возможности. ИИ-агент. Агенты. Агентурные рабочие процессы. Агенты. Агенты. Агент. Агент. Агент. Агент. Агент. Агентурный. Хорошо. Большинство объяснений ИИ-агентов либо слишком технические, либо слишком простые. Это видео предназначено для таких людей, как я. У вас нет никакого технического образования, но вы регулярно используете ИИ-инструменты и хотите узнать ровно столько об ИИ-агентах, чтобы понять, как это на вас влияет. В этом видео мы будем следовать простому плану обучения "один, два, три", опираясь на концепции, которые вы уже понимаете, такие как ChatGPT, а затем переходя к ИИ-рабочим процессам, и, наконец, к ИИ-агентам. Все это время мы будем использовать примеры, с которыми вы действительно столкнетесь в реальной жизни. И поверьте мне, когда я говорю вам, что эти пугающие термины, которые вы видите повсюду, такие как RAG, RAG или ReAct, намного проще, чем вы думаете. Давайте начнем. Начнем с первого уровня, больших языковых моделей. Популярные ИИ-чат-боты, такие как ChatGPT, Google Gemini и Claude, являются приложениями, построенными на основе больших языковых моделей, LLM, и они отлично генерируют и редактируют текст. Вот простая визуализация. Вы, человек, предоставляете ввод, а LLM производит вывод на основе своих обучающих данных. Например, если бы я попросил ChatGPT составить электронное письмо с просьбой о неформальной встрече, мой запрос — это ввод, а полученное письмо, которое намного вежливее, чем я когда-либо был бы в реальной жизни, — это вывод. Пока все хорошо, верно? Простые вещи. Но что, если бы я спросил ChatGPT, когда моя следующая неформальная встреча? Даже не видя ответа, и вы, и я знаем, что ChatGPT потерпит неудачу, потому что он не знает этой информации. У него нет доступа к моему календарю. Это подчеркивает две ключевые черты больших языковых моделей. Во-первых, несмотря на обучение на огромных объемах данных, они имеют ограниченное знание проприетарной информации, такой как наша личная информация или внутренние данные компании. Во-вторых, LLM пассивны. Они ждут нашего запроса, а затем отвечают. Верно? Держите эти две черты в уме, двигаясь дальше. Переходим ко второму уровню, ИИ-рабочим процессам. Давайте продолжим наш пример. Что, если бы я, человек, сказал LLM: "Каждый раз, когда я спрашиваю о личном событии, выполняй поисковый запрос и получай данные из моего Google календаря, прежде чем дать ответ". С этой логикой, реализованной следующим образом, в следующий раз, когда я спрошу: "Когда моя неформальная встреча с Илоном Маском?", я получу правильный ответ, потому что LLM теперь сначала зайдет в мой Google календарь, чтобы найти эту информацию. Но вот где становится сложно. Что, если мой следующий уточняющий вопрос будет: "Какая погода будет в тот день?" LLM теперь не сможет ответить на запрос, потому что путь, который мы указали LLM, — это всегда искать в моем Google календаре, который не содержит информации о погоде. Это фундаментальная черта ИИ-рабочих процессов. Они могут следовать только заранее определенным путям, установленным людьми. И если вы хотите углубиться в технические детали, этот путь также называется управляющей логикой. Продолжая мой пример, что, если бы я добавил больше шагов в рабочий процесс, разрешив LLM получать доступ к погоде через API, а затем, просто для развлечения, использовать модель преобразования текста в аудио, чтобы произнести ответ. Прогноз погоды на встречу с Илоном Маском: солнечно, с шансом быть хорошим парнем. Вот в чем дело. Независимо от того, сколько шагов мы добавим, это все равно просто ИИ-рабочий процесс. Даже если бы было сотни или тысячи шагов, если человек является лицом, принимающим решения, нет никакого участия ИИ-агента. Совет: генерация с дополненным поиском или RAG — это модный термин, который часто используется. Проще говоря, RAG — это процесс, который помогает ИИ-моделям искать информацию перед ответом, например, получать доступ к моему календарю или службе погоды. По сути, RAG — это просто тип ИИ-рабочего процесса. Кстати, у меня есть бесплатный набор инструментов ИИ, который помогает разобраться в шуме и освоить основные ИИ-инструменты и рабочие процессы. Я оставлю ссылку на него ниже. Вот пример из реальной жизни. Следуя удивительному руководству Хелены Лу, я создал простой ИИ-рабочий процесс с помощью make.com. Здесь вы можете увидеть, что сначала я использую Google Sheets для чего-то. В частности, я компилирую ссылки на новостные статьи в Google Sheet. И вот этот Google Sheet. Во-вторых, я использую Perplexity для суммирования этих новостных статей. Затем, используя Claude и написанный мной запрос, я прошу Claude составить пост для LinkedIn и Instagram. Наконец, я могу запланировать его автоматический запуск каждый день в 8 утра. Как видите, это ИИ-рабочий процесс, потому что он следует заранее определенному пути, установленному мной. Шаг первый, вы делаете это. Шаг второй, вы делаете это. Шаг третий, вы делаете это. И, наконец, не забудьте запускать ежедневно в 8 утра. Последнее, если я протестирую этот рабочий процесс и мне не понравится конечный результат поста в LinkedIn, например, как вы можете видеть прямо здесь, э, он недостаточно смешной, а я от природы остроумен, верно? Мне придется вручную вернуться и переписать запрос для Claude. Хорошо? И этот итеративный процесс проб и ошибок в настоящее время выполняется мной, человеком. Так что имейте это в виду, двигаясь дальше. Хорошо, третий уровень, ИИ-агенты. Продолжая пример make.com, давайте разберем, что я делал до сих пор как человек, принимающий решения. С целью создания постов в социальных сетях на основе новостных статей мне нужно сделать две вещи. Во-первых, рассуждать или думать о лучшем подходе. Мне нужно сначала скомпилировать новостные статьи, затем суммировать их, затем написать финальные посты. Во-вторых, действовать, используя инструменты. Мне нужно найти и связать эти новостные статьи в Google Sheets. Использовать Perplexity для суммирования в реальном времени, а затем Claude для написания текстов. Итак, и это самое важное предложение во всем этом видео. Одно огромное изменение, которое должно произойти, чтобы этот ИИ-рабочий процесс стал ИИ-агентом, заключается в том, чтобы меня, человека, принимающего решения, заменила LLM. Другими словами, ИИ-агент должен рассуждать. Какой самый эффективный способ компиляции этих новостных статей? Должен ли я копировать и вставлять каждую статью в документ Word? Нет, вероятно, проще скомпилировать ссылки на эти статьи, а затем использовать другой инструмент для получения данных. Да, это имеет больше смысла. ИИ-агент должен действовать, то есть делать вещи с помощью инструментов. Должен ли я использовать Microsoft Word для компиляции ссылок? Нет. Вставка ссылок непосредственно в строки намного эффективнее. А как насчет Excel? М. Так что пользователь уже подключил свою учетную запись Google к make.com. Поэтому Google Sheets — лучший вариант. Совет: благодаря этому наиболее распространенной конфигурацией для ИИ-агентов является фреймворк ReAct. Все ИИ-агенты должны рассуждать и действовать. Так что ReAct. Звучит просто, когда мы разберем это, верно? Третья ключевая черта ИИ-агентов — их способность к итерации. Помните, когда мне пришлось вручную переписывать запрос, чтобы сделать пост в LinkedIn более смешным? Мне, человеку, вероятно, придется повторить этот итеративный процесс несколько раз, чтобы получить что-то, что меня устроит, верно? ИИ-агент сможет делать то же самое автономно. В нашем примере ИИ-агент автономно добавит еще одну LLM, чтобы критиковать свой собственный вывод. Хорошо, я составил первую версию поста в LinkedIn. Как мне убедиться, что он хорош? О, я знаю. Я добавлю еще один шаг, где LLM будет критиковать пост на основе лучших практик LinkedIn. И давайте повторять это до тех пор, пока критерии лучших практик не будут выполнены. И после нескольких таких циклов мы получим окончательный результат. Это был гипотетический пример. Так что давайте перейдем к реальному примеру ИИ-агента. Эндрю — выдающаяся фигура в области ИИ, и он создал этот демонстрационный веб-сайт, который иллюстрирует, как работает ИИ-агент. Я оставлю ссылку на полное видео ниже, но когда я ищу ключевое слово, такое как "лыжник", ИИ-визуальный агент на заднем плане сначала рассуждает, как выглядит лыжник. Человек на лыжах, едущий очень быстро по снегу, например, верно? Я не уверен. А затем он действует, просматривая клипы в видеоматериалах, пытаясь определить, что, по его мнению, является лыжником, индексируя этот клип и затем возвращая этот клип нам. Хотя это может не показаться впечатляющим, помните, что все это сделал ИИ-агент, а не человек, который заранее просматривал footage, вручную идентифицировал лыжника и добавлял теги, такие как "лыжник", "гора", "лыжи", "снег". Программирование, очевидно, намного более техническое и сложное, чем то, что мы видим на фронтенде, но в этом и заключается смысл этой демонстрации, верно? Средний пользователь, такой как я, хочет простое приложение, которое просто работает, без необходимости понимать, что происходит на бэкенде. Говоря о примерах, я также создаю своего собственного базового ИИ-агента с помощью Nan. Так что дайте мне знать в комментариях, какой тип ИИ-агента вы хотели бы, чтобы я сделал в следующем руководстве. Чтобы подвести итог, вот упрощенная визуализация трех уровней, которые мы рассмотрели сегодня. Уровень первый: мы предоставляем ввод, а LLM отвечает выводом. Легко. Уровень второй, для ИИ-рабочих процессов: мы предоставляем ввод и говорим LLM следовать заранее определенному пути, который может включать получение информации из внешних инструментов. Ключевая черта здесь в том, что человек программирует путь, по которому следует LLM. Уровень третий: ИИ-агент получает цель, а LLM выполняет рассуждения, чтобы определить наилучший способ достижения цели, предпринимает действия с помощью инструментов для получения промежуточного результата, наблюдает за этим промежуточным результатом и решает, требуются ли итерации, и производит окончательный результат, который достигает первоначальной цели. Ключевая черта здесь в том, что LLM является лицом, принимающим решения в рабочем процессе. Если вы нашли это полезным, возможно, вы захотите узнать, как создать базу данных запросов в Notion. Увидимся в следующем видео. А пока всего наилучшего.