Transcription
Привет, я Шри из Techie Talks AI. Это ваше полное руководство для быстрого старта для любого разработчика, готового перейти в экосистему ИИ Google. Вы можете спросить, почему Google? Потому что мы являемся свидетелями настоящего момента Gmail в истории технологий. Благодаря своему комплексному набору продуктов, основанному на массивном предварительном просмотре Gemini 3 Pro, Google эффективно переопределил ландшафт, оставив всех остальных игроков в воздушной арене в роли догоняющих. Давайте начнем. Давайте подготовимся к 2026 году. Мы начинаем с основ. Как использовать API Google Gemini. Это API предварительного просмотра Google Gemini 3 Pro. Добро пожаловать всем. Сегодня мы не просто общаемся с ИИ. Мы собираемся строить с ним. В этом экспресс-курсе мы будем использовать совершенно новый Google Gen AI SDK, чтобы провести вас от простого запроса "Hello World" до создания полностью автономного агента. К концу этого видео вы поймете, как реализовать мультимодальное зрение RAG и вызов функций, используя Gemini 3 Pro и его предварительную версию. Теперь, чтобы сделать это путешествие простым, мы будем использовать собственный ноутбук Google Colab Jupiter. Так что вам не нужно ничего устанавливать, а ссылка на этот ноутбук Colab будет дана в описании. Все, что вам нужно, это API-ключ. Сначала давайте подготовим нашу среду. Мы работаем в Google Colab. Итак, первый шаг — установка официальной библиотеки Gen AI. Теперь, прежде чем мы это сделаем, нам нужно убедиться, что мы нажимаем на эти секреты и вводим ваш API-ключ Gen AI. Получить API-ключ очень просто. Просто посетите studio.google.com и нажмите "Получить API-ключ", и вы получите свой API-ключ здесь, просто нажав на него. Хорошо. Восклицательный знак pip install минус q - gen ai. Это установит официальный Python SDK для gen AI. Хорошо, это сделано. Итак, нам нужно правильно управлять нашей безопасностью. Итак, нам нужно настроить API-ключ с помощью менеджера секретов Colab. Итак, если вы нажмете на эти секреты, вы найдете место, где вы можете ввести gemini_appa key. После этого мы инициализируем клиент Gemini, то есть gen client, и передаем API-ключ через user data.get. Итак, давайте выполним это, чтобы подтвердить, что API-ключ правильный, и да, клиент инициализирован. Теперь мы собираемся посмотреть на простой запрос. Хорошо. Итак, это раздел, где мы передаем простой запрос нашей предварительной модели Google Gemini 3 Pro, объясняющей квантовую запутанность с помощью метафоры о носках. Хорошо. Итак, здесь, если вы откроете свою коробку и увидите красный носок, вы сразу же с 100% уверенностью поймете, что у вашего друга на Марсе синий носок. Хорошо. В этом идея. Но мы увидели, как легко мы можем получить доступ к самой мощной модели, доступной в настоящее время. И это будет становиться все больше и больше в ближайшие дни и недели. И эта настройка важна, потому что она подтверждает, что наш клиент правильно настроен, и демонстрирует возможности модели по генерации необработанного текста, прежде чем мы начнем накладывать сложные инструменты. Следующее — заземление или добавление поиска Google. Представьте себе потенциал, который у нас есть в руках, когда мы можем использовать ИИ и возможности поиска Google. Итак, вот что мы собираемся увидеть, как легко мы можем включить стандартные языковые модели, которые заморожены во времени. Они не знают, что произошло 5 минут назад. Мы исправили это в этой демонстрации, прикрепив инструмент поиска Google к нашему запросу. Это эффективно [смех] дает модели глаза для сканирования веб в реальном времени, гарантируя, что когда мы спрашиваем о текущих событиях или новостях, ответы основаны на реальности, а не на галлюцинациях. Это очень просто. Просто добавьте раздел конфигурации к нашему клиенту Gemini и прикрепите инструменты Google Search Tool. Вот и все. Итак, здесь мы спрашиваем, каковы ключевые технологические события вчерашнего дня. Итак, LLM ищет. Хорошо, вот главные новости. Сбой Cloudflare. Думаю, все мы испытали этот сбой. Джефф Безос возвращается к исполнительным ролям. Google запускает Gemini 3, свою самую продвинутую модель ИИ. Хорошо, это добавило возможность поиска к нашему клиенту Gemini. Теперь давайте дадим ИИ частную память. Мы строим систему генерации с дополненным поиском или RAG. Преобразуя наши собственные документы в математические векторы, мы можем искать в них, чтобы найти точную информацию, которая нужна пользователю. Затем мы заставляем Gemini отвечать на вопросы строго на основе наших частных данных, эффективно создавая второй мозг для вашего приложения. Давайте посмотрим, как это работает. Итак, здесь мы предоставляем пример документа. Это может быть из PDF, веб-сайта или текстового файла. Это ваши собственные знания, массив моих документов. А затем из моих документов мы создаем вложения, используя text embedding 004. Давайте запустим это. Он создал три вектора для нашей базы знаний. В зависимости от размера вашего входного документа, стратегии разбиения на части и т. д. вы получите такое количество векторов. У нас есть функция find best match, и мы передаем запрос. Вот пример: print best match. Find best match. Какой код для Apollo? Если вы посмотрите в знаниях, в нашей базе знаний, у нас есть проект Apollo, секретный код 77-альфа-синий. Давайте запустим это, чтобы протестировать нашу векторную базу данных и ее возможности поиска по сходству. Смотрите здесь, лучшее совпадение: проект Apollo, секретный код запуска 77-альфа-синий. Итак, это поиск по сходству. Он преобразует наш запрос во вложение, а затем находит наиболее близкие совпадающие векторы. Теперь мы собираемся реализовать этот механизм RAG в нашем клиенте Google Gemini Pro. Здесь наш вопрос: каков секретный код запуска? Мы спрашиваем, сначала запрашивая нашу векторную базу данных, чтобы получить совпадающие фрагменты. Затем он создаст окончательный запрос, содержащий наши фрагменты и наш первоначальный запрос. Затем он передаст это нашему клиенту Gemini. Вот и все. Затем вы можете спросить, в чем разница между предыдущим прямым запросом и этим? Нет, это даст более осмысленный ответ. Смотрите здесь, он не просто возвращает содержимое векторной базы данных. Он возвращает только код, потому что это единственное, о чем мы просили. Следующее — мультимодальность, и мы добавим возможность зрения. Мы выходим за рамки текстового поля. Мы собираемся использовать нативную мультимодальную возможность Gemini, передавая фактический объект изображения прямо вместе с нашим текстовым запросом. Это позволяет модели видеть изображение, анализировать его содержимое и даже генерировать конкретные поисковые запросы на основе визуальных данных, которые она видит. Итак, здесь мы загружаем изображение. Это URL изображения. Мы не знаем, что это за изображение, но в этом разделе мы выведем изображение, чтобы увидеть, что это такое. Хорошо. Похоже на инструмент. Итак, здесь [кашляет] мы загружаем изображение в этот объект img и передаем его нашему клиенту, а затем спрашиваем, что это за инструмент, а также генерируем конкретный поисковый запрос Google, который я мог бы использовать для его покупки. Итак, давайте запустим его. Хорошо, на основе изображения этот инструмент — консоль органа для церкви с четырьмя мануалами. Здесь он дает нам запрос, который мы можем использовать для покупки такого оборудования. Итак, здесь говорится: скопируйте и вставьте это в Google, купите подержанный цифровой церковный орган с четырьмя мануалами, и он также предлагает другие альтернативные варианты поиска. Итак, здесь мы добавили мультимодальную возможность зрения к нашему клиенту Gemini. Теперь мы объединяем все, что мы узнали, в цикл агента, объединяя инструмент поиска из нашей предыдущей демонстрации с возможностями рассуждения из демонстрации зрения. Мы создаем систему, которая не просто угадывает, а проверяет себя. Мы можем даже просматривать метаданные в ответе, чтобы точно увидеть, какие источники модель использовала для проверки своего ответа. У меня есть 3-галлонный кувшин и 5-галлонный кувшин. Мне нужно ровно четыре галлона воды. Как мне это сделать? Объясните шаг за шагом. Он дает пошаговый ответ на наш вопрос. Смотрите, есть два способа сделать это. Но вот самый быстрый метод. Я не читаю это, но в этом идея. Итак, отличие от нашего предыдущего клиента заключается в том, что здесь мы добавили конфигурацию и задали температуру, чтобы быть более точным. Итак, вот агент проверки фактов, который использует вызов функций, то есть Google Search Tool вызывается, как и раньше. Итак, здесь мы спросили, кто является текущим генеральным директором Twitter X и когда именно он вступил в должность? На данный момент у X нет официально назначенного генерального директора. В настоящее время компания находится под операционным контролем своего владельца Илона Маска, который также является исполнительным председателем и главным техническим директором. Итак, ниже приведены используемые источники. Наконец, мы достигаем самого мощного уровня — вызова функций. Это дает ИИ руки для взаимодействия с внешним миром или доступа к нашим собственным системам. Мы определяем стандартную функцию Python, такую как конвертер валют, и Gemini решает, будет ли и когда выполнять этот код для решения проблемы. Это мост между естественным языком и фактическим выполнением программного обеспечения. Вот демонстрация вызова функций. Здесь мы определяем нашу пользовательскую функцию get exchange rate, и она просто предоставляет некоторые жестко закодированные значения, чтобы продемонстрировать использование вызова функций. Здесь мы добавили нашу функцию в конфигурацию вызова инструментов. Смотрите, ранее мы использовали Google Grounding или поиск. Мы могли бы использовать и это вместе с этим. Но здесь мы хотим убедиться, что ответ исходит от нашей функции. И затем здесь у нас есть клиент Gemini, и мы передаем конфигурацию инструмента здесь. И затем мы задаем наш запрос: сколько стоит 100 евро? Давайте запустим его. Смотрите, 100 евро эквивалентны 105 долларам США. Итак, наша функция здесь, смотрите, мы изменим это на 106 и посмотрим на ответ. Смотрите здесь, 1,06 USD€1. Следовательно, 100 — это 106 USD. На этом завершается итоговое резюме. Итак, мы прошли от простой генерации текста до создания инструмента с помощью агента. Теперь у вас есть план для создания поисковых систем, систем RAG и ботов, ориентированных на действия. Поэтому, когда вы покупаете код, убедитесь, что вы понимаете код, скрывающийся за кулисами. Единственное, что осталось сделать, это взять этот код, получить свой API-ключ и начать создавать свои собственные приложения. Спасибо за просмотр и помните, Gemini всегда здесь, чтобы помочь вам в вашем пути кодирования. Всего наилучшего. Увидимся снова в другом видео. Пока-пока. Спасибо за просмотр. Пожалуйста, ставьте лайки, делитесь и подписывайтесь. Ваша поддержка очень помогает. Есть идеи или предложения? Оставьте их в комментариях. Давайте строить вместе. В Shoguni мы предлагаем экспертные консультации по автоматизации no-codemake.com и Python с готовыми к использованию модулями для быстрого старта ваших проектов. Оставайтесь с нами и подписывайтесь на новые видео.