Transcription
Google только что выпустил свой API поиска по файлам, который не только значительно упрощает выполнение RAG, но и предлагает одни из самых агрессивных цен, которые я видел от поставщика, не являющегося открытым исходным кодом. Хранение, запросы и создание эмбеддингов практически бесплатны, особенно по сравнению с большинством других поставщиков на рынке. И это означает, что вы можете создавать производственные RAG с надежной производительностью, хорошим семантическим поиском и цитатами за долю стоимости, которую вам пришлось бы заплатить всего год назад.
Учитывая все новые продукты и функции, которые Gemini выпускал в последние несколько недель, становится совершенно ясно, что они стремятся не только построить множество недостроенных мостов для рынка ИИ, но и предоставить вам комплексные решения. И этот новый API поиска по файлам не является исключением.
Итак, в этом видео я расскажу вам, что такое API поиска по файлам, как он работает и как вы можете использовать его в таких инструментах, как AI Studio, Any, а также Cloud Code, чтобы RAG стал менее обременительным и более готовым к использованию. Давайте приступим.
Итак, если вы зайдете в их документацию, вы увидите, что их цель, по сути, состоит в том, чтобы максимально упростить для вас загрузку чего угодно, например, текстового файла или PDF-файла, и автоматическое преобразование его в их собственный конвейер, где у вас не так много контроля над тем, что происходит под капотом, но это довольно готовое решение в том смысле, что вы можете загружать эти файлы, а Gemini будет решать, как их разбивать, как их встраивать и выполнять работу за вас.
Если вы не очень технически подкованы, они предоставили демонстрационное приложение, которое при нажатии перенесет вас на эту страницу в AI Studio. И вы можете фактически вернуться в сам AI Studio. И теперь, если вы знакомы с их новыми обновлениями и улучшениями Vibe Coding, то, зайдя в раздел "Создание" прямо здесь, вы увидите, что несколько различных опций включают создание чат-приложения на базе ИИ, Gemini Intelligence. Так что добавление этого в приложение AI Studio Vibe Coding стало проще, чем когда-либо.
Теперь для быстрой демонстрации, вот как это выглядит "из коробки". И все, что вам нужно сделать, это включить API-ключ и пополнить его. То есть просто указать какой-либо способ оплаты. Он не должен взимать с вас плату в течение длительного времени, исходя из их ценообразования.
Итак, если вы перейдете к просмотру файлов, вы можете загрузить любой файл, который хотите. И вы увидите, как быстро он проходит от загрузки до разбиения и добавления в базу знаний. Я собираюсь загрузить этот файл под названием "thumbnail masterclass". И когда я нажму "Загрузить и чат", он должен взять документ. Затем он проиндексирует его, пройдет и создаст эмбеддинги, используя их демонстрационную модель за кулисами. А затем он в конечном итоге создаст все фрагменты и отправит их в их хранилище файлов. И менее чем за 10 секунд он берет этот файл, выполняет на нем автоматический RAG. И теперь вы "из коробки" можете нажать на предложенные вопросы.
Так что я могу просто сказать здесь: "Можете ли вы обобщить основные уроки из файла, который я вам только что предоставил?" И тогда он должен быть в состоянии взять этот файл, разбить его в плане резюме и предоставить источники и цитаты. И вы можете видеть здесь, что он выдает полное резюме по пунктам. И если вы прокрутите вниз до самого конца, он пройдет по всем источникам, где, если вы нажмете на источники, он покажет вам предварительный просмотр фрагментов, где, по его мнению, он нашел соответствующий ответ. Так что он скажет вам, с каких страниц это взято. И, очевидно, в этом случае цитаты все взяты из одного и того же файла. Но предполагая, что у вас было 10, 15, 20 разных файлов, вы могли бы отследить, какие пять основных источников были использованы для получения ответа.
Теперь это, очевидно, использование этого нового API в простом режиме. Если вы посмотрите на их документацию по поиску по файлам, независимо от того, понимаете вы код или нет, вы можете взять все это. Вы можете перейти и нажать на это, нажать "Просмотреть как markdown", и это сгенерирует эту страницу. Вы можете передать эту страницу выбранному вами ИИ, будь то Cursor, Claude Code. И именно это я и сделал, чтобы довольно быстро понять, как использовать его в таких инструментах, как Any и Cloud Code.
Итак, дальше я покажу вам, как мы можем использовать это в Any. А затем мы перейдем к Cloud Code ближе к концу видео.
Итак, в этом рабочем процессе я не только покажу вам, как загружать файлы в хранилище файлов и создавать хранилище файлов в API поиска по файлам, но и как использовать его "из коробки". Итак, вы можете попросить ИИ-агента использовать этот инструмент поиска документов для запроса любого хранилища файлов, которое вы в конечном итоге создадите. И, очевидно, я хочу, чтобы вы сидели, расслабились и просто следили. И я сделаю это доступным для вас по второй ссылке в описании ниже, так что вы можете просто использовать его "из коробки".
Итак, слева направо здесь у нас есть возможность загрузить форму. Когда мы нажмем "Выполнить рабочий процесс", появится модальное окно, которое позволит нам загрузить файл PDF, DOCX или текстовый файл. Одна вещь, которую я заметил, это то, что он, кажется, не очень любит файлы DOCX. Поэтому я бы загружал PDF-файлы прежде всего.
После того, как файл будет учтен, мы затем применяем некоторый JavaScript, чтобы, по сути, извлечь всю двоичную информацию, потому что двоичный формат является основным типом файла, который нам нужно будет передать и распространить по всему рабочему процессу. А затем следующий шаг очень важен, где мы фактически создаем хранилище поиска по файлам.
Итак, если мы нажмем на это модальное окно, вы увидите, что это URL из документации API, которую я только что показал вам, где мы можем получить доступ к этому хранилищу файлов. А затем вам придется добавить свой API-ключ. В данном случае это тот, который я удалю сразу после этого видео. А затем, прокручивая вниз, вы просто хотите указать, как вы хотите назвать свое хранилище поиска по файлам. Итак, в моем случае я называю его "nitn document store".
Следующий важный узел здесь — "Загрузить файл в хранилище файлов". И если вы нажмете на это, у нас будет новый URL с путем загрузки, и мы добавим сюда API-ключ. А в самом низу вы теперь хотите сослаться на свои данные формы, которые у нас были изначально. А затем мы берем двоичный файл NAD. И вы можете назвать его как угодно. В моем случае я просто ссылаюсь на него как на "data".
И после того, как вы импортируете его в свое хранилище поиска по файлам, вы затем сможете запрашивать его. Итак, в нашем случае здесь, если мы откроем совершенно новый чат с нашим агентом, мы сможем задать вопрос о том, какие документы у нас есть в этом хранилище файлов. Итак, если мы зададим простой вопрос, например: "Можете ли вы обобщить информацию, которую вы имеете о документах в вашей базе знаний, и передать ее?", это должно быть установлено ИИ-агентом. У нас есть здесь подсказка, чтобы взять мой расплывчатый вопрос и сделать его лучше для хранилища файлов. И вы увидите, насколько быстро он выдает ответ.
Если я перетащу это, то вы увидите, что он выдает резюме документа. В данном случае это был документ об экспертной сети, которую мы строим в моем сообществе. А затем, если мы прокрутим это влево, вы сможете увидеть все метаданные. Итак, вы увидите, что это фрагменты здесь, которые извлечены. Это извлеченные фрагменты.
Итак, если мы прокрутим вниз, вы увидите, что у нас есть раздел под названием "grounding meta" и "grounding chunks". Итак, концепция "grounding" (заземления) происходит от их аналогичной концепции для поиска под названием "grounded Gemini search", где он не должен отвечать на вопрос, основываясь на своих собственных знаниях. Он всегда должен быть основан на поиске, который он находит в хранилище файлов. Это означает, что это не будет идеально, как и любой другой продукт ИИ на рынке, но у него будет более высокая вероятность не галлюцинировать, поскольку он пытается заземлить любой ответ, который он дает, из вашего вопроса, а также соответствующее совпадение с этим вопросом.
И просто чтобы продемонстрировать это, я придумал очень расплывчатый и бессмысленный вопрос: "Расскажи мне о документе-постере в твоей базе знаний о Lucky Charms". Теперь в его базе знаний нет документов, связанных с этим. Так что некоторые LMS могут обратиться к своей базе знаний и все равно получить ответ, даже если в базе знаний нет ничего, что бы его поддерживало. Поэтому, поскольку он заземлен, он должен ответить: "Я не знаю". И в данном случае он говорит: "Я не смог найти никакой информации о документе-постере, связанном с Lucky Charms". И он просто говорит вам, к чему у него есть доступ в его базе знаний. Так в этом и заключается смысл заземления, когда он не должен давать никакого ответа, если в соответствующих файлах, которые вы ему предоставили, нет никакого ответа.
Теперь это использование этого в Any. Прежде чем мы перейдем к примеру с Cloud Code, который я покажу вам. Важно понять, чем это отличается от того, что уже есть на рынке. Итак, с точки зрения индексации, это очень похоже на обычный RAG "из коробки", где у вас есть серия документов. Затем у вас есть это хранилище поиска по файлам, которое предназначено для постоянного хранения. Это означает, что когда вы загружаете файл, пока у вас есть идентификатор самого хранилища файлов, вы всегда должны иметь возможность ссылаться на этот набор файлов. И если бы вам нужна была знакомая аналогия, это было бы очень похоже на векторные хранилища OpenAI, которые появились несколько лет назад и, на мой взгляд, работают не так хорошо, и они как бы отказались от этого продукта с точки зрения обеспечения его максимальной заземленности.
Вы получите в целом точные результаты с большим количеством векторного поиска здесь, и это намного дороже в масштабе. И именно здесь вступает в игру их интеллектуальное разбиение на фрагменты, где, если мы нажмем на это, цель состоит в том, чтобы они придумали идеальное перекрытие фрагментов при разрезании предоставленных вами документов. Обычно это слой, который вам придется решать, но эта часть была абстрагирована от вас. Так что вы можете просто сосредоточиться на загрузке файла и беспокоиться о том, как вы будете использовать этот RAG.
Очень похоже на другие векторные базы данных, он использует поиск по косинусной схожести для получения ответа. И с точки зрения хранения, особенно по сравнению с чем-то вроде OpenAI, это практически бесплатно, если вы не используете гипермасштабирование.
Итак, с точки зрения запросов и процесса запросов, вы, как пользователь, отправляете вопрос, этот вопрос попадает в их конвейер за кулисами. Он выполняет семантический векторный поиск, что очень знакомо. Он находит топ-К, которые могут быть топ-пятью ответами, топ-десятью ответами, и очень быстро возвращает ответ, а затем следующий шаг — предоставление заземленного контекста, где вся цель снова состоит в том, чтобы предоставить вам релевантные фрагменты, которые относятся к основному вопросу, который задается.
Затем у вас есть этап LLM, где LLM берет заземленный контекст, который вы получили отсюда, и затем, по сути, контекстуализирует его в естественный язык, чтобы ответить на вопрос очень человекоподобным способом. И вы можете использовать Gemini 2.5 Flash, 2.5 Pro, возможно, Gemini 3 к тому времени, когда вы это увидите, и использовать это очень быстро и эффективно. И снова, когда дело доходит до стоимости, Gemini ничтожно мал по сравнению со многими другими конкурентами на рынке. Опять же, особенно по мере масштабирования ваших RAG-конвейеров.
Итак, это около 15 центов за миллион токенов инференса, что практически дешево для большинства случаев использования, не соответствующих стандарту SOC 2 или HIPAA. Очевидно, вы передаете свои данные Gemini. Так что, если у вас есть очень конфиденциальные или секретные данные, вы не захотите использовать этот API. Это скорее для неконфиденциальных документов или неконфиденциальных знаний, которые вы хотите использовать "из коробки", не строя векторное хранилище PG в Superbase или что-то подобное. Это предлагает вам сложность с производительностью за долю стоимости.
Теперь, чтобы закончить, я хотел показать вам, как вы можете взять эту документацию API, опять же, независимо от того, технически вы подкованы или нет, и использовать ее и передать выбранному вами ИИ, Cursor, Claude Code, WindSurf, что угодно, и создать свое собственное приложение, которое вы можете использовать либо внутри компании, для себя, своей компании, своей организации, либо вы можете фактически превратить его в микро-SaaS, где у вас может быть что-то вроде этого, где я создал этот интерфейс, используя Cloud Code, и я могу перетащить файл по своему выбору.
Итак, я собираюсь сделать это и показать вам процесс. Итак, я собираюсь загрузить файл, тот же файл, который я показал вам в Any, PDF "thumbnail masterclass". И после его загрузки он должен синхронизироваться с этим чат-боксом, который я здесь разместил. И вы видите, что "thumbnail masterclass" готов. И я должен иметь возможность спросить его: "О чем этот документ?" и нажать на это. Он должен перейти и найти это хранилище файлов, которое теперь обновлено, и выдать ответ. Вы можете видеть, что почти молниеносно, используя 2.5 Flash в качестве основного движка.
И поскольку API гибок, он позволяет вам выполнять фильтрацию метаданных. И это пример фильтрации метаданных, где вы можете фильтровать ответ, который возвращается, по определенным ключевым словам. Например, author = John Doe или year > 2020. Так что это дает вам более богатый способ извлечения, чем старый стандартный способ просто взять фрагмент и чисто посмотреть на совпадения семантического поиска.
Теперь другие вещи, которые я добавил здесь, которые идут "из коробки" из самого API, — это возможность контролировать, как происходят фрагменты, а также добавлять метаданные к этим отдельным фрагментам. И эта функция — одна из тех, которую я добавил сам, а именно возможность взять ответ из API из хранилища файлов и, по сути, настроить или уточнить его, прежде чем он вернется к вам как пользователю. Так что это скорее то, что я добавил как функцию, которую вы тоже можете добавить. И прелесть этого в том, что API очень прост в использовании. Как я уже говорил, вы можете взять этот markdown-файл, который они предоставляют, передать его в качестве контекста, а затем добавить любые функции, которые вам нужны, чтобы пройти от А до Я.
И последнее, что я добавил, — поскольку мы уже создаем хранилище файлов здесь и управляем им в этом командном центре, я создал эту вкладку "API-документация", где у меня всегда есть доступ к имени моего хранилища, моему API-ключу, моей модели, количеству файлов в моем хранилище, и я могу быстро использовать эти curl-запросы в чем-то вроде Any или где угодно, чтобы иметь к нему доступ, чтобы сделать это максимально простым.
Теперь, если это выглядит круто для вас, то я также сделаю этот мега-промпт доступным по второй ссылке в описании ниже, так что вы можете повеселиться с ним. Я не буду проходить через промпт. Это очень объемный промпт о том, как именно я это собрал. Теперь он не даст вам именно это за один раз. Я делаю такие вещи, как все мои репозитории GitHub, доступными для членов моего эксклюзивного сообщества, но если вы хотите иметь возможность взять этот промпт и обмениваться идеями с ним, вы должны суметь воспроизвести его менее чем за час.
В любом случае, я просто хотел показать вам, как использовать этот совершенно новый API, который невероятно мощный в выполнении того, что раньше занимало часы, если не недели, для создания в масштабе, и делать это за минуты.
Хотя вы, возможно, не захотите использовать эту версию API, если вы используете более конфиденциальные данные, соответствующие требованиям HIPAA, существует версия в Gemini Cloud, где вы можете использовать ее более приватно. В любом случае, если вы нашли это полезным введением в API поиска по файлам, пожалуйста, дайте мне знать в комментариях ниже. Это очень помогает видео и каналу. И если вам нравится такой контент и вы хотите получить доступ к эксклюзивным ресурсам, которые помогут вам быстрее перейти от нуля к одному со всем полезным на рынке ИИ, таким как это приложение Vibe Coded, то проверьте первую ссылку в описании ниже, и, возможно, я увижу вас в моем эксклюзивном сообществе под названием Early AI Doctors. Увидимся в следующем видео.