Transcription
Хорошо, так Google только что сделал довольно большой ход в гонке искусственного интеллекта, и этот ход нацелен на то, чем большинство людей пользуются каждый день, — офисное программное обеспечение. Компания только что объявила о крупном обновлении Workspace, где Gemini теперь глубоко интегрирован в Docs, Sheets, Slides и Google Drive, превращая их в полностью нативные для ИИ инструменты продуктивности. В то же время Google также выпустил совершенно новую модель ИИ под названием Gemini Embedding 2, которая предназначена для обеспечения работы инфраструктуры современных систем ИИ, позволяя тексту, изображениям, видео, аудио и документам существовать в одном и том же пространстве вложений. Теперь это произошло сразу после того, как Microsoft выпустила свое собственное обновление, интегрирующее Claude в пакет Office. Так что, очевидно, обе компании соревнуются в превращении программного обеспечения для повышения производительности в среды, управляемые ИИ. Стратегия Google проста. Вместо того чтобы заставлять пользователей открывать отдельные инструменты ИИ, Gemini теперь появляется непосредственно в приложениях, где уже происходит работа. И когда вы смотрите на масштаб Workspace, вы понимаете, почему это важно. Около 300 миллионов человек активно используют Google Workspace. Между тем, более широкая экосистема Google охватывает примерно 3 миллиарда пользователей по всему миру. Таким образом, когда Google меняет то, как работают эти инструменты, это не затрагивает нишевую группу. Это потенциально меняет то, как офисная работа происходит по всему миру. Прямо сейчас новые функции на базе Gemini развертываются для пользователей планов Google AI Pro и Ultra. Но направление ясно. Workspace превращается в то, что Google называет нативным для ИИ офисным пакетом. Один интересный результат бенчмарка уже вышел из этого обновления. В реальном бенчмарке редактирования электронных таблиц под названием spreadsheet bench, Gemini, работающий в Sheets, достиг уровня успеха в 70,48%. Это ставит его впереди других систем ИИ и удивительно близко к уровню эксперта по электронным таблицам человека. Но более значительный сдвиг здесь — это не бенчмарки. Это то, как на самом деле выполняется работа. Вместо того чтобы начинать с нуля каждый раз, вы теперь можете создавать целые документы, электронные таблицы или презентации с помощью одной инструкции. И ИИ не просто выдумывает случайный контент. Он извлекает реальный контекст из ваших электронных писем, файлов и даже из Интернета. Давайте начнем с Google Docs, потому что именно там опыт становится очень очевидным. С новой системой вы можете набрать что-то вроде: «Напиши общественный информационный бюллетень, используя протоколы собрания моего ТСЖ и список мероприятий за январь». В течение нескольких секунд Gemini создает полный черновик. То, что происходит за кулисами, довольно мощно. Система сканирует ваши файлы Google Drive, сообщения Gmail и соответствующую веб-информацию. Затем она создает документ, используя реальные данные, связанные с вашей учетной записью. После создания черновика вы можете доработать его с помощью естественных инструкций. Вы можете попросить ИИ сократить определенные разделы, расширить детали или изменить структуру. Google также представил функцию под названием «соответствие стилю письма». Распространенная жалоба на написание ИИ заключается в том, что оно звучит роботизированно или не соответствует тому, как люди обычно пишут. Эта функция анализирует ваши прошлые документы и корректирует сгенерированный текст так, чтобы он напоминал ваш личный стиль письма. Еще одно дополнение — «соответствие формату документа». Допустим, у вас есть шаблон маршрута путешествия, который вы обычно используете. Gemini может сканировать ваши электронные письма, извлекать такую информацию, как бронирование авиабилетов, бронирование отелей и аренда автомобилей, а затем автоматически помещать эти детали в шаблон. Таким образом, вместо ручного копирования информации из разных источников, ИИ собирает структуру документа для вас. Теперь перейдем к Google Sheets, с которым, честно говоря, у многих людей возникают трудности. Электронные таблицы — это мощные инструменты, хотя их создание может быть запутанным. Многие люди не знают, как структурировать таблицы, какие столбцы им нужны или какие формулы должны существовать. Gemini теперь может создать для вас всю структуру электронной таблицы. Например, вы можете набрать что-то вроде: «Организуй мой маршрут для переезда в Чикаго, создай список упаковки, категоризированный по комнатам, добавь контактную информацию для коммунальных услуг, таких как вода, электричество и газ, и отслеживай предложения от транспортных компаний в моем почтовом ящике». Gemini читает соответствующие электронные письма и файлы, а затем автоматически создает электронную таблицу. Это включает таблицы, структурированные категории, а иногда даже панели для отслеживания прогресса. Теперь, пока Google глубже внедряет ИИ в инструменты продуктивности, голос также становится частью конвейера. Higsfield спонсирует сегодняшнее видео, и они только что выпустили Higsfield Audio, который добавляет генерацию голоса, подмену голоса и многоязычный перевод видео непосредственно на одной платформе. Вы можете генерировать естественные ИИ-голоса из текста. Выбирайте между несколькими голосовыми моделями или даже клонируйте свой собственный голос, загрузив короткую запись. >> Я Роман. Считайте меня биением сердца вашей истории. После создания голоса вы можете применять его к видео, заменять существующие голоса или генерировать озвучку для нового контента. >> Привет, подпишитесь на канал AI Revolution. >> Одна из особенно интересных функций — подмена голоса в видео. Вы можете загрузить клип, выбрать другой голос, и система заменит оригинальную речь, сохраняя при этом синхронизацию времени и движения губ с видео. Хорошо, так Google только что сделал довольно большой ход в гонке искусственного интеллекта, и этот ход нацелен на то, чем большинство людей пользуются каждый день, — офисное программное обеспечение. >> Он также поддерживает перевод видео, что означает, что вы можете взять видео на одном языке и сгенерировать версии на других языках, таких как немецкий, французский или китайский, сохраняя при этом синхронизацию голоса с визуальными эффектами. Поскольку это часть платформы Higsfield, весь рабочий процесс остается связанным. Вы можете генерировать визуальные эффекты, создавать видео с моделями, такими как Cling, и теперь генерировать или заменять голос — все в одном месте. Попробуйте Higsfield Audio сами. Ссылка в описании. Хорошо, а теперь вернемся к видео. Затем есть функция под названием «Заполнить с помощью Gemini». Это выводит автоматизацию еще дальше, потому что ИИ может сам заполнять электронную таблицу. Вместо ручного ввода данных в строки и столбцы, Gemini может классифицировать информацию, обобщать ее и даже извлекать данные в реальном времени из поиска Google. Так представьте, что вы создаете электронную таблицу для отслеживания заявок в колледж. Обычно вы вручную искали бы сроки, плату за обучение и требования к подаче заявок для каждого университета. С этой системой вы можете просто протянуть столбец, и Gemini автоматически заполнит информацию, используя данные, собранные из Интернета. Это означает, что поиск информации, ее организация и ввод в электронные таблицы могут происходить автоматически. Slides также получили крупное обновление. Многие люди говорят, что презентации — самая болезненная часть офисной работы. Структурирование слайдов, написание контента, форматирование макетов и выбор цветов легко могут занять часы. Теперь вы можете просто описать презентацию, которую хотите. Если вы наберете что-то вроде: «Создай пятистраничную презентацию для моей предстоящей поездки в Токио», Gemini сгенерирует всю презентацию. Он извлекает контекст из электронных писем, файлов и онлайн-информации для создания слайдов. Если вы не удовлетворены результатом, вы можете попросить ИИ внести коррективы. Например, сделать цвета более подходящими для стиля бренда, сократить формулировки или изменить общий макет. Вместо того чтобы создавать презентации вручную, вы, по сути, управляете ИИ, как творческим ассистентом. Теперь, возможно, самая интересная часть этого обновления — это Google Drive. Drive всегда был системой хранения файлов и папок. Проблема в том, что большинство людей не очень хорошо организуют свое хранилище. Через несколько лет облачные диски становятся беспорядочными коллекциями сотен или тысяч файлов. Часто вы помните, что содержит документ, хотя не можете вспомнить точное имя файла или где он хранится. Вы можете вспомнить что-то вроде презентации, показанной аудиторскому комитету, или документ, упоминающий цифры доходов за прошлый год. Традиционный поиск по ключевым словам испытывает трудности в таких ситуациях, потому что он совпадает только с конкретными словами. Google представляет функцию под названием «Обзоры ИИ» в Drive, чтобы решить эту проблему. Вместо того чтобы полагаться на ключевые слова, система пытается понять ваше намерение. Вы описываете документ, который ищете, на обычном языке, а ИИ интерпретирует, что вы имеете в виду. Затем он сканирует файлы и извлекает наиболее релевантные результаты. Таким образом, ваш диск постепенно становится чем-то более близким к персональной базе знаний, а не простой системой хранения. Есть также другая функция под названием «Спросить Gemini» в Drive. Это позволяет пользователям задавать сложные вопросы по нескольким источникам одновременно. Документы, электронные письма, события календаря и веб-информация могут способствовать ответу. Например, кто-то может выбрать все свои налоговые файлы и спросить: «Какие вопросы мне следует задать моему налоговому консультанту перед подачей налоговой декларации в этом году?» Gemini анализирует документы и генерирует ответ на основе фактической информации в этих файлах. Пока Google трансформирует инструменты продуктивности с помощью Gemini в Workspace, компания также представила что-то, предназначенное для разработчиков, создающих системы ИИ. Этот новый релиз называется Gemini Embedding 2. Модели вложений на самом деле являются основным компонентом современной инфраструктуры ИИ. Они преобразуют информацию в математические векторы, чтобы машины могли сравнивать смысл между фрагментами контента. Когда система ИИ ищет релевантную информацию в базе данных, вложения часто используются для поиска контента, семантически похожего на запрос пользователя. Предыдущая модель вложений Gemini фокусировалась только на тексте. Gemini Embedding 2 значительно расширяет эту концепцию. Он может отображать пять различных типов носителей в одном векторном пространстве. Текст, изображения, видео, аудио и PDF-документы. Ранее разработчикам часто требовались отдельные модели для разных типов контента. Например, модели CLIP для изображений и модели на основе BERT для текста. Gemini Embedding 2 устраняет эту сложность, вкладывая все типы носителей в унифицированное представление. Модель также поддерживает смешанные входы, что означает, что разработчики могут комбинировать различные типы носителей в одном запросе. Существуют конкретные ограничения для каждого типа ввода. Текстовые входы могут содержать до 8192 токенов. Система может обрабатывать до шести изображений за запрос в форматах PNG, JPEG, WEBP и HEIC. Видеоклипы могут быть длиной до 120 секунд. Аудиовходы могут включать до 80 секунд нативного аудио, такого как MP3 или Wave. И, что интересно, система может обрабатывать аудио без необходимости отдельного шага транскрипции. PDF-документы могут содержать до шести страниц за запрос. Когда эти входы обрабатываются вместе, модель улавливает взаимосвязи между различными типами контента. Например, визуальный кадр в видео может быть связан с произнесенным диалогом в аудиодорожке, и оба могут быть сравнены с текстовыми запросами с использованием метрик сходства, таких как косинусное сходство. Другая проблема с моделями вложений — эффективность. Эти векторы могут содержать тысячи измерений, что делает их хранение и поиск вычислительно дорогим. Для решения этой проблемы Gemini Embedding 2 использует так называемое обучение представлений Матрешка, часто сокращаемое до MRL. Традиционные системы вложений распределяют семантическую информацию по всем измерениям вектора. Если разработчики пытаются сократить вектор для уменьшения использования памяти, точность часто снижается. MRL изменяет эту структуру. Наиболее важная семантическая информация хранится в первых измерениях вектора. Размер вложений по умолчанию составляет 372 измерения. Однако разработчики могут безопасно усекать вектор до 1536 или даже 768 измерений, сохраняя при этом высокую точность. Это позволяет использовать двухэтапный процесс поиска. Система может сначала выполнить очень быстрый поиск, используя более короткие векторы по миллионам элементов. Затем она переранжирует лучшие результаты, используя полные 372 измерения вложений. Такой подход значительно снижает вычислительные затраты без ущерба для точности окончательного извлечения. Google также оценил модель с использованием масштабного бенчмарка текстовых вложений, обычно называемого MTB. Результаты показали улучшение точности извлечения по сравнению с предыдущей моделью вложений. Еще одно улучшение касается так называемого «дрейфа домена». Многие системы вложений хорошо работают на общих наборах данных, таких как Википедия, но теряют точность при применении к специализированным областям, таким как проприетарные кодовые базы или техническая документация. Gemini Embedding 2 был обучен с использованием многоэтапного процесса на разнообразных наборах данных для улучшения производительности в специализированных задачах. Модель также поддерживает большое контекстное окно для текстовых вложений. Разработчики могут вкладывать до 8192 токенов одновременно, что позволяет обрабатывать большие фрагменты документов вместе. Это помогает сохранить долгосрочный контекст внутри документов и уменьшает так называемую «фрагментацию контекста», когда извлеченные текстовые сегменты не имеют достаточной окружающей информации для получения связных ответов. Разработчики также могут предоставлять подсказки, специфичные для задачи, при генерации вложений, используя такие параметры, как «query retrieval», «document retrieval» или «classification». Эти подсказки корректируют оптимизацию векторов для различных задач, улучшая производительность извлечения. Таким образом, с одной стороны, Google трансформирует повседневные инструменты продуктивности, используемые сотнями миллионов людей. С другой стороны, он улучшает инфраструктуру, которую разработчики используют для создания систем ИИ. И, честно говоря, одновременное появление обоих этих обновлений показывает, насколько агрессивно Google продвигает Gemini по всей экосистеме ИИ. В любом случае, на этом все. Дайте мне знать, что вы думаете об этих обновлениях. Спасибо за просмотр, и увидимся в следующем видео.