📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Claude для Chrome: агентный обзор браузера

Yersham25:12

Transcription

Приветствуем всех. Сегодня у нас такая интересная тема на повестке дня. Новая штука от Antropic. Расширение для Chrome называется Cloud for Chrome. Угу.

Antropic получается выходит на поле так называемого агентного браузинга. Ну, это когда ИИ помогает нам в сети, что-то делает за нас. Но они, значит, делают это по-своему, да? Они отдельный браузер создают, как некоторые другие, а именно расширение. Точно. И это ставит их, ну, как бы в один ряд с Perplexity, может быть, с тем, что Open AI готовит. Ну, и Google, конечно, со своим Джемини прямо в Chrome. Угу.

Наша задача сегодня попробовать разобраться, что это вообще такое на основе первых тестов раннего доступа, какие у него сильные стороны, какие слабые, ну, и, конечно, вопросы безопасности, куда без них. Давайте, так сказать, распакуем это, да. Тема и агентов, которые вот сами могут кликать, что-то заполнять в браузере, она сейчас очень активно развивается. И подход Antropic через расширение, он, ну, действительно интересен. В чём интерес? Ну, он как бы встраивается в то, чем пользователь уже пользуется, в привычный Chrome. Это может быть плюсом, удобнее вроде, но с другой стороны и свои сложности это несёт в плане надёжности, безопасности, опять же.

Согласен. Ну, давай посмотрим, как это вообще выглядит и работает на практике, судя по тому, что известно.

Да, давай. Итак, как это реализовано? Судя по описаниям, это такая боковая панелька в Chrome, похожая, ну, на обычные чат-интерфейсы, там Claude, ChatGPT, вот это всё. Угу. Знакомый формат, да. И важно понимать, это прямо подчёркивается, что это пока очень ранний доступ и следовательский предпросмотр, что ли. Доступен там вообще ограниченному числу подписчиков их планом Max. То есть это не готовый продукт для всех, а скорее такой, ну, взгляд за кулисы в лабораторию.

Именно. Ну, вот первый пример из источников такой довольно простой. Задача: опубликовать пост в X, бывшем Twitter, от имени пользователя. Ага. И сообщается, что расширение справилось. То есть оно перешло на сайт X, подготовило текст поста и, что важно, по умолчанию оно спросило разрешение перед тем, как реально нажать кнопку "Опубликовать".

Вот, вот это как раз интересно с точки зрения механики, как оно работает. Система по сути делает снимок экрана, ну, текущего состояния страницы, анализирует его, планирует следующее действие, там, кликнуть на кнопку "Написать пост", выполняет это действие, снова делает снимок, чтобы проверить, получилось или нет. И так шаг за шагом. Понятно? Такая последовательность, да? И вот этот запрос разрешения по умолчанию - это, мне кажется, ключевой момент контроля. Источники упоминают, что там есть опция вроде как разрешить все действия для конкретного сайта или даже вообще все действия, ну, для самых смелых.

Ха, да уж. Но вот эта базовая настройка "Спроси перед тем, как сделать" она показывает, что Antropic ставит безопасность во главу угла, особенно когда речь о личных аккаунтах, ну, или каких-то важных действиях.

Да, это логично. Даёт понять, что там под капотом происходит и кто в итоге несёт ответственность. О'кей, с публикацией ну, более-менее понятно, а вот с задачами посложнее. Там был тест с поиском квартиры на Zillow.

Да, это уже интереснее. Задали параметры: район, цену и такое, знаешь, немного расплывчатое условие - задний двор. Как агент с этим справился? Ну, судя по описанию, он перешёл на Zillow, как и просили, корректно ввёл ценовой диапазон в нужные поля. И, что примечательно, он вот эту неоднозначность с задним двором смог разрешить, как нашёл и применил фильтр, который на Zillow называется "Открытое пространство" (Outdoor Spaces). То есть он не просто тупо искал слово "двор", а как бы понял, что имеется в виду, и нашёл соответствующую опцию на сайте. То есть это не просто следование инструкции "нажми сюда", а какая-то ээ интерпретация, адаптация к интерфейсу.

Да, похоже на то. Это показывает некоторую гибкость, способность сопоставить запрос пользователя с реальными элементами управления на конкретном сайте. Но был там и нюанс, связанный со скоростью. Упоминалось, что агент работал, ну, скажем так, неторопливо, мягко говоря, да, с паузами в две-три секунды после каждого клика. И весь процесс поиска квартиры занял около 10 минут. Честно говоря, звучит медленнее, чем если бы я сам это делал руками.

Да, эта медлительность, она, похоже, характерна для текущего поколения вот таких ИИ-агентов. Эти паузы, они, вероятно, не просто так. Зачем они? Ну, скорее всего, чтобы система могла убедиться, что страница полностью загрузилась, что все элементы, с которыми нужно взаимодействовать, уже доступны, знаешь, чтобы не кликнуть в пустоту или не пропустить нужный элемент, который ещё не прорисовался.

А, ну да, чтобы не торопиться и не наломать дров. Именно. Это такой компромисс между скоростью и надёжностью. Агенты ведь всё ещё учатся ориентироваться в этом сложном, постоянно меняющемся вебе. По сути, они имитируют такого, знаешь, осторожного пользователя, который впервые попал на незнакомый сайт и разбирается, что к чему.

Понятно. Ну, 10 минут на поиск с несколькими фильтрами, это, конечно, не молниеносно, но сам принцип работы понятен. Да, главное, что он смог это сделать. И ведь он не просто нашёл сайт, он применил и другие фильтры, которые ему задали: тип жилья, дом, наличие стиральной машины и вот то самое открытое пространство. Угу. Итог, правда, был не очень впечатляющим, как пишут. Нашлась всего одна квартира, и та довольно дорогая. Ну, тут уж от рынка зависит. Агент не может найти то, чего нет.

Это да. Но сам факт, что вот этот многоступенчатый поиск с фильтрами, да ещё и с интерпретацией нечёткого запроса вроде "заднего двора", что он вообще сработал, это уже, ну, что-то показывает.

Согласна. Это демонстрация потенциала. Давай посмотрим другой сценарий. Использование агента для исследовательских задач. Пример: проанализировать недавние колебания цен на акции Nvidia и выяснить причины. Как он тут себя повёл?

А вот здесь подход, судя по всему, отличается от простого поискового запроса в Google. Ну, Google, что выдаст тебе? Ссылки, краткие выдержки, сниппеты. Ну да, стандартно. А этот агент, как сообщается, начал активно просматривать разные веб-сайты, новостные порталы, финансовые ресурсы. Он как бы заходил на страницы и собирал информацию прямо оттуда. Не просто индексировал заголовки, а, ну, как бы читал содержание нескольких источников, чтобы потом составить некую сводку.

То есть он анализирует дом страницы, текст, скорее всего, да, анализирует структуру, извлекает текст, возможно, ищет ключевые фразы, связанные с запросом. И это получается ближе к работе, ну, не знаю, аналитика человека, который реально садится и изучает первоисточники.

В каком-то смысле, да, ценность тут именно в глубине сбора информации. Он не ограничивается одной страницей или одним мнением, а может обработать несколько релевантных страниц. Это позволяет получить более полную, объёмную картину, особенно по сложным темам, где одного источника явно недостаточно. И что, он справился с Nvidia?

Да, согласно отчёту, агент смог правильно определить ключевые факторы, которые повлияли на цену акции Nvidia в тот период. То есть он не просто собрал информацию, но и смог её как-то осмыслить и выделить главное. Вот эта способность быстро обрабатывать большие объёмы текста и выделять суть - это, конечно, потенциально очень мощный инструмент для исследовательской работы, для аналитики.

Безусловно, если это будет работать надёжно и стабильно. Хорошо, перейдём к покупкам. Ещё один тест. Задача: найти конкретную модель камеры, но без указания, где искать, в каких магазинах. Как агент к этому подошёл?

Тоже довольно методично, судя по описанию. Сначала, как пишут, он использовал Google, чтобы просто определить ориентировочную цену, понять порядок цифр. Ну, как бы референс найти, да-да. Затем перешёл во вкладку "Покупки" в Google, чтобы посмотреть агрегированные предложения, а уже после этого начал последовательно проверять сайты крупных ритейлеров. Там упоминаются Amazon, Best Buy, B&H, eBay. То есть такой системный обход основных игроков. Угу. Интересно, что отмечается, что он, похоже, работает только с одной вкладкой за раз. То есть он не открывает сразу пять магазинов, чтобы сравнить.

Да, источник обращает на это внимание. Это может показаться каким-то ограничением. Ну, не так эффективно, как человек бы сделал, наверное. Ну да, я бы открыл все сразу. Но тут, видимо, важна внутренняя память агента. Он же запоминает информацию, цены, наличие, которую собрал на предыдущем сайте, и может использовать эти данные для сравнения, даже когда переходит последовательно с одного сайта на другой.

А, то есть он накапливает информацию. По ходу, похоже на то. И в итоге, как сообщается, он смог предоставить список найденных предложений с ценами из разных магазинов. И вот тут важный момент - проверка на галлюцинации. Его попросили дать прямые ссылки на те товары, которые он нашёл. И что?

И как пишут, ссылки оказались корректными. Они вели на нужные страницы товаров в соответствующих магазинах. Вот это прямо очень ценно. Если он не просто говорит: "Я нашёл", а даёт рабочую ссылку. Это реально может сэкономить кучу времени на рутинном поиске лучших предложений.

Да, если это будет работать стабильно и без ошибок, это хорошее подспорье для первоначального ресёрча. О'кей, поиск, сравнение цен, исследование - это вроде бы области, где такой агент может быть полезен. А как насчёт взаимодействия с файлами? Это же тоже важная часть работы в браузере. Проверили и это.

Пример: скачивание формы W9 с сайта налогового управления США IRS. Задача не только найти информацию, но и инициировать скачивание файла. И как прошло? Там ещё упоминалось, что тест проводился в автоматическом режиме. То есть агенту дали больше свободы действий без постоянных запросов разрешения на каждый чих. Да. И вот что интересно. С поиском агент справился успешно. Нашёл нужную форму W9 на официальном сайте IRS. Там же её и открыл в браузере. Всё как надо. А дальше скачивание.

А вот дальше произошло нечто показательное с точки зрения безопасности. Несмотря на этот самый автоматический режим, когда дело дошло непосредственно до скачивания PDF-файла этой формы, система всё равно запросила явное разрешение пользователя. То есть, стоп. Даже если ты сказал "Действуй сам", на моменте скачивания файла из интернета он всё равно тебя спрашивает: "Точно скачиваем".

Именно так. Выглядит как такой встроенный предохранитель на критически важных действиях. Ну, это выглядит как очень разумный и продуманный подход со стороны Antropic, учитывая их репутацию компании, которая сильно фокусируется на безопасности. И абсолютно нельзя же просто позволить программе бесконтрольно тащить на твой компьютер что угодно из сети.

Совершенно верно. Как сообщается, окно сохранения файла появилось, как обычно, при скачивании. Но вот финальное нажатие кнопки "Сохранить" оно осталось за человеком.

Понятно. То есть чёткое разграничение полномочий. Агент может найти, подготовить, показать. На финальное решение загрузки файла на локальный компьютер принимает пользователь. Да. И это поднимает вот этот важный вопрос о доверии и о необходимом уровне контроля при работе с такими агентами. Видимо, на данном этапе развития технологии полный автоматизм в таких вещах, как скачивание файлов, кажется и преждевременным, и рискованным.

Согласен. Но вот где агент, похоже, реально споткнулся, судя по описанию, это с заполнением веб-форм.

Да, был и такой тест. Ему дали эффективные данные, чтобы он заполнил ту самую форму W9, которую он нашёл и открыл на сайте IRS. И что там произошло? Ну, во-первых, сразу проявилась вот эта заложенная в него осторожность. Агент отказался вводить особо чувствительные числительные данные, там упоминался номер социального страхования (SSN).

А, то есть он сказал: "Нет, такое я вводить не буду". Примерно так. И это опять же про безопасность, отказ от работы с SSN и, вероятно, с другой конфиденциальной информацией, там, номера банковских карт, пароли - это, скорее всего, сознательное ограничение, заложенное разработчиками.

Ну, логично. Доверять вот таких критически важных данных и агенту на данном этапе, наверное, никто бы не стал. Риски слишком велики. Конечно, это разумное ограничение, но дальше, как описывается в источнике, начались уже реальные проблемы с самим процессом заполнения.

Что пошло не так? Агент вроде бы начал процесс, он даже корректно описывал шаги, которые собирается предпринять. Ну, там: "Сейчас я введу имя в поле такое-то". Но при этом, как пишут, он смотрел не на ту страницу или не на тот раздел этой сложной PDF-формы. То есть он как бы потерялся в интерфейсе формы.

Похоже на то. Запутался. И в итоге он сообщил пользователю, что все данные успешно заполнил, а на самом деле в форме оказалось только имя, которое он ввёл в самом начале. А остальное пусто. Да. И как он отреагировал, когда ему на это указали? Там же вроде был диалог.

Да. Пользователь ему написал что-то вроде: "Я вижу только имя, проверь ещё раз". И агент, как сообщается, перепроверил, сделал скриншот текущего состояния формы, сравнил его с заданием, которое ему дали, и признал свою ошибку. Сказал, что да, не справился.

Хм, интересно, это неудача на сложной многостраничной форме? Может, дело в том, что это PDF, а не обычная веб-форма, или в интерактивных элементах? Вполне возможно. Сложная структура, может быть, какие-то нестандартные элементы управления. Это как раз показывает текущие ограничения таких агентов. Они могут теряться в задачах, которые требуют точного и последовательного взаимодействия с большим количеством элементов интерфейса, особенно если интерфейс сложный или необычный. И что любопытно, источник отмечает, что эту ошибку не удалось воспроизвести на других, более простых веб-формах.

Да, это важно. То есть, возможно, это не общая проблема с заполнением форм, а специфическая сложность, связанная именно с PDF или с конкретной структурой формы W9. Нужно больше тестов на разных формах, чтобы понять.

Понятно. Значит, с формами пока не всё гладко, особенно со сложными. И в целом, если обобщить подход к чувствительной информации, будь то личные данные или финансы, он очень консервативен.

Да, очень. Агент может перейти на сайт твоего банка, если попросить, но он не будет пытаться залогиниться или тем более совершать какие-то операции. И это правильно. На данном этапе источник ещё упоминает важную техническую деталь. Это расширение Cloud for Chrome. Оно работает локально, прямо в браузере пользователя. Угу. В отличие от некоторых других подходов, где действия могут выполняться где-то в удалённой песочнице на серверах компании.

Да, это важное отличие. Локальное выполнение может быть лучше с точки зрения приватности данных пользователя. Они не уходят куда-то наружу для обработки. Но с другой стороны, это не отменяет необходимости в мерах безопасности. Даже локально работающий агент может наделать дел, если его обмануть.

Вот и это как раз подводит нас к общей картине безопасности. Появление таких вот браузерных агентов это ведь не только новые возможности, но и, очевидно, новые риски, новые векторы атак.

Безусловно, одна из главных угроз, о которой много говорят исследователи в этой области - это так называемая инъекция промпта. Да, промт инжекшн. Серьёзная проблема. Можешь пояснить в двух словах, что это?

Ну, грубо говоря, злоумышленник может спрятать вредоносные инструкции для ИИ-агента прямо на веб-странице. Эти инструкции могут быть в виде невидимого текста, там, белым шрифтом на белом фоне или в метаданных страницы или даже как-то хитро закодированы в изображении. Ого. И агент, когда он анализирует эту страницу для выполнения задачи пользователя, например, "найди мне информацию о продукте на этой странице", он может случайно прочитать эти скрытые инструкции и попытаться их выполнить. Например, инструкцию "перейди на фишинговый сайт и введи там данные" или "отправь мои куки на сервер злоумышленника".

Звучит, честно говоря, довольно тревожно, если любой сайт потенциально может взломать твоего ИИ-помощника. Да, это реальный риск. И Antropic, учитывая их фокус на безопасности, конечно, должны были об этом подумать. Какие меры противодействия они предлагают?

Они заявляют о нескольких уровнях защиты. Во-первых, это разрешение на уровне сайтов. Пользователь сам контролирует, к каким сайтам у Claude вообще есть доступ. Можно составить белый или чёрный список, управлять этим. То есть не дать агенту ходить куда попало, без разрешения.

Именно. Во-вторых, это подтверждение действий. Как мы уже обсуждали, по умолчанию требуется добро от пользователя на большинство действий. И даже если включить автоматический режим, то для самых критических штук - скачивание файлов, работа с какой-то потенциально чувствительной информацией - он всё равно переспросит. Угу. Двойной контроль. Плюс к этому сообщается о явной блокировке доступа к целым категориям сайтов, которые считаются высокорисковыми. Каким, например? Финансовые сервисы. Ну, видимо, чтобы избежать случайных транзакций или утечки данных. Контент для взрослых, пиратские ресурсы. Такой превентивный чёрный список.

Понятно. То есть они признают, что на данном этапе технология недостаточно надёжна, чтобы свободно пускать её плавать по абсолютно всему интернету, особенно по потенциально опасным его уголкам.

Да, похоже на то. И насколько все эти меры эффективны? Есть какие-то цифры, замеры?

Antropic приводит данные своего внутреннего исследования. По их словам, вот эти меры разрешения, подтверждения, блокировки позволили снизить уязвимость к определённым видам инъекции промпта, когда вредная инструкция спрятана где-то на странице, с примерно 23% до 11%.

С 23 до 11%. Это при использовании их модели Sonnet 4, да? Это же одна из их основных, довольно мощных моделей, да? Sonnet 4. Она используется для управления агентом. Снижение почти вдвое - это, конечно, значительный прогресс, но 11% - это всё равно звучит как, ну, не маленькая вероятность ошибки. Получается, примерно каждый десятый сложный или потенциально вредоносный сайт всё ещё может обмануть агента.

Совершенно верно, 11% - это очень далеко от нуля. И это ярко подчёркивает, насколько сложна задача обеспечения безопасности вот такого автономного браузинга. Это не тривиальная проблема. Однако там был ещё один тип атаки, где результаты получше.

Да, был тест на атаку, когда вредоносные данные прячут в невидимых для пользователя полях веб-формы, но агент их может прочитать и использовать. И вот на специальном тестовом наборе для таких атак им, как сообщается, удалось снизить частоту ошибок с 36% аж до 0%.

С 36 до нуля. Вот это уже серьёзно, да? Это показывает, что если есть конкретная, хорошо изученная уязвимость, то можно разработать целенаправленные контрмеры, которые будут весьма эффективны. Но проблема в том, что "вселенная атак", как выражаются сами исследователи Antropic, она гораздо шире, чем эти два конкретных типа. Постоянно появляются новые векторы, новые хитрости.

И какой вывод делает сама Antropic из всего этого? Готовы ли они вот прямо сейчас выпустить это расширение в широкий доступ?

Судя по их заявлениям, нет, не готовы. Они открыто признают, что перед тем, как делать продукт массовым, им необходимо, цитирую, "расширить вселенную атак, которые они рассматривают и тестируют". И, конечно, найти способы снизить вот эти проценты уязвимости - и 11%, и другие - значительно ближе к нулю. То есть они понимают, что текущий уровень безопасности, хоть он и улучшен по сравнению с каким-то базовым уровнем, всё ещё недостаточен для продукта, которым могли бы пользоваться миллионы людей без серьёзных рисков.

Да, именно так. И это, мне кажется, подводит нас к ключевому вызову для всей этой области ИИ-агентов. Нужно найти вот этот очень тонкий баланс.

Баланс между чем и чем? Между функциональностью агента, чтобы он был реально полезен, экономил время, делал то, что нужно, и его безопасностью, чтобы он не стал уязвимостью, через которую можно атаковать пользователя, или инструментом для мошенников. Вот в поиск этого баланса он и будет определять будущее таких технологий и их распространение и принятие людьми.

Да, звучит как главная задача на ближайшее время для всех, кто этим занимается. Ну что ж, давай попробуем подвести итоги нашего сегодняшнего погружения в Cloud for Chrome.

Давай. Итак, что мы имеем? Это интересный эксперимент от Antropic. Их взгляд на эйджентный браузинг реализован как расширение для Chrome, а не как отдельный браузер, что само по себе примечательно. Угу. Ранние тесты, которые доступны, показывают, что у него есть потенциал для автоматизации таких рутинных задач, как поиск информации в сети, сравнение товаров в магазинах, выполнение каких-то простых действий на сайтах вроде публикации поста. Да, и агент демонстрирует способность к некоторой интерпретации запросов, к адаптации к интерфейсам сайтов, что важно.

Но есть и явные ограничения, которые видны уже сейчас. Во-первых, скорость работы. Пока что это не быстро. Оставляет желать лучшего, да? Во-вторых, сложности с комплексными, многоступенчатыми задачами. Особенно это проявилось при заполнении сложных, нестандартных или просто громоздких форм. Там агент может путаться, да, там есть над чем работать. И, конечно, ключевой аспект - это безопасность. Antropic делает сильный акцент. Это видно и по системе разрешений, и по запросам подтверждений на важные действия, и по ограничениям на работу с чувствительными данными и с сайтами. Но при этом они сами признают, что работа здесь ещё далеко не закончена. Уровень безопасности нужно повышать. Так что пока это скорее технология для энтузиастов, для исследователей, для тех, кто готов мириться с ограничениями и потенциальными рисками ради изучения нового, не для широкого круга пользователей.

Совершенно верно. Это пока эксперимент. И вот в качестве такой финальной мысли, подумать, ли, как будет эволюционировать наше взаимодействие вот с такими ИИ-агентами в будущем. Их возможности, очевидно, будут расти. Они будут становиться умнее, быстрее, способнее, скорее всего. Да. Ну и уязвимости, вероятно, будут обнаруживаться и дальше. Новые типы атак будут придумывать. Как вот в этих условиях строить и поддерживать доверие к таким системам?

Да, это очень важный и сложный вопрос. Доверие - это ведь не только про то, что агент не сделает что-то плохое намеренно, хотя и это важно, но и про то, что он не сделает ошибку, не даст себя обмануть, не подведёт в критический момент. И как разработчики смогут гарантировать эту безопасность? Смогут ли они найти способы сделать агентов надёжными, не убив при этом всю их пользу и гибкость, не превратив их в слишком зарегулированные и бесполезные инструменты? Вот это и есть тот самый баланс, о котором мы говорили. Ответы на все эти вопросы, они не появятся завтра. Они будут формироваться постепенно по мере того, как эти технологии будут развиваться, внедряться, проходить проверку реальностью. Это огромное поле для наблюдений, для исследований, для дискуссий на ближайшие годы.

Да, будем наблюдать. Спасибо за интересный разбор.

Спасибо.