📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Hermes Agent: как персональный ИИ меняет рабочие процессы

Yersham21:06

Transcription

О'кей, давайте разберём это. Ситуация, ну, довольно безумная. Кто-то берёт и увольняет невероятно продвинутого ИИ-ассистента просто потому, что его постоянная цифровая амнезия обходится в сотни долларов каждый день.

Ага. И это ещё мягко сказано. Да. И на его место этот человек ставит старый, ну, пластиковый Android-смартфон баксов за 50, который теперь типа управляет вообще всей его жизнью, инвестициями и бытом за сущие копейки.

Звучит как завязка какого-то киберпанк-романа, если честно. Абсолютно. Но сегодня это, в общем-то, наша реальность. В этом детальном анализе мы погружаемся в транскрипт одного очень интересного интервью с YouTube-канала Грега Айзенберга.

Угу. У него в гостях был Имран. Это эксперт из инвестиционного фонда Алиф. И они, э, обсуждали систему Hermis Agent. В сети этот инструмент, ну, уже успели окрестить убийцей Open Cloud.

Да, да, громкое заявление. Вот именно. И наша миссия сегодня разобраться, действительно ли мы наблюдаем фундаментальный сдвиг в том, э-э, как вообще работают автономные агенты и почему все эти суперсложные технологии вдруг переезжают на как бы дешёвые мобильники.

Что здесь действительно захватывает, так это сама смена архитектуры, ну, повседневной автоматизации. Мы же уходим от парадигмы, где ИИ — это просто умный чатбот, который только реагирует на разовые запросы.

Да. Именно. Источник прямо показывает нам полноценную автономную систему с долгосрочной памятью. Но слушай, чтобы понять, почему Hermis вообще так резко взлетел, нужно сначала посмотреть на то, что заставило пользователей бежать от его предшественника, от OpenClo.

Да, был везде. Из каждого утюга про него говорили. Но если верить нашему источнику, работа с ним очень быстро превращалась в пытку.

Мягко говоря. Он описывает три критические проблемы. И первое — это, ну, полное отсутствие памяти. Я читала это и думала, что это как нанять гениального сотрудника, которому каждые 10 минут нужно заново объяснять, как называется компания и где лежат документы.

Это невероятно раздражает на практике. А вторая проблема — чудовищная нестабильность. Там в транскрипте говорится, что шлюз системы порой падал так часто, что его, ну, приходилось перезагружать каждый час.

Каждый час — это же вообще не автономность. Вообще ни разу. И третья проблема, она как раз вытекает из первых двух. Это просто неконтролируемое сжигание токенов.

Ага. Когда ИИ не помнит контекст, он вынужден прогонять через языковую модель огромные массивы одних и тех же данных снова и снова, просто чтобы, ну, заново понять задачу.

То есть он каждый раз читает всю инструкцию с нуля. Да, именно. В транскрипте отмечается, что для базовых задач, типа формат "вопрос-ответ", система Nebula всё ещё отлично подходит. Но как только дело касается глубокой персонализации, ээ, какой-то скрытой фоновой работы, старые подходы просто рушатся под собственным весом.

И тут на сцену выходит Hermis, и он решает проблему стабильности. Так что аптайм без перезагрузок у него превышает неделю.

Да, это огромный скачок. Но меня, знаешь, больше зацепило то, как они решили проблему с памятью. Они же не стали изобретать велосипед, не стали внедрять какие-то сверхсложные векторные базы данных, а просто взяли обычную SQLite.

Угу. Гениально в своей простоте. Да? Для тех, кто не пишет код, это классическая табличная база данных. На ней десятилетиями работают, ну, самые обычные мобильные веб-приложения. Но как именно это меняет поведение ИИ на практике? Смотри, использование SQLite позволяет агенту физически записывать каждое своё успешное действие, каждую команду, каждый результат в такую структурированную таблицу.

Так. В отличие от простых логов чата, ИИ теперь может сам писать SQL-запросы к собственной памяти. Ну вот, допустим, на прошлой неделе в переписке промелькнул какой-то ключ от API.

Ага. И агент его запомнил. Точно. И если сегодня ему понадобится этот ключ, он не будет просить его заново у пользователя. Он просто прочешет свою базу данных, найдёт нужную строчку и использует её. Плюс Hermis из коробки поставляется с более чем 40 инструментами.

Ого, 40 из коробки. Да, он сразу умеет работать с Apple Notes, сервисом Find My, может даже отправлять сообщения через iMessage.

Стоп, стоп, подожди. Мы говорим об экспериментальной программе, которая имеет доступ к локальным заметкам, геолокации и личным сообщениям.

Именно так. Кошмар для информационной безопасности. Одно неверное движение, один баг, и все личные данные могут улететь на какой-нибудь левый сервер.

Этот скептицизм более чем оправдан. Я сам об этом подумал. Любая система с таким глубоким доступом — это всегда риск. Но в материале подчёркивается, как именно Hermis подходит к этому вопросу. У него есть ээ встроенная функция самоаудита.

Это как? Он сам себя проверяет? Да. Можно отправить запрос, и агент сам проанализирует свои конфигурационные файлы. Он проверит, ну, не лежат ли ключи доступа в открытом текстовом формате, оценит надёжность сетевых ограничений.

Звучит неплохо, но достаточно ли этого для базовой защиты? Да. А если нужна жёсткая изоляция, архитектура Hermis позволяет запускать его внутри Docker-контейнеров.

То есть, грубо говоря, мы сажаем агента в такую цифровую звукоизолированную комнату, откуда он может общаться с внешним миром только через одно строго заданное окошко.

Абсолютно точная аналогия. Именно так работает контейнеризация. А для совсем уж параноиков есть вариант бессерверного запуска через платформы вроде Model.

А в чём разница? В этом случае код агента как бы оживает в облаке только на долю секунды. Вот ровно для выполнения конкретной задачи. И тут же уничтожается, вообще не оставляя постоянно открытой уязвимости.

Вау, это круто. Да? Если связать это с более широкой картиной, разработчики и начинают наконец-то понимать, что без надёжной инфраструктуры и безопасности самые умные алгоритмы просто никому не нужны. О'кей, допустим, систему мы обезопасили, но давай перейдём к самому больному вопросу, к деньгам.

О, да. В транскрипте упоминаются, что счета за OpenClo могли достигать сотен долларов в день. Сотен. Это же не помощник, это какая-то финансовая чёрная дыра.

Абсолютно. И вот здесь начинается самое интересное. Имран рассказывает, как снизил эти расходы со 130 долларов до 10 долларов за 5 дней.

Падение почти на 90% — это просто безумие. Да, как вообще Hermis это делает технически? Это происходит через фундаментальную смену парадигмы, маршрутизации и принципы выполнения задач. Начнём с маршрутизации. У Hermis есть специальная терминальная команда Hermis Model.

Так. Она напрямую связывает его с сервисами вроде Open Router. Это такая биржа языковых моделей. То есть агент больше не привязан жёстко к одному какому-то дорогому провайдеру.

Поняла. То есть он выбирает, к кому пойти. Да. Если задача примитивная, он может на лету переключиться на полностью бесплатную модель, например, Nvidia Niront. А если нужно чуть больше логики, используется Quen 36+.

И сколько она стоит? Она стоит всего 33 цента за миллион токенов ввода. Сравните это с премиальными моделями вроде Son, которые стоят в разы, просто в разы дороже.

То есть мы перестаём вызывать тяжёлую артиллерию для того, чтобы, ну, просто отсортировать спам на почте. Это очень логично. Использование старых агентов было похоже на то, как если бы за каждую поездку в булочную за углом мы платили по тарифу бизнес-класса.

Отличное сравнение. Но эта смена тарифов — это только половина дела. Настоящая экономия возникает благодаря принципу из классического программирования. Он называется "Don't repeat yourself". Не повторяйся.

Угу. DRY. Да. В старой модели, если нужно было каждый день собирать аналитику с какого-то веб-сайта, каждый день тратил токены на чтение страницы, на анализ структуры, на извлечение текста.

Итак, по кругу. Именно. А Hermis работает иначе. Пользователь просит его один раз написать детерминированный код, ну, скажем, скрипт на Python для конкретного сайта.

А, я поняла. То есть ИИ выступает не как исполнитель вот этой ежедневной задачи, а как инженер, который создаёт инструмент в точку. А затем этот скрипт просто запускается по расписанию в фоновом режиме, вообще больше не обращаясь к дорогой нейросети.

Совершенно верно. Тяжёлая языковая модель используется ровно один раз для написания самой логики. Дальше работает бесплатный локальный скрипт. И это поднимает очень важный вопрос о том, как часто сейчас индустрия использует сверхмощные нейросети для задач, которые, ну, решаются банальным планировщиком задач операционной системы.

Слушай, ну экономика стала понятной, да? Но раз мы используем локальные скрипты, возникает такой чисто физический вопрос: а где эти скрипты должны крутиться 24х7?

Хороший вопрос. Просто долгое время аксиомой считалось, что для своего личного ИИ нужен облачный сервер или хотя бы, знаешь, Мак Mini в шкафу, который постоянно подключен к розетке и сети. Но решение, которое описал Имран, оно просто ломает шаблоны. Он запустил своего агента на дешёвом Android-смартфоне.

Да, если быть точным, на Samsung S21 под управлением Android 15. На телефоне. И назвал он этого агента кодовым именем Коржик — Куки Монстр из Маппетов.

Забавное имя, да, но выбор дешёвого телефона вместо сервера — это, знаешь, не просто какая-то причуда гика-энтузиаста. Это очень изящный обход системных ограничений современного интернета.

В смысле, как это работает? Технически это реализуется через приложение. Это такой эмулятор терминала для Android. Он работает в связке с пакетом Termux API, который ставится через магазин приложений F-Droid с открытым исходным кодом.

Слушай, ну зачем городить весь этот огород с телефоном? У нас же есть облачные сервисы AWS, Google Cloud. Там же всё разворачивается буквально в два клика. Зачем превращать старый мобильник в сервер?

Все дело в доступе к аппаратному обеспечению и в борьбе с алгоритмами. Смотри, облачный сервер — это виртуальная сущность. Социальные сети и всякие крупные платформы прекрасно умеют определять трафик из дата-центров.

Ага. Они видят, что это бот. Да. И когда контент публикуется через официальные API или сторонние сервисы, платформы часто применяют искусственное занижение охватов, так называемый "недотрафик". Им же нужно, чтобы живой пользователь физически сидел в их приложении и смотрел рекламу.

Так-так-так. И как старый Android-телефон Termux решает проблему вот этих урезанных охватов? А вот тут начинается магия. Телефон даёт агенту, ну, физическое тело. Termux через API получает доступ к реальному железу.

Ого. Он видит уровень заряда батареи, может переключать Wi-Fi, управлять яркостью. И самое важное, он может программно имитировать реальное касание экрана. То есть для серверов, условной социальной сети это выглядит так, как будто живой человек взял устройство с подлинным MAC-адресом, открыл оригинальное приложение и прямо руками набрал пост.

Абсолютно. Никаких срезанных охватов, потому что платформа просто не понимает, что это делает бот. Для неё это живой человек со смартфоном.

Это невероятно хитро. У агента буквально появляются руки в цифровом мире. Да, это меняет правила игры. В транскрипте упоминается ещё один кейс использования телефона, и он меня немного пугает. Обработка двухфакторной аутентификации. SIM-карта стоит прямо в этом же Android-устройстве, и ИИ считывает входящие SMS, чтобы авторизовываться в рабочих сервисах.

Мм, да, это острая тема. И тут я снова должна включить своего внутреннего критика. Давать автономному скрипту доступ к SMS с кодами от банков и корпоративных аккаунтов. Но это же звучит как катастрофа, которая просто ждёт своего часа.

Я согласен. Это действительно зона повышенного риска. И здесь как раз возвращается концепция песочницы, которую мы обсуждали чуть раньше.

Так и как она тут помогает? Агент на телефоне не имеет безграничного доступа ко всему. Если система настроена правильно, ИИ может только считывать определённые шаблоны сообщений и затем передавать их в конкретный защищённый канал, например, через тот же Telegram.

Ну то есть он не может прочитать переписку с мамой и отправить её в сеть. Верно. Но вы правы в том, что баланс между удобством вот этой автоматизации 2FA и безопасностью — это то, с чем пользователям придётся разбираться очень и очень аккуратно. Сама концепция в том, что телефон перестаёт быть просто экраном для потребления контента. Он становится таким выделенным узлом вашей личной автоматизации.

Итак, что же всё это значит на практике? Вот у нас есть дешёвый ИИ, который помнит прошлый контекст, который работает через локальные скрипты и, э, живёт в телефоне на столе. Как вообще эта архитектура повседневности интегрируется в реальную жизнь обычного человека?

В источнике Имран как раз щедро делится деталями того, как он управляет всей этой системой через Telegram. Ну или через защищённый, удалённый доступ. И результаты, я вам скажу, впечатляют.

Угу. Там есть очень чёткое разделение. Да, разделение на рабочую и личную жизнь там прослеживается очень жёстко. Это, кстати, строгая рекомендация из источника: никогда не смешивать рабочих агентов с личными.

И как это работает у него в фонде Алиф? В профессиональной сфере агент Имрана каждое утро проводит прямо жёсткую фильтрацию почты. Он не просто помечает спам, он самостоятельно отписывается от бесполезных рассылок и генерирует короткую выжимку действительно важных писем.

Там упоминается, что это экономит ему около часа каждый божий день. И этот сэкономленный час конвертируется в реальные деньги. Имран успевает пообщаться на 20-30% с большим количеством основателей стартапов.

Да. А для венчурного фонда это прямое влияние на прибыль? Совершенно верно. А вот в личной жизни интеграция доходит до какой-то удивительной степени интимности. Гость рассказывает, как однажды просто надиктовал ИИ восьмиминутное голосовое сообщение.

Ага, это мой любимый момент. Он просто ходил по кухне, открывал шкафы, заглядывал в холодильник и перечислял всё, что там лежит. И теперь агент каждый день присылает ему готовые рецепты, которые базируются исключительно на имеющихся продуктах и строго соответствуют его фитнес-целям. И это, естественно, ведёт к сокращению заказов в доставке еды, DoorDash и всё такое.

Да, и буквально окупает свою работу, просто не давая владельцу заказывать фастфуд. Это гениально. Согласен.

Но, слушай, как вообще вся эта информация структурируется? У него же там от списков стартапов до содержимого холодильника. Это же чистый хаос.

Точкой сборки выступает программа Obsidian. Это такая база знаний, где вся информация хранится в простых текстовых файлах, ну, формата Markdown. Их Hermis умеет работать с этими файлами напрямую.

То есть он сам их читает и правит? Да, каждое утро и самостоятельно собирает дашборд. Он сводит расписания, задачи, маршруты поездок и даже контекст по предстоящим звонкам. Всё это в один понятный текстовый документ. И тут на сцену выходят так называемые кастомные навыки. Меня поразил пример со встроенным навыком JetSet.

О, да, это сильная штука. Для тех, кто не в курсе, это методология Грега Кагана. Это глава легендарного акселератора Y Combinator. Получается, Имран взял логику топового стартап-эксперта, превратил её в системный промпт, и теперь его личный агент фильтрует рабочие проекты ровно так, как это делали бы в Кремниевой долине. Это просто отличный пример того, как человеческие знания становятся отчуждаемыми алгоритмами. Другой, не менее поразительный кейс из источника — это навык психотерапевта.

Серьёзно? Он сделал ИИ-психотерапевта? Да. И гость создал его буквально за несколько минут. Он взял статью из Википедии о Джозефе Вайценбауме. Это учёный из MIT, который ещё в шестидесятых годах создал знаменитую программу ELIZA. Она имитировала работу психотерапевта.

И агент это скопировал. Агент изучил эту статью и перенял стиль эмпатичного собеседника.

Вау, звучит невероятно круто, но у меня возникает резонный вопрос. Настройка серверов на Android, написание скриптов для парсинга сайтов, интеграция с этим Obsidian, создание промптов на базе Википедии. Разве это не превращается в какую-то гигантскую чёрную дыру для личного времени?

Мм, понимаю, о чём вы. Ну, правда, человек хотел сэкономить час на чтение почты, а в итоге потратил 3 месяца на программирование своего цифрового дворца.

Это фундаментальная ловушка, в которую попадают очень многие гики-энтузиасты. Но в транскрипте есть золотое правило, которое формулирует сам Имран. Он говорит: "Кастомизация — это не навык". В том, чтобы бесконечно полировать дашборды или менять цвета тегов в Obsidian. Секрет заключается в очень жёсткой оценке своего времени.

Как это должно работать на практике? Допустим, вы оцениваете свой рабочий час в 500 долларов. Если вы тратите этот час на ручное удаление спама или на поиск рецептов ужина, вы фактически выбрасываете эти 500 долларов в мусорку.

Согласна. ИИ должен забирать на себя всю тихую, невидимую фоновую работу. Он просто подготавливает почву. А вот высвобождённый человеческий разум должен заниматься тем, что машины пока не умеют.

Принимать ключевые стратегические решения и выстраивать отношения с живыми людьми. Именно так.

Что ж, подводя черту под нашим анализом, становится ясно, что Hermis Agent — это не просто какой-то новый интерфейс поверх старой языковой модели.

Да, масштаб изменений тут совсем другой. Мы видим переход к архитектуре, где инструменты реально умеют запоминать контекст через локальные базы данных. Они радикально снижают стоимость работы за счёт написания скриптов и могут физически взаимодействовать с миром через нестандартное железо, вроде тех же старых смартфонов.

Да. Точно. Всё это превращает просто разрозненные файлы в стройную систему управления жизнью. Этот разбор ясно показывает: эра дорогих ИИ-ассистентов с амнезией подходит к концу, и она уступает место дешёвым, автономным и невероятно персонализированным системам.

Но, знаешь, процесс этой персонализации требует времени. В источнике есть одна очень важная деталь. Там говорится, что агенту необходимо от 7 до 20 дней непрерывного ежедневного использования, чтобы по-настоящему понять пользователя. 20 дней, чтобы он подстроился под человека.

Да, за эти 3 недели он анализирует график, привычки, предпочтения в еде, особенности рабочей коммуникации. И только тогда он начинает работать вообще без сбоев.

Слушай, и эта цифра в 20 дней заставляет задуматься о совершенно неожиданном аспекте.

О каком же? Ну вот смотри, если мы впускаем алгоритм так глубоко в свою жизнь, чтобы он безупречно организовывал наш день, сортировал переписку, даже планировал, что мы будем есть на ужин,

Наступит ли момент, когда мы сами совершенно неосознанно начнём менять свои собственные привычки?

О, это сильная мысль. Не станем ли мы формулировать мысли проще и действовать более предсказуемо, просто чтобы нашему ИИ-двойнику было легче нас анализировать? Когда твой цифровой ассистент знает содержимое твоего холодильника и расписание встреч, остаётся открытым вопрос: кто кого на самом деле программирует?