📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

I Cut My OpenClaw Costs by 97%

Matt Ganzak26:29

Transcription

Привет, это Мэтт Ганзак, и это руководство по оптимизации токенов OpenClaw. И если вы не знакомы с OpenClaw, это персональный ИИ-ассистент, который вы можете развернуть локально. Есть пара вещей, которые я хочу вам сказать. Во-первых, вам, вероятно, не стоит этим заниматься, если вы не разработчик или если вы раньше не развертывали приложения локально, не разрабатывали никаких приложений раньше. Так что я определенно не рекомендую это вам. Эм, во-вторых, обязательно разверните его в контролируемой среде. Так что на ПК или Mac, определенно Mac лучше. Эм, разверните его на собственном устройстве. Например, не развертывайте это на своей собственной машине. Он попытается войти в ваши приложения. Он попытается получить доступ к вещам. Один парень даже сказал, что он получил доступ к кредитной карте. Он пошел и попросил его перестроить свой бренд, а он пошел и купил курс за 3000 долларов, прошел курс, чтобы помочь ему построить свой бренд. Так что, да, он буквально сделает что-то для вас, и вам нужно быть очень осторожным. Так что я должен предварить все это здесь. Эм, еще одно предварительное замечание, которое я должен добавить, и здесь есть отказ от ответственности: я даю вам шаги, которые я предпринял, и если вы попытаетесь следовать этим же шагам, есть шанс, что вы можете сломать свой OpenClaw, если вы не знаете, что делаете. Так что, пожалуйста, не пытайтесь делать эти настройки, если вы не знаете, что делаете. Так что это не моя вина. Я не занимаюсь кодированием. Я просто даю вам именно то, что я сделал. И надеюсь, это поможет некоторым людям. Я публиковал в TikTok и Instagram, и я помогал многим людям в этих одноминутных видео. Так что я хочу сделать что-то более комплексное, чтобы углубиться немного больше, чтобы ответить на некоторые из тех вопросов, которые я получал. Итак, прежде всего, эм, OpenClaw снова, это ИИ, который подключается к другим платформам, таким как Claude, O Open AI, и так далее. Когда я впервые построил свою V1, я попытался использовать OpenAI, и он построил приложение ужасно, и оно ничего толком не делало. Так что я просто боролся с ним, и он лгал мне, и это было очень расстраивающе. [хмыкает] Так что я прекратил это и сделал эм, эм V2, и я создал V2 моего приложения с Sonnet. И когда я проходил через эм, Sonnet немного дешевле, чем Opus, а Haiku дешевле, чем Sonnet. Так что это иерархия эм, расходов. Но тем не менее, мне стоило около 3 долларов, чуть меньше 3 долларов, чтобы развернуть и настроить все приложение для использования Sonnet. И это определенно того стоило. Это действительно дало мне хорошую основу и хорошую архитектуру для дальнейшего развития. Но я заметил некоторые проблемы, когда работал с Sonnet. И это шаги, которые я предпринял, чтобы снизить мои расходы на 97%. Так что это довольно массивное изменение в количестве токенов, которые использовались и расходовались. И я дам вам точное обоснование и именно то, как я нашел это в аудитах токенов, которые я провожу раз в день, и как я исправил это шаг за шагом, так что это не, знаете, очень сложно. Хорошо. Эм, также под этим видео я дам вам ссылку на это руководство, чтобы вы могли фактически пройти его и скопировать и вставить все, чтобы у вас был доступ к этому. Но давайте пройдемся по нему. Я не буду читать каждое слово на этой странице. Вы можете прочитать его сами. Ключевая вещь - это просто ввести здесь до и после, например, ежедневное использование. Эм, эм, это было ежедневное использование, как просто выполнение одной или двух задач стоило от 2 до 3 долларов. Так что ежемесячно это было бы, знаете ли, 90 долларов, и это просто почти просто простаивало. Оно все еще тратило 2-3 доллара в день, просто простаивая. И эм, теперь после того, как технически я на нуле, простаивая, и я объясню это через минуту. Эм, но, знаете, вы хотите, чтобы это могло запускать тесты. Так какие задачи я заставляю его выполнять? Я заставляю его находить возможности для нас. Мы управляем венчурными компаниями. Так что я заставляю его находить возможности и составлять исходящие сообщения. И я еще не позволяю ему отправлять электронные письма. Я не позволяю ему быть полностью автономным и делать такие вещи. Но он проводит исследование и эм, эм, получает действительные адреса электронной почты. Я занимаюсь B2B бизнесом, так что многие из наших приложений, как наше приложение для больниц, знаете ли, я не могу запускать рекламу для приложения для больниц и находить конкретного, знаете ли, вице-президента по безопасности пациентов в больнице XYZ. Я не найду их через рекламу. Конечно, я мог бы сделать холодное обращение в LinkedIn, но, знаете ли, это приложение находит их профиль в LinkedIn, но оно также находит их адрес электронной почты, так что я могу отправить им электронное письмо и рассказать им о том, чем мы занимаемся, и найти возможность для сотрудничества. Так что, B2B бизнес, это феноменально. Вы можете сделать так много с этим. Это всего лишь один пример использования, который вы можете сделать. Теперь, одна из вещей, которую я обнаружил, была неправильной, и это основная логика архитектуры OpenClaw, заключается в том, что он загружает всю вашу историю при каждом сообщении. Он загружает все ваши контекстные файлы. Он загружает, а ваши контекстные файлы немного раздуты, и чем больше вы знаете, вы помещаете в свои контекстные файлы, душу, личность пользователя и т. д., тем более раздутыми они будут каждый раз. Так что каждое сердцебиение будет эм, расходовать токены. Каждый раз, когда вы просите его что-то сделать, он будет запускать ваши контекстные файлы и так далее. Так что я тратил 2-3 миллиона токенов просто на сердцебиения. Как мое сердцебиение происходило примерно каждые 30 минут, и я тратил столько токенов каждые 30 минут. Я подумал: "Что здесь происходит?" Я загрузил 25 долларов в Anthropic, и я был на пути к тому, чтобы просто простаивая потратить почти 20 долларов за день, просто ничего не делая. И это определенно проблема. Эм, и это не то, что написано в эм, знаете ли, веб-платформе и так далее. Так что это не то, что вы можете просто пойти и сделать. Вам нужно подготовить свое приложение, чтобы делать эти вещи. Так что это одна вещь, которую я сделал: я больше не загружаю все контекстные файлы каждый раз. Так что это само по себе сэкономило мне около 80% моего перегрузки контекстом только на этом. Так что это было огромное. Вот мое до и после. Так что до этого было около 50 килобайт контекста при запуске, а также каждый раз, когда я его запрашивал, а также каждый раз, когда происходило сердцебиение, как каждый раз, когда оно просто раздувалось и становилось все больше и больше, по мере того как память становилась все больше и больше, это просто компилировало количество токенов. Так что, если вы использовали его неделями или месяцами, знаете ли, контекст может быть намного больше для вас, и каждый раз, когда вы совершаете любое действие, размер вашего контекстного файла может увеличиваться с 50 до 75 до 100 и более. И это действительно компилирует использование данных без причины. Как вы буквально ничего не делаете, и вам приходится платить деньги без причины. Так что это важно. Другое дело - многие люди говорят, что вы можете использовать только одну ИИ-модель, и это не так. Так что я на самом деле использую три ИИ-модели, фактически четыре, потому что я сделал еще одно изменение совсем недавно этим утром. Но просто чтобы дать вам некоторое понимание этого, вы сможете перейти к вашему файлу конфигурации OpenClaw. Так что это ваш файл конфигурации. Внутри вы увидите agents default model, а затем вы увидите вашу основную модель. Так что, если вы настраиваете ее изначально на Sonnet, это будет Sonnet. Вы можете настроить ее таким образом, чтобы иметь несколько моделей. И я также добавил третью здесь для Opus, где у меня около 1% моих задач проходит через Opus. Так что в настоящее время около 85% работает через Haiku, где-то около того, 10% на Sonnet и 5% или меньше на Opus. Так что смысл сказанного в том, что вы можете сегментировать задачи и помещать их в память, и вы можете сегментировать задачи для этого, чтобы сказать, что эта задача является безмозглой задачей, и мне не нужно запускать Opus для какой-то безмозглой задачи, знаете ли, такой как перемещение файлов, организация вещей, как компиляция CSV в одно целое или что бы вы ни делали как безмозглую задачу ввода данных. Вам не нужно использовать Opus или Sonnet. Вы можете использовать Haiku, но я на самом деле использую Olama, который является бесплатным LLM, и я объясню это через секунду, но я использую его для выполнения моих безмозглых задач, а также моих сердцебиений и так далее. Я опережаю себя, но смысл в том, что вы можете иметь четыре разные модели, работающие одновременно, а затем иметь ваши критические и различные уровни критичности задач в зависимости от того, что им нужно рассуждать и думать. Вы можете назначить каждую модель в зависимости от вашего варианта использования, в зависимости от того, какие рассуждения необходимо включить или что нужно написать и так далее, и вы можете запускать вещи на Haiku, который в 10-50 раз дешевле, и иметь тот же результат. Так что, если вы просто используете Opus, или вы просто используете Sonnet или какую-либо другую ИИ-модель, вы, вероятно, сжигаете токены без причины, потому что вы могли бы использовать одну из более дешевых моделей, чтобы сделать это для вас, верно? Так что вы добавляете маршрутизацию для этого, и вам придется определить, что делает ваш бизнес и что вам нужно, чтобы он достиг. И затем вы назначаете, какая модель в зависимости от того, какие задачи вы хотите, чтобы она выполняла. И если она сталкивается с блоком, если есть какой-то блок, который произойдет, он эскалируется до следующей более высокой модели. Если там есть блок, он эскалируется до следующей более высокой модели. Так что вы можете настроить так, что, возможно, он даже начинается с бесплатного, знаете ли, локального LLM, а затем, возможно, переходит к Haiku, а затем, возможно, к Sonnet, а затем, возможно, к Opus в качестве последнего и так далее. Так что есть способы сделать это. Так что [хмыкает] раньше я использовал Sonnet для всего. Так что это была доля цента за тысячу токенов. И я значительно снизил ее, просто заставив Haiku выполнять около 80% работы. И, и теперь с этим, у меня даже есть LLM на фронте. Так что он может выполнять около 15% моих фронтенд-задач. И это, вероятно, 75% сейчас, если бы я сказал, на Haiku, может быть, 10% на Sonnet, и около 3-5% на Opus. Так что я могу эскалировать вещи, не сжигая токены. Так что, вы можете поставить свое сердцебиение на Olama. Так что, сердцебиение - это когда оно как бы пингует систему, чтобы дать ей знать, что все работает. Есть ли у вас активные задачи? Если у вас нет сердцебиения, оно может просто уснуть и не закончить текущую задачу. Но если у вас есть сердцебиение, оно даст ему небольшой толчок и просто скажет: "Эй, что здесь происходит?" Знаете ли, есть ли у вас открытые задачи? Нужно ли вам продвигаться по этим задачам? Что происходит. И каждый раз, когда оно запускает сердцебиение, оно отправляет контекстные файлы, а также ищет историю сеанса. Некоторые люди говорят, что оно не ищет историю сеанса, но то, что я обнаружил, когда проводил аудит токенов, это то, что оно фактически загружает мою историю сеанса. И мы поговорим об истории сеанса через минуту, но история сеанса - это как если вы используете Slack для общения с вашим ботом или WhatsApp, оно смотрит на все, что вы когда-либо говорили в Slack, и компилирует это. Когда я посмотрел свои журналы и провел аудит токенов, у меня было 111 килобайт сеанса просто текста, который отправлялся. Каждый раз, когда я снова его запрашивал, оно помещало это в контекст, помещало это в память и загружало каждый раз. И я видел это в журналах. Я подумал: "Нам это не нужно". Так что вам нужно создать команду, чтобы убить ваш сеанс, а затем, когда вы сделаете новый запрос, он не будет загружать контекст всего, о чем вы когда-либо говорили. Я немного отклоняюсь от темы, но так что вы установите этот локальный LLM и можете добавить его вот так. Так выглядит мой, и вы можете добавить OAMA вот так, это последняя версия прямо сейчас. Если вы смотрите это через пару недель или пару месяцев, эта версия может немного отличаться. Так что я просто убедился бы, что у вас последняя версия, и когда вы ее запустите, вы можете запустить ее здесь, а затем вы можете найти последнюю версию и убедиться, что вы установили последнюю версию и так далее. Итак, с учетом сказанного, теперь я могу заставить Olama запускать мои сердцебиения, и цель этого в том, что я не хочу тратить токены на сердцебиения. Как это простаивает, и вы платите деньги. Зачем бы вы это делали, если вы используете Opus и не настраиваете эти вещи? Вы можете тратить 5 долларов в день просто на то, чтобы он работал, и он простаивает, ничего не делая. Так зачем бы вы это делали? Так почему бы не настроить его и не настроить так, чтобы сердцебиение просто работало локально, потому что это безмозгло. В этом действительно нет ничего сложного. Это как проверить вашу память и проверить вашу задачу и убедиться, что все в порядке. А затем он возвращается: система в порядке. Эм, проверка сердцебиения в порядке, или какие бы слова он ни говорил, но суть в том, что вам не нужно делать API-вызовы для сердцебиений, точка, конец истории. Это должно быть основной интеграцией в OpenClaw, и если, надеюсь, кто-то сможет внести это, или, может быть, я внесу это, но это должна быть основная интеграция, потому что нет причин, по которым вы должны тратить API токены на сердцебиения, точка. Я не могу придумать ни одного варианта использования, почему это могло бы понадобиться. Нет причин, потому что все, что он делает, это просто проверяет свою локальную память и проверяет свою локальную задачу, которую он выполняет. Так зачем бы вы это делали? Другая проблема, с которой я сталкивался, были ограничения по скорости. Так что, когда вы изначально регистрируетесь в Anthropic, чтобы получить API-ключ, он дает вам что-то вроде 30 000 токенов в минуту. И как я уже говорил, и именно здесь я обнаружил проблему с историей сеанса. И я, вероятно, никогда бы ее не нашел, если бы не ограничение по скорости. Так что спасибо за низкое ограничение по скорости, которое я мог видеть. И оно пинговало около миллиона токенов и загружало слишком много всего сразу без причины. И то, что я обнаружил, это то, что оно сжимало все мои контекстные файлы, ну, оно не сжимало, оно распаковывало все мои контекстные файлы, а затем оно делало вызов, но оно загружало мою полную историю сеанса из Slack каждый раз. Так что, когда я сделал команду и запросил его сделать команду, и мы придумали название команды "новый сеанс". Так что всякий раз, когда я говорю "новый сеанс", сбросьте всю вашу предыдущую историю сеанса, но сохраните ее в вашей памяти, чтобы мы могли вызвать ее позже. Так настроена моя память, и я могу сбросить свой сеанс Slack. Так что он не компилирует все, что я когда-либо говорил в Slack, каждый раз, когда я запрашиваю его, чтобы отправить его в API, чтобы сделать вызов. Так что да, это было огромно. И это сильно повлияло на ограничения по скорости. И теперь у меня есть встроенное управление скоростью. И вы можете прочитать, как я сделал встроенное управление скоростью и так далее. И это так важно, чтобы вы не сталкивались с этими ограничениями по скорости каждый раз. Я получал 429 каждый раз, когда отправлял. И я выяснил, что это был Slack, потому что я зашел в веб-версию и делал тот же самый запрос в веб-версии, а не в Slack, и вызовы проходили нормально. Так что я прочитал журналы и прочитал, что отправлялось, и посмотрел токены в аудите токенов, а затем я сравнил бок о бок, чтобы сказать, что Slack компилирует каждое сообщение, которое я когда-либо отправлял в Slack, каждый раз, когда я снова запрашивал. И я не тестировал это на WhatsApp. Если у вас есть на WhatsApp, оставьте комментарий ниже и дайте мне знать. Но я бы предположил, что любая платформа обмена сообщениями, которая делает это и позволяет вам общаться с ней, вероятно, делает то же самое, и она компилирует это. Она берет вашу полную историю сеанса и отправляет ее для расходования токенов ИИ каждый раз, когда вы ее используете. Так что, некоторые другие вещи, которые я сделал, это я взял свои рабочие файлы и сжал некоторые из них, и я уменьшил их, а затем я точно сказал ему, что делать с моим выбором модели и переключением туда и обратно. Я включил все ограничения по скорости и разбил все это на то, что ему нужно делать. А затем я определил некоторые ключевые метрики. И вы можете включить одну из метрик, которую вы хотите достичь, - это низкое использование токенов. Так что вы можете буквально сказать ему оптимизировать для токенов. Так что теперь каждый раз, когда я его запрашиваю, он говорит мне, сколько токенов он собирается потратить для достижения цели. Например, найди мне 1000 лидов для этого бизнеса и найди лучший адрес электронной почты и найди их LinkedIn и найди лицо, принимающее решения, и так далее, и так далее, и так далее, и скажи мне, сколько токенов ты собираешься потратить. Теперь это как, знаете ли, это будет стоить 60 токенов или 60 центов для достижения этого. Я говорю: "Отлично, сделай это". Затем в конце он говорит мне, сколько токенов он фактически использовал, и я могу сказать: "О, ну, мы были близки, или, знаете ли, что было не так, что было блоком, что было проблемой, а затем мы можем работать над этим и работать над этим", но в метриках успеха это одна вещь, которую я добавил: работайте эффективно, работайте эффективно, чтобы я не тратил токены без причины. Мне писали некоторые люди, и вы можете проверить всю свою настройку и пройти эти шаги, и у вас есть небольшой контрольный список. Мне писали некоторые люди, говоря: "Я лег спать, а утром проснулся, и он сжег 500 долларов". Это еще одна вещь: не позволяйте, пока вы действительно не настроите это, не позволяйте Anthropic автоматически выставлять вам счета. Просто добавьте пару долларов, а затем будьте очень внимательны к тому, как это тратится. Так что у меня на экране, если бы вы смотрели на мой экран моего агента. Это не мой агент. Это мой ноутбук. Но на моем агенте я держу панель управления токенами, а затем каждый раз, когда я запускаю тест, я делаю снимок токенов и возвращаю его боту OpenClaw и говорю: "Сравните, как вы думаете, было использование токенов и какова была стоимость, с фактической стоимостью и фактическим использованием токенов". Так что я даю ему пару снимков с панели управления, а затем он говорит: "Хорошо". Я калибруюсь сейчас, чтобы убедиться, что это более точно. Мне пришлось сделать это три раза, и после того, как я сделал это три раза, он достиг точки, когда он был на 99% точен в определении стоимости. Еще одна очень важная вещь, которую нужно сделать, и я не добавил ее сюда, но, вероятно, добавлю, это кэширование. Так что стоимость API кэша намного ниже, чем у всего остального. Так что я выполнил задачу, и она была на 95% на кэшированных токенах и так далее. И я выполнил эту огромную задачу за ночь, и это было, вероятно, 6 часов просто исследования и поиска информации и написания электронных писем для меня и написания последующих действий и, знаете ли, размещения всего в правильных папках и организации всего и выполнения всего этого для меня. И в конце это стоило мне 6 долларов. Я говорю: "Это безумие", потому что, знаете ли, мы платим как венчурная студия, мы платим людям за то, чтобы они проводили исследования для нас, занимались вводом данных и искали лиц, принимающих решения. Так что мы платим людям за это, и это стоит нам десятки тысяч долларов, а производительность того, что они делают, по сравнению с тем, что OpenClaw сделал для меня за ночь за один день за ночь, это примерно то, что я бы заплатил этой компании в месяц за исследования. И это было сделано за ночь, и это стоило 6 долларов. Я говорю: "Это абсолютно безумие". Так что, знаете ли, я могу делать свою работу и работать, знаете ли, работать в течение дня, и пусть он мне помогает и помогает мне с вещами, но в конце дня я могу сказать: "Эй, найди мне новый список хитов для XYZ". И когда я просыпаюсь утром, у него будет список хитов, все организовано и все доработано, все собрано в основной список и так далее. Так что это невероятно. Так что, когда я настраиваю это, и то, как у меня настроено, мы запускаем эти суб-агенты, чтобы выполнять работу по сканированию, и я использую Brave search API, а затем я использую hunter.io, чтобы найти их реальные адреса электронной почты, оба API, и то, что он делает, это запускает эти суб-агенты. Он запустил около 14 суб-агентов для меня, и он сделал всю работу на основе того, что один делал это, а затем Sonnet проводил исследование и писал это, а Haiku выполнял это, а затем на бэкэнде LLM Olama организовывал все файлы. Так что они подают данные, а затем суб-агент для OAMA просто организовывал файлы и собирал все вместе и убеждался, что заголовки и CSV выглядят хорошо и все остальное. Так что у меня работали три разных агента. Я вообще не использовал Opus в задаче прошлой ночью. У меня был, у меня был Haiku, который искал информацию, как будто он читал блоги, и я искал проблемные бизнесы и так далее. Так что он читал блоги, он читал все эти инсайты и делал все эти исследования, и затем он находил одно, передавал его Sonnet. Sonnet писал мои электронные письма и мои холодные обращения, и то, что мне нужно сделать сегодня, чтобы связаться с ними, и структурировал все последующие действия и все остальное, что ему нужно сделать. И затем Lama на LLM организовывал файлы и собирал мою файловую структуру и убеждался, что все чисто. Так что, когда я просыпаюсь утром, я могу просто выполнить задачу, и я занимаюсь рассылкой. Я не позволяю этой машине заниматься рассылкой сейчас. Может быть, в будущем я буду, но сегодня нет. Так что, тогда я могу настроить свою рассылку и настроить, знаете ли, бронирование демо-звонков и так далее. И это работало за 6 долларов. Это работало всю ночь, шесть часов за 6 долларов. Так что это примерно доллар в час. Это [смех] просто подумайте об этом. Если бы он работал 24 часа в сутки, это было бы около доллара в час. И никто не работает за доллар в час так эффективно, имея 14 суб-агентов, работающих и делающих вещи одновременно и работающих взаимозаменяемо. Вот что безумно в этой платформе. Но если вы просто используете Opus, если вы буквально просто используете Opus, эта задача стоила бы около 150 долларов, которая произошла прошлой ночью, а мне стоила 1 доллар, за час, верно? Так что вот что безумно в этом, но вам нужно быть внимательным к оптимизации токенов, и именно поэтому я собрал это. Если у вас есть какие-либо конкретные вопросы, вы можете упомянуть их в комментариях. Я зайду и постараюсь помочь вам по пути. Но я хочу, чтобы вы сократили свои расходы на токены, потому что вы не будете запускать эту штуку, и она не будет эффективной. Вы не будете довольны ею, если вы тратите 50 или даже, как сказал один парень, 500 долларов на токены за ночь, и она делает немного, но на самом деле не делает ничего выдающегося для вас. Правильно? Так что надеюсь, это было полезно. Оставьте комментарий ниже, если у вас есть какие-либо вопросы, и вы можете перейти по ссылке ниже на этот документ и следовать шагам и оптимизировать свой, чтобы иметь эти несколько суб-агентов, а затем запускать различные задачи в зависимости от рассуждений, которые вам нужны. Haiku отлично подходит для большинства вещей. Haiku может сделать большинство вещей. Знаете ли, Sonnet для написания, выполнения некоторого кодирования, Opus для самых сложных и так далее, но установите lama, установите локальный LLM для выполнения основных вещей, сердцебиения и всего остального, и вы значительно сократите свои расходы на ИИ, сделав это. Так что, спасибо вам большое. Увидимся в следующем видео.