📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Build ANYTHING with Claude Sonnet 4.5 and n8n AI Agents

Nate Herk | AI Automation19:21

Transcription

Итак, Anthropic только что выпустила Cloud Sonnet 4.5, которая является их новейшей моделью ИИ и самой умной моделью ИИ на сегодняшний день. Итак, сегодня я собираюсь рассказать о том, как вы можете создавать что угодно с помощью Sonnet 4.5 и ИИ-агентов NAND. Конечно, мы не просто будем об этом говорить. Я также собираюсь показать вам кое-что. Итак, мы перейдем к NADN и фактически поэкспериментируем с Sonnet 4.5 в NADN. Но перед этим, я думаю, нам нужно сделать очень краткий обзор этого нового выпуска Sonnet 4.5. Итак, вот что у нас есть. Sonet 4.5 был выпущен 29 сентября 2025 года. И да, я знаю, что кажется, будто новая фундаментальная модель выпускается каждый день. В настоящее время она доступна для всех, и вы можете использовать ее через веб-приложения Cloud, приложения для iOS, Android, а также через API, именно поэтому мы сегодня подключаем ее к нашим ИИ-агентам. И, по сути, это последняя модель Enthropic. Cloud Sonnet 4.5 — это модель искусственного интеллекта, разработанная для помощи в написании кода, создании сложных агентов, выполнении бизнес- и исследовательских рабочих процессов, а также для использования компьютеров как человеческий ассистент. Вот цитата Шона Уорда, генерального директора IGENT AI. Sonnet 4.5 меняет наши ожидания. Он обрабатывает более 30 часов автономного кодирования, освобождая наших инженеров для выполнения месяцев сложной архитектурной работы за значительно меньшее время, сохраняя при этом согласованность в огромных базах данных или, простите, кодовых базах. В прошлом одним из ограничений многих из этих моделей было попытка работать с огромным количеством контекста в течение длительного времени как с текущим проектом. Так что будет интересно посмотреть, как Sonnet 4.5 это изменит. И если вы слышали об Enthropic, вы слышали о Claude, вы слышали об Opus. Все они, по сути, встроены в семейство моделей Claude от Anthropic. Итак, у нас есть несколько разных. У нас есть Haiku, у нас есть Sonnet, и у нас есть Opus. Все они, по сути, для разных целей. Haiku быстрее и доступнее. Sonnet — хороший баланс, а Opus — это модель с максимальной мощностью рассуждений. И что касается стоимости, вы можете увидеть разбивку прямо здесь. Sonnet 4.5 имеет ту же стоимость, что и Sonnet 4. И, как вы можете видеть, модели Opus, которые являются моделями рассуждений, намного дороже. Так почему же Sonnet 4.5 лучше предыдущих моделей Sonnet? Ну, согласно бенчмаркам и метрикам, которые мы рассмотрим после этого слайда, Sonnet 4.5 превосходит предыдущие модели в кодировании, длительных запусках и задачах реальных агентов. Он обладает более сильной памятью и может обрабатывать более крупные проекты, не забывая. И он стоит столько же, сколько Sonnet 4, так что вы получаете больше отдачи за свои деньги. Теперь, одна вещь, которую я хотел быстро упомянуть здесь, это контекстное окно этой модели Sonnet. Оно составляет 200 000, что намного больше токенов, чем вы, возможно, думаете, но оно не такое большое, как у некоторых других моделей. Так что это одна из вещей, которую я бы назвал ограничением этой модели. Как вы можете видеть, глядя на эту арену Vellum AI с контекстным окном, вы можете увидеть, например, Llama, Scout, Llama for Maverick, Gemini 2. Flash, эти парни в миллионах. У нас даже есть GPD 4.1 Nano Mini и 4.1 базовый. Это тоже миллион. 2.5 Pro Gemini. И вы можете видеть, что GBD5 имеет 400 000. И максимум, до которого Claude может дойти прямо сейчас, составляет 200 000, если вы не находитесь на бета- или корпоративных планах. Я считаю, что они достигают миллиона. Но все же, я покажу вам, сколько контекста мы собираемся загрузить в этого агента, и как 200 000 — это все еще много токенов. Так что, конечно, я хотел показать вам некоторые бенчмарки. Итак, давайте посмотрим на некоторые из этих тестов. Первый из них — S. Bench verified, что-то вроде экзамена по кодированию или разработке программного обеспечения. Sonnet 4.5 набрал лидирующие в отрасли 77-82% на этом экзамене, что означает, что он может автоматически исправлять или писать реальное программное обеспечение и выполнять задачи кодирования с навыками профессионального разработчика, что очень важно для новичков, таких как я в кодировании, потому что мы можем фактически доверять ему в решении наших проблем программирования. И я недавно сделал одно из этих видео того же типа, когда вышел GBT5. И вы можете видеть, что GBT5 находится здесь внизу, а sonnet 4.5 уже превосходит GBT5 и Codeex. Мы также можем видеть согласно этой таблице, что sonnet 4.5 лидирует среди всех моделей в ключевых тестах, таких как кодирование, использование компьютера, финансовый анализ, что означает, что он в настоящее время лучший для автоматизации реальных рабочих мест в сфере программного обеспечения и обработки сложных компьютерных задач. И я знаю, что я иду довольно быстро, я просто хочу перейти к самому интересному в Nen. Так что, если вы хотите увидеть фактический документ о выпуске от Anthropic, просто найдите Cloud Sonnet 4.5 release notes, или я также помещу его в описание этого видео. Теперь, это мне показалось довольно интересным, что также есть в документе о выпуске Anthropic, но вы можете видеть, что у нас есть финансы, медицина, право и STEM. И оранжевым цветом наверху у нас Sonnet 4.5, который превосходит практически все другие модели семейства Claude в этих категориях. И это, по сути, означает, что Sonnet 4.5 намного лучше отвечает на сложные вопросы о финансах, праве, медицине и науке, чем предыдущие модели ИИ. Таким образом, он дает более точные и экспертные советы по этим темам, что будет очень важно при использовании ИИ-агентов. Вам все равно придется запрашивать своих агентов с вашим предметным опытом и предоставлять им правильные инструменты и контекст, необходимые для выполнения работы, но это очень хорошая отправная точка. Теперь, конечно, насколько практичны эти вещи? Как Sonnet 4.5 и NADN революционизируют автоматизацию? Ну, у нас есть более умная автоматизация для начала. Экспертные навыки Sonnet в кодировании позволяют автоматизации NAND думать, решать проблемы и адаптироваться к проблемам. У нас также есть огромная пользовательская мощность в одном рабочем процессе, потому что мы можем запускать действительно продвинутые потоки и иметь в них действительно продвинутые модели. И идея по-прежнему заключается в том, что ИИ должен автоматизировать вещи, но вы должны быть там для человеческого одобрения и обратной связи. Но мы приближаемся к тому моменту, когда раньше было так: хорошо, я бы доверял ИИ делать 60%, теперь 70%, теперь 80%. И мы просто медленно ползем вверх по этому спектру. Конечно, он становится все более и более доступным. Так что NADN уже очень доступен в начале. У меня нет опыта в программировании. Многие люди, которых я обучаю, не имеют опыта в программировании. Так что nen плюс модель, которая становится все лучше и лучше в кодировании и рассуждениях и требует меньше системных запросов. Это просто снижает барьер для входа в создание пользовательских ИИ-автоматизаций. А затем, конечно, отраслевое влияние того, что он становится умнее в областях, которые действительно важны, таких как финансы, право, медицина и наука, и, конечно же, кодирование. Итак, мы собираемся перейти к NIDEN. Я покажу вам, как мы можем подключить Sonnet 4.5 к нашим ИИ-агентам. Я покажу вам пример создания контента с базовой моделью. Мы сравним его с некоторыми другими моделями и посмотрим, насколько хорошо он работает. Мы также проведем оценку контекстного окна. Итак, мы собираемся загрузить в него тонну информации и посмотрим, насколько хорошо он сможет выбрать правильные ответы из этого контекста. А затем мы бросим на него кучу инструментов и даже не дадим ему системный запрос и посмотрим, насколько хорошо он сможет справиться со всем этим. Итак, это звучит хорошо. Давайте перейдем к edit end.

Хорошо. Итак, прежде всего, я хочу показать вам, как мы можем подключиться к Sonnet 4.5 в наших ИИ-агентах. Итак, вы можете видеть, что у нас есть ИИ-агент здесь, и нам нужно подключить мозг. Итак, я нажму на модель чата и выберу anthropic. Но я столкнулся с проблемой. Позвольте мне показать вам, что я имею в виду, а затем я покажу, как мы можем это исправить. Но то, что у нас есть здесь, это Enthropic. Вам нужно зайти сюда и создать учетную запись Anthropic. Итак, вы просто зайдете сюда, нажмете "создать новую учетные данные", и вам будет предложен API-ключ. Затем вы просто зайдете в Google и введете Anthropic Claude console. И это должно выглядеть так. Как только вы попадете сюда, это отличается от вашей обычной среды чата с Claude. Вам нужно убедиться, что вы ввели платежную информацию. Так что просто введите карту. А затем, когда вы перейдете к этому разделу ниже под названием API-ключи, все, что вам нужно сделать, это нажать "создать ключ". Дайте ему имя. Он даст вам эту строку для копирования. А затем вы просто вставите ее сюда. Нажмите "сохранить", и вы должны стать зеленым. Как только вы это сделаете, вы сможете открыть этот список моделей. И вы можете видеть прямо здесь, у нас есть sonnet 4.5. И позвольте мне показать вам, что я заметил с этой моделью. Когда я захожу сюда и говорю "привет", я, по сути, получаю эту проблему: "неверный запрос, проверьте параметры". И говорится, что top_p не может быть установлен на -1. И если я перейду к top p, он на самом деле не установлен на -1. А затем я получаю эту другую проблему, где говорится, что что-то не так с температурой. Так что я думаю, что это просто проблема прямо сейчас с sonnet 4.5 через anthropic, потому что если я перейду к sonnet 4 и повторно отправлю то же сообщение, у нас нет проблем. Так что обходной путь прямо сейчас, и то, как я бы советовал вам это сделать в любом случае, это получить модель чата open router. Это, по сути, то же самое, потому что это позволяет вам подключаться к множеству различных моделей. И снова, все, что вам нужно сделать, это ввести API-ключ. Так что вы зайдете на open routouter.ai. Вы можете видеть, вы можете маршрутизировать к скольким угодно различным моделям. А затем вы просто зайдете сюда, в правый верхний угол, перейдете к ключам, и вы создадите новый ключ. И вы скопируете это. Вы вставите это сюда. И тогда вы будете готовы к работе. И теперь мы можем перейти к sonnet 4.5. И если я скажу "привет", вы можете видеть, что он фактически будет работать через open router. И теперь мы в порядке с sonnet 4.5. И я бы фактически рекомендовал использовать open router в любом случае, потому что вы можете отслеживать все свое использование по всем вашим различным моделям чата, и вы можете просто хранить свою платежную информацию в одном месте. Так что мне нравится использовать open router. Так что в любом случае, давайте перейдем к нашему первому эксперименту, который заключается в создании контента. Итак, что здесь происходит, это у нас есть ИИ-агент, и у него вообще нет системного запроса. Так что единственное, что он получает, это тот же ввод, который просто говорит: "создать электронное письмо в формате HTML, которое должно быть как профессиональный отчет о последствиях низкокачественного сна или недостаточного сна". В этом первом примере мы попробуем с GPT 4.1. Итак, мы только что получили это обратно. Давайте посмотрим, как это получилось. Хорошо. Итак, вот мы. Влияние недостатка сна. Имейте в виду, что я вообще не давал ему никаких подсказок ассистента. Итак, у нас есть ключевые эффекты. У нас есть небольшая цитата здесь. А затем у нас есть советы для лучшего сна. И вы можете видеть, довольно кратко, но неплохо. Теперь мы собираемся запустить его снова. На этот раз мы используем Sonnet 4.5. Имейте в виду, без системного запроса и тот же самый ввод. Так что я свяжусь с вами, когда мы получим это обратно. Хорошо, вот что мы только что получили для set 4.5. Вы можете видеть, что он намного красочнее с HTML. У нас есть последствия недосыпания. У нас есть цитата о том, что сон — это не роскошь. У нас есть 7-9 часов рекомендовано. 35% взрослых не получают достаточно. Затем он переходит к некоторым последствиям для здоровья сердечно-сосудистой системы, увеличению веса, ослаблению иммунной функции, умственным и когнитивным эффектам. У нас есть небольшие важные примечания здесь. И поэтому суть в том, посмотрите, насколько подробным является этот и насколько хорошо он фактически отформатирован. У нас есть рекомендации для лучшего сна. И поэтому, что круто в этом, так это то, что если вы помните, у этого агента нет системного запроса и нет инструментов. Так что он смог извлечь все это только из базовой модели. И мы запустим последний раз с, вероятно, самым большим конкурентом Sonnet на данный момент, которым является GPT5. Так что я свяжусь с вами, когда мы получим это письмо обратно, и мы посмотрим, насколько оно нам понравится по сравнению с Sonnet 4.5. Хорошо, вот пример для GPT5, последствия недостатка сна. У нас есть ключевые выводы. У нас есть, что происходит, если вы не высыпаетесь, когнитивные, эмоциональные и психические, метаболические и гормональные, сердечно-сосудистые, краткосрочные эффекты, долгосрочные риски. Он также затрагивает некоторые признаки того, что вы можете страдать от недосыпания. Он также затрагивает 7-9 часов в ночь, что является достаточным сном. У нас есть практические шаги по улучшению сна и когда обращаться за профессиональной помощью. Так что, я бы сказал, это довольно похоже на Enthropic. Этот на самом деле включает некоторые источники внизу, что довольно круто. И на самом деле выглядит, на мой взгляд, немного более профессионально как отчет. Опять же, это был Sonnet 4.5, так что он был красочным. Это все еще впечатляет, но на самом деле, я думаю, что я бы, вероятно, предпочел ChachiBt 5 в этом случае. Хорошо, так что прямо сейчас в ментальном подсчете у меня пока GBT, но давайте посмотрим, что произойдет в следующем, которое будет оценкой контекстного окна. Итак, мы фактически собираемся использовать функцию оценки, и у нас готовы вопросы. И то, что у нас есть в системном запросе этого агента, это буквально просто то, что вы полезный агент. А затем мы поместили туда весь PDF. Так что это был 10K Apple. И вот фактический документ, который мы извлекли. Так что это 121-страничный PDF с огромным количеством информации. И когда мы запустим это, вы увидите, что весь этот PDF составляет менее 100 000 токенов. Так что он находится в пределах лимита Sonnet 4.5. Но в любом случае, что мы собираемся сделать, это начать здесь с GPT5. Я перейду на вкладку "оценки" и просто запущу этот тест, и мы получим средний балл правильности, и я также скажу вам, сколько стоит каждый из этих запусков. Так что я свяжусь с вами, как только этот запуск завершится с GBTE 5. Хорошо, так что GBT5 только что завершился, и вы можете видеть, что он получил балл правильности 4.2. Так что я просто собираюсь быстро переключить эту модель чата на Sonnet 4.5, и мы собираемся запустить ее снова, и мы должны увидеть, превзойдет ли она 4.2. Так что я начну этот тест, и мы увидим. И на самом деле, я только что заметил кое-что действительно интересное. Итак, у нас есть сравнение моделей между GBD5 и Claude Sonnet 4.5 прямо здесь, в open router, и вы можете видеть, во-первых, что GBD5 дешевле, примерно вдвое дешевле по входным токенам и немного дешевле по выходным токенам, но что интересно здесь, так это то, что через open router, похоже, мы фактически получаем контекстное окно в миллион, и я думаю, что если бы вы прошли через консоль Anthropic, вы бы получили только 200k, но я полагаю, мы получаем доступ к бета- или корпоративной версии sonnet 4.5 через open router, так что это огромный плюс, но из-за разницы в цене. Если Enthropic не покажет лучшие результаты в этой конкретной оценке, то для этого конкретного использования я бы выбрал GBT5. Но, конечно, для этого и существуют оценки, потому что в зависимости от использования разные модели будут работать по-разному. Хорошо, так что 4x5 только что завершился, и вы можете видеть, что он едва превзошел GPT5 с 4.3 правильности, и это из пяти. Теперь, одна вещь, которую я хотел сказать, это то, что я запустил только 10 вариантов использования, что является слишком маленьким набором данных, чтобы действительно знать, лучше ли модель или нет. Но я просто хотел быстро показать вам, как я бы начал думать об объективном сравнении двух разных моделей. Теперь одна вещь, которую нужно иметь в виду здесь, это цена. Так что, если бы эти вещи стоили одинаково, я бы, вероятно, предпочел Sonnet 4.5 в этом случае. Но, как мы знаем, GBT немного дешевле. И если мы перейдем к моей активности здесь, в Open Router, вы можете видеть, что каждый из этих запусков занимал около 96 000 токенов для Sonnet 4.5, и это составляет чуть менее 30 центов. И когда мы смотрим на предыдущую оценку, она занимала около 90 000 токенов для GPT5, что составляет ноль, но если посчитать, это около 10-12 центов. Так что примерно вдвое дешевле. И тогда, конечно, возникает вопрос: стоит ли платить вдвое меньше и получать похожие результаты. Я бы сказал, что вы, вероятно, захотите запустить более 10 наборов оценок. Вы, вероятно, захотите запустить около 100, возможно, даже 200, и тогда у вас будет гораздо больше данных, из которых можно выбирать. Так что я на самом деле вернулся быстро, пока редактировал, потому что я хотел запустить еще несколько моделей. И вы можете видеть, что это действительно интересно. В целом, они набирают довольно высокие баллы. Это был sonnet 4. Это был Gemini Flash, который очень хорош в тесте "иголка в стоге сена" или сканировании огромного контекста и извлечении нужной информации. Это был GBT40. Это был sonnet 3.5. И это был DeepSeek R1. Суть в том, что у всех этих моделей разное количество токенов, сколько времени это заняло и все такое прочее. Так что вам действительно придется запустить более 10 вопросов через набор данных. Но все дело в том, чтобы выяснить, какая конкретная модель из какого конкретного фундаментального семейства оптимальна для этого конкретного использования. В любом случае, я подумал, что вам может быть интересно. Давайте вернемся к видео. Но в любом случае, я надеюсь, что это было познавательно и показало вам, как вы можете начать думать о выборе между различными моделями. Итак, с этим, давайте перейдем к финальному эксперименту, который заключается в использовании вызовов инструментов с нашими агентами в NAND.

Хорошо, для последнего примера, что мы собираемся сделать, это у нас есть Sonnet 4.5, как вы можете видеть, подключенный к множеству этих различных инструментов. Так что базовые вещи, такие как отправка электронных писем, управление событиями календаря, поиск в Интернете, все такое прочее. Так что здесь я тестирую, насколько быстро новичок может прийти в edit и подключить некоторые инструменты к агенту. И у нас даже нет системного запроса. Все, что мы делаем, это даем ему сегодняшнее время и дату. Итак, давайте начнем с быстрого примера. Я скажу: "Используй свою базу данных контактов, чтобы получить электронное письмо Майкла Скотта и отправь ему письмо, сказав, что я опоздаю на сегодняшнее совещание на 20 минут". Итак, мы собираемся отправить это. Мы скроем чат, и посмотрим, о чем он думает. Хорошо. Интересно. Итак, у нас возникла проблема с тем, как он пытается разобрать аргументы инструмента для модели чата. Так что мне интересно, может быть, это была проблема из-за инструментов, а не из-за вызова определенных вещей, таких как подрабочие процессы. Так что я попробую снова в этом рабочем процессе, где у нас есть ultimate assistant с под-агентами, а не просто инструментами. Так что я говорю агенту провести исследование голосовых агентов, а затем отправить его Майклу Скотту. И вы можете видеть, что происходит здесь, это то, что он использует Plexity. Он также вызывает контактного агента. И теперь мы посмотрим, сможет ли он передать эту информацию в агент электронной почты и отправить это письмо для нас. Пока все хорошо. Вы можете видеть, что он также смог вызвать агент электронной почты. Хорошо, так что вы можете видеть, что он фактически завершился и сказал, что сделал все это для нас. Давайте посмотрим на электронное письмо. Хорошо, так что он смог отправить это на правильный адрес электронной почты для Майкла Скотта. У нас есть голосовые агенты ИИ — это интеллектуальные программные системы, которые понимают, интерпретируют и отвечают на человеческую речь в реальном времени. Как они работают. У нас есть NLP. У нас есть TTS. У нас есть текущие приложения, преимущества и последние разработки. А затем подпись от Нейта. Так что, как вы можете видеть, он более чем способен справляться с такими вещами. Проблема здесь была просто потому, что он пытался использовать инструменты напрямую, а не подрабочие процессы, по какой-то причине. И, честно говоря, я не совсем уверен, почему это происходит. И здесь вы можете видеть, что мы используем Claude Sonnet 4.5. Вы также видели, что он вызвал Perplexity, и у него не было проблем. И инструменты, которые мы используем в этих агентах ниже, — это те же самые инструменты, которые у нас есть здесь. И поэтому, если у нас есть просто этот базовый агент Sonnet 4.5 с одним инструментом для отправки электронного письма, и я говорю: "Пожалуйста, отправьте электронное письмо на nateample.com с вопросом, что случилось", и мы отправляем это. Сможет ли он это сделать или нет? Может быть, он просто был перегружен. Хорошо, похоже, что он, возможно, просто был перегружен всеми инструментами, к которым у него был доступ. И вы можете видеть, что мы получили это письмо на nateample.com с вопросом, что случилось. Хорошо, давайте попробуем еще раз. Я только что добавил еще два инструмента, и я собираюсь сказать: "Пожалуйста, проведи исследование о разнице между собаками и кошками и отправь это в виде электронного письма на nate@acample.com, а также создай событие в календаре на обед сегодня в 14:00 с бобом@acample.com". Хорошо, давайте посмотрим, сможет ли он справиться с этими запросами с тремя инструментами. Нет системного запроса, кроме даты и времени. Он просто создал событие в календаре. Он только что искал Tavi, и похоже, что у него не будет проблем с отправкой этого исследования обратно в инструмент электронной почты, и он сможет отправить это письмо. Хорошо, круто. Итак, все это завершилось. Если я быстро зайду в свой календарь, у нас будет обед с Бобом, и там будет Bob atample.com. Мы также в моей электронной почте имеем два исследования Nate@acample.com о разнице между кошками и собаками. И это отформатировано довольно странно из-за того, как был настроен инструмент. Как вы можете видеть, он был настроен только на отправку HTML, а не текста. Так что он пришел странно. Но суть в том, что он может вызывать инструменты, и у него здесь нет проблем, как вы можете видеть. Я думаю, по какой-то причине я просто перегрузил его слишком большим количеством инструментов. И это даже не реалистичный пример того, что вы хотели бы делать с таким количеством инструментов, потому что это идеально работало здесь, когда у нас был ultimate assistant, где у нас были все эти инструменты, сгруппированные в специализированных агентов, и это работало намного лучше. Итак, это подводит итог экспериментам, которые у нас были на сегодня. В конечном итоге, когда дело доходит до выбора модели чата, я обычно начинаю с чего-то вроде GBT40 или пяти. А затем оттуда я думаю: "Хорошо, исходя из этого использования, какая модель, по моему мнению, может быть лучше?". А затем я проведу оценки, чтобы увидеть, лучше ли она или нет. Чем больше вы играете с агентами, тем больше вы начнете понимать, какие из них вы любите использовать для определенных сценариев. Так что трудно сказать, что, например, Sonnet 4.5 — это новый король LLM, потому что каждый LLM лучше в разных вещах. Но хорошая новость в том, что если вы хотите быть в сообществе, где вы можете постоянно вести такие разговоры и слышать, что используют другие люди для разных сценариев, то обязательно загляните в мое плюс-сообщество. Ссылка на это находится в описании. У нас есть отличное сообщество из более чем 2500 участников, которые ежедневно создают с помощью nodn и строят бизнес с помощью nodn. У нас также есть раздел класса с тремя курсами прямо сейчас. У нас есть агент ноль, который является основами для начинающих. У нас есть 10 часов за 10 секунд, где мы погружаемся в nodn. А затем у нас есть агентство одного человека, которое является нашим новым курсом для годовых участников, где мы говорим о закладке фундамента для масштабируемого бизнеса по автоматизации ИИ. Так что я был бы рад видеть вас на этих звонках и в этом сообществе. Но на этом видео заканчивается. Если вам понравилось или вы узнали что-то новое, пожалуйста, поставьте лайк. Это определенно мне очень помогает. И, как всегда, я ценю, что вы дошли до конца видео. Увидимся в следующем. Спасибо всем.