📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Топ-16 open-source AI-агентов / лучшие проекты

Yersham15:25

Transcription

Привет. Сегодня у нас такой детальный разбор проектов и агентов, тех, что с открытым исходным кодом. Мы тут посмотрели недавний обзор на YouTube, где целая подборка была. Ну и выбрали, на наш взгляд, самое-самое. Попробуем разобраться, что там сейчас на пике.

Привет. Да, тема горячая и развивается всё ну очень скремительно. Сегодня как раз посмотрим на главные направления. Ээ, ну, во-первых, как всё упрощается, да, чтобы агентов мог делать не только программист.

Ага.

Во-вторых, сами фреймворки от совсем крошечных до таких, знаешь, корпоративных монстров. Ну, и как они учатся, как с миром взаимодействуют.

Вот. И как раз про взаимодействие. Приватность, масштаб тоже важно.

Да.

Конечно. Постараемся охватить ключевые моменты по каждому проекту.

Отлично. Ну давай тогда с простоты и начнём. Вот если я, скажем, не разработчик, но хочу своего иагента, что мне делать? Sim, кажется как раз про это.

Да, SIM - это хороший пример, это визуальная платформа, то есть код писать, ну, практически не нужно. Представь себе такое интерактивное полотно, холст, где ты просто мышкой соединяешь разные блоки.

Блоки - это что?

Модели Ии. Да, модели, например, от Open AI или локальные какие-то, плюс API разных сервисов, ну, там бизнес-инструменты, SLK, Nion, GitHub, их там больше 80 штук интегрировано.

Ого, 80. Серьёзно?

Угу. И важно, что ты потом эти процессы можешь запускать разными способами: через чат, по API, вебхуками. То есть это не просто игрушка, а вполне рабочая история.

Так, а данные? Вот я собрал процесс, он работает с моими данными. Куда они идут? Это облако.

А вот тут интересный момент. Sim можно использовать как облачный сервис, да, но его же можно развернуть и локально, у себя на своих серверах.

А вот это важно.

Очень важно, особенно для компаний. Подключаешь свои локальные модели, и все данные остаются внутри. полная конфиденциальность. Плюс там есть фичи совместной работы команды. Так что, да, SIM - это про то, чтобы сделать и агентов, ну, максимально доступными.

Понятно. То есть SIM - это такой демократичный вариант. А если задача посерьёзнее для бизнеса, где нужны прямо корпоративные фишки, интеграции, Astron Agent, вот он чем выделяется?

Astronent - это уже, так сказать, другой уровень. Это платформа корпоративного класса. Тут тебе и хостинг моделей, и развёртывание приложений готовых, и оптимизация, и контроль доступа строгий. Но главная, пожалуй, фишка - это тесная интеграция с RPA.

RPA - это роботизация процессов. Можешь чуть подробнее, как это с Eтами связано?

Да, конечно. RPA, ну, robotic Process Automation - это когда программы, роботы имитируют действия человека в интерфейсах других программ. кликают кнопки, заполняют формы, копируют данные. И вот когда ты и агента соединяешь с RPA, он может не просто думать или текст писать, а реально выполнять рутинные задачи в корпоративных системах. Счета обработать, данные в CRM обновить. Ну вот такое всё.

Ага. То есть агент не только думает, но и руками работает в системе.

Именно. И ATН как раз заточен под такие сценарии. Он даёт среду для разработки и управления вот такими действующими агентами. Плюс там докер для развёртывания, поддержка разных языков, ну, в общем, инструмент для серьёзных IT-команд.

Окей, с такими большими платформами понятно, но ведь есть и другой подход, да, фреймворки для разработчиков, которые хотят всё сами контролировать. И тут интересно покеet Flow. Всего 100 строк кода. Как это вообще возможно?

Это да, поразительно. Pocketфлоow - это прямо апофиоз минимализма. Идея в том, что не нужно городить сложной конструкции. Можно описать логику работы агентов через простые графы. Совсем без внешних зависимостей. Это как, знаешь, такой суперлёгкий скелет. На него уже можно навесить всё, что нужно: координацию нескольких агентов, декомпозицию задач, то есть разбивку сложного на простое и даже раг. Рак, напомни, это когда агент ищет информацию перед ответом.

Да. Retrieval augmented generation. То есть он не просто из головы берёт, а сначала ищет релевантные данные, а потом уже генерирует ответ на их основе. Очень полезная штука.

И этот Pocketфу на 100 строчках всё это умеет.

Ну, он даёт базу для этого. А самое крутое, его портировали на кучу языков. Typeescript, Java, Go, Rust, C++, PHP. Представляешь?

Ого. То есть логику написала один раз и запускай где хочешь.

Практически, да, это делает его, ну, наверное, самым переносимым LLM фреймворком вообще. Если тебе нужна лёгкость и встраиваемость в любой проект, PocketFow, прямо находка.

Так, хорошо. Минимализм - это Pocketфлоow. А если наоборот нужна мощь, производительность, сложная орхистровка агентов? Вот CRUI его часто ставят как альтернатива Lengchain. В чём его сила?

CRUA он с нуля написан на Python, и главная цель была производительность и гибкость именно во взаимодействии агентов. Если PocketFow - это про просто про простоту, то QRU и - это про управление целой командой агентов. Разработчик получает очень детальный контроль над тем, как они сотрудничают. Там есть два режима. Круз - это когда агенты автономно работают над общей задачей, а Flows - это когда ты прямо как режиссёр выстраиваешь последовательность их действий, кто кому что передаёт.

Звучит мощно, но, наверное, и сложнее в освоении, чем Pocketфлоow.

Ну, конечно, тут компромисс. Круй требует большего погружения, да, но взамен ты получаешь контроль над сложными сценариями. Можно задать каждому агенту роль аналитик, писатель, критик, например, дать им свои инструменты, цели, управлять обменом информации.

То есть для задач, где нужна прямо слаженная командная работа.

Именно для таких задач КРУИI подходит отлично. Плюс у них есть корпоративный пакет MP с мониторингом. аналитикой. Это намекает, что они метят в серьёзные промышленные решения. Так что да, выбор между Pocketфлоow и Cruai - это, по сути, выбор между лёгкостью и мощью.

Ясно. Двигаемся дальше. Часто же нужно, чтобы агент не просто выполнял инструкции, а учился на своём опыте, особенно для таких многошаговых задач. И тут у нас Orent Reinforcement Trainer. И особенно интригует Ruler Framework. Что за линейка такая?

Да, - это про обучение с подкреплением. Ну, это когда агент учится методом проб и ошибок, получая награды или штрафы за свои действия.

Как дрессировка, условно.

Очень условно. Но да, принцип похожий. Проблема в том, что обычно для каждой задачи нужно вручную придумывать и кодить сложную систему наград Reward Function. Это долго и муторно. А Rollр - это очень элегантное решение. Это система вознаграждения, которая работает Zero Shot. Ей не нужно предварительное обучение под конкретную задачу.

Zero Shot, то есть просто берёшь и используешь.

LM под капотом сам оценивает, насколько хорошо агент справляется на каждом шаге и выдаёт ему награду. Представь, что судья прочитал правила игры и сразу может судить, не тренируясь заранее. Разработчики говорят, это ускоряет настройку обучения раза в два-три, потому что самая нудная часть создания функции награды автоматизировано.

Звучит круто. И для чего такой артист с Ruler подходит?

Ну, для обучения агентов играм, например, или для поиска информации, или для взаимодействия с внешними инструментами через УА. Вот ты упоминал MCNP сервера.

Да, MCNP серверы. Снова это аббревиатура. Что это?

Machine Communication протокол. Да, оно самое по сути это такой открытый стандарт протокол. Он позволяет разным и моделям LLM единообразно общаться с разными внешними инструментами. Будь то браузер, файловая система, да, что угодно. Вместо того, чтобы для каждого инструмента писать свой костыль для интеграции, можно использовать стандартный MCP-сервер как шлюз к этому инструменту.

А как LLM к этому шлюзу подключить?

А для этого есть MCPU. Это такой лёгкий мост, который соединяет любую LLM, Open AI, antropic, lama, неважно, с любым MCP-сервером. Буквально несколько строк кода и готово.

То есть связка плюс Ruler плюс MCPUs позволяет создавать агентов, которые не просто рассуждают, а учатся действовать в реальном цифровом мире через стандартные интерфейсы.

Совершенно верно. Это большой шаг к более автономным и способным агентам. Они учатся на реальном опыте взаимодействия.

Хорошо. Теперь давай про веб. Взаимодействие с сайтами, браузером. Тут тоже разные подходы. Например, Magentic UI. Там кажется человек сильно вовлечён.

Да, Magtic UI - это исследовательский прототип, и он как раз про Human Envelope, человек в цикле. Агент может делать много всего в вебе, сайты смотреть, формы заполнять, файлы анализировать, код писать. Но,

но

но каждый его шаг или план действий может и должен быть проверен, скорректирован и одобрен человеком. Там интерфейс специальный для этого. Ведёшь сессию с агентом, управляешь задачами. Это не полная автономия, а скорее такая совместная работа человека ИИ.

Понятно. Это для случаев, когда страшно отпускать ИИ в свободное плавание, где нужен контроль.

Да, именно. Ну или где задача сложная и нужно точно направить агента. Скажем, сложное бронирование или заполнение каких-то критически важных форм. Magentic UI как раз исследует такую модель коллаборации.

Логично. А если наоборот, хочется максимальной приватности, чтобы данные вообще никуда не уходили, всё локально. Есть такое?

Есть. И это прямо важный тренд сейчас. Adenic se вот пример такого решения. Это и ассистент, который работает полностью на твоём устройстве.

Совсем локально. Без облака?

Да, без облака, без отправки данных куда-то на серверы. Все вычисления, вся обработка у тебя на компьютере.

И что он умеет, такой локальный помощник? Насколько он функционален?

Ну, довольно много. Веб может просматривать информацию, извлекать форму, заполнять код, писать и отлаживать. Причём он позиционируется как автономный. сам выбирает нужного агентаспециалиста под задачу, планирует шаги и выполняет. Обещают ещё голосовое управление добавить.

Хм, интересно. Производительность, конечно, будет от железа зависеть.

Естественно. Но главный плюс - это полный контроль над данными и приватность. Это такой ответ на опасение по поводу конфиденциальности облачных.

Да уж, актуально. И давай под конец затронем что-то по-настоящему масштабное. Tнги Deep Research. Это же не фреймворк. А целая огромная модель.

Да.

О, да. Танги - это тяжеловес. 30,5 млрд параметров. Это очень-очень много.

30 млрд.

Но хитрость в том, что во время работы она активирует только 3-3 млрд параметров для обработки каждого токена. Это называется Mixure of Experts. M. Смесь экспертов. Позволяет сделать огромную модель эффективной.

И зачем такая махина нужна? Какие задачи она решает лучше других?

Она заточена под глубокие многошаговые рассуждения, под сложный поиск информации, особенно когда нужно перелопатить кучу источников или выполнить длинную цепочку действий, например, ответить на какой-то сложный исследовательский вопрос или долго взаимодействовать с браузером для сбора данных. Она показывает очень хорошие результаты на сложных бенчмарках типа Браузер Comp или WeberQA.

А как такую модель вообще создали? Обучение, наверное, адское.

Подход к обучению там тоже передовой. Они использовали полностью автоматизированный конвейер для генерации данных для обучения. То есть другие и агенты сами генерировали примеры. Плюс непрерывном до обучения и обучение с подкреплением по методу GRPO. Group Relative Policy Optimization. Это, кстати, тот же продвинутый RL метод, что и вt, только в гигантском масштабе. Он помогает обучать сложным стратегиям.

Понятно. То есть тонги - это такой взгляд в будущее. Огромные, но эффективные модели, обученные сложными методами для реально трудных задач.

Именно так. Это передний край исследований и агентов.

Что ж, ну вот мы и пробежались по самым разным уголкам мира и агентов с открытым кодом от визуальных конструкторов типа SIM,

которые делают технологию доступнее,

да, до суперлёгких фреймворков вроде Pocketфow и мощных оркестраторов, как CrewA. Поговорили про обучение с подкреплением АРлер, про важность стандартов типа MCP,

про веб-агентов из контролем человека, как Magintic UI и приватных, как Agent и Se

ну и закончили гигантом тонгий Deep Resarch.

Да, картина очень пёстрая получилась, но тренды видны, мне кажется.

Какие бы ты выделила?

Ну, во-первых, явное движение к упрощению. Инструменты вроде SIM - это оно. Во-вторых, гибкость для разработчиков фреймворки на любой вкус, от Pocketфлоу до Кру. В-третьих, фокус на обучение на опыте и реальном взаимодействии с миром. RLMCP.

Приватность ещё.

Да, приватность. Agentic se как пример. Ну и, конечно, масштаб. Модели вроде тонги показывают, какие сложные задачи уже можно решать. Похожие инструменты для создания и агентов становятся не просто мощнее, но и разнообразнее и доступнее. И открытый код тут, конечно, двигатель прогресса.

Безусловно. И это, знаешь, ставит такой интересный вопрос под конец. Если создавать и запускать автономных агентов становится всё проще, то как это изменит, ну, всё, нашу работу, исследование, быт,

особенно, если они всё лучше учатся действовать сами.

Вот именно. Куда нас вся эта эволюция приведёт в ближайшие годы? Вопрос открытый.