📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Sakana Fugu: обучаемая система многоагентной оркестрации

Yersham14:28

Transcription

Обычно мы представляем себе искусственный интеллект как такой один гигантский мегамозг. Ну, типа всезнающий оракул.

Ага. Прямо такая чёрная коробка, в которую закинул вопрос и получил ответ.

Точно. Но что, если самая мощная нейросеть сейчас это, э, вообще не нейросеч в таком классическом понимании. скорее такой гениальный менеджер.

Вот именно менеджер, который сам ни строчки кода не пишет, но зато умеет безупречно раздавать задачи другим. В общем, сегодня мы как раз разбираем этот колоссальный сдвиг в индустрии.

Да, мы уходим от создания одного идеального и солиста, уходим к умным системамкоординаторам. И в центре нашего внимания сегодня свежая штупа из Японии. Называется Сакана Фугу.

Звучит интригующе, да? И чтобы понять, реально ли это меняет правила игры или это просто красивый маркетинг, мы собрали экличную базу. У нас есть жёсткие полевые тесты от техноблогера Нейта Херка, видео с невероятными примерами от Джулианы Голди и официальная документация самой Саканы AI.

Наша цель - разобрать это по винтикам без лишнего жаргона. И знаешь, для начала стоит обратить внимание на само название.

Фигу. Как рыба.

Да-да. Фугу - знаменитая японская рыба, а их логотип - это такая стайка маленьких рыбок, которые синхронно объединяются и формируют очертание одной большой.

А, ну то есть это прямо буквальная репрезентация того, как они работают.

Именно. Это не просто дизайн, и за этим стоят очень серьёзные люди. Компания базируется в Токио, и один из соучредителей - это Леон Джонс.

Топ. Тот самый Леон Джонс.

Ага. Тот самый, который соавтор знаменитой статьи Attention is all you need.

Ого.

Да. Статье, которая представила архитектуру Трансформер и вообще запустила всю эту революцию нейросетей. Так что когда люди такого калибра что-то предлагают, ну, к этому стоит присмотреться.

100%. Они фундаментально понимают, как это всё устроено. Слушай, если попытаться писать фугу простой аналогией, мне кажется, это похоже на идеального прораба на стройке.

Отличное сравнение. Ну, просто раньше все пытались создать ээ универсального строителя, такого парна, который сам и фундамент льёт, и проводку тянет, и крышу кроет. А Фугу работает как менеджер проекта.

Берёт чертёж и раздаёт задачи профильным специалистам.

Точно. Но чтобы понять, почему вокруг этого столько шума, надо посмотреть, что там под капотом, как именно этот прораб вообще распределяет роли.

Вот тут видео Джулена Голди очень помогает. С точки зрения пользователя всё вообще максимально привычно, просто одно окно чата, обычный API, пишешь текст, получаешь ответ.

Да, но за кулисами сидит так называемый дирижёр. Этот внутренний алгоритм мгновенно берёт твой промт, препарирует его и динамически распределяет куски задачи между лучшими мировыми моделями.

То есть он на лету решает, кто с чем лучше справиться.

Именно, скажем, если задача сложная, дирижёр может поручить планирование архитектуры модели Cloud, потом написание кода отдать моделям OpenA, а какую-нибудь жёсткую проверку фактов Джемини от Google.

И потом всё это склеивает, да, собирает результаты и выдаёт тебе один чистый ответ.

Звучит круто, но, ээ, попытки заставить нейросети общаться друг с другом уже ведь были. В чём тут реальная инновация? Как дирижёр вообще понимает, кому что отдавать?

Ответ и в их технической документации. Они опираются на две статьи Тринити и Кондактор. Фишка в том, что процесс маршрутизации не запрограммирован жёстко.

То есть нет правила типа вижу слово код, отправляю GPT. Эволюционирующий координатор, он обучается через обучение с подкреплением. Ну, reinforcement learning.

Звучит сложно. Как это выглядит на практике?

Ну, представь процесс дрессировки собаки.

Ага. Координатор получает математическое лакомство, если итоговый ответ системы оказался точным и быстрым, и, наоборот, получает штраф, если его агенты запутались или ушли в бесконечный цикл споров.

А, понял. И он прогоняет миллионы таких симуляций, да, и сам учится находить неочевидные паттерны, назначает моделям роли вроде мыслителя, работника, верификатора и заставляет их общаться на естественном языке.

Слушай, это реально как нанять элитное агентство. Ты же как заказчик не видишь, как там в переговорке копирайтер до хрепоты спорит с дизайнером или как редактор вычёркивает абзацы. Да, ты получаешь готовый сайт. И Голди в обзоре это классно показывает. Фугу с одного промта создал рабочий лендинг, а потом бац и написал интерактивную игру лабиринт для браузера.

А помнишь тот пример с галактикой?

О, да, это был отвал башки. Симуляция вращающаяся спиральной галактики.

Да-да. С настройкой масштаба времени и расчётом дней в секунду. Одна модель точно бы запуталась в математике орбит или сломала бы визуальный код.

А тут дирижёр всё разделил. Один агент считал физику, другой писал JavaScript, третий проверял, не конфликтуют ли они.

И тут всплывает ещё одна крутая штука: рекурсия.

Да, это важно. Дирижёр может буквально вызывать копии самого себя, чтобы, э, подумать усердней над сложным куском.

Ага. Если первый агент не справляется, дирижёр анализирует провал и зовёт другого с новым подходом. И так, пока не добьётся качества. Ии проверяет работу. И и

Звучит как магия, но, ээ, давай спустимся на Землю. Одно дело красивые ролики для Ютуба, а другое рутина.

Ты про тесты Нейта Херка?

Да, про суровую реальность. Нейт прогнал самую тяжёлую версию Fuga Ульра и просто отдельную модель Cloud OPUS 48 через 38 одинаковых задач.

Там были головоломки, алгоритмы. Да, именно. И результат заставляет прямо задуматься. В тридцатишести случаях из трицати восьми была ничья, а в оставшихся двух победил опус.

Звучит как провал для фугу.

Это ещё не всё. По метрикам мультиагентная система оказалась в 4 с по раза медленнее. Суммарно Фуга думал 357 минут, а Опус справился за 80.

Разница колоссальная, да? И цена. Опус потратил 10 баксов на тест, а фугу целых 50. Зачем платить в пять раз больше и ждать в четыре раза дольше за такой же ответ? Это же просто невыгодно.

Ну, ээ, я бы сказала, тут проблема в методологии.

В смысле, индустрия привыкла тестировать AI короткими загадками или маленькими кусками кода, но архитектура пула агентов, особенно Фугу Ультра, не создана для того, чтобы быть быстрым поисковиком.

То есть это как забивать гвозди микроскопом?

Абсолютно точная фраза: "Задержка в несколько минут возникает не из-за тормозов платформы, а из-за чего? Из-за того, что внутри разворачивается целый консилиум. Агенты проверяют работу друг друга, пишут тесты, переписывают код. Для тривиальных задач это просто избыточно."

Понятно?

Для быстрых диалогов есть стандартная версия Фугу. А версия ультра - это тяжёлая артиллерия для совсем других масштабов.

О'кей. Но если бенчмарки не раскрывают потенциал, то в чём тогда суперсила? Почему профи готовы так долго ждать?

Автономия. Глубокая долгосрочная автономия. В отчёте Саканы есть пример с фреймворком Autoresarch. Они дали агенту доступ к кодовой базе машинного обучения и просто оставили его в покое на 14 часов.

14 часов вообще без человека, да. И всего на одном графическом процессоре H100.

Обалдеть. И что он там делал полсуток?

Он провёл 123 полноценных эксперимента. Сам менял код обучения, размер пакета данных, скорость обучения.

И сам же тестировал.

Да, тестировал, делал выводы и планировал следующий шаг. И в итоге нашёл конфигурацию, которая по показателю BBP превзошла все одиночные модели.

Слушай, надо, наверное, пояснить про этот BBP. Ну, биться на байт. Это такая метрика эффективности того, как модель сжимает и понимает информацию.

Чем меньше бит нужно для предсказания данных, тем умнее модель.

Да и получается, Фугу сам нашёл способ это улучшить. Человеку бы понадобились недели на эти 123 запуска, сбор логов и анализ, а тут система менеджер всё разрулила сама.

В этом и суть. Ни одна одиночная модель не удержит фокус 14 часов подряд. Она бы просто забыла изначальную задачу.

Точно. Или застряла бы в логической петле. А дирижёр держит строй.

В документации есть ещё примеры. Вот исследователь патентов, у него обычно анализ двадцати статей и патентов занимал 3-4 дня.

И это напряжённая работа. Да. Он отдал это фугу, и всё было готово за несколько часов. Причём система нашла скрытые связи, которые уставший человек бы просто пропустил.

С Кодом та же история. Там, где обычный ИИ находит три явных бага в архитектуре, мультиагентная система благодаря проверкам вытаскивает 20 скрытых уязвимостей.

В отчёте это называется стабильность персоны.

Хороший термин. Обычные модели начинают галлюцинировать от долгих задач, а фугу держит фокус железобетонно. Но, ээ, знаешь, что самое интересное?

Что же Галди в своём видео говорит, что фугу раскрывается на 100% не в чате, а при интеграции в Agent OS.

О, это критически важно обсудить. Agent OS - это операционная система для агентов. СофT, который даёт и управлять компьютером.

Открывать браузер, качать файлы, да, в скрипты запускать. И если подключить туда дирижёра Фугу, вся автоматизация сразу получает доступ ко всем лучшим моделям мира. Поиск в браузере одной модели, код другой.

И тебе не нужно переписывать систему каждый раз, когда выходят новые GPT или Cloud.

Именно. Дирижёр сам подтянет лучшие инструменты. Это просто меняет игру.

Да. И, кстати, архитектура Фуго решает ещё одну огромную проблему стратегическую. Ты про то, что передовые модели сейчас стали как, ну, как нефть или чипы, да. И этот ресурс сейчас очень централизован. Почти всё в руках гигантов из США.

А Сакана базируется в Токио.

Вот. И они понимают риски. Сейчас доступ к передовой модели могут обрубить в любой момент. Санкции, политика, законы.

Кстати, фуга же сейчас недоступен в Евросоюзе.

Да, из-за жёстких законов. защите данных GDPR. Им нужно время на адаптацию. И вот в таких реалиях динамический пул агентов - это страховка.

Если одну модель заблокировали, дирижёр просто выкидывает её из пула и отправляет задачу другим.

Совершенно верно, бизнес-процессы не останавливаются из-за одного провайдера. Плюс пользователи могут сами отключать конкретные модели в настройках, если у них параноя по поводу приватности.

Да, гибкость невероятная. Но слушай, давай вернёмся к деньгаям. Тот тест Нейта Херка показал разницу в пять раз. Кажется, если дирижёр зовёт три мощные модели, цена должна просто улететь в космос.

А вот тут у Сэре очень хитрая политика ценообразования.

Как это работает?

Они не суммируют комиссии. Если дирижёр задействовал три разные модели, ты платишь только по тарифу самый дорогой из них.

А, то есть оплата по высшей ставке в пуле, а не за каждый чих каждого агента.

Точно. Это делает экономику предстазуемой. Да, это дороже обычного АПИ, но счёт не будет умножаться неконтролируемо. Плюс у них есть подписке: от 20 баксов за базу до 200 для профи. Там огромные лимиты для тяжёлых агентов.

И знаешь, это важный концептуальный сд. Они же продают не мегамозг, а алгоритм маршрутизации. умного регулировщика.

Да. И это поднимает вопрос доверия. Точная маршрутизация, какая модель, что делала - это их коммерческая тайна.

То есть мы доверяем дирижёру, вообще не знаю, кто там в оркестре сидит.

Именно так. Логи распределения задач они не отдают.

Это заставляет задуматься. Итак, если резюмировать всё это дело, Сакана Фугу показывает нам, что будущее ИИ - это не обязательно бесконечное раздувание одной гигантской модели. Совершенно необязательно будущее в координации того, что уже есть.

Правило простое: нужно быстро написать письмо бери обычный чатбот. Нужно провести глубокий аудит или написать сложный софт. Зови мультиагентную команду.

И для специалистов это значит, что фокус смещается с написание идеальных промтов на искусство делегирования.

Да. Умение разбить проектные этапы, настроить агентов, оценить результат целой команды. Экономика моделей становится важнее знания их синтаксиса.

100%. И знаешь, это подводит нас к финальной мысли, которую я бы хотел, чтобы каждый из нас обдумал. Мы же привыкли восхищаться этими брендовыми нейросетями GPT, Cloud Gemini, как звёздами.

Да, но если такие системы дирижёры, как Фугу, станут стандартом, не превратят ли они эти передовые модели просто в безлеких чернорабочих?

М, интересная мысль. Просто коммутизированный фон. Потеряют ли эти гиганты свою индивидуальность, если мы будем общаться только с их менеджером, даже не зная, кто именно там месит бетон на нашей цифровой стройке?

Архитектура становится всё сложнее, и кто управляет этим хаосом, тот и будет определять будущие индустрии.