📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Главные open-source инструменты для AI-инженеров

Yersham14:10

Transcription

Индустрия искусственного интеллекта сейчас, ну, находится в очень странной точке. С одной стороны, каждый день появляются десятки новых моделей, громких обещаний, м, да и фреймворков, которые обещают заменить целые отделы. Именно обещают, что алгоритмы вот-вот заменят всех разработчиков. Но когда инженеры пытаются внедрить всё это в реальные рабочие процессы, ну, возникает суровая реальность.

О, да. Огромная часть этих прорывов оказывается просто шумом, да, информационным шумом. А попытки запустить, скажем так, сложных автономных агентов приводят к тому, что счета за использование АПИ, ну, они раздуваются до астрономических масштабов. Бюджеты сгорают ещё до того, как продукт выходит на рынок.

Это классическая проблема масштабирования. Знаете, мы перешли от этапа создания концепции, ну, когда вопрос был, возможно ли это в принципе, к этапу, как заставить это работать, и при этом не обанкротиться. Да. Да-да. Не обанкротиться и не сойдя с ума от переизбытка сырых данных. И найти выход из этого лабиринта - это, в общем-то, наша сегодняшняя миссия.

Итак, давайте разберём это. В фокусе нашего глубокого разбора сегодня крайне насыщенный материал - это транскрипт видео с YouTube канала Мэтью Бермана. Угу. И там детально препарируются четыре бесплатных инструмента с открытым исходным кодом на GitHub. Они набрали от 24 до 56.000 звёзд. И они показывают совершенно новый подход к поиску данных, их осмыслению, ну и написанию кода.

Что здесь действительно увлекательно, так это то, что Open source даёт мощь корпоративных решений в руки обычных людей. Это настоящая демократизация технологий. Да, и этот разбор сэкономит уйму времени всем, кто хочет оставаться на острие трендов, но уже устал от информационного шума. Ну и от гигантских счетов за AP, конечно. Точно.

Ээ, начнём с первой проблемы. Прежде чем что-то создавать с помощью ИИ, нужно найти качественную информацию. Верно. Без этого, ну, поискового спама. Угу. Это фундамент, да.

И вот тут у нас первый проект - улита Last 30 Days, то есть "Последние 30 дней", более 40.000 звёзд на GitHub. Её создал Мэт One Ван Хорн, сооснователь компании, которая потом стала лифт, да, и устанавливается она как обычный навык. Вызывается командой "сла 30 дней". Но самое интересное здесь - это алгоритм поиска.

Ага. В отличие от того же Google, где, ну, сплошная реклама и SEO, именно вместо парсинга ключевых слов алгоритм ищет данные на основе реального внимания людей. Он собирает апвоуты на Redit, на Hacker News, изучает ставки реальными деньгами на Полимаркет. Ого, даже ставки, да? А ещё лайки в Экс, транскрипты YouTube и метрики вовлечённости в TikTok. А затем ИИ синтезирует всё это в краткую сводку.

То есть это как такая цифровая городская площадь, а не традиционная библиотека. Хорошее сравнение, да? Но подождите, разве это не создаёт мощнейший информационный пузырь? Ну, если мы видим только то, за что проголосовало большинство, не упускаем ли мы какую-то непопулярную, но важную истину? Толпа же часто ошибается.

Отличное замечание. И это было бы правдой, если бы мы говорили только о лайках в соцсетях. Но тут интеграция с Полимаркет и GitHub. Это не просто лайки, а там, где люди рискуют деньгами. Совершенно верно. Люди ставят реальные деньги или рискуют своей репутацией в коде на GitHub. Это переход от просто алгоритмической выдачи к фильтрации через коллективный интеллект.

Понял. И в материале есть классный пример. Там был запрос на тему "инженеринг", то есть циклическая инженерия. Угу. "Не нужно писать промпты для агентов-кодировщиков. Вы должны проектировать циклы, которые будут отправлять эти промты агенту."

И архитектура поиска здесь очень умная. Система заранее определяет, где именно искать. Она нашла Twitter аккаунт Питера ещё до начала глубокого поиска. И, кстати, может сгенерировать красивую HTML-страницу со сводкой через флаг `emit = HTML`. Круто.

То есть инструмент Last 30 Days помог нам найти актуальные тренды. Но возникает новая проблема. Какая же? Как быстро усвоить эти огромные документы или исследования по найденным трендам? Ведь это десятки страниц.

И тут у нас второй проект - Open Notebook. Чуть меньше 30.000 звёзд. Это, по сути, бесплатный локальный клон Google Notу LM. Да, с открытым исходным кодом. Он позволяет загружать PDF-файлы и любые документы и не просто задавать по ним вопросы. И вот здесь начинается самое интересное, да?

Он может генерировать синтезированный подкаст, где ИИ-ведущие обсуждают ваш материал. В видео приводился пример с ссе от Tri Holdings. Угу, я помню этот момент. Сначала у системы спросили, сторонник ли автор ИИ или противник. Она ответила, что автор за ИИ, но не в смысле замены людей. А потом бам, сгенерировала подкаст длиной 23 минуты 36 секунд.

И с очень глубоким выводом, кстати, там прозвучала фраза, что для аудитории внутренние разрешения могут быть важнее внешней полировки продукта. Это просто взрыв мозга. То есть это как иметь команду блестящих научных ассистентов, которые за ночь прочитывают архивы, а утром за кофе пересказывают тебе всю суть.

Да, но если мы свяжем это с более широкой картиной, главная ценность здесь не в том, что ИИ за человека. Там есть функция вопросов для размышления, где ИИ подталкивает пользователя к выводам. То есть он не даёт готовых ответов, а заставляет думать. Именно. И самое главное, проект работает локально.

А, точно. В источнике упоминаются модели GPT5 PITP 5 для чата, текст Embeding 3 Large и TTS GPT For mini для озвучки, но также подчёкиваются локальные модели через OLAM или LM Studio. Чувствительные корпоративные данные больше не нужно сливать на серверы и IT-гигантов. Это спасение для многих компаний.

И ещё там спонсор видео упоминался - 11 Labs. У них платформа 11 Agents для голосовых агентов с экспрессивным режимом, чтобы голоса не звучали как роботы. Да, звучание получается очень естественным.

О'кей, тренды мы нашли, документацию осмыслили, настало время, ну, применять эти знания и писать код. Переходим к третьему проекту - Agents Skills. Это абсолютный лидер по звёздам из нашего списка - более 56.000. Ну ого, да.

И он нацелен исключительно на рабочий процесс инженерии агентов. В отличие от того же Gstack, который пытается эмулировать работу целой компании, этот инструмент сфокусирован на разработке. Там же семь сшкоманд. Так, для семи стадий инженерии: спецификация, планирование, сборка, тестирование, проверка кода, упрощение и ээ запуск.

Всё верно. И самая примечательная команда - это с интерviewми. О, да, расскажите про это. Вместо того, чтобы пользователь писал длинный промт, ИИ берёт у него интервью, чтобы понять, что именно нужно создать. Автор видео ответил, что хочет сайт с идеями для агентных циклов.

Угу. И инструмент тут же сформулировал гипотезу и структуру. Например, предложил коллекцию паттернов вроде "повторять с задержкой". Это так называемая разработка на основе спецификаций Spec Driven Development.

Да, но тут у меня возникает сомнение, которое наверняка появится у любого практика, кто нас слушает. Не услохняет ли это процесс? В каком смысле? Ну, если человеку нужно просто написать быстрый скрипт, разве это вот интервью с ИИ не замедлит его работу? Зачем бюрократия на пустом месте?

Вы знаете, стадия интервью предотвращает самую частую ошибку разработчиков: невероятно эффективное создание продукта, который никому не нужен. Ха, это точно. Да. И ИИ здесь действует не как автопилот, а как второй пилот. Он заставляет пройтись по чек-листу перед взлётом. Вы тратите немного времени в начале, но экономите часы на переписывание кода потом. Плюс там встроены функции для усиления безопасности и оптимизации производительности.

Справедливо. Сначала думаем, потом пишем. Итак, мы создаём сложные проекты. Агенты у нас генерируют спецификации, пишут код. И тут бац, внезапно счета за использование нейросетей взлетают до небес. Мм, да, из-за огромного контекста. Чтение логов, истории чатов - это съедает токены моментально.

Как не разориться в процессе? Вот тут на сцену выходит четвёртый проект - Headroom. Абсолютный скрытый хит. У него чуть больше 24.000 звёзд, но в июне был просто взрывной рост. Да, он решает именно проблему контекста. Он сжимает выводы инструментов, логи, фрагменты рак и историю. И делает это до того, как данные попадут в ЛМ.

Так, подождите, я читал эти примеры экономии, и они просто безумны. Ээ, поиск по коду 100 результатов. Раньше это было 17.000 токенов, с хдрумом - 1.400. Это экономия 92%. Впечатляет, правда? Не то слово. Дебагинг инцидентов с 65.000 токенов до 5.000, опять 92%. Отслеживание проблем на Гитхабе -73% токенов. Изучение кодовой базы -47%. И это позволяет, например, использовать агентов вроде клоуд колда дольше часа без превышения лимитов.

И запускается всё просто. Команда Headroom Rap Cloud No Proxy, а статистика экономии смотрится через Headroom Пеf. Но слушайте, да, как это вообще возможно ужать текст на 92% без потери качества? В источнике говорится, что они сохраняют идеальную точность на таких жёстких тестов, как Trufqa QA. Звучит как магия или какая-то хитрая маркетинговая уловка.

На самом деле никакой магии. Нужно просто понять, как ИИ видит текст. ИИ не нужны красивые отступы, форматирования или избыточный синтаксис GSON, который нужен человеческому глазу. Инструмент просто убирает этот визуальный шум. А, то есть машинам не нужны пробелы и красивые абзацы. Именно. Мы платим за форматирование, которое моделям вообще не сдалось. И тесты вроде GSM, Mik, Squad V2, BFCL подтверждают, что семантика не теряется.

Итак, что всё это значит? Значит, мы выкидываем воздух из контекста, но там есть ещё одна фичам learn. О, да, это концептуальный сдвиг. Эта функция анализирует неудачные сессии агентов и пишет корректировки прямо в их файлы настройки. То есть ИИ анализирует свои ошибки, да?

Например, в источнике ИИ понял, что можно сэкономить 8.000 токенов за сессию, если загружать схемы инструментов отложенно, а не все сразу. Он сам переписал свои инструкции, чтобы стать дешевле. Вау, самооптимизация. Но, ээ, тут есть важное предупреждение из видео, о котором мы обязаны сказать.

Да, безопасность превыше всего. Проект Headroom по умолчанию устанавливает сторонний инструмент сирена и включает телеметрию. Отправляет данные разработчикам. Угу. И чтобы отменить это, нужно обязательно использовать флаг -n no при установке. Это критически важно помнить при работе с открытым исходным кодом. Всегда считайте документацию. Скрытая телеметрия может стать огромной проблемой для компаний. Точно.

Что ж, давайте подведём итоги нашего путешествия. Мы сегодня разобрали четыре инструмента, которые меняют правила игры. Угу. Мы начали с Last 30 Days, да. Научились находить ценные сигналы среди шума, затем перешли к глубокому анализу локальных документов через Open Notebook. Потом выстроили строгий инженерный процесс с помощью Agent Skills и, наконец, научились сжимать данные через headroom, чтобы сэкономить бюджет.

Главный вывод для всех, кто нас слушает: узкое место сегодня - это не доступ к моделям ИИ, а умение грамотно оркестрировать эти инструменты. Именно. И знаете, в финале я хочу поделиться одной провокационной мыслью просто для самостоятельного размышления. Давайте.

Обратите внимание на то, к чему мы пришли в нашем глубоком разборе: ИИ теперь сам фильтрует для нас поисковую выдачу. Он синтезирует документы в аудиоподкасты. Он проводит с нами интервью для написания кода, и он даже оптимизирует собственные инструкции на основе своих неудач с помощью HR and Learn.

Угу. Цикл замыкается, да? И если ИИ забирает на себя поиск, осмысление, создания и самооптимизацию, то в чём через 5 лет будет заключаться роль человека? Не станут ли люди просто, ну, номинальными менеджерами в полностью автономных экосистемах алгоритмов, где наша единственная задача - просто нажать кнопку запуска и отойти в сторону?

Это немного пугает, но звучит очень правдоподобно. Задумайтесь об этом. Огромное спасибо, что погружались в эту тему вместе с нами. До новых встреч на наших глубоких разборах.