📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

17 Trending AI Projects on GitHub: nanochat, Superpowers, beads, AI Hedge Fund,Sora Extend,AgentFlow

Github Awesome11:42

Transcription

Сегодня мы погружаемся в топ-17 трендовых ИИ-проектов на GitHub, включая инструменты LLM, клон ChatGPT и генерацию длинных видео в Sora 2. Независимо от того, являетесь ли вы энтузиастом ИИ, исследователем или независимым разработчиком, создающим свой следующий побочный проект, здесь есть что-то, что вас вдохновит. Все ссылки находятся в описании. И давайте сразу перейдем к трендовым ИИ-проектам на GitHub.

Первым у нас идет Nanohat от Андре Карпати. И, вау, этот проект взорвал интернет быстро. Всего за 12 часов после выпуска он собрал более 5000 просмотров на GitHub. Nanohat — это клон ChatGPT с нуля, от обучения до инференса, упакованный всего в 8000 строк кода. Вы можете запустить его на одном облачном GPU, и всего за 4 часа вы будете общаться с вашей собственной LLM в веб-интерфейсе, похожем на ChatGPT. Он охватывает все. Обучение токенизатора, предварительное обучение на мелких веб-данных, промежуточное обучение на мелких разговорах и даже использование инструментов с песочницей Python. И самое лучшее: вы можете создать модель примерно за сто долларов и масштабировать ее до уровня согласованности GPT3 с небольшим увеличением вычислительных ресурсов.

Поговорим о Superpowers, плагине, который дает Claude способности разработчика кода. Думайте об этом как о библиотеке навыков для ИИ-кодирующих агентов, наполненной проверенными методами тестирования, отладки, сотрудничества и даже метаобучения. Он устанавливает полный набор команд, позволяя Claude проектировать, планировать и кодировать со структурой, а не с хаосом. Плагин автоматически синхронизирует ваш локальный репозиторий навыков, регистрирует новые хуки и даже позволяет создавать или вносить свой вклад в собственные навыки через запросы на слияние GitHub с встроенным обнаружением навыков, синхронизацией версий и тестируемой документацией. Superpowers превращает вашего ИИ-кодера в структурированного, дисциплинированного товарища по команде.

Когда-нибудь хотели, чтобы ваш кодирующий агент мог помнить, что он делал вчера? Встречайте Beads, легкую систему памяти, которая дает вашим ИИ-агентам долгосрочную фокусировку и организационные суперспособности. Вместо того чтобы вываливать наполовину законченные планы в формате markdown, Beads превращает рабочий процесс ваших агентов в трекер задач на основе графа, связывая связанные задачи вместе, как бусины на нитке. В результате ваши агенты могут безупречно следовать сложным многосессионным планам, не теряя контекста и не пропуская шаги. Добавьте Beads в любой репозиторий, и внезапно ваш кодирующий агент перестанет забывать, начнет планировать и работать как настоящий товарищ по команде со структурированным рассуждением.

Встречайте UNIFM WMA0, систему, разработанную для обучения роботов пониманию и взаимодействию с реальным миром. В основе этой системы лежит модель, которая изучает физику взаимодействий робота с окружающей средой. Она хорошо справляется с двумя задачами. Во-первых, она действует как симулятор, генерируя синтетические данные, чтобы роботы могли безопасно практиковаться, прежде чем прикасаться к реальному миру. Во-вторых, она работает как усилитель политики, предсказывая, как будут развиваться будущие взаимодействия, помогая роботу планировать более умные ходы в реальном времени. UNIFM D0 может симулировать сложные долгосрочные задачи, такие как упаковка объектов, навигация по препятствиям или манипулирование инструментами, все это через управляемую генерацию на основе видео.

Встречайте Fast API MCP, элегантный новый мост между вашими приложениями Fast API и протоколом контекста модели. Этот проект позволяет вам экспортировать любой конечный пункт Fast API как инструмент MCP, с встроенной аутентификацией, сохранением схемы и полной поддержкой документации, и все это без какой-либо настройки. В отличие от универсальных конвертеров, Fast API MCP является нативным для Fast API, что означает, что он напрямую использует ваш интерфейс ASGI для эффективной связи с низкой задержкой. Вы можете смонтировать ваш MCP-сервер в том же приложении или развернуть его отдельно, что дает вам полную гибкость в том, как ваши ИИ-агенты взаимодействуют с вашим бэкендом.

Вот кое-что для всех ИИ-кодеров и промпт-инженеров. Представляем Guide Injest. Этот инструмент делает что-то красиво простое, но меняющее правила игры. Он превращает любой репозиторий GitHub в удобный для промптов текстовый дайджест, который вы можете напрямую подать в LLM. Хотите проанализировать проект с помощью Chat GPT или Claude? Просто замените "hub" на "ingest" в URL GitHub, и вуаля, вы мгновенно получите чистую, структурированную текстовую версию всего кодовой базы. Guidingest предоставляет вам статистику файлов, структуру каталогов, количество токенов и идеально отформатированные фрагменты кода, разработанные для контекстных окон ИИ.

Представьте, если бы вся память вашего ИИ могла поместиться в видеофайл. Mevid — это инфраструктура памяти для реальных ИИ, сжимающая миллионы текстовых фрагментов в один searchable MP4-файл, сохраняя при этом скорость извлечения менее 100 миллисекунд. Вместо того чтобы каждый раз запрашивать массивные векторные базы данных при каждом промпте LLM, Mevid кодирует текст в QR-коды внутри кадров видео, используя десятилетия исследований в области сжатия видео для достижения в 50-100 раз меньшего объема хранения по сравнению с традиционными методами. Нет кластера баз данных, нет настройки Docker, нет сетевой задержки, только Python и MP4-файл, что означает, что ваш ИИ может хранить, искать и извлекать огромные базы знаний полностью офлайн.

Встречайте AI hedge fund, proof of concept, который превращает инвесторов в автономных ИИ-агентов, работающих вместе на виртуальной торговой площадке. Этот проект не торгует реальными деньгами. Вместо этого он моделирует, как различные инвестиционные философии могут взаимодействовать в рамках одной интеллектуальной системы. Представьте себе цифровой инвестиционный комитет с легендами, такими как Уоррен Баффет, Чарли Мангер, Питер Линч и Майкл Бьюрри, каждый из которых воплощен в виде ИИ-агента с логикой рассуждения и портфеля. Агент оценки рассчитывает внутреннюю стоимость. Агенты настроения, фундаментальных показателей и технических показателей предоставляют рыночную информацию. Затем менеджер по рискам и менеджер портфеля сотрудничают для принятия симулированных решений.

Когда-нибудь просили своего ИИ-помощника по кодированию создать что-то, только чтобы понять, что он неправильно понял, что вы имели в виду? Вот где на помощь приходит OpenSpec. Он приносит разработку на основе спецификаций в мир ИИ-кодирования. Вместо того чтобы полагаться на расплывчатую память чата или случайные промпты, OpenSpec предоставляет вам легкий рабочий процесс, где люди и ИИ соглашаются о том, что строить, прежде чем будет написана первая строка кода. Вы составляете предложение об изменении, совместно просматриваете его с вашим ИИ, и после согласования помощник реализует код, который каждый раз соответствует утвержденной спецификации. Никаких API-ключей, никакой сложной настройки.

Мы видели, как диффузионные модели трансформировали то, как мы создаем изображения и видео. Но что, если бы мы применили ту же концепцию к тексту? Встречайте diffusion GPT, аннотированную дискретную диффузионную модель на уровне символов для генерации текста. Сочетание простоты baby GPT Карпати с передовыми исследованиями дискретного диффузионного моделирования. Вместо того чтобы генерировать один токен за раз, как традиционные авторегрессивные модели, diffusion GPT учится очищать целые последовательности параллельно, превращая поврежденный текст обратно в смысл. Запустите его на Colab, настройте набор данных или расписание шума и наблюдайте, как хаос Шекспира снова превращается в связные стихи.

Следующим идет MCP agent, легкая структура для создания ИИ-агентов с использованием протокола контекста модели. Думайте об этом как о недостающем звене между вашими моделями ИИ и реальными инструментами. С MCP agent вы можете легко создавать многоагентные рабочие процессы, системы с участием человека или даже чат-боты с извлечением информации, используя простые повторно используемые шаблоны, вдохновленные руководством Anthropic по созданию эффективных агентов. Он автоматически управляет соединениями MCP-сервера, поддерживает оркестрацию роя OpenAI и бесшовно интегрируется с такими инструментами, как Claude Desktop, Gmail или Murmo Notebooks.

Следующим идет Sora Extend, инструмент для всех, кого разочаровал 12-секундный лимит видео Sora от OpenAI. Sora Extend позволяет вам бесшовно генерировать длинные ИИ-видео, объединяя короткие клипы с идеальной непрерывностью. Вот как это работает. Ваш промпт разбивается на связные сегменты, каждый из которых обрабатывается независимо Sora 2. Магия происходит, когда последний кадр каждого клипа становится контекстом для следующего, обеспечивая визуальную и тематическую согласованность всей последовательности. После генерации всех сегментов Sora Extend автоматически объединяет их в одно плавное видео, так что вы получаете высококачественный расширенный контент без ручного редактирования.

Следующим идет RCM, фреймворк для высококачественной генерации видео за несколько шагов. RCM масштабирует дистилляцию непрерывной временной согласованности до массивных видеодиффузионных моделей с более чем 10 миллиардами параметров и выдает видео с высокой точностью и сильным разнообразием всего за два-четыре шага. Секретный соус: совместный дистилляционный фреймворк прямого и обратного расхождения, плюс открытый исходный код flash attention to JVP kernel, который поддерживает крупномасштабный параллелизм, делая даже огромные модели эффективными для обучения и инференса. Построенный поверх Cosmos Predict 2, RCM позволяет генерировать кинематографические видео за секунды по текстовым промптам, предлагая полный контроль над разрешением, соотношением сторон и случайными зернами для воспроизводимости.

Далее у нас Marovian thinker, метод масштабирования инференса в больших языковых моделях. Традиционное RL для рассуждающих LLM, таких как Long, рассматривает состояние как весь промпт плюс все прошлые токены мышления. Проблема: состояние продолжает расти, делая вычислительную стоимость квадратичной, а использование памяти — раздутым. Встречайте парадигму Marovian thinking. Поддерживая состояние ограниченным и фиксированным, модели теперь продвигают свое рассуждение, никогда не увеличивая контекст неконтролируемо. Это делает вычислительную стоимость линейной по количеству шагов рассуждения, что является огромным повышением эффективности.

Nano browser, ИИ-инструмент для автоматизации веб-браузера с открытым исходным кодом, который работает внутри вашего браузера. Думайте об этом как о бесплатной альтернативе OpenAI Operator, но с изюминкой. Он работает на основе многоагентной системы, которая планирует, навигирует. Независимо от того, автоматизируете ли вы рабочие процессы, парсите данные или запускаете исследовательских агентов на лету, Nano Browser превращает ваш браузер в полноценный центр управления ИИ.

Представляем Agent Flow, обучаемую структуру, которая учится планировать, рассуждать и использовать инструменты в потоке. Agent Flow использует модульный подход с четырьмя специализированными агентами: планировщиком, исполнителем, верификатором и генератором. Эти модули работают вместе в течение нескольких поворотов, руководствуясь развивающейся памятью и интегрированными инструментами, такими как Python coder, Google search и Wikipedia, формируя самооптимизирующуюся экосистему интеллекта. Agent Flow постоянно улучшается во время рассуждения, совершенствуя свое планирование и принятие решений в реальном времени.

Встречайте streaming VLM — понимание в реальном времени бесконечных видеопотоков. Традиционные VLM испытывают трудности при обработке длинных или непрерывных видео. Полное внимание приводит к квадратичным вычислительным затратам. Streaming VLM меняет правила игры. Он поддерживает компактный KV-кэш, разумно повторно использует состояния и идеально выравнивает свое обучение с потоковым инференсом. Результат: стабильное понимание в реальном времени до восьми кадров в секунду на одном Nvidia H100. Стратегия контролируемого дообучения этой модели не только повышает производительность потоковой передачи, но и улучшает общее визуальное решение вопросов.