📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Trending GitHub Projects This Week: Open Source AI Tools, Dev Kits & Cloud Platforms #209

ManuAGI - AutoGPT Tutorials17:34

Transcription

Добро пожаловать, создатели. Сегодня мы погружаемся в самые популярные и открытые проекты GitHub на этой неделе, часть первая, где вы откроете для себя мощные новые инструменты для расширения вашего набора разработчика. Вы узнаете о практическом применении передовых репозиториев, таких как DeepSseek OCR для обработки документов и better tstack для быстрой настройки проектов TypeScript. Давайте начнем и посмотрим, что вы можете создать прямо сейчас. >> С возвращением на уроки Manu AGI. Здесь мы исследуем захватывающий мир ИИ, новейшие инструменты ИИ для вас. Поэтому не забудьте нажать кнопку подписки и колокольчик уведомлений, чтобы не пропустить последние идеи в области ИИ. Итак, давайте начнем сегодняшнее видео. Проект номер один, DeepSeek OCR, визуальное сжатие токенов переосмысливает обработку документов. Давайте погрузимся в мир оптического сжатия, где одно изображение действительно стоит тысяч слов. Deepseek OCR — это модель зрения и языка с открытым исходным кодом, выпущенная под лицензией MIT, которая меняет то, как ИИ обрабатывает документы, сжимая текст в визуальные токены. Построенная на двухкомпонентной архитектуре, включающей глубокий энкодер и глубокий декодер. Эта система решает критическую проблему в обработке ИИ длинных документов без чрезмерного расхода вычислительных ресурсов. Затем происходит магия через контекстное оптическое сжатие, где страницы, отрисованные с высоким разрешением, кодируются в минимальные визуальные токены. Техника, которая достигает почти без потерь сжатия при соотношениях до 10 раз с разрешениями от крошечного режима всего с 64 визуальными токенами до динамического режима Gundam. Модель с хирургической точностью обрабатывает все, от чистых отчетов до сложных газет. Работая на VLLM с поддержкой CUDA, она обрабатывает документы примерно со скоростью 2500 токенов в секунду на одном GPU, превосходя модели, такие как minor U, которым требуется более 6000 токенов на страницу. Разработчики, исследователи и команды по обработке документов получают точное оптическое распознавание символов, которое преобразует изображения в markdown, анализирует фигуры и обрабатывает многоязычные макеты, сохраняя при этом низкое потребление памяти и управляемые затраты на вывод. Попробуйте и убедитесь, как быстро это станет частью вашего рабочего процесса. Прежде чем мы перейдем к следующему проекту, я должен представить вам инструмент, который изменит то, как мы занимаемся переработкой контента. Давайте представим A POB AI, платформу номер один прямо сейчас для создания ИИ-инфлюенсеров и цифровых персонажей. A POB AI — это прежде всего невероятный инструмент для создания фотореалистичных ИИ-аватаров, вашего собственного цифрового ведущего. Но сегодня мы сосредоточимся на их новейшей и самой мощной функции — Revideo. Revido позволяет вам превратить старые статические видео или даже старые видеоконцепции в совершенно новый, очень привлекательный и немедленно монетизируемый видеоконтент всего за несколько кликов. Сначала просто нажмите «Создать бесплатно». Быстрая регистрация с помощью вашей учетной записи Google или электронной почты, и вы готовы использовать платформу. Это так просто. Если вы хотите создать своего базового ИИ-инфлюенсера, нажмите «Создать портретную модель». Вы можете загрузить свое собственное изображение, чтобы создать цифровой двойник, или позволить ИИ сгенерировать новое. Я загружаю изображение своей модели здесь. Заполняю детали, такие как имя. Назовем ее Аура и дадим короткое описание. Нажмите «Создать свою модель». И буквально за несколько секунд ваша модель готова к созданию контента. Но мы хотим использовать функцию rev video. Поэтому я перейду в rev video и выберу опцию загрузить новое видео. Вы также можете выбрать любой ранее созданный контент. Это видео, которое мы хотим трансформировать. Далее нам нужно эталонное изображение. Я загружаю изображение профиля ИИ-инфлюенсера, которого мы только что создали, Ауры. Это говорит Ri video использовать ее внешний вид и стиль в новом выводе. После того, как все настроено, у нас есть исходное видео и эталон ИИ. Мы просто нажимаем большую кнопку «Сгенерировать», чтобы создать ваше новое монетизируемое видео. И вуаля, готово. Давайте посмотрим на некоторые невероятные результаты, созданные с помощью этой функции rev video. Итак, если вы новичок в Apob AI и хотите перестать тратить время на старый контент, вы можете попробовать его совершенно бесплатно. Используйте ссылку в описании ниже, чтобы зарегистрироваться и получить первоначальные бесплатные кредиты. Проверьте функцию Rev video и начните превращать свои старые видео в новые источники дохода уже сегодня. Хорошо, давайте вернемся к обновлению проекта. Проект номер два, пространственное рассуждение. Нулевое обнаружение объектов без примеров благодаря основанному на сетке интеллекту. Представьте себе инструмент, который превращает модели рассуждений в точные детекторы объектов без необходимости традиционного обучения. Spatial reasoning — это пакет Python с открытым исходным кодом, выпущенный под лицензией MIT, который меняет то, как системы ИИ обнаруживают объекты, комбинируя передовые модели рассуждений с основанной на сетке пространственной логикой. Проект отвечает на увлекательный вопрос. Могут ли системы рассуждений, такие как модели OpenAI и Gemini от Google, выполнять сложное обнаружение объектов посредством чистого пространственного восприятия? По своей сути, передовая модель рассуждений делит изображения на ячейки сетки, позволяя системе с хирургической точностью определять объекты посредством рассуждений с использованием инструментов, а не традиционных подходов компьютерного зрения. Пакет, созданный для исследователей, разработчиков и специалистов по компьютерному зрению, предлагает четыре режима обнаружения, включая передовую модель рассуждений, которая превосходит стандартные подходы, модель зрения, основанную на grounding dyno и SAM, и интеграцию Gemini для точного обнаружения. Рабочий процесс удивительно прост. Один вызов функции принимает путь к изображению и описание объекта, возвращая ограничивающие рамки и визуализированные результаты, готовые к сохранению. Установка происходит через pip или из исходного кода с необязательной поддержкой flash attention для повышения производительности трансформеров. И весь API работает через командную строку для быстрого тестирования или программно через Python с переменными окружения для ключей API. Изучите его один раз и почувствуйте, насколько гладкими станут ваши повседневные задачи. Проект номер три, reader 3. Глава за главой, чтение встречается с ИИ-диалогом. Вот что-то, что ощущается как будущее литературного взаимодействия, разработанное самим Андреем Карпати. Reader 3 — это легкий самохостинг EPUB-ридер, выпущенный под лицензией MIT, который меняет то, как люди взаимодействуют с книгами, представляя их по одной главе за раз. Идеально отформатирован для копирования в вашу любимую языковую модель. Созданный в основном с помощью vibe coding с помощью ИИ, этот минималистичный инструмент Python удовлетворяет простую, но мощную потребность, делая обсуждение литературы с chat GPT, Claude или любым LLM без борьбы с форматами файлов или неуклюжим извлечением текста. Весь рабочий процесс выполняется локально через fast API с bus pow, обрабатывающим разбор EPUB, требуя всего двух команд через менеджер пакетов UV. Чтобы начать, скачайте любой EPUB из таких источников, как Project Gutenberg. Запустите парсер для создания каталога книг. Затем запустите сервер для доступа к вашей библиотеке по адресу localhost. Каждая книга хранится как сериализованный объект с кэшированной загрузкой глав для мгновенной навигации. А интерфейс отображает чистый текст главы с кнопками «предыдущая» и «следующая» для беспрепятственного продвижения по вашему чтению. Инструмент, разработанный для читателей, студентов и всех, кто интересуется расширением своего литературного опыта с помощью анализа ИИ, обобщения или обсуждения, ставит простоту и портативность выше функций. Попробуйте сегодня и наблюдайте, как ваша продуктивность мгновенно меняется. Проект номер четыре, WSA Builds. Приложения Android, работающие нативно на Windows. Давайте погрузимся в мир кроссплатформенной эмуляции, где Android встречается с Windows без компромиссов. WSA Builds — это проект с открытым исходным кодом, выпущенный под лицензией AGPL, который предоставляет полный опыт Google Play Store на компьютерах с Windows, предоставляя предварительно собранные пакеты Windows subsystem for Android с root-доступом magic и ядром SU, созданными непосредственно Mustard Chef. Эта инициатива, управляемая сообществом, обходит официальное ограничение Microsoft WSA, которое поддерживает только Amazon App Store, путем интеграции Mind the Gaps или Google Play Services, превращая любую совместимую машину с Windows в двухплатформенную мощную систему. Процесс установки удивительно прост. Скачайте архив seven-zip для вашей системной архитектуры. Распакуйте в постоянное место, например, в документы. Запустите пакетный скрипт, и через несколько минут приложения Android будут запускаться как нативные приложения Windows с полным управлением окнами и поддержкой клавиатуры. Проект, созданный для разработчиков, мобильных геймеров и продвинутых пользователей, которым нужен доступ к приложениям Android на настольном оборудовании, поддерживает как Windows 11, так и Windows 10 с различными конфигурациями, включая сборки LTS, которые получают постоянные обновления для Magisk, Kernel SU и Google Apps, даже после того, как Microsoft прекратила официальную поддержку WSA. Работая на разделах NTFS с аппаратными требованиями от скромных 8 ГБ ОЗУ до рекомендуемых 16 ГБ, система использует виртуализацию HyperV и работает на процессорах Intel, AMD и ARM с обширной совместимостью приложений, задокументированной для сотен приложений и игр. Попробуйте и убедитесь, как быстро это станет частью вашего рабочего процесса. Проект номер пять, Play Canvas Engine, нативная разработка игр в браузере без компромиссов. Вот что-то, что ощущается как будущее интерактивных веб-приложений, созданное для скорости и доступности. Play Canvas Engine — это игровой движок с открытым исходным кодом, выпущенный под лицензией MIT, который меняет то, как разработчики создают иммерсивный контент, запуская сложные игры и интерактивные приложения непосредственно в любом современном браузере с помощью технологий WebJL, WebGPU, Web XR и GLTF. Этому движку доверяют гиганты отрасли, такие как Disney, King, BMW, Samsung и Mozilla. Этот движок на основе JavaScript предоставляет полный набор функций, включая передовую графику с физически корректным рендерингом, системы анимации на основе состояний, полную интеграцию физики через AMOJS, позиционное аудио через Web Audio API и нативную поддержку мыши, клавиатуры, сенсорного ввода, геймпада и VR-контроллеров. Рабочий процесс разработки удивительно доступен. Установите NodeJS, импортируйте модуль play canvas, и всего за 15 строк кода вы сможете отрисовать вращающийся куб с камерой и освещением, все это будет работать в полном разрешении с автоматическим изменением размера холста. Последние обновления демонстрируют передовые инновации с поддержкой вычислительных шейдеров Web GPU, возможностями трехмерного гауссова сплэттинга с потоковой передачей LOD и настройкой шейдеров, нейтральным тоновым отображением Kronos PBR для визуализации электронной коммерции и оптимизациями, которые значительно повышают производительность рендеринга с помощью таких методов, как неблокирующие загрузки передач и исправления кластерного освещения. Движок, созданный для разработчиков игр, креативных агентств, специалистов по визуализации и всех, кто ищет производительную графику на основе браузера без зависимостей от плагинов, поставляется с асинхронной потоковой передачей ресурсов, основанной на сжатии Draco и Basis, а также с сопутствующим браузерным визуальным редактором для командной работы. Изучите его один раз и почувствуйте, насколько гладкими станут ваши повседневные задачи. Проект номер шесть, Open Cloud, легкая самохостинг облачная платформа. Давайте погрузимся в мир OpenCloud, сервера с открытым исходным кодом, предназначенного для самохостинг обмена файлами и совместной работы, который дает вам полный контроль над вашими данными. Созданный на Go и выпущенный под лицензией Apache 2.0, этот бэкенд обеспечивает основные сервисы и хранит все данные в файловой системе, а не полагается на базу данных, что делает настройку простой и эффективной. Он поддерживает аутентификацию Open ID Connect, включая интеграцию с такими системами, как keycloak или встроенным провайдером Libra Connect, обеспечивая безопасный вход в вашу существующую экосистему идентификации. Вы собираете его локально с помощью make generate, затем make minor C opencloud build и запускаете с opencloud/bin opencloud innit и opencloud/bin opencloud server, что означает, что вы можете запустить его для тестирования за минимальное время, потому что архитектура основана на микросервисах и достаточно эффективна для работы на Raspberry Pi, но при этом масштабируется до использования в центрах обработки данных. Он предлагает отличное сочетание минимальных затрат на ресурсы и готовности к производству. Разработанный для разработчиков, самохостеров, небольших команд и организаций, заботящихся о конфиденциальности, он обеспечивает портативность, контроль и экономичность в одном аккуратном пакете. Попробуйте и убедитесь, как быстро это станет частью вашего рабочего процесса. Проект номер семь, Discordo, клиент Discord на основе терминала для продвинутых пользователей. Представьте себе возможность войти в свой любимый сервис чата, не выходя из окна терминала. Именно это и предлагает Discordo. Этот проект с открытым исходным кодом предоставляет легкий, безопасный и многофункциональный клиент с графическим интерфейсом TUI для Discord. Созданный на Go и выпущенный под лицензией GPL 3.0 no, он поддерживает кроссплатформенные сборки для Windows, Mac OS и Linux с предварительно собранными бинарными файлами и доступностью в менеджере пакетов. Основные функции включают поддержку мыши и буфера обмена, обработку вложений, уведомления рабочего стола и безопасное хранение токенов в хранилище ключей ОС, поэтому вы получаете привычный опыт чата, но в вашей оболочке, сохраняя скорость, минимальные накладные расходы и полный контроль. Разработчики, системные администраторы и технически подкованные пользователи чатов получают выгоду от этого инструмента. Отсутствие раздувания памяти GUI, быстрый запуск, настраиваемая конфигурация через файл конфигурации или флаги и интеграция в существующие рабочие процессы. Существуют открытые проблемы, связанные со сборкой на некоторых платформах и обработкой 2FA. Попробуйте сегодня и наблюдайте, как ваш рабочий процесс обмена сообщениями становится частью вашего терминала. Проект номер восемь, rebrows app. Превратите записанное браузерное сеанс в многоразовый рабочий процесс. Вот что-то, что ощущается как будущее. Представьте себе, что вы записываете свой браузерный сеанс один раз, а затем он превращается в исполняемый автоматизированный рабочий процесс, который вы можете запускать снова одним щелчком мыши. Именно это и предлагает Rebrows app с открытым исходным кодом. Разработанный для разработчиков, тестировщиков и команд, ориентированных на автоматизацию, которым нужна скорость, точность и меньше повторяющейся работы. Он использует TypeScript и Python, поддерживаемые такими инструментами, как Playright и протокол использования браузера для автоматизации браузера. Репозиторий показывает полный стек: веб-интерфейс в папке UI/, бэкенд API в API/ и расширение Chrome в разделе extensions, которое фактически записывает ваш браузерный сеанс. Основные моменты. Проект заявляет о 20-кратной скорости и 95% точности благодаря детерминированным повторам действий браузера. Вы клонируете репозиторий, устанавливаете свои переменные Open AI key и superbase или self-host N, затем запускаете настройку Docker для локального запуска фронтенда и бэкенда, чтобы он был доступен и мог быть самохостинг для инженеров и исследователей, создающих конвейеры QA, демонстрационные потоки или повторяющиеся веб-путешествия. Этот инструмент обеспечивает надежный контроль, четкую видимость и быструю итерацию. Попробуйте и наблюдайте, как ваша продуктивность мгновенно меняется. Проект номер девять, better tstack — современный CLI для создания типобезопасных проектов TS. Представьте себе начало нового приложения и вместо того, чтобы бороться с файлами конфигурации, выбором стека и самостоятельной настройкой всего, вы просто запускаете CLI и получаете готовый, лучший в своем классе проект TypeScript, созданный для вас. Именно это и предлагает create better tstack. Это бесплатный CLI-инструмент с открытым исходным кодом, который создает сквозные типобезопасные проекты TypeScript с настраиваемыми параметрами. Согласно репозиторию, вы выбираете свой фронтенд-фреймворк: React, Spelt, Solid, React Native или none, и свой бэкенд: Express, Fastify, Hono, Allesia или none. Выберите свою среду выполнения: NodeJS, Bun, Cloudflare workers. Выберите свою базу данных: Skylight, Postgresque, MongoDB, None, и ORM: Drizzle, Prisma, Mongoose, и необязательные надстройки CLI. Проект подчеркивает минимальные шаблоны, отсутствие раздувания, последние зависимости и полную настройку. Он создан с использованием Typescript, использует структуру монорепозитория app/ CLI и app/web, и предлагает визуальный конструктор стека в своей документации. Разработчики, стартапы и технические создатели получают от него выгоду, получая чистый шаблон, типобезопасность везде и более быстрое время до прототипа с полным контролем над своим стеком. Попробуйте сегодня и наблюдайте, как ваша продуктивность мгновенно меняется. Проект номер 10, Super Cookie, постоянное отслеживание отпечатков браузера через фавиконы. Вот что-то, что ощущается как будущее и немного тревожно. Проект с открытым исходным кодом Super Cookie от Jonas Straa показывает, как обычные фавиконы браузера, этот крошечный значок, который вы видите рядом с названием сайта, могут быть использованы для присвоения уникального идентификатора посетителю, и сохранять этот идентификатор даже тогда, когда пользователи очищают файлы cookie, переключаются в режим инкогнито или используют VPN. Инструмент предназначен для образовательных и демонстрационных целей и использует сервер в сочетании с обнаружением кэша фавиконов для восстановления того, кэшированы ли определенные ресурсы фавиконов, и тем самым различать браузеры. Ключевой вывод заключается в том, что логика кэширования фавиконов некоторых браузеров оставляет следы, которые трекеры могут эффективно использовать, давая им супер-куки, которые труднее удалить, чем обычные куки. Проект актуален для разработчиков, исследователей безопасности, защитников конфиденциальности и всех, кто обеспокоен отслеживанием в Интернете, поскольку он освещает скрытый вектор отслеживания и побуждает поставщиков браузеров и пользователей переосмыслить меры защиты. Попробуйте исследовать демо, и вы увидите, как быстро то, что казалось безобидным значком, становится постоянным тегом в вашей истории просмотров. Спасибо за просмотр. Если вам понравился этот обзор, пожалуйста, поставьте лайк видео, подпишитесь на канал, прокомментируйте свой любимый репозиторий из этого списка и нажмите на колокольчик, чтобы не пропустить наш следующий выпуск. Не забудьте поставить звездочки репозиториям и попробовать их демо-версии, ссылки на которые есть в описании. И если у вас есть предложения для второй части, оставьте их в комментариях.