📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

RLM. AI больше НЕ ЗАБЫВАЕТ. Context Rot ПОВЕРЖЕН!

Pavel Bekoev18:53

Transcription

Я исправил все баги. Всё работает идеально.

>> Кнопка входа не работает.

>> Оу, странно. Сейчас поправлю. Готово. Проверяй.

>> Теперь страница вообще пустая.

>> Без паники. Финальный фикс.

>> Сайт упал.

>> Не переживай, все поправлю.

>> [ __ ] [ __ ] Заебало. Заебало. Заебало.

В прошлом ролике мы с тобой разобрали, что такое [музыка] контекстрот, а именно, почему модели начинают тупеть, когда контекста становится много. И чем больше у модели контекстное окно, тем ей самой же сложнее качественно его обрабатывать. Поэтому все эти миллион токенов, 10 млн токенов, миллион миллионов токенов вплывут на задачи, где нужно реально думать. И ни для кого не секрет, что когда Оба Сусанеet подняли контекстное окно до 1 млн токенов, в сообществе появилось много хейта касательно того, что Клод отупел. И в прошлом ролике мы обсудили, возможно, единственное решение этой проблемы, а именно RLM или recursive language Model. Именно об этом мы сегодня и поговорим.

А сейчас, бро, ответь мне. Как ты думаешь, что будет, если в твою модель загрузить какую-то огромную статью, стопку документов или попросить её провести анализ какой-то огромной кодовой базы? И если ты активно пользуешься нейросетями, скорее всего, для тебя это сейчас прозвучало как скрежет по стеклу. Прости меня, пожалуйста, я тут, чтобы помочь. Так что, если ты задолбался постоянно стартовать новые чаты, потому что старые отказываются работать, смотри [музыка] этот ролик до конца, и тогда ты узнаешь, как благодаря волшебному RLM аишки проходят тесты, где реально надо думать в 500 раз лучше. И это сейчас был не кликбейт, это буквально цифры из статьи. А как именно проходили эти тесты, я подробнее объясню буквально на пальцах. Так что смотри внимательно, почему раг, которым последние годы все затыкают дыру в контексте - это простой костыль. Почему, о котором мы сегодня будем говорить, значительно дешевле обычных запросов каишки? Ну а в конце я покажу, куда всё это движется, как CLO, GPT и всякие [музыка] подобные тулзы, которыми ты пользуешься, тоже двигаются в направлении к RLM.

Но прежде, чем я расскажу про этот новый модный молодёжный способ работать с большим объёмом данных, а именно РЛM, прежде стоит рассказать, почему тот самый пенсионерский рак уже не в тренде. Для тех, кто не в курсе, последние несколько лет проблему от упивания нейросетей на больших объёмах данных старательно пытались решить с помощью навороченного костыля, внутри которого лежит векторная база данных, в которую так охотно и легко может захаживать аишка и брать данные в максимально нативном и удобном для себя формате.

Как тебя зва?

>> Лёха.

>> Лёха. Здорово, Лёха. Ать.

>> И чтобы не называть вещи своими именами, ввели модный термин раг Retrieval agmented generation. Переводится на русский так же криво, как и работает иногда. Поисковая дополненная генерация. Наверное, я не должен быть так уж строг к этому инструменту, потому что сам использовал его в своих проектах. В целом он был норм. А если тебе, братишка, страшно, что ты сейчас ничего не понимаешь или ты слушаешь, слышишь об этом рак изо всех утюгов и до сих пор не знаешь, что это такое, не переживай, сейчас я всё тебе расскажу на пальцах.

Смотри, все твои документы, код, все твои [музыка] текстовые данные, короче, и всё такое режут на маленькие куски, так называемые чанки. Каждый такой чанк прогоняют через [музыка] специальную модель, называемую Bed, которая превращает текст вектор. Это просто массив чисел. можешь думать про него как про координаты кусков инфы [музыка] в гигантском пространстве смыслом если я буду писать рэпа-альбом, я обязательно использую эту метафору. Куски, похожие по теме по смыслу, лежат рядом друг с другом. Разные лежат далеко. Ну а теперь юзер задаёт свой вопрос. Вопрос тоже превращают в вектор. Идут в базу со словами: "Дай ближайших соседей [музыка] по этой точке". База возвращает топ-5 или топ-10 самых похожих кусков. Эти куски суют модели вместе с вопросом, и она отвечает, опираясь только на них. Вот в этом и весь рак. Звучит, может быть, мудрённо, на деле это просто [музыка] поиск похожего.

Но здесь есть подвох, и он не один. Первое: Рак не думает, он ищет похожее. Сколько у меня уникальных поинтов, он не скажет никогда. Считает, связывать пары агрегировать, это не его операция. Второе и самое больное - это то, что такую базу нужно постоянно поддерживать, держать её актуальной. Изменил данные, необходимо [музыка] переимбедить. Поменял доку, необходимо переимбедить. Поменял эмбедер на новую модель, необходимо переимбедить всё. Перенарезал как-то чанки иначе, тоже всё надо переимбедить. Это отдельная инфраструктура, которую кто-то должен пилить и поддерживать.

А теперь представь ситуацию, в которой модель сама может ходить по нужным ей данным без векторной базы данных, без этих чанков, без имбединга. Аишка, которая сама для себя в моменте в рантайме [музыка] создаёт нужные ей тулзы для того, чтобы качественно работать с данными. То есть модель не просто анализирует твои данные, она пишет код, который помогает ей анализировать твои данные. Вот это и есть РВМ.

Если интересно, как работает эта волшебная палочка, пожалуйста, внимание на схему. Подаём на вход. что угодно, какие-то файлы, может быть, с гитрепозитория, кто, может быть, базу данных, опишку, [музыка] документу, логи. В самой статье авторы положили все данные внутрь переменной в Питоне, но в общем [музыка] случае не принципиально, как именно предоставлять эти данные переменной, файлами, подключением к удалённой базе. Главное, что данные лежат вне модели и доступ только через [музыка] код. Ну, в исследовании авторы просто закинули всё в переменную на Питоне. Далее обработка. И тут вся [музыка] магия. LM пишет код на Python. Код вызывается, возвращается результат. Модель смотрит на результат и решает, понятно ей или нет. Если ей понятно, то выход из цикла. И переходим к выводу. Если непонятно, то модель вызывает саб [музыка] RLM. Это, можно сказать, новый мини-мозг с незамыленным, так сказать, глазом, с абсолютно чистым контекстом. Он берёт только тот самый непонятный кусок данных и разбирается в нём изолированно и возвращает ответ внутри [музыка] переменной обратно. И вот основная модель продолжает цикл с новой информацией. И этот цикл крутится какое-то количество раз до тех пор, пока модель полностью поймёт всё, что от неё [музыка] нужно или до лимита, который сдаётся параметром глубины рекурсии. Его тоже можно ограничить. [музыка] И что тоже очень интересно, финальный ответ тебе пишет не основная модель. К этому моменту она уже забита [музыка] кодом, какими-то выводами, рассуждениями. Если её попросить ещё и финальный отчёт написать, то начнёт тупить уже на этом этапе. Поэтому главная модель просто запускает [музыка] отдельный сабр LM агрегатор с чистой головой, получает структурированные данные и выдаёт ответ. И итог результат лежит также в переменной. [музыка] И всё. Это весь алгоритм, простой, как сапоги.

О'кей. А теперь давай посмотрим конкретный пример, разберём на какой-то боевой задаче. Всё. Внимание на схемку. Я эти схемки только недавно научился строить, поэтому очень горжусь этим. Допустим, ты пришёл в новую команду, тебе дали проект на 800 файлов, и любой, кто приходил в новый проект, прекрасно понимает, о чём я сейчас говорю. Курсор Клодь теряют контекст. Простого грепа им недостаточно. Ну, а срmм ты делаешь так. Сверху подключаем окружение. Файлы все 800 в Python переменной. Инструменты read, gitlog, gitblame, Greb, Sublam. Дальше модель сама решает, что и в каком порядке ей делать. [музыка] Она исследует структуру, пишет какую-нибудь бетоновскую функцию, например, сосчитает, сколько файлов в каждой папке верхнего уровня и получает какой-то ответ. Шаг два. Далее, например, она идёт в Git и смотрит, какие файлы меняются чаще всего, и приходит к выводу: или файлы отвечают за всё подряд, так называемые Gкты, либо это какой-то обитель багов, либо там сейчас активная разработка. И получает, скажем, топ-20 таких мест. Шаг три: рекурсия. Каждый из этих двадцати файлов надо проанализировать детально. Далее наша основная модель сама пишет, например, циклф са обвызовом RLM на каждом файле. Скажем, 20 параллельных вызовов. Каждый саm видит только один файл и его историю коммитов и возвращает короткий вердикт. Например, это G object, количество [музыка] строк, его статус в активной разработке или там куча багов. И на этом моменте модель может делать сабвызовы с уточняющими вопросами до тех пор, пока ей не станет ясна вся картина целиком. Шаг четыре. Агрегатор, финальный Сабр, штука, которая собирает всё в один отчёт. что-то типа такого. И в ответе выдаёт, что в первую очередь рефакторить надо эти пять файлов, например. И вот это и есть готовый омбординг для новичка. Без там чтения [музыка] какого-то анализа миллиона строк кода своими глазами, без бесконечных грепов, тонущего в контексте клода или курсора.

Ну а эту схему я оставлю в своём Telegram-канале. [музыка] Туда же прикреплю ссылки на гит с этим RLM, чтобы ты мог установить его и поиграться с ним сам.

А теперь давай поговорим, откуда этот LM вообще так захайпился, а именно благодаря какому исследованию. Быстренько напомню, как именно у Ишек тестируется контекстное [музыка] окно. Самый популярный бенчмарк, посвящённый этой теме, называется Needle and Htech. И все модели проходят его на 100%, а маркетологи с удовольствием хвастаются это для того, чтобы продавать свои подписочки вам. Но вся суть-то в том, что тестт - это всего лишь поиск, это не проверка мышления. Поэтому MIT в своём исследовании этот понтовый бенчмарк отбросили и взяли задачу посложнее. Задачу, над которой реально нужно подумать.

Ну а сейчас, братишка, тебе ненадолго [музыка] всё-таки придётся включить свой мозг. Я прекрасно понимаю, мне самому это делать очень тяжело из-за тотального присутствия искусственного [музыка] интеллекта в нашей жизни. Но иногда это бывает очень полезно, поэтому не пренебрегаем этим. И давай вместе попробуем въехать, как именно тестировали мышление. неросетей в тесте этого. И называется этот тест ООО Long Pairs. И построена она на так называемом трек. Что такое вообще трек? Текст Retrieval Conference. Конференция, которую с девяносто второго года организует американский институт стандартов NIS. Но нам интересно другое, а именно то, что у них есть очень знаменитый датасет Question classification. 5.500 коротких вопросов на английском. Каждый размечен одной из шести категорий. Про человека home, про место log, про число нам, про аббревиатуру абr, про объект, про описание desk. На нём 20 лет учат классификации, то есть MIT взяли уже проверенную базу. А именно они взяли около 500 записей из трек суммарно примерно на 32.000 токенов. И [музыка] они придумали 20 вопросов. не просто классифицировать, а связать пары. И вот тут самое интересное, что вообще такое пара. Пара - это любые две разные уникальные пары записей из 500. Вот тут наглядно можно посмотреть, как это выглядит для семи [музыка] записей. То есть нужно найти количество уникальных пар. Например, среди семи [музыка] записей 21 уникальная пара. Математика простая. Вот так вот выглядит эта формула. Для 500 записей- это 124.750 750 оригинальных пар. Ну а вопрос звучит примерно как: сколько пар записей в датасете, где обе относятся категорий про человека? И в тесте было 20 таких вопросов, каждый из которых требует агрегации по парам. Вот тут на схеме можешь посмотреть и остальные примеры. И чтобы ответить на вопрос модели, надо пересобрать все 124.000 пар для каждой проверить условия и вернуть число. И, как ты сам понимаешь, это уже не просто поиск, это самое настоящее рассуждение со сложностью n². Число операции растёт квадратично от количества записей. Удвоить данные, работа становится в четыре раза больше. И GPT5 на этой задаче выдаёт 1%. Из двадцати вопросов модель ни на один не отвечает правильно. Десятое просто статистический шум. Контекст не переполнен. Все данные помещаются, 32.000 токенов в восемь раз меньше его лимита. И модель не тупая, просто антенtion физически не тянет. Парные сравнения на длинном контексте - это фундаментальный лимит архитектуры. Но та же модель, те же данные, обёрнутые в РM, дают 58%. больше половины правильных ответов на той же задаче, [музыка] на тех же данных, на той же GPT5, без переобучения, без новых весов, просто за счёт другого способа скармливать модели данные. И, как ты, наверное, уже понял, этот способ сработает с абсолютно любой моделью: с клодом, с GPT, с Ginai, хоть с какой-нибудь [музыка] локальной ламой. Вообще неважно. Не надо ничего переобучать. Ничего там дополнительно платить не [музыка] надо, просто платишь за токены, которые ты используешь. Это просто обёртка, которую ты можешь поставить, сделать [музыка] сам. Кстати, ссылку на это исследование, там все схемы и на гитрепозитории [музыка] с этим RLM, который ты можешь попробовать применить под свои задачи, я оставлю в своём Telegram-канале. Так что залетай туда.

А теперь самое время подвести итоги и поговорить о том, куда всё это движется. Давай по-честному. Рак, на который я наезжал какое-то время в этом ролике, конечно, всё ещё не помер. Он отлично работает, справляется в своей нише. Там, где данные меняются редко, ответ нужен быстро и дёшево. Поддержка клиентов, FQ, поиск по статической документации. Вот здесь рак идеален. Подготовил векторную базу данных один раз, дальше каждый запрос стоит копейки. И отвечает всё это просто за миллисекунды. А вот где рак ломается, это уже, наверное, какие-то размышления продвинутые. Вот в этом случае нам как раз-таки и нужен RM. И скорее всего будущее оно как раз-таки за гибридным подходом, где РM будет выступать в роли оркестратора, а Раг просто одним из его инструментов. Тогда RM думает, рагще. Каждый занимается тем, что у него получается хорошо.

Ты спросишь у меня: "Пошок, ты сейчас рассказал про это решение? Звучит, конечно, всё это круто. А сколько это стоит?" Наверное, какое-то состояние бешеных денег. Так вот, возьмём задачу от 6 до 11 млн токенов одним запросом. И сразу важный момент, ни один обычный GPT столько в контекст вообще не вмещает, упирается в лимит. Но просто гипотетически, даже если просто прогнать такой объём токенов по трифу, самый дешёвый GPT5 Mini, это уже от полутора до почти 3х долларов, и то лишь за вход, без обработки. Ам реально решает задачу целиком и в среднем за 99 центов. И дешевле, и точнее.

Итак, почему всё-таки этот способ оказался таким дешёвым? Первое и самое главное, модель практически ничего не читает. Вот смотри, если ты берёшь какой-то огромный документ, данный, неважно, бросаешь это чату GPT, например, объём 10 млн токенов, каждый из этих токенов идёт в нейросеть. И за каждый токен, который он прочитал, ты платишь. RLM же берёт только маленькие кусочки, так важные ей для понимания сути вопроса и для, в конечном счёте, того, чтобы она дала тебе хороший качественный ответ. И в сумме может получиться, например, она потратит на это миллион токенов, но не 10 млн. В 10 раз меньше, в 10 раз дешевле.

Теперь давай поговорим о том, куда движется индустрия. Ча GPT уже говорят, что их память построена не на раг. И, скорее всего, все серьёзные мемори системы пойдут всё-таки в парадигму RLM в двадцать шестом-двать седьмом году. плот-код, курсоры, подобные инструменты уже движутся в сторону. То есть модели внутри этих инструментов уже используют какие-то тулзы для работы с данными, какие-то грепы, глобы, риды. Всё это упрощённая версия. Ну а полная впереди. Далее, что значительно повлияет на развитие РM - это задачи с высокой ценой ошибки. Какая-то медицинская диагностика, финансовый аудит, resarch. Пусть модель думает 10 минут, часть пуст думает, только бы чтобы не врала. И в таких задачах LM просто вне конкуренции. Чем дешевле становится искусный интеллект, тем люди дольше готовы ждать, лишь бы ответ был точный. Вот, например, юристу. Он без проблем подождёт ответ 5-10 минут вместо 5 секунд. Главное, чтобы искусственный интеллект не пропустил важный пункт в контракте на 100 страниц. И врач может подождать. Главное, чтобы искусственный интеллект не упустил какой-то важный симптом в огромной истории болезни за 10 лет. То есть быстро, но неправильно в таких задачах никому не нужно. Нужно точно, пусть и долго. А чем дешевле будут аишки, тем больше задач перейдёт в эту категорию. [музыка] Им - это ровно про это. Технология, на которой будут строиться такие медленные, но точные аишные системы.

И так, короче, вроде всё рассказал, выводы подвёл, телегу прорекламировал, возможно, недостаточно. Там ещё про стартапы, да, рассказываю себя как свой стартап в реалтайме строю. Не просто строю ещё трачу бабки на маркетинг. Там плюс там же есть чат, где сидят супершаристые ребята, которые зачастую выдают какие-то факты, от которых я сам, короче, в шоке. Короче, ребята супер продвинутые, так что залетай. И спасибо, что досмотрел до конца. Скорее всего, ролик получился очень длинным. Мне это очень приятно. И алгоритмом Ютуба тоже, когда люди досматривают ролик до конца, YouTube считает, что ролик очень крутой, двигает его выше. Так что спасибо, ставь сам знаешь что, если тебе понравился ролик. Ну а я пошёл настраивать свои рекламные кампании и надеяться, что меня мои стартапы будут покупать. Вы тоже там найдите, [музыка] чем себе заняться. И пока.

Что ебре? Словно неба в слезах. Я живу как во сне. Снова вижу [музыка] тебя. И я твоё на губах замерло. Далекодалеко я прощаю. Yeah.