📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Фазовые переходы в памяти ИИ-агентов: архитектура REC Memory

Yersham20:46

Transcription

А знаешь, если попытаться визуализировать нашу сегодняшнюю тему, мне на ум приходит такая картина. Какая?

Ну вот представь себе обычного офисного сотрудника. Начало новой рабочей недели. Он приходит на работу, садится за стол, готовый продолжить какой-то очень сложный многомесячный проект.

Ага. Стандартная ситуация, да? Но тут к нему подходит ассистент, и вместо того, чтобы открыть аккуратно отсортированный блокнот с краткими итогами их прошлых встреч, он просто берёт и вываливает на стол всё содержимое мусорной корзины за последний месяц.

Ого, ничего себе метафора.

Дада. Вот прямо черновики, чеки из кофейни, какие-то обрывки фраз, старые распечатки, всё это в одной огромной куче. И говорит: "Вот наша предыстория, нужно с этим разобраться". Звучит как абсолютный кошмар для любого профессионала.

Вот именно. И парадокс заключается в том, что именно так, ну, до самого недавнего времени работали передовые системы искусственного интеллекта.

Да, когда дело касалось долгосрочной памяти.

Точно. И наш сегодняшний глубокий разбор посвящён именно этому фундаментальному сдвигу эволюции памяти у агентов на базе больших языковых моделей, ну или

Отличная тема. И опираться мы будем на свежее исследование э-э от 15 мая 2026 года. Это материалы, подготовленные объединённой группой учёных из Китайского университета Гонконга, Уханьского университета и лаборатории Huawei.

Эта тема сейчас действительно находится, скажем так, прямо на острие технологического прогресса.

Угу. Потому что индустрия уже очень давно перешагнула тот этап, когда одни росети требовалось, ну, просто написать стихотворение или там сгенерировать рецепт блинчиков за пару секунд.

Да, сейчас ставки куда выше.

Именно текущая цель - это непрерывное взаимодействие с иагентами часами, днями, а иногда и целыми неделями,

Особенно в рамках сложных бизнес-процессов.

Да, да, бизнес-процессов или исследовательских задач. Но здесь разработчики сталкиваются с одним непреодолимым физическим ограничением. Это так называемое окно контекста,

Лимит памяти, грубо говоря.

Да-да, даже у самых передовых моделей современности, вроде последних версий пчении, это окно имеет жёсткий лимит. Допустим, от 250.000 до 1 млн токенов.

И что происходит, когда этот лимит исчерпывается при долгом общении?

Неизбежно происходит одно из двух. Либо модель просто исчерпывает этот лимит и начинает все с чистого листа, ну, полностью стирая из своего сознания всю предысторию проекта.

Ужасно.

Либо она начинает фатально страдать от информационной перегрузки, потому что пытается удержать в активном вычислении абсолютно каждую мельчайшую деталь последних недель.

Слушай, прежде чем переходить к тому изъячному решению, которое предлагают авторы вот этого нового исследования, логично было бы разобрать сам корень проблемы.

Согласен. Старые методы зашли в тупик.

Да, в материалах очень часто фигурирует термин жадная консолидация памяти или Memory Consolidation. Как вообще этот механизм работал в классических архитектурах?

Ну, в классических системах процесс был предельно прямолинейным и, я бы даже сказал, очень грубым.

Как именно?

В качестве внешней памяти для ЛМА обычно выступал просто длинный текстовый документ. Ну, например, непрерывный Markdown файл.

Угу. Обычный текстовик, да. И каждый раз, когда происходило какое-либо взаимодействие, но там отправлялась новая команда, загружался документ или генерировался ответ, система немедленно обрабатывала этот входящий поток.

И что она с ним делала?

Она просто добавляла, то есть конкатинировала новые данные прямо в конец этого файла. Это и называется жадной консолидации. Модель пытается сохранить все и сразу.

То есть этот файл просто становился бесконечно длинным. И в какой-то момент система в нём просто терялась.

Именно так. Но, ээ, проблема лежит ещё глубже на уровне базовой математики трансформеров.

Так, а вот с этого места можно чуть подробнее.

Конечно. Механизм внимания, на котором вообще построены всем, имеет квадратичную вычислительную сложность. Это значит, что если объём текста в памяти вырастает в два раза,

То вычисления растут в четыре.

Бинго в четыре раза. И система вызывает тяжеловесную модель для осмысления каждого такого крошечного обновления. Это сжигает колоссальное количество серверного времени и токенов.

А токены - это же ресурс, который критически нужен для самой беседы, верно?

Абсолютно верно. В итоге окно контекста просто забивается информационным шумом. Модель не успевает отделить главное от второстепенного. Алгоритм просто заставляет её перечитывать и анализировать вообще всё в хронологическом порядке при каждом новом запросе.

Слушай, это мне очень напоминает первокурсника перед первой серьёзной сессией.

Так интересно.

Ну вот он пытается запомнить учебник и берёт неоново-жёлтый маркер, выделяя абсолютно каждую строчку текста на странице.

Да-да-да, классика.

В итоге вся страница становится просто сплошным жёлтым пятном. И когда нужно найти главное правило, иерархии информации нет вообще. Остаётся только этот цветовой шум.

Прекрасная аналогия. И когда вся страница жёлтая, маркеры действительно полностью теряет свою функцию.

И что же делать? Раз сплошное выделение не работает?

Искусственный интеллект должен научиться фильтровать данные во времени. То есть, ну, буквально научиться ждать.

Ждать чего?

Ждать, пока информация не докажет свою релевантность и не обретёт определённый семантический вес. И вот здесь авторы исследования обращаются к концепции из классической физики, к фазовым переходам.

О, да, связь программного кода с физикой - это, пожалуй, самая интригующая часть работы.

Согласен, это звучит очень круто.

Обычно фазовый переход ассоциируется, ну, с кипением воды или превращением её в лёд при достижении определённой температуры. как они эту метафору перекладывают на языковые модели.

За этим стоит очень строгая математика. Они предлагают архитектуру на основе рекурентности Mмеory. Вместо немедленной обработки каждого сказанного слова и переходит в активный режим осмысления только тогда, когда определённая тема повторяется достаточное количество раз.

То есть информация должна создать какую-то кретическую массу.

Да, именно. Возвращаясь к твоей физике, вода становится льдом не просто так, а только при достижении определённой температуры, когда молекулы замедляются и меняют структуру.

Ага.

В архитектуре RМО разрозненные текстовые данные превращаются в структурированное воспоминание только при достижении локальной топологической плотности.

Слушай, тут возникает закономерный технический вопрос.

Давай. Для нас, для людей очевидно, что если мы вчера обсуждали яблоки, а сегодня обсуждаем бананы, то мы как бы развиваем тему фруктов, да, и плотность этой темы в нашем разговоре растёт.

Угу. Логично.

Но машина оперирует исключительно числами. Как она вообще вычисляет эту топологическую плотность? Как понимает, что наступил момент для фазового перехода?

Ключ кроется в механизме векторных пространств. Благодаря огромному предварительному обучению на триллионах текстов языковые модели кодируют смыслы математически.

То есть каждое понятие становится вектором.

Да, каждое понятие или фраза превращается в embedдинг. Это такой многомерный вектор. Его можно представить как точку в огромном пространстве координат.

И похожие по смыслу вещи оказываются рядом.

В точку. Те же яблоко и банан в этом пространстве будут располагаться очень близко друг к другу. А вектор слова бульдозер будет находиться на огромном математическом расстоянии от них.

Значит, модель буквально измеряет геометрическое расстояние между фразами.

Абсолютно верно. Чаще всего используется косинусное сходство. Это вычисление угла между этими векторами стрелками.

И как это запускает консолидацию?

Когда в определённой зоне этого пространства скапливается много векторов. Ну, скажем, пользователь несколько раз за неделю возвращается к обсуждению логистики поставок. Система постоянно мониторит эти кластеры.

Ага.

И как только расстояние между векторами и их количество преодолевают заданный порог, фиксируется высокая плотность. Тема признаётся рекурентной, повторяющейся, и бац, запускается фазовый переход.

Звучит потрясающе. Я читала, чтобы реализовать этот физический подход на практике, авторы пошли на радикальные изменения архитектуры.

Да. Они отказались от единого файла. Они разделили единый монолитный файл памяти на три отдельных резервуара, ну или многообразия, и каждая выполняет свою строгую функцию. Первое в этой иерахия - подсознательное хранилище Subconscious Store.

Исследователи прямо сравнивают его с тепловой баней в термодинамике. Это среда, куда изначально сбрасываются абсолютно все новые фрагменты взаимодействия

В виде тех самых дешёвых векторов.

Да, очень дешёвых в плане вычисления векторов. На этом этапе нет никаких сложных операций со стороны большой языковой модели.

То есть она не тратит на это энергию

Вообще. Система просто вычисляет координаты фразы и кидает вектор в буфер. Это сырые необработанные данные, которые просто плавают там и не перегружают активный контекст модели.

Так, значит, подсознание работает просто как буфернокопитель. Поняла? Далее в структуре идёт эпизодическое хранилище Эпизодик Store. И, судя по всему, именно здесь происходит главная трансформация.

О, да, это и есть место фазового перехода. Авторы используют термин конструктивная интерференция.

Это из физики волн, да? Когда несколько волн накладываются друг на друга и создают волну больше амплитудой. Здесь то же самое. Как только плотность похожих векторов достигает порога, система пробуждает основную лм.

И что она делает?

Она берёт эти повторяющиеся микросостояния, разрозненные кусочки диалогов за разные дни и сжимает их в компактное повествовательное макрособытие.

Можешь привести пример?

Ну вот, например, пять разных упоминаний о том, что клиент предпочитает утренние встречи, пьёт кофе без сахара и не любит звонки в пятницу.

Ага. Они консолидируются в один структурный факт о предпочтениях этого клиента.

Ничего себе. Это же кардинально экономят токены.

Ещё как. Это превращает хаос в логичную историю.

Механика компрессии очень крутая, но архитектура включает ещё и третье хранилище семантическое SEMANC Store. Если алгоритм так круто сжимает данные в эпизоды, зачем нужен ещё один резервуар?

Это резервный слой. Он решает главную проблему любого сжатия. При архивации неизбежно теряются мелкие, но жизненно важные детали. Так называемые атомарные факты.

Какие, например?

В материалах? Отличный пример приводится. Допустим, в долгой беседе с медицинским ассистентом один раз прозвучала фраза: "Пациент страдает аллергией на арахис".

Ой, это же критическая информация. Ошибка недопустима. А если она прозвучала только однажды? И вот тут кроется главная уязвимость подсознательного хранилища. У этой фразы нет повторений.

Она не создаёт плотности. Да, она не создаёт достаточной плотности векторов, не вызывает фазовый переход и, соответственно, не попадает в эпизодическую память. В старой парадигме она бы просто потерялась в шуме.

И тут вступает семантическое хранилище.

Именно оно выступает как слой сохранения чётности. Оно работает параллельно, используя алгоритмы извлечения именованных сущностей или жёстко заданные правила для критических данных.

Ага. То есть оно распознаёт этот изолированный, но важный факт,

Да? И переносит его в семантическое хранилище, вообще минуя проверку на повторяемость. И это спасает одиночные векторы от потери.

Знаешь, мне вся эта трёхуровневая система очень напоминает работу писателя над большим романом.

В каком смысле?

Ну, смотри, подсознательное хранилище - это разбросанные по всему столу стикеры с идеями, случайные заметки, которые ещё вообще никак не связаны.

Отличное сравнение.

Эпизодическое хранилище - это уже написанные отредактированные главы, где мысли сплелись в сюжет, а все лишнее отброшено.

Да, точно.

А вот семантическое хранилище это такой глосарий или справочник в конце книги? куда писатель заносит точные даты, названия городов, имена героев, чтобы просто не допустить фактических ошибок. Эта метафора невероятно точно отражает суть. Система не тратит энергию редактора, то есть мощности огромной LLM, на сортировку этих стикеров, пока их не наберётся достаточно для целой главы.

А строгие факты просто выносятся в табличку, да, для быстрого доступа. Теоретическая база звучит, ну, безупречно, но любая теория должна проходить проверку практикой. Насколько эффективна эта архитектура в реальных задачах? В исследовании вроде разбираются тесты на бенчмарке Лакома.

Да, Лакома - это крайне требовательный бенчмарк. Он создан специально для проверки долгосрочного логического вывода,

Как он работает. И агенту скармливают просто бесконечные запутанные логики событий за очень долгое время, и он должен отвечать на сложные вопросы по хронологии. И результаты Мери там просто поразительные.

Цифры есть.

Использование этой архитектуры сокращает количество математических операций на 87%.

Ого, 87 - это огромная цифра

По сравнению со старыми методами.

Да, по сравнению с жадной консолидацией. Для поддержания связанного контекста требуется всего около 200.000 токенов.

Система демонстрирует колоссальный прирост эффективности, и это серьёзная заявка на смену правил игры. Но из документации понятно, что эта система, ну, это не решение прямо из коробки. Векторные пороги требуют тонкой ручной настройки.

Да, инженерам нужно искать так называемые идеальные точки баланса. Ну, sweet Spots. Авторы выделяют два ключевых параметра. Первый - это Data SIM. За что он отвечает?

За геометрическое сходство векторов. Это своеобразный радиус поиска. В исследовании указано, что оптимальный порог равен примерно 0,7, то есть 70% сходства.

А что будет на практике, если разработчик задаст, ну, неверный коэффициент?

Механизм просто сломается. [фыркает] Если задать слишком мягкий порог, например, 0,6, радиус поиска станет огромным. модель начнёт считать похожими вообще разные темы, данные слипнутся и начнёт путать детали разных проектов.

А если сделать слишком строгим, допустим, 085,

Тогда система станет слишком требовательной. Данные не смогут объединиться в кластеры, фазовый переход вообще не сработает, и всё так и останется в виде мусора в подсознании.

Понятно? А второй параметр Date Counto

Это порок рекурентности, та самая критическая масса. В тестах идеальным показателем оказалась пятёрка. То есть нужно накопить как минимум пять семантически связанных векторов, чтобы запустить эпизод.

Слушай, но тут возникает повод для скепсиса. Если эти параметры так сильно влияют на работу, не означает ли это, что каждую систему придётся очень долго калибровать под конкретную индустрию?

Да, это абсолютно справедливое замечание.

Очевидно же, что для медицинского диагноста критическая плотность данных должна быть одной, а для агента, который помогает программисту писать код, совершенно другой. В коде каждая переменная важна, там нельзя ждать пяти упоминаний.

Я согласен, это технологическое ограничение на данный момент. Топология данных в юриспруденции или программировании кардинально отличается от дружеского чата.

То есть универсальной формулы нет.

Пока нет. Внедрение и мемори требует серьёзной предварительной настройки под специфику конкретной области.

Знаешь, анализ вот этих ограничений выводит наше обсуждение далеко за рамки простых бенчмарков. Само наличие подсознательного, эпизодического и семантического слоёв заставляет задуматься о более фундаментальных вещах.

О природе интеллекта.

Именно что эта архитектура говорит нам о природе интеллекта как такового. Философский подтекст тут действительно глубокий. Это исследование эмпирически доказывает, что подлинный интеллект, неважно машинный или биологический, физически требует наличия вот этого резервуара с низкой энергией.

То есть невозможно осмысливать всё в ту же секунду.

Невозможно и просто математически невыгодно пытаться каталогизировать все события в момент их появления.

Получается, эффективная система должна уметь игнорировать информацию до определённого момента.

Совершенно верно. Нужно позволить потоку данных какое-то время существовать в фоновом режиме, накопить статистику. И только когда статистика подтверждает важность паттерна, хаос превращается в знание.

А попытка структурировать хаос на лету приводит к выгоранию ресурсов, что мы и видели в старых методах.

Точно.

Тем не менее, у любой прорывной архитектуры есть свои слепые зоны. Какие скрытые уязвимости есть у этого подхода, который полагается на плотность данных? Векторный поиск ведь имеет свои специфические проблемы.

Да. Слабые места проистекают из самой математики эмбедингов. Как мы обсуждали, модель считает, что только повторяющаяся информация стоит консолидации. Одиночные факты остаются на дне подсознания.

Откуда их извлекают прямым векторным поиском?

Да. И вот здесь возникает проблема жёстких отрицаний, так называемых hards.

Как это выглядит на уровне вычислений?

Векторная математика блестяще находит похожие концепты, но часто пасует перед строгой логикой отрицания. Смотри, словосочетание страдает аллергией на арахис и не страдает аллергией на арахис, содержат одни и те же якори аллергия и арахис.

Ага. И в пространстве они будут близко.

Пугающе близко. Частица не часто является слишком слабым сигналом, чтобы кардинально развести эти векторы в стороны. То есть, если важный факт остался в виде одиначного вектора, система может извлечь его, но не распознать отрицание и может решить, что арахис безопасен.

К сожалению, такой риск есть. Если этот тонкий факт не сжался в эпизод и не был выхвачен семантическим фильтром, шансы на ошибку возрастают. Модель может просто выдать галлюцинацию.

Это та цена, которую приходится платить за снижение вычислительных затрат на 87%.

Да, жёсткие статические пороги делают алгоритм уязвимым. Это такой технологический компромисс.

И компромисс потрясающий. С одной стороны, индустрия получает невероятную эффективность и возможность вести СИделями. Мы переходим от жадного пожирания токенов к изящной консолидации. Разрозненные логи превращаются в умные архивы

Благодаря фазовым переходам.

Да, но с другой стороны, остаётся этот риск споткнуться о важную, но лишённую повторений деталь. Но, знаешь, помимо чисто инженерных прорывов, материалы этого исследования оставляют пространство для размышления и нового порядка.

О чём ты?

Разработчики намеренно обучают ИИ игнорировать единичные взаимодействия ради экономии ресурсов. Система ждёт критической массы.

Угу. Интересно перенести эту логику на нашу человеческую жизнь. Как часто в реальной коммуникации мы упускаем жизненно важные сигналы от коллег или близких просто потому, что они прозвучали лишь однажды.

Ого, глубоко копаешь.

Ну правда, тихая просьба, какая-то случайная оговорка. Они могут так и остаться в информационном шуме, не преодолев наш собственный внутренний порог рекурентности. Эволюция машинной памяти - это отличный повод проанализировать архитектуру человеческого внимания. Оставляем это как пищу для размышлений.