Transcription
Каждый день в мире выходят сотни новых исследований в области искусственного интеллекта. За 2025 год их появилось около 50.000. Очевидно, что изучить всё это невозможно. К тому же читать такие статьи могут лишь специально обученные люди. В них много технических деталей, формул и кода. Но главное, большинство этих работ никак не влияет на реальное развитие искусственного интеллекта.
Я весь год ежедневно анализировал эти исследования, поэтому в этом ролике мы разберём только самые перспективные подходы, которые будут определять развитие искусственного интеллекта в 2026 году. Для этого я отобрал 30 научных работ, которые реально меняют индустрию, разделил их на шесть ключевых направлений и в каждом выбрал по пять самых значимых от методов обучения искусственного интеллекта и проектирования мультиагентных систем до физического воплощения агентов в виде роботов, дронов и других устройств, а также того, как искусственный интеллект помогает нам в программировании, науке и прикладных задачах. Мы разберём всё это простыми словами и в конце подумаем. Чего ждать от искусственного интеллекта в наступившем 2026 году? Поехали.
Начнём с новых методов обучения моделей. Разработчики нашумевшей китайской модели DeepsК показали, как с помощью обучения с подкреплением можно улучшить способность больших языковых моделей к рассуждению. Они научили модели самостоятельно генерировать цепочки мыслей для решения сложных задач, а затем на этих рассуждениях обучили семейство моделей R1. Модель R1 конкурирует с закрытыми системами Open AI в математике, логике и программирования и без огромных затрат на обучение.
Теперь про распределённо обученную модель Интеллект 2. Для обучения больших языковых моделей больше не нужен гигантский датацентр, достаточно децентрализованной сети обычных компьютеров. Тысячи узлов по всему миру генерируют рассуждения, проверяют их и получают награды. Модель учат не просто думать, а думать короче, штрафуя за лишние шаги. Всего за 2 недели Интеллект 2 обошёл лучшие открытые модели своей весовой категории в математике и коде. Это настоящий кошмар для корпораций с огромными дата-центрами. Ведь, оказывается, интеллект можно обучать коллективно.
А теперь представьте искусственный интеллект, который не просто понимает текущую реальность, а умеет предсказывать будущее. Так, даже, чтобы приготовить обед, важно не только распознать предметы, но и представить цепочку шагов и их последствия. Учёные предложили предсказывать будущее с помощью языка. Модель смотрит видео, формулирует цель, а затем строит план как последовательность действий изменений состояния мира. Есть два режима: быстрые, сразу действовать и вдумчивы. прокрутить несколько вариантов будущего и с помощью критика выбрать лучших. Именно второй режим убирает лишние шаги, поэтому, чтобы искусственный интеллект научился планировать в реальном мире, ему достаточно научиться думать о будущем с мыслами через язык, так же как это делает человек.
Следующее исследование от Nvidia. Пока рынок иагентов растёт к сотням миллиардов долларов, индустрия продолжает опираться на дорогие и медленные большие модели. Исследователи предлагают в ряде задач заменить их малыми моделями до 10 млрд параметров. Для агентных систем этого более чем достаточно. Эксперименты показывают, что до 70% вызовов LLM можно заменить малыми моделями без потери качества, сократив задержки и стоимость от 10 до 30 раз. Поэтому будущее не за самыми большими моделями, а за гибридной архитектурой. Малые модели - это рабочие лошадки, а большие нужны для действительно сложных задач.
Следующее исследование из MIT. Большие языковые модели плохо справляются со сложной математикой, медицинскими и финансовыми задачами, а разметка данных людьми - это всегда долго и дорого. Поэтому исследователи разработали модель, которая учит саму себя. Сначала она ищет информацию в открытых источниках, а затем более сильная модель генерирует пары, вопрос и ответ. После этого задача автоматически усложняется или упрощается под уровень ученика, а для обучения отбираются самые полезные примеры. В результате точность в математике выросла с 62 до 92%, а в медицине и финансах показало двузначный прираст. И всё это всего на примерно 500 синтетических задачах почти без человеческой разметки. Это означает, что для развития искусственного интеллекта нужно правильно поставить задачу и настроить автоматическое самообучение. Человек в таком случае становится архитектором процесса, а не разменчиком данных.
Перейдём к мультиагентным системам. Цель Open Deep Search- сделать открытый аналог Perplexity. Авторы показали, что надёжный интеллектуальный поиск - это вопрос правильной архитектурой. Open Deep Search объединяет веб-поиск и рассуждающих агентов. Запрос сначала переформулируется и ищется в интернете, после чего агент шаг за шагом рассуждает, проверяет источники и собирает ответ. И всё это с использованием открытых инструментов и моделей. Агент может рассуждать напрямую или планировать через код. Так система сама решает, сколько искать и когда остановиться. В тестах эта система обошла Perplexity. Это означает, что качественный поиск на базе искусственного интеллекта теперь доступен каждому.
Framework Auto Agent - это no cod платформа для создания агентов. В отличие от LНIN или Long Raph, которые требуют навыков программирования, здесь пользователь просто описывает задачу на естественном языке, а система сама строит агентов, планы действий, работу с файлами и инструментами. Архитектура включает движок рассуждений, мультиагентную систему, самоорганизующуюся файловую систему и механизм, который преобразует текстовое описание в рабочего агента. На бенчмарке Гая система стабильно решает задачи с точностью выше 70%, а в задачах поиска информации работает гибче, чем многие ручные решения. Теперь автоматизация доступна не только тем, кто пишет код, а тем, кто умеет формулировать задачи.
Следующее исследование о Sales Force. Оно про реальную боль бизнеса. Это хаос в данных, отчёты, письма, базы, код. В компании есть всё. Но связать это в одну централизованную систему довольно сложно. Исследователи предложили управляемую мультиагентную систему с прозрачным планом исследования. Внутри оркестратор, специализированные поисковые агенты, подключение внутренних баз компании, визуализация данных и встроенная рефлексия. Система сама ищет пробелы и противоречия в данных, а каждый вывод привязан к источникам. Пользователь может менять курс прямо по ходу работы, уточнять фокус, добавлять задачи. и ограничивать источники. В результате фреймворк обходит других агентов на бечмарках для глубокого анализа данных. Так искусственный интеллект становится партнёром аналитика, и бизнес начинает доверять решениям, принятым с его помощи.
Следующее исследование от китайской компании Алиба. Исследователи решили узнать, что будет, если заставить агента работать с тысячами API. Они дают агенту 30.000 инструментов, каждый из которых читает и записывает данные в общее состояние среды. На основе этого автоматически строится тысяча новых сред, в которых агент учится жить. Сначала осваивает общие навыки, затем специализируется по доменам. Результаты впечатляют. Модель на 4 млрд параметров догоняет модель на 30 млрд параметров, а 30 млрд местами приближается к закрытым системам. И всё это без обучения с подкреплением и без гигантских моделей. То есть масштабировать можно не модель, а саму среду. Дайте агенту большой разнообразный мир, и он станет умнее.
А теперь представьте искусственный интеллект в роли врача, который выдвигает гипотезы и назначает анализы. Для этого учёные создали виртуальную клинику, симуляцию, где агент получает правдоподобные результаты обследований, как в больнице, и обучили его так, что награда даётся не только за верный диагноз, но и за правильный вызов нужных инструментов. В итоге агент уверенно обходит классические языковые модели, точнее выбирает тесты и быстрее приходит к верному диагнозу. Это и есть главное качество мультиагентных систем. Каждый агент делает свою часть работы, используя нужный инструмент.
Перейдём к роботам, дронам и другим устройствам. Microsoft наконец решили главную проблему компьютерных агентов. Нажатие на кнопки. Они разработали систему, которая понимает интерфейс и API Windows приложений. Архитектура состоит из диспетчера Host Agent и специализированных агентов для Excel, Ворда, браузера и средки. Система воспринимает экран как последовательность скриншотов и по запросу пользователя строит цепочку действий. Если можно вызвать API, вызываем. Если нельзя, то нажимаем на кнопку. Мультиагентная система заранее предсказывает результаты действий, а агент-валидатор проверяет последствия перед выполнением. В итоге вдвое меньше ошибок и вдвое дешевле вызовы LLM, а пользователь спокойно работает параллельно в отдельном окне. На сложных бенчмарках система уверенно обходит остальных агентов, поэтому будущее автоматизации в агентах, которые встроены напрямую в операционную систему.
Следующее исследование о том, как подружить ЛМ с реальным железом. В умном доме у каждого устройства свои форматы данных. Исследователи предлагают MCP-сервер для интернета вещей с архитектурой из трёх слоёв. LM выбирает действия. Промежуточный сервер управляет соединениями и очередями, а микроконтроллеры читают сенсоры и отвечают. В итоге 100% успешных вызовов со средней задержкой около 200 мсекунд. Так можно безопасно подключать к физическому миру, превращая умный дом в простой чат.
Следующий шаг - заводы и цифровые двойники целых индустрий. В Google задаются вопросом: "Мы научили искусственный интеллект говорить и видеть". Как заставить его двигаться в реальном мире? Мультимодальные модели сильны в цифровой среде, но роботам нужно понимать 3Dцену и реагировать в реальном времени. Для этого Google добавили модуль Gemini Robotics, усиливающий пространственное мышление и планирование действий. В сложных задачах упаковка, оригами, работа двумя руками. Успех достигает от 80 до 100% после небольшого обучения. А 96% опасных случаев блокируется. Универсальный агент обретает тело и выходит физический мир. Роботов больше не нужно программировать под каждое движение. Достаточно показать, как это делать. Это уже очень близко к тому, как учатся люди.
Следующее исследование про управление дронами без обучения с нуля. Теперь мы можем без лишних слов просто указать пальцем, куда лететь дрону. визуальной языковой модели показывается кадр, и она прямо на изображении указывает точку, куда лететь и примерное расстояние. Дальше обычная геометрия переводит это в 3D-движение. В симуляции почти 94% успешных миссий против 30% у старых методов. В реальных полётах те же цифры. Дрон уверенно обходит препятствия, следует за человеком и летит быстрее, чем при управлении словами. Когда можно напрямую указать точку, не прибегая к языковым командам, автономные роботы становятся гораздо практичнее.
Как научить робота мыть посуду? А оказывается, простые бытовые действия для роботов сложнее шахмат. Для этого нужны дорогие камеры, датчики и калибровка. Беркли предлагает учить робота по видео. глазами человека. Учёные берут обычные записи с умных очков и превращая движение рук и объектов в компактные 3D точки. И этого достаточно. Робот не знает, как что-то делать правильно. Он просто смотрит через обычную камеру и пытается повторить траекторию в общем 3D-пространстве. В результате около 70% успешных действий на новых объектах и в новых условиях. Роботов можно учить также, как и людей. наблюдением. Так наша повседневная жизнь становится новым топливом, ценными данными для обучения машин, а значит, и ответственность за их навыки тоже лежит на нас.
Ну а теперь про программирование. В программировании произошла революция. Сегодня есть два подхода: vibe codдинing и agent coding. И они меняют само представление о том, кто такой разработчик. - это диалог с машиной. Ты объясняешь идею, архитектуру и ограничения. Искусственный интеллект пишет код, после чего ты всё за ним переделыешь. Это быстро и хорошо подходит для прототипов приложений. Agenticдинг - это другое. Ты задаёшь цель, а искусственный интеллект сам планирует, пишет код, запускает тесты и исправляет ошибки. Человек становится менеджером процесса. Это сильно ускоряет разработку, но есть риск потери контроля. Самое важное- эти подходы не конкурируют. Будущее за гибридной моделью, где человек архитектор и критик, а искусственный интеллект - автономный исполнитель. Да, сегодня искусственный интеллект уже неплохо пишет код, но архитектура и ответственность всё также лежит на человеке.
Учёные решили ответить на вопрос, сколько денег искусственный интеллект реально может заработать как фриланс-разработчик. Они взяли 148 реальных задач Subfork, всякие баги и административные задачи почти на миллион долларов, и проверили, что смогут выполнить языковые модели. В итоге даже одна из лучших моделей Clotet справилась с лишь 26% инженерных и 45% административных задач. Итоговый заработок около 400.000 долларов вместо миллиона. Причина в том, что реальная задача требуют понимания контекста. Искусственный интеллект, конечно, сильно полезен в работе, но полноценным фриланс-инженером он пока ещё не стал.
Google пофиксили 7.400 багов за 1 доллар. Они решили не искать сразу первопричину проблемы, а поставить минимальный предохранитель прямо в точке сбоя. В результате почти половина уязвимости исправляется автоматически по цене около 26.000ных доллара за бак, меньше чем за 1 минуту. Связки с большими моделями до 73% фиксов при ещё меньших затратах. А пока система таким образом латает дыры, люди-инженеры выигрывают время на то, чтобы подчинить корневую проблему.
Китайские исследователи выпустили Янус Кодер, который видит результаты своей работы и самоулучшается в процессе. Программные интерфейсы - это результат выполнения кода, но раньше искусственный интеллект этого не видел. Янус кодер понимает, что именно делает его код. Мультимодальная модель принимает код и скриншоты экрана и сравнивает, чтобы визуальный результат совпадал замыслом. Потом он на этом учится. В тестах Янус кодера входят открытые аналоги и конкурируют с GPT4O. Будущее программирование - это диалог с системой, которая видит, запускает и оценивает результат своей работы.
Другой китайский агентко отвечает на вопрос: может ли искусственный интеллект собрать рабочий репозиторий по научной статье? Оказалось, главная проблема - контекст. Аллам тонут в информационном шуме и начинают противоречить сами себе. Пкод решает это так. Статья сначала сжимается в единый источник правды, затем код пишется с использованием памяти, паттернов из других репозиториев и проверяется запуском песочнице. В результате пкод почти вдвое превосходит прошлых агентов и местами обходит коммерческие инструменты. Будущий кодинг не в больших моделях, а в памяти, структуре и контроль внимания. Тот, кто научится этим управлять, сможет автоматизировать полный цикл разработки.
Переходим к самому интересному. Искусственный интеллект для науки. Научных исследований становится слишком много, гипотез ещё больше, а времени у людей всё меньше. Поэтому Google Resсarch разработали AI соавтора научных работ. AI автор - это мультиагентная система, в которой разные агенты делают то, что раньше делала команда учёных. Один генерирует гипотезы, другой критикует, третий ранжирует, четвёртый улучшает идеи, а пятый собирает всё восмысленный вывод. В задачах биомедицины гипотезы AI автора подтверждались экспериментально, причём качество идеи росло с масштабом вычислений, а автоматический рейтинг хорошо совпадал с мнением экспертов. Так, искусственный интеллект становится соавтором научных идей, но без контроля человека наука рискует ускориться не туда.
Учёные из IMD и университета Джона Хопкинса построили лабораторию агентов. Идея в том, чтобы использовать её агентов как научных сотрудников, закрывающих весь исследовательский цикл, от обзора литературы до экспериментов и написания статьи. Система получает исследовательскую идею и дальше работает сама. Один агент ищет статьи в научном репозитории архив. Другой планирует и запускает эксперименты, пишет и чинный код. А третья собирает отчёт в латекс. Человек может вмешиваться, но не обязан. В экспериментах лаборатория автономно сгенерировала 15 статей по машинному обучению. Аспиранты оценили их как полезные. Сегодня иследователь не заменяет человека, а освобождает его время для новых идей. Думаю, что лаборатория будущего - это синергия человека и команды AIгентов.
Болтать модели научились хорошо, а вот хорошо искать и проверять реальные факты не очень. Microsoft разработали агента веб-исследователя, который ищет, открывает страницы, возвращается, уточняет запросы и строит длинную цепочку рассуждений. Поиск чтения чередуется, а весь путь сохраняется в контексте. Исследователи специально создают вопросы с размытыми формулировками, которые нельзя решить в один клик, чтобы приучить агента копать глубже. Затем дают примеры и дообучают через обучение с подкреплением. В результате модель уровня 3 14 млрд параметров обгоняет более крупные модели на сложных веб-бэчмарках. Чтобы искусственный интеллект перестал галлюцинировать, его нужно научить проверять информацию, и тогда он станет полноценным исследователем.
Но китайские учёные всё-таки пытаются убрать человека из исследовательского цикла. Они решили разработать агента, который самостоятельно открывает законы природы. Агент сам анализирует данные, пишет и запускает код, предлагает формулы, подбирает константы и проверяет гипотезы экспериментальная. У него есть память лучших находок и обучение с подкреплением, которое постепенно улучшает гипотезы. В результате система стабильно обходит аналоги, лучше восстанавливает и численные значения, и структуру формул, устойчиво к шуму и работает даже на новых доменах. Но способен ли искусственный интеллект таким образом стать полностью автономным исследователем, который открывает новые законы природы? Время покажет.
Архив - это платформа, где учёные публикуют припринты своих научных работ, и они предложили сделать эту систему доступной для AI агентов. Автономные AI лаборатории проводят исследования, публикуют припринты, читают работы других агентов и дорабатывают их. Человек задаёт направление, а дальше агенты действуют сами. На задаче МАЗс 500 точность выросла с 70 до 88%, а при параллельной работе лаборатории почти до 80%. Агенты переиспользуют идеи, исправляют ошибки и накапливают общие знания.
Переходим к финальной теме. Прикладной искусственный интеллект. Сегодня у искусственного интеллекта есть проблема. Он статичен. Обучили и всё. Но есть решение. Самоэволюционирующие агенты. Это системы, которые учатся на лету, обновляют память, меняют инструменты, перестраивают стратегии и даже собственную архитектуру и делают это постоянно, прямо как живые системы. Исследователи показывают, что эволюционировать может не только модель, но и контекст, инструменты, да и сама структура агентов. Есть быстрые изменения внутри задач и устойчивые между ними. И популяция агентов учится эффективнее одиночек. Потенциал колоссальный: персонализация, коллективный разум, обучение без гигантских датасетов. Но функцию вознаграждения можно взломать, поэтому важно правильно задавать цели и метрики и тестировать агентов на отдельных задачах и на протяжении всего их жизненного цикла. Путь к суперинтеллекту - это умение адаптироваться. Главный вопрос: как это делать безопасно?
Теперь про поведение AI агентов. Сегодня они не просто решают задачи, они планируют, договариваются, влияют друг на друга и на людей. Но агента нельзя понять клятья только на его архитектуру. Поведение рождается во взаимодействии со средой. Так появляется поведенческая наука об иагентах. Она изучает, как на поведение влияет обратная связь и социальный контекст. Китайские учёные показывают, что в мультиагентных системах возникают сообщества союзами, конфликтами и стратегиями выживания. А во взаимодействии с людьми искусственный интеллект может усиливать мышление или искажать его. Поведение агента определяется тремя факторами: промптриггером, предобученными способностями и мотивацией. Вместе они управляют адаптацией поведения агента. Без поведенческой науки мы не управляем искусственным интеллектом. Мы лишь надеемся, что он ведёт себя правильно. Понимать поведение агентов значит сохранять контроль над их реальным влиянием на наш мир.
Если раньше мы учились спрашивать у искусственного интеллекта, то сегодня мы учимся управлять тем, как он думает. Сначала у нас был промтнжениринг, а теперь мы строим целые цепочки рассуждений, и это уже походит на когнитивный инженеринг. В общем виде это происходит так: есть поток данных. Данные получают контекст и становятся информацией для агента. Информация превращается в знание, а знание, закрепляясь на практике, становится мудростью. На практике модель генерирует ответ, получает внешнюю обратную связь, находит ошибку и через самоуточнение улучшает рассуждение. Поэтому выигрывают те, кто умеет проектировать такие когнитивные системы.
AI агенты уже умеют договариваться и торговаться. Так формируется агентная экономика. Проблема в том, что сегодня она растёт стихийно и сразу выходит в реальный мир. Такой рынок нельзя опускать на самотёк. Его нужно проектировать заранее. Аукционы ресурсов, новые валюты, репутация, идентичность и многоуровневый надзор. Агентная экономика неизбежна. Вопрос лишь в том, станет ли она управляемой и полезной или усилит неравенство и хаос. Новыми правилами нужно заниматься уже сейчас.
И напоследок, сегодня A-агенты уже работают рядом с людьми. Они пишут письма, готовят отчёты и отбирают кандидатов. Вопрос в том, что мы готовы ему доверить. Учёные Стэнфорда опросили самих сотрудников. 1. Человек из сотни профессий разобрали более 800 задач. Почти половину из них люди готовы автоматизировать. Но есть жёсткая граница. решение и сложную коммуникацию машине доверять не хотят. Учёные предложили шкалу взаимодействия человека и искусственного интеллекта от полной автоматизации до полного человеческого контроля. Будущее труда в правильном балансе. Искусственный интеллект забирает у нас лишнюю работу. На человеке остаётся смысл, стратегия, творчество и ответственность.
Итак, наступил 2026 год. Главное, нас ждёт масштабное развитие и внедрения тех технологий, о которых мы только что проговорили. Компания будущего - это не одна большая модель. Это набор небольших мультимодальных интеллектов, встроенных прямо в бизнес-процессы. Интеллект учится на цепочках принятия решений. Как думают менеджеры, аналитики и инженеры? Именно там и возникает реальная ценность.
Теперь для обучения искусственного интеллекта не нужны гигантские дата-центры. Децентрализованное обучение делает интеллект доступным каждому. Одного текста уже недостаточно. Мир мультимодален. Искусственный интеллект должен видеть, слышать, действовать и понимать последствия своих решений. И помним, что в конкретных задачах малые модели работают не хуже больших, даже обученные на синтетических данных.
Суперагент - это новая операционная система бизнеса. Он не решает задачи сам, он управляет другими агентами. Он ставит цели, распределяет роли, следит за выполнением и корректирует процесс. Задачи проходят через динамические пайплайны, собираемые на лету под контекст и ограничения. Система учится на данных всей компании. Каждое действие усиливает общий корпоративный интеллект. Тысячи инструментов и сервисов становятся частью единого цифрового организма.
Мультиагентные системы обретают тела и выходят в реальный мир в виде роботов, дронов и других устройств. Искусственный интеллект становится операционной системой для любых роботов. Теперь достаточно задать цель, а планировании исполнения берут на себя агенты, обучаясь в реальном мире. Ключевой ресурс сегодня данные от первого лица. Именно так искусственный интеллект учится через опыт, прямо как человек.
Вайп-кодинг и агентная разработка существуют вместе. Аналитик, тестировщик и разработчик - это разные агенты и мультиагентной системы. Сначала пишутся требования, потом тесты и только затем код. Репозиторий становится рабочей памятью системы, а среда разработки общей для людей и агентов. Человек - архитектор намерений, а система сама генерирует, проверяет и исполняет код.
Искусственный интеллект уже стал младшим научным сотрудником. Исследовательский цикл теперь делится между отдельными агентами. Размер модели больше не главное. Важнее среда, данные и переиспользование знаний. Искусственный интеллект начинает предлагать неочевидные гипотезы, а каждый шаг логируется и воспроизводится. Цикл научных исследований ускоряется на порядке. Это ещё не суперинтелект, но уверенный шаг к нему.
Мы уже перешли к проектированию когнитивных систем и инженерингу контекста. Путь к общему искусственному интеллекту лежит не через одну гигантскую модель, а через продуманную систему из среды, памяти, целей, ограничений и обратной связи. Когда интеллект выходит за пределы прямого контроля, важнее всего становится управление контекстом. Размер модели теряет значимость, главное - данные, их интерпретация и цели. Так люди перестают быть простыми исполнителями и становятся менеджерами и агентов. Из-за этого экономика и рынок труда меняются быстро и необратимо.
Если видео было полезным, ставьте лайк, чтобы оно рекомендовалось другим. Не забывайте подписаться на YouTube и Telegram. В Телеграме я делюсь инсайтами по внедрению искусственного интеллекта в бизнес, запуску и стартапов и, простыми словами объясняю, как работают все эти AI чудеса. Стройте когнитивные системы, превращайте компании в корпоративный интеллект, который меняет экономику. Счастливо и увидимся в следующих видео.