📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

China’s New AI Is 6X More Efficient Than Claude

AI Revolution16:01

Transcription

Хорошо. Итак, после всей этой ситуации с Fable 5, Китай ответил весьма прямолинейно. Две модели кодирования с открытым весом, Kimi K 2.7 code и GLM 5.2, теперь нацелились на GPT 5.5 и Claude с гораздо более низкими ценами, серьезной производительностью в кодировании и, в некоторых случаях, реальными победами в бенчмарках. И в то же время Cursor может быть приобретен SpaceX за 60 миллиардов долларов, в то время как OpenAI готовит GPT-BD1, новую голосовую модель, которая может сделать общение с ChatGPT намного более естественным.

Итак, начнем с Kimi K 2.7 code. Moonshot AI выпустила K 2.7 code как модель с открытым весом, разработанную специально для кодирующих агентов. Так что это не совсем та модель, которую вы используете для любого случайного вопроса. Moonshot по-прежнему рекомендует K 2.6 для общих задач, K 2.7 code более сфокусирована. Она создана для рабочих процессов, где ИИ должен перемещаться по кодовой базе, понимать, что сломано, редактировать файлы, тестировать идеи, помнить, что уже не сработало, и продолжать работу на протяжении нескольких шагов.

Под капотом это огромная модель. Kimi K 2.7 code имеет 1 триллион параметров, но поскольку она использует дизайн "смесь экспертов", одновременно активно только 32 миллиарда. Внутри 384 эксперта, и восемь выбираются на токен, что является одной из причин, почему такую большую модель все еще можно практично запускать. Она также поддерживает контекстное окно в 256 000 токенов и может обрабатывать текст, изображения, [музыка] и видео. Такой размер контекста уже не шокирует, но его все еще достаточно для многих кодирующих рабочих процессов. Она также использует визуальный энкодер Moonshot MoonViT с 400 миллионами параметров. И поскольку архитектура такая же, как у K 2.5 и K 2.6, существующие настройки развертывания могут быть использованы повторно с большей легкостью.

Более важное улучшение — это эффективность. Moonshot утверждает, что K2.7 code использует примерно на 30% меньше "думающих" токенов, чем K2.6. Это важно, потому что кодирующие агенты могут тратить много токенов на планирование, перепроверку и чрезмерные размышления, прежде чем они действительно сделают что-то [музыка] полезное. Меньшее количество "думающих" токенов обычно означает более низкую стоимость, меньшую задержку и модель, которая ощущается менее расточительной в реальных рабочих процессах разработчиков. Moonshot также добавила режим принудительного мышления [музыка] и режим сохранения мышления, что помогает модели сохранять свое рассуждение на протяжении нескольких ходов. Для кодирующих агентов это полезно, потому что задача обычно не заканчивается после одного ответа. >> [музыка] >> Модель должна помнить, что она изменила, что сломалось и что ей следует попробовать дальше.

На бенчмарках K2.7 code явно лучше, чем K2.6. На Kimiko Bench V2 она поднялась с 50,9 до 62,0. На Program Bench она выросла с 48,3 до 53,6. [музыка] На тестах, проверяющих кодирование на разных языках, таких как Python, Rust и Go, она поднялась с 26,7 до 35,1. Ее результаты как агента также улучшились, достигнув 76,0 на MCP Atlas и 81,1 на MCP Mark Verified. Результат MCP Mark важен, потому что он тестирует [музыка] агентов в реальных программных средах, таких как GitHub, Notion, файловые системы, базы данных PostgreSQL и автоматизация браузера через Playwright. Так что это ближе к тому, что люди на самом деле хотят от кодирующих агентов, [музыка] а не просто чистая бенчмарк-головоломка.

Теперь Kimiko не везде превосходит лучшие закрытые модели. GPT-5.5 по-прежнему явно выигрывает в нескольких тестах кодирования. На Program Bench GPT-5.5 набирает 69,1 балла, в то время как K2.7 code — 53,6. На Kimi Code Bench V2 GPT 5.5 набирает 69,0 балла, в то время как Kimi — 62,0. Program Bench особенно жесток, потому что агент должен воссоздать работу программы, используя только скомпилированный бинарный файл и документацию без исходного кода, декомпиляции, [музыка] или доступа в Интернет.

Тем не менее, есть один важный исключение. На MCP Mark Verified Kimi K 2.7 Code фактически превосходит Claude Opus 4.8, набрав 81,1 против 76,4. [музыка] GPT 5.5 по-прежнему далеко впереди с 92,9, но этот результат показывает, что Kimi — это не просто дешевая модель, [музыка] притворяющаяся конкурентом. В некоторых средах кодирования в стиле агентов она уже действительно сильна.

А затем цена делает все это еще интереснее. Kimi K 2.7 Code стоит 95 центов за миллион входных токенов и 4 доллара за миллион выходных токенов. Кэшированный ввод падает еще ниже до 19 центов за миллион токенов. Теперь сравните это с GPT 5.5 за 5 долларов за ввод и 30 долларов за вывод, или Claude Opus 4.8 за 5 долларов за ввод и 25 долларов за вывод. Таким образом, только по выходным токенам Claude Opus 4.8 более чем в шесть раз дороже, чем Kimi K 2.7 Code. А для кодирующих агентов это имеет большое значение, потому что именно на выводе эти системы сжигают деньги.

Лицензия также довольно открытая. K 2.7 Code использует модифицированную лицензию MIT, [музыка] поэтому люди могут использовать ее, изменять и распространять в коммерческих целях. Но крупные продукты с более чем 100 [музыка] миллионами активных пользователей в месяц или более чем 20 долларами ежемесячного дохода должны четко указывать Kimi K 2.7 Code в интерфейсе. Модель доступна через API Kimi, Kimi Code CLI, Hugging Face VLLM и SG Lang. Существует нативная INT4 квантизация для более дешевого развертывания, и Moonshot говорит, что скоро появится режим шестикратного ускорения.

А затем Z.ai представила GLM 5.2. Z.ai, ранее Zhipu AI, выпустила GLM 5.2 16 июня как модель с открытым весом на 753 миллиарда параметров, разработанную для кодирующих агентов с дальним горизонтом. Она предназначена для ИИ-систем, которые могут работать над более крупными инженерными задачами, использовать инструменты, понимать большие проекты и продолжать работу в течение более длительных рабочих процессов. Она доступна на Hugging Face, через API Z.ai и в более чем 20 сторонних средах кодирования.

Модель поставляется с контекстным окном в 1 миллион токенов, но важная часть — это не только размер. Это делает этот длинный контекст пригодным для использования. [музыка] GLM 5.2 представляет index share, который повторно использует один и тот же индексатор для каждых четырех слоев разреженного внимания. [музыка] При полной длине контекста в 1 миллион токенов Z.ai утверждает, что это снижает количество вычислений на токен [музыка] в 2,9 раза. Проще говоря, модель может обрабатывать очень длинный контекст >> [музыка] >> без такого сильного взлета стоимости. Она также имеет улучшенный слой предсказания нескольких токенов для спекулятивного декодирования, который может увеличить принятую длину токенов [музыка] до 20% во время инференса. По сути, это помогает модели генерировать быстрее.

И Z.ai добавила выбираемые режимы мышления, так что пользователи могут выбирать >> [музыка] >> максимальное усилие для самого сильного рассуждения или высокое усилие для лучшего баланса между качеством, скоростью и стоимостью токенов. В максимальном режиме GLM 5.2 может использовать почти 85 000 выходных токенов на одну задачу. Но в высоком режиме она теряет всего несколько баллов в бенчмарках, примерно вдвое сокращая использование вывода. Для компании, которая целый день запускает кодирующих агентов, это может быть разница между чем-то впечатляющим и чем-то практичным.

Бенчмарки — это то, где GLM 5.2 начинает выглядеть как реальная проблема для закрытых моделей. На SWE-Bench Pro, который тестирует реальные задачи программной инженерии, GLM 5.2 набирает [музыка] 62,1 балла. GPT 5.5 набирает 58,6, а GLM 5.1 — 58,4. Так что это не просто небольшое обновление. Она фактически превосходит GPT 5.5 в этом тесте. На Frontier Swue, который измеряет выполнение задач с дальним горизонтом, GLM 5.2 набирает 74,4%. GPT 5.5 набирает 72,6%, в то время как Claude Opus 4.8 немного впереди с 75,1%. На MCP Atlas она набирает 77,0, опережая GPT 5.5 с 75,3, и немного отставая от Claude Opus 4.8 с 77,8. На Humanity's Last Exam с включенными инструментами она достигает 54,7, опережая GPT 5.5 с 52,2, но все еще отставая от Claude Opus с 57,9.

А затем цена. GLM 5.2 стоит 1,40 доллара за миллион входных токенов и 4,40 доллара за миллион выходных токенов. GPT 5.5 стоит 5 долларов за ввод и 30 долларов за вывод. Таким образом, в качестве грубого общего сравнения, GLM 5.2 стоит 5,80 доллара против GPT 5.5 за 35 долларов. Это делает ее примерно в 1/6 цены, при этом она соответствует или превосходит GPT 5.5 на нескольких серьезных бенчмарках кодирования. Z.ai также предлагает кэшированный ввод по 26 центов за миллион токенов, что важно, когда один и тот же репозиторий, документация и файлы проекта повторно используются во многих запусках агента.

Лицензия может быть столь же важна, как и цена. GLM 5.2 выпущена под неограниченной открытой лицензией MIT. Z.ai называет ее "чисто открытой" без региональных ограничений и техническим доступом без границ. Таким образом, предприятия могут загружать веса, настраивать модель, дообучать ее, запускать локально или развертывать на собственной инфраструктуре. Они не привязаны к одному поставщику API.

И этот момент становится еще более актуальным сейчас из-за того, что произошло с Claude Fable 5. После того, как экспортный контроль администрации Трампа, по сообщениям, запретил иностранным гражданам использовать его, Anthropic [музыка] отключила Fable 5 и Mythos 5 для всех. Таким образом, компаниям теперь приходится думать о очень неприятном вопросе. Что произойдет, если доступ к топовой закрытой модели исчезнет в одночасье? В этом мире GLM 5.2 не просто дешевле, она более контролируема. Компания может разместить ее у себя, избежать географических ограничений, избежать привязки к поставщику и продолжать разработку, даже если политика в отношении американских моделей снова изменится.

Z.ai также запустила план GLM coding для разработческих рабочих процессов, с поддержкой таких инструментов, как Claude Code, Open Claw, Kline, Kilo Code, Crush и Factory. Легкий план начинается с 12,60 доллара в месяц при годовой оплате. Pro — 50,40 доллара, а Max — 112 долларов. Kilo Code подтвердил поддержку с первого дня, а Kline немедленно продвинул ее как крупную модель кодирования с открытым весом.

Таким образом, теперь давление идет с двух сторон. Kimi K 2.7 code чрезвычайно дешева и достаточно сильна для многих задач кодирующих агентов. GLM 5.2 стоит дороже, чем Kimi, но все же намного дешевле, чем GPT 5.5 и Claude Opus 4.8, при этом фактически превосходя GPT 5.5 на нескольких серьезных бенчмарках. И обе модели с открытым весом появляются в то время, когда западные закрытые модели дороги, ограничены и внезапно стали гораздо менее предсказуемыми.

Это подводит нас к другой важной новости в области ИИ-кодирования, Cursor. Согласно отчету, SpaceX приобретает AnySphere, компанию, стоящую за Cursor, >> [музыка] >> в рамках сделки на 60 миллиардов долларов, полностью оплачиваемой акциями. Cursor уже является одной из самых быстрорастущих платформ для ИИ-кодирования в мире, и недавно она достигла годового оборота в 4 миллиарда долларов, увеличившись с 3 миллиардов долларов в апреле. Это абсурдный рост для инструмента кодирования. Джейсон Калаканис, близкий к Илону Маску и один из ведущих подкаста All-In, назвал эту сделку потенциально лучшим приобретением со времен Instagram и YouTube. Это, очевидно, огромное сравнение. Meta купила Instagram за 1 миллиард долларов в 2012 году, а Instagram принес около 32 миллиардов долларов дохода от рекламы в США в 2025 году. [музыка] Google купил YouTube за 1 миллиард 650 миллионов долларов в 2006 году, а YouTube принес более 60 миллиардов долларов дохода в 2025 году от рекламы и подписок.

Cursor еще не там. При годовом обороте в 4 миллиарда долларов ей потребуется вырасти примерно в восемь раз, чтобы достичь уровня дохода Instagram в 32 миллиарда долларов, и примерно в 15 раз, чтобы достичь масштаба YouTube в 60 миллиардов долларов. Но это уже значимо по сравнению с самой SpaceX. SpaceX, по сообщениям, получила доход в 18,7 миллиарда долларов в 2025 году, что означает, что текущий годовой оборот Cursor уже составит около 21% годовых продаж SpaceX.

Калаканис был оптимистичен в отношении этого в течение нескольких месяцев. Еще в апреле он сказал, что сделка SpaceX и Cursor практически неизбежна, и назвал Cursor "машиной для печатания денег". Он также сказал, что Cursor ожидает закончить 2026 год с оборотом в 6 миллиардов долларов. Но настоящая причина, по которой сделка имеет значение, — это вычислительные мощности. Калаканис указал на доступ Илона к массивной инфраструктуре GPU, [музыка] включая то, что он описал как 550 000 GPU в Colossus. Его аргумент заключается в том, что самым большим ограничением Cursor являются вычислительные мощности, и если объединить Cursor со SpaceX, xAI и этой инфраструктурой, это может вывести их на лидирующие позиции в кодировании в течение 12 месяцев.

Это также даст Grok доступ к чрезвычайно ценным рабочим процессам разработчиков, запросам на кодирование, [музыка] решениям по проектированию, поведению при отладке и реальным задачам программного обеспечения. Другими словами, Cursor — это не просто приложение для кодирования, это окно [музыка] в то, как разработчики на самом деле создают программное обеспечение с помощью ИИ. Такие данные чрезвычайно ценны, если вы пытаетесь улучшить [музыка] кодирующих агентов.

И, наконец, OpenAI готовит нечто другое, но все же очень важное, крупное обновление голоса ChatGPT. Модель, по сообщениям, называется GPT-b1, и она указывает на двунаправленную аудиоархитектуру. Идея заключается в том, что голосовой режим ChatGPT должен уметь слушать и говорить одновременно, естественно обрабатывать прерывания и корректировать речь на середине предложения, вместо того чтобы замирать, когда пользователь издает звук. Это большой пробел в текущих голосовых помощниках. Они могут звучать хорошо, но часто не ощущаются как настоящий разговор, потому что смена ролей все еще неуклюжа.

Признаки GPT-b1 появились в веб- и мобильных приложениях, что предполагает скорый запуск для потребителей, хотя окончательное название может еще измениться. Более важный момент заключается в том, что текстовые модели OpenAI далеко продвинулись в поколение GPT-5.5, в то время как голос остался на старом аудиостеке. Таким образом, ChatGPT в письменной форме может ощущаться намного умнее, чем ChatGPT в голосовом режиме, и этот разрыв имеет значение, если OpenAI считает, что речь станет основным способом использования ИИ.

Новая голосовая настройка может позволить пользователям выбирать [музыка] между новым режимом BD latest и текущим продвинутым голосовым режимом, вместо того чтобы принудительно переводить всех в новую систему немедленно. Также похоже, что голос получит уровни интеллекта, аналогичные тексту: высокий, средний и мгновенный. Это позволит пользователям выбирать более глубокое рассуждение, когда оно им нужно, или более быстрые ответы, когда им просто нужно быстрое взаимодействие. Также произошло недавнее изменение пользовательского интерфейса, позволяющее перетаскивать голосовой пузырь к середине экрана, что может быть частью того же редизайна. Время запуска пока неясно, но основа явно закладывается.

Хорошо. Итак, что вы думаете? Это начало реального догона открытых моделей, или мы все еще переоцениваем победы в бенчмарках? Дайте мне знать ниже, подпишитесь для получения дополнительной информации и спасибо за просмотр. Увидимся в следующем выпуске.