Transcription
Итак, этим утром, я уверен, многие из вас видели, как Anthropic выпустила Claude Opus 4.7, которая является самой мощной моделью Opus на данный момент. Ходили слухи, что она выйдет на этой или, возможно, на следующей неделе. И на самом деле прошло некоторое время с тех пор, как мы получили Opus 4.6. Так что ее очень ждали. Поскольку это новая модель Opus, теоретически она должна быть самой мощной и высокопроизводительной моделью, доступной широкой публике. Но мы собираемся проверить это сами. В этом видео я просто подробно расскажу, о чем они говорили здесь, и предоставлю вам все бенчмарки, все улучшения по сравнению с предыдущей моделью Opus, и как бы разберу, что делает эту модель уникальной, а затем мы перейдем к выполнению пары задач и посмотрим, насколько хорошо она с ними справится. Итак, давайте начнем. Итак, это будет мой первый взгляд на Claude Opus 4.7, только что выпущенную сегодня. Я надеюсь, что это будет большое улучшение. Честно говоря, последние пару дней я был очень расстроен, пытаясь использовать Opus 4.6 в Claude Code. Просто она совершала много очень глупых ошибок, и вы не можете оставлять контекстное окно открытым слишком долго, потому что оно может стать очень глупым, если у вас просто долгий разговор. Вам нужно держать контекстные окна действительно короткими. Так что я надеюсь, что это улучшение на самом деле довольно существенное, чтобы я мог продолжать использовать Opus. Первым делом, и это цифра, которую все хотят увидеть первой, — это бенчмарки. Они выпустили их много, но мы рассмотрим четыре из них здесь. Cursor bench здесь — это бенчмарк кодирования, запущенный Cursor. И Opus 4.7 набрала 70%. Это выше, чем 58% у Opus 4.6. Довольно значительное увеличение. Visual Acuity от Expo. И это тестирует способность модели видеть и интерпретировать скриншоты чрезвычайно точно. Вы можете видеть, что Opus совершила огромный скачок здесь с 54,5% в Opus 4.6 до 98,5%. Это довольно значительное, почти удвоенное улучшение. И в своем введении они действительно подчеркнули улучшенное зрение, особенно с информационно насыщенными скриншотами или изображениями. Так что мы проверим это позже сами. Finance agent eval, я думаю, это было довольно интересно. Это измеряет, насколько хорошо модель выполняет финансовые задачи автономно. Такие вещи, как интерпретация отчетов, выполнение расчетов по документам, принятие решений. Opus 4.7 набрала 0,813 против 0,767 у Opus. Так что это значительный шаг вперед в этом бенчмарке. Наконец, у нас есть Rakuten uh SWE bench. И это бенчмарк, который использует реальные производственные ошибки из их кодовой базы. Так что это не теоретические или игрушечные проблемы, не подобранные тестовые случаи. Это реальные ошибки, с которыми реальным инженерам пришлось иметь дело. И Opus 4.7 решила в три раза больше этих задач, чем Opus 4.6. Так что это тоже довольно большой скачок. Так что большое улучшение здесь заключается в том, что кодирование не просто лучше, оно другое. И это означает, что Opus не просто набрала больше баллов в бенчмарках. Она смогла решить задачи, которые были просто недоступны для предыдущей модели. Это довольно значительный скачок в улучшении. Она показала 13% улучшение в решении задач в этом бенчмарке. Итак, Opus в основном известна как кодирующий агент. Итак, Opus в основном известна как кодирующая модель. Так что, видя это большое улучшение, я надеюсь. И, вероятно, именно здесь вы будете видеть самые большие улучшения изо дня в день. Другое большое улучшение, как я уже сказал, было зрение, которое совершило скачок поколений. Я дал вам бенчмарк раньше, но это было действительно о возможности видеть в три раза больше пикселей, чем любая предыдущая модель Claude. И это очень важно, потому что многие изображения, которые вы действительно хотите анализировать с помощью AI-дашбордов, скриншоты плотного кода, отсканированные документы, медицинские изображения, требуют детализации. Низкое разрешение означает, что модель щурится. Более высокое разрешение, как это, означает, что она действительно может прочитать то, что там есть. Так что мне интересно протестировать это немного. И кратко, они ввели новый уровень X high effort, находящийся между high и max, чтобы дать разработчикам точный контроль над компромиссом между глубиной рассуждений и задержкой. Так что имейте это в виду, когда будете пытаться сопоставить уровень рассуждений с фактической задачей, которую вы ей ставите. Ценообразование, кстати, не изменилось с Opus 4.6. Так что вы просто получаете бесплатное обновление с Opus 4.6, если вы используете API и платите за токен. И, наконец, она значительно лучше следует инструкциям. И я думаю, это тоже важно. Любой, кто использовал Opus для каких-либо значительных проектов, вероятно, сталкивался с тем, что вы говорите Claude сделать одно, а она просто уходит и делает что-то другое. Так что здесь говорится, что она может лучше следовать вашим инструкциям. Так что, если это сработает, это довольно хорошее улучшение, потому что я был разочарован этим. Буквально вчера я сказал ей попробовать реализовать этот MCP-сервер в проекте, над которым я работал. Она этого не сделала. Она попыталась сделать что-то совершенно другое. Я указал ей на ее ошибку. Она сказала: "О, извините. Вы правы. Я не следовала вашим инструкциям." А затем продолжила делать что-то совершенно другое вместо того, что я просил ее сделать изначально. Так что, надеюсь, у этой не будет такой проблемы. Еще пара интересных функций, которые, как мне показалось, были интересными. Ultra view, это новая команда / slash, которая запускает выделенную сессию обзора, отмечая ошибки и проблемы дизайна. Мне это действительно интересно. Мы протестируем это сразу после того, как появится новый токенизатор, это интересно. Так что тот же входной текст теперь соответствует 1,35 раза большему количеству токенов. Этот новый токенизатор как бы подразумевает, что это была полностью новая обученная модель, а не просто переобученная с Opus 4.6. И это также может привести к лучшему пониманию, потому что вы разбиваете текст на большее количество токенов, но это также может привести к большим затратам на токены. Так что будьте осторожны с этим, когда работаете с этой новой моделью. У них также улучшенная память и лучшая устойчивость к инъекциям промптов. Я надеюсь, что память действительно улучшена. Они ввели систему памяти, но она все еще кажется слабой. Так что вот и все. Это просто мое небольшое введение, разбирающее статью, которую они опубликовали сегодня, где они представили ее, разбирая бенчмарки. Но бенчмарки — это одно. Любой может иметь отличные бенчмарки. Давайте посмотрим, как это работает. Итак, первое, что я хочу протестировать, — это возможности зрения, потому что я думаю, что это было интересно. Вы видите здесь, я в Claude Code um Opus 4.7 только что вышла. Хорошо. Для теста зрения у меня была идея дать ей некоторые диаграммы и электронные таблицы, как эта, с большим количеством текста и чисел. Но она справилась довольно плохо. Она не могла очень хорошо читать такой текст. Она не могла точно читать имена. Она не могла точно читать числа. И проблема в том, что этот скриншот имеет довольно низкое разрешение, а числа довольно мелкие. Я пробовал несколько разных экспериментов, используя обычные скриншоты, и она не очень хорошо анализировала скриншоты с довольно низким разрешением. Так что это было разочаровывающе. Но это не совсем то, что утверждает Opus 4.7. Реальное утверждение заключается в том, что она лучше справляется с изображениями с высоким разрешением и высоким мегапиксельным разрешением. Так что, на самом деле, лучшим тестом для этого являются не скриншоты на моем экране. Это как бумага, подобная этой, с множеством мелких диаграмм. В ней больше пикселей на изображение, чем я получал. Так что я дам ей это вместо этого как лучший тест. Но это то, о чем вам следует помнить. Она все еще довольно значительно испытывает трудности со скриншотами, которые вы делаете сами, которые могут быть с низким разрешением. Я собираюсь спросить ее об этих диаграммах прямо здесь. Um, это статья об обучении моделей с использованием рекуррентного подхода, и она, очевидно, довольно легко прочитала статью, но вопрос в изображении. Она смогла довольно хорошо его прочитать. Um, кривые точности для рекуррентных моделей глубины. Она смогла увидеть, что на рисунке есть три подлинии с линейной диаграммой, и она смогла довольно легко увидеть эти числа. Вы можете видеть здесь, она точно описывает, что происходит в каждом из этих um, с довольно хорошей детализацией. Та же метрика для среднего и правого. Итак, у нас есть даже эти числа R = 2 GRS около 7K эпох, и это точно около 7K, и у нее есть свой вывод. На этой странице было еще одно изображение, показывающее рекуррентный метод по сравнению с обычным методом обучения, и она смогла прочитать их и точно сказать, что происходит в каждом из них. Она довольно хорошо читает тепловую карту здесь. Так что это улучшенное зрение действительно хорошо только в очень специфических случаях. Это не так захватывающе, как когда я впервые увидел это. Я думал, что у нее будет идеальное зрение для всего. Но это довольно полезно для таких вещей, как PDF-файлы с плотными изображениями, как это. Она довольно хорошо видит это и довольно хорошо анализирует. Так что это определенно полезно. Довольно иронично, что она способна проводить такой глубокий анализ и чтение и видеть все на изображениях, которые намного сложнее, чем моя простая um, электронная таблица, моя старая коллекция NFT. Это она не может обработать вообще. Но продвинутые обучающие данные — у нее нет проблем. Так что имейте это в виду, если вы тестируете функции зрения, вам все равно нужны изображения с очень высоким разрешением, чтобы они работали. Она просто гораздо лучше справляется с этими изображениями с высоким разрешением. Следующая задача будет своего рода um, обзором кода. Я хочу попробовать использовать эту команду / ultra review, которая запустит выделенную сессию обзора. Так что это был эксперимент, который я проводил вчера. По сути, используя подход автоматического исследования для написания пользовательского ядра Triton для моего конкретного GPU. Um, следите за этим, на следующей неделе должно быть эпизод об этом. Но это был проект, с которым у меня было много трудностей. Множество ошибок, и Opus 4.6 действительно испытывала с этим трудности. Мы в итоге получили довольно приличные результаты. Но я хочу посмотреть, сможет ли этот ultra review найти ошибки. Вы видите, он просматривает мою текущую ветку. Вы также можете просмотреть определенный номер PR, чтобы получить и просмотреть его. Это довольно хорошо. Хорошо. Так что, я думаю, это должно быть в Claude Code на веб-сайте, я полагаю. Так что, если вы зайдете в свой Claude Code на десктопе, claude.ai, AI. Вы увидите это здесь. Вы можете видеть изменения, ultra view того, что я пытался сделать. Um, мы пытались сделать это. Первая попытка на самом деле провалилась при первом обзоре. Она нашла пару ошибок, над которыми пыталась работать. Так что я перезапустил ее. Вы видите setup binding. Это будет сканирование. Это моя вторая попытка. Хорошо, она снова сбойнула. Так что разочаровывающие результаты от этой функции. Возможно, это просто потому, что она была выпущена. Есть какая-то проблема с ней, или есть какая-то проблема с моей кодовой базой, которая делает ее несовместимой, но um, это немного разочаровывающий результат. Итак, последнее задание, которое я дам ей, — это кодовое задание, настоящее кодовое задание. Это спецификация скрипта, которую я имею для нового проекта, над которым я работаю, и это, по сути, инструмент визуализации, который демонстрирует, как порядок транзакций в пуле DLM на Solana влияет на конечную цену. Так что это просто инструмент визуализации. Это не так сложно. Это должно быть довольно легко. Проблема на самом деле в поиске данных и поиске правильного способа их применения. Хорошо. Так что она смогла пройти через это довольно быстро. Прошло всего, я не знаю, 20 минут с тех пор, как я начал это. Мне не пришлось делать никакого промптинга в середине, и она смогла на основе этого скрипта спецификации построить это. Итак, давайте попробуем посмотреть, сможем ли мы это увидеть. Она запустит dev-сервер здесь. И вот оно. На самом деле выглядит довольно здорово. Um, это Да, это именно то, о чем я говорил. Ключевая концепция здесь была симулятор, который симулировал оптимальный порядок транзакций по сравнению с фактическим, и это дало нам демо здесь. Um, синяя линия — это то, что произошло на самом деле. Зеленая линия — это лучший сценарий, а худший сценарий — красный. И если мы спустимся, у нас будет все это начальное распределение корзин, которое связано с концентрированной ликвидностью. Вы видите все транзакции. Так что это было практически сделано с одного раза после того, как я дал ей этот скрипт спецификации. Um, довольно впечатляюще на самом деле. Так что, хотя у меня были проблемы um, со зрением, пришлось дать ей определенный тип изображения, чтобы улучшения зрения действительно хорошо работали. И, к сожалению, ultra review просто не сработал. Но это может быть временная проблема. Нам придется попробовать это еще раз позже. Само основное кодирование, способность читать скрипт спецификации и создавать это за 20 минут или около того, um, было на самом деле довольно впечатляющим. Это проект, как я уже сказал, над которым я пытался работать с Opus 4.6 вчера, и это была настоящая борьба. Она постоянно уходила в разные стороны. Так что я думаю, что этот um, слайд, этот, на самом деле, вероятно, точен. Я думаю, что она действительно следует инструкциям значительно лучше. Вчера, когда я дал ей тот же скрипт спецификации, она, как я уже сказал, пыталась делать разные вещи, добавляя функции, которых даже не было в скрипте спецификации, и просто делала глупые способы попытаться реализовать это. Эта смогла сделать это очень быстро и оставаться сосредоточенной. Так как Claude Code и Opus в основном предназначены для кодирования в области разработки программного обеспечения, um, успокаивает то, что она смогла произвести это довольно легко, потому что это был не самый простой um, проект, который я ей дал. Хорошо, на этом мы закончим этот эпизод. Просто очень быстрый первый взгляд на Opus 4.7, которая только что вышла. Мой честный первый взгляд на нее. Вы видите, я оставил все проблемы, которые у меня были с ней, просто тестируя ее, но также и некоторые хорошие результаты, которые мы получили от нее. Так что в ближайшие um, недели вы сможете увидеть, как я на самом деле работаю над этим, потому что я буду делать это с моими различными экспериментами и моими различными проектами. Я обычно буду использовать Opus 4.7 для этого. Я могу um, протестировать GBT 54. Также ходят слухи, что новая модель GBT, Frontier model, выйдет скоро. Так что, если она выйдет, я обязательно протестирую ее. Но это был просто первый взгляд на Opus 4.7. Так что, если вам понравилось это видео, пожалуйста, поставьте лайк, оставьте комментарий. Расскажите мне о своем опыте работы с ней до сих пор. Пожалуйста, подпишитесь на канал, и я увижу вас в следующем.