Transcription
Когда я использую Copilot, я просто хочу, чтобы он работал для меня. Я не хочу тратить время на попытки выполнить задачи с четырьмя разными моделями и сравнивать все это. Я хочу иметь возможность доверять, что мы можем [музыка] сделать это. Добро пожаловать на GitHub Checkout, новенький. Да, большое спасибо, что пригласили. Я так рада, что вы здесь, потому что, как и многие из нас, мы экспериментировали, используя GitHub Copilot и назначая задачи, переключаясь с помощью этого селектора моделей. И часто я не знаю, какую модель добавить. И теперь, благодаря вам и работе вашей команды, у нас есть режим автоматического выбора. Ландшафт моделей меняется так быстро, и это здорово для развития ИИ в нашей отрасли, но это добавляет дополнительный уровень сложности. Итак, вопросы о том, какую модель вы используете, для каких сценариев вы их используете и как вы на самом деле масштабируете это, когда может появиться новая версия модели или новая модель, которая выйдет на следующий день. Мы хотим, чтобы это могло абстрагировать эту сложность от вас и фактически автоматически предоставлять вам лучшую доступную модель для вашей задачи в реальном времени, чтобы разработчики могли сосредоточиться на том, что они хотят делать. И поэтому мы делаем это через автоматический выбор моделей Copilot или авто для краткости. Самое лучшее в авто — это то, что он чрезвычайно прост. Нет никакой конфигурации, никаких переключателей политик, которые вам нужно было бы делать. Все, что вам нужно сделать, это зайти в ваш любимый IDE, GitHub Copilot CLI или агент Copilot cloud и зайти в ваш выборщик моделей. Итак, для сегодняшней демонстрации я покажу вам два сценария. У меня уже включен авто, но чтобы показать вам, как это работает, все, что вам нужно сделать, это пройти через модель, и вы заметите авто. Итак, первое, что я вижу здесь, это 10% скидка, и она фактически применяется ко всем платным пользователям, так что это 10% скидка на любые модели, используемые через авто. И я хочу подчеркнуть, что мы делаем это не просто потому, что считаем, что добавляем самые дешевые или худшие модели. На самом деле все наоборот. Мы очень целенаправленно подходим к выбору моделей, которые мы включаем в каждый план и для каждого сценария, в котором вы фактически его используете. Итак, я сделаю два разных сценария. Первый — это простая задача. Итак, я просто использую что-то простое, например, конвертирую 32° по Фаренгейту в Цельсий. И довольно быстро мы видим, что Auto использует Claude Haiku 4.5. Давайте посмотрим, что произойдет, если мы переключимся на что-то, что требует более сложной модели рассуждений. Итак, я попробую эту задачу в этой версии Auto, которая у меня есть в VS Code. Итак, у меня уже открыто мое приложение для растений. Я просто скажу: "рефакторинг моей кодовой базы приложения". И пока это работает, я хочу уделить время, чтобы поговорить о том, почему мне пришлось очистить сеанс в CLI и почему мне пришлось бы делать это для VS Code, чтобы показать здесь разные используемые модели. И это потому, что мы фактически вызываем интеллектуальную версию Auto или намерение задачи с Auto только несколько раз. Первый раз в начале разговора, а затем второй раз после сжатия, когда вы достигаете определенного процента вашего контекстного окна. И поэтому естественное побуждение: почему вы не смотрите на запрос каждый раз, когда я отправляю запрос? Итак, каждый пользовательский запрос, мы бы классифицировали его. Но на практике, когда мы фактически сделали это, мы заметили, что это фактически добавляет больше затрат пользователю. Итак, по сути, вы просто уничтожаете кеш, когда переключаете модели в середине сеанса, и это усугубляется, когда вы переключаете модели между поставщиками моделей. И поэтому одним из ключевых преимуществ Auto является то, что мы передаем вам эффективность токенов и более качественный опыт. Итак, нам нужно найти баланс, поэтому мы фактически маршрутизируем меньше, чем вы могли бы ожидать. Итак, для этого сценария я не позволю ему идти до конца, потому что это может занять некоторое время. Я просто остановлю его здесь. И мы замечаем, что у нас фактически есть Claude Sonnet 4.6, и это было бы то, что я ожидаю для примера с более сложными рассуждениями, такого как этот. Он автоматически понял задачу, знал, что ему нужен более высокий уровень рассуждений, и затем переключил модель. Да, в этом сценарии я на самом деле ни о чем не думаю, кроме как о том, чтобы выполнить задачу рефакторинга. Когда я использую Copilot, я просто хочу, чтобы он работал для меня. Я не хочу тратить время на попытки выполнить задачу с четырьмя разными моделями и сравнивать все это. Я хочу иметь возможность доверять, что мы можем сделать это. И независимо от того, использую ли я CLI или VS Code, все, что мне нужно сделать, это просто выбрать авто. Вот и все. Просто выберите авто в меню, и тогда Copilot будет думать за меня, выяснит, какую модель мне следует выбрать. Точно, и именно так это работает и для чат-агента Copilot. Как? Я хотел бы понять, как команда это построила, потому что это потрясающе. Я хотел бы снять эту часть мышления, и честно говоря, часто я думаю, что если вы не занимаетесь глубокими исследованиями и не проводите собственные тесты и бенчмарки, не пишете собственные электронные письма, мы на самом деле не знаем. Первая проблема, которую нам пришлось решить, заключалась в том, как на самом деле выбрать лучшую доступную модель в любой момент времени. И что мы сделали здесь, это создали движок выбора моделей, который смотрит на различные ключевые метрики использования, такие как задержка или, э-э, емкость, емкость или ошибки. Это визуализация того, как выглядит динамический выбор моделей, и я нахожу это проще, чтобы помочь нам понять, как это работает, учитывая, что некоторые из этих улучшений довольно скрыты для авто. Итак, я упомянул, как мы находим лучшую доступную модель? Что мы делаем, так это переранжируем эти модели в реальном времени с учетом емкости, задержки и ошибок. Вы всегда получите этот последовательный и надежный опыт с любой моделью, которая фактически имеет самый высокий, э-э, балл на основе некоторых из этих факторов. Это текущая версия авто, но то, о чем я рад говорить, это более интеллектуальная маршрутизация на основе задач, которую мы имеем. И для этого я покажу вам еще один из этих макетов. Э-э, мы фактически разработали это, сопоставляя разные модели. Итак, у нас были модели с более высокими рассуждениями против моделей с более низкими рассуждениями, и поэтому у нас была куча различных бенчмарков или тестов, чтобы увидеть, какие из них решат какую задачу. Мы увидели три разных сценария. Первый заключается в том, что некоторые задачи могут быть решены обоими, некоторые решаются только более крупной моделью, а некоторые — только меньшей моделью. И этот перехлест — это действительно та, э-э, возможность, которую мы имеем, чтобы действительно оказать влияние, чтобы поддерживать уровень качества или сделать его еще лучше со всеми этими эффективностями токенов. Итак, маршрутизатор теперь фактически смотрит на природу и сложность вашей задачи, и он построен для того, чтобы смотреть на несколько различных измерений, таких как потребности в рассуждениях, потребности в оркестровке инструментов, потребности в отладке, подобные вещи, чтобы дать нам окончательный ранжированный список того, какие модели будут лучшими для вашей задачи. А затем вы, когда вы объединяете динамический выбор моделей поверх этого, вы не только получаете модель, которая лучше всего подходит для вашей задачи, но и модель, которая наиболее надежно обслуживается для вас. Итак, именно сила в сочетании всех этих систем фактически делает Auto привлекательной функцией. Это не только для экономии на использовании и для сохранения ваших более сложных задач для моделей, которые фактически требуют, э-э, более сложных задач, но это фактически делает некоторую оптимизацию, которая фактически сделает ее лучше. Поскольку некоторые задачи решались только меньшими моделями, одним из выводов, которые мы сделали, когда оценивали все эти модели вместе, было то, что система, которая последовательно маршрутизирует к лучшей модели для вашей задачи, не только экономит на затратах, но и фактически превосходит использование одной модели в одиночку. И поэтому, конечно, вы можете использовать одну модель, такую как Opus, снова и снова, и это будет здорово, но вы теряете некоторую эффективность или оптимизацию затрат, которую вы можете получить от использования меньшей модели, которая может сделать то же самое. Как это будет развиваться, потому что появится много новых моделей, и я полагаю, когда они будут добавлены, они уже будут частью этого интеллектуального, э-э, выбора моделей? Цель определенно состоит в том, чтобы сделать все новейшие и лучшие модели доступными для вас через Auto. Я думаю, что нам предстоит проделать некоторую работу, чтобы улучшить контроль над этим, особенно для более дорогих моделей, таких как Opuses мира и тому подобное. Но с точки зрения бенчмаркинга и оценки, э-э, наша команда, не только моя команда Auto, но и команда моделей проводит множество строгих оценок, прежде чем мы сделаем любую модель доступной. И это комбинация как офлайн-оценки на некоторых бенчмарках, которые вам могут быть известны, таких как SweepBench или некоторые другие, которые у нас есть внутри, так и онлайн-экспериментов. И мы активно инвестируем в эту область, особенно для чего-то вроде Auto, потому что, знаете ли, трудно оценить, каким будет влияние или использование моделей, особенно в этой динамичной среде. Мы не знаем, какая у вас задача, какие политики у вас действуют и каковы метрики в реальном времени. И единственный способ сделать это — через контролируемые онлайн-эксперименты. Мы понимаем, как происходит интеллектуальная маршрутизация и как происходит выбор моделей, какие модели включены в выбор, которые мы можем использовать. Мы выбираем модели на основе качества и того, в каком сценарии вы фактически их используете. Итак, в Auto сегодня у вас есть доступ ко многим различным моделям от поставщиков моделей, которые у нас есть на GitHub. Это своего рода наш особый соус с разнообразием моделей в нашей экосистеме. И вы заметите, что они различаются в зависимости от сценариев. Все эти модели будут меняться и развиваться по мере появления новых моделей, по мере улучшения маршрутизатора и по мере проведения большего количества оценок, чтобы увидеть, что вы фактически получаете от использования этих моделей в каждом из этих сценариев. Замечательно. Итак, если люди видели автоматический выбор и были немного осторожны с его выбором, думая, что он, возможно, просто перейдет к модели, которая не будет их выбором, на самом деле многое было сделано за кулисами, чтобы убедиться, что этот интеллект применяется, поскольку Copilot выбирает лучшую модель с точки зрения стоимости и для выполнения работы с первого раза. Так что попробуйте. Это потрясающе. Я читаю все отзывы. Мы всегда в социальных сетях. Мы на форумах GitHub. Так что, если люди пробовали это раньше и немного колеблются, вернитесь и дайте другие предложения или идеи для настроек, пожалуйста, не стесняйтесь размещать где-нибудь. Я уверена, что кто-то из членов нашей команды увидит это, и мы постараемся включить это в дорожную карту. Что-нибудь еще на подходе, чем вы можете поделиться? Интеллектуальный автоматический выбор появится в VS Code в течение следующих нескольких недель, что будет огромным. А затем мы очень скоро последуем всем остальным нашим идеям в портфолио, CLI и агенте кода. Так что следите за нашим журналом изменений, чтобы узнать о последних объявлениях. Но помимо этого, мы начинаем думать о настройках и кастомизации. Итак, у вас может быть сценарий, когда вы хотите использовать определенные модели для небольших задач или определенные модели для более крупных задач. Мы хотим иметь возможность предоставить вам этот уровень контроля, чтобы вы также могли учиться по ходу дела, как все эти модели работают вместе для конкретных сценариев. А затем другое, что я упомяну, это то, что вся эта маршрутизация происходит на основном агенте. Так что, если вы получите Haiku, вы получите Haiku на протяжении всего сеанса вашего агента кода. Что мы хотим работать в будущем, это дальнейшая доработка и обучение наших моделей, чтобы они фактически смотрели на под-агентов. Потому что я думаю, что было бы так здорово, если бы у вас был агент триажа, который использует модель с более низкими рассуждениями, если у вас был агент спецификаций, который использует модель с немного более высокими рассуждениями, а затем агент выполнения, который фактически способен переключаться между всеми доступными моделями, чтобы получить вам нужный ответ, а также эффективность, которую вы можете получить. Это потрясающе. Так много всего, чего стоит ожидать от этой новой функции, и, очевидно, было много скрытой работы. Э-э, я с нетерпением жду, как она будет развиваться. Большое спасибо, что показали нам ее. Да, спасибо. И это был ваш первый взгляд на новую функцию автоматического выбора моделей GitHub Copilot. Более интеллектуальный, чем когда-либо, делающий то, что выходит за рамки экономии вашего использования. Так что спасибо команде за то, что показали нам ее. И если вы пробовали авто раньше, попробуйте еще раз. Он значительно улучшился. Пожалуйста, дайте нам знать, что вы думаете об этой новой функции в комментариях. Я отвечаю на каждый из них. И не забудьте поставить лайк и подписаться, чтобы никогда не пропустить другой совет для разработчиков или обновление функции. Отправьте эти изменения в main, и я увидимся на следующем релизе.