📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

GPT-5.4 Mini & Nano: OpenAI's FASTEST AND Most Capable Models Yet!

Universe of AI9:00

Transcription

Open AAI не берет выходных. Сегодня, 17 марта, они выпустили две новые модели, GPT [музыка] 5.4 Mini и GPT 5.4 Nano. И, честно говоря, время выпуска довольно дикое, потому что сама GBT 5.4 была запущена менее 2 недель назад, которая, в свою очередь, вышла всего через пару дней после GPT [музыка] 5.3. В данный момент Open AAI работает так быстро, что кажется, будто появляется новая модель каждый раз, когда вы обновляете свою ленту. Итак, давайте разберемся, что это за две модели, что они могут делать и для кого они предназначены.

Итак, первый вопрос: зачем нужна меньшая модель, когда у вас уже есть полная версия? Ответ довольно прост. Точность не всегда является узким местом. Если вы запускаете что-то вроде чат-бота для обслуживания клиентов, отвечающего на одни и те же 200 вопросов весь день, вам не нужна модель, которая показала лучшие результаты на экзаменах по химии уровня PhD. Вам нужно что-то быстрое и дешевое, что не заставляет вас ждать. В этом вся суть. Эти модели созданы для такого типа рабочей нагрузки, где задержка напрямую формирует пользовательский опыт. Помощники по кодированию, которые должны быть отзывчивыми. Под-агенты, которые быстро выполняют вспомогательные задачи. Компьютеры, использующие системы, которые захватывают и интерпретируют скриншоты, и мультимодальные приложения, которые могут рассуждать об изображениях в реальном времени. Так что дело не в том, чтобы быть урезанной версией флагманской модели. Дело в том, чтобы быть специально разработанной для определенного класса работ. Прежде чем мы продолжим, мы только что запустили новостную рассылку "Вселенная ИИ". Если вы хотите быть в курсе новостей ИИ, не ища их, ссылка находится в описании. Не пропустите.

Блог OpenAs начинается с GPT 5.4 Mini. Так что начнем с нее. GPT 5.4 Mini значительно превосходит GPD5 Mini в области кодирования, рассуждений, мультимодального понимания и использования инструментов, работая более чем в два раза быстрее. Она также приближается к производительности более крупной модели GPT 5.4 perform на нескольких оценках, включая бенчмарк программной инженерии pro и osworld verified. Последняя часть важна, потому что она не только быстрее, но и разрыв между mini и полной моделью действительно сократился. На бенчмарке программной инженерии pro, который тестирует реальные задачи программной инженерии, GPT 5.4 mini набрала 54,4% по сравнению с флагманской моделью, которая имеет 57,7%. Это довольно небольшой разрыв для модели, которая стоит долю цены и работает со значительно более высокой скоростью. А на OS World Varified, который касается фактической работы модели на рабочем столе, например, чтения скриншота и нажатия на элементы, Mini достигла 72,1% по сравнению с 75% у флагмана. Обе модели фактически превзошли человеческий базовый уровень в 72,4%. Это деталь, над которой стоит задуматься на секунду. Небольшая модель, даже не полный флагман, превосходит человеческий базовый уровень в задачах навигации по рабочему столу. Вот где мы находимся сейчас.

Блог также углубляется в рабочие процессы кодирования, и именно здесь Mini становится интересной для многих. Модели обрабатывают целевые правки, навигацию по базе кода, генерацию фронтенда и циклы отладки с низкой задержкой, что делает их отличным выбором для задач кодирования, которые должны выполняться с более высокой скоростью и меньшими затратами. И в блоге упоминается довольно умный архитектурный шаблон в codeex. Например, более крупная модель, такая как GPT 5.4, может заниматься планированием, координацией и окончательным суждением, делегируя под-агентам GPT 5.4 mini, которые выполняют узкие подзадачи параллельно, такие как поиск в кодовой базе, просмотр большого файла или обработка вспомогательных документов. Таким образом, вместо того, чтобы использовать дорогостоящую флагманскую модель на каждом шаге вашего рабочего процесса, вы используете ее как мозг, а Mini выполняет основную работу. В Codeex Mini потребляет всего 30% квоты GPT 5.4, что для любого, кто использует рабочие процессы кодирования в масштабе, является действительно значительной разницей в стоимости.

Что касается рассуждений, то на тесте рассуждений GPQA уровня магистратуры diamond, Mini набрала 88% по сравнению с полной моделью, которая имеет 93%. Опять же, это не идентично, но, честно говоря, не так уж далеко для модели, которая настолько быстрее и дешевле. Блог также говорит о том, что мультимодальность и использование компьютера являются реальной силой Mini. Она может быстро интерпретировать плотные скриншоты пользовательского интерфейса, что очень важно для ИИ-агентов, которые фактически выполняют действия на вашем компьютере, а не просто генерируют текст.

Теперь давайте поговорим о GPT 5.4 Nano, которая является меньшей из двух. Nano — это самая маленькая, самая дешевая версия GPT 5.4 для задач, где скорость и стоимость имеют наибольшее значение. OpenAI рекомендует ее для классификации, извлечения данных, ранжирования и под-агентов кодирования, которые выполняют более простые вспомогательные задачи. Блог довольно прямолинеен в отношении того, что такое Nano и для чего она не предназначена. Это не модель, к которой вы обращаетесь со сложной проблемой рассуждений. Nano набрала 52,39% на Software Engineering Bench Pro и 46,3% на Terminal Bench 2.0, что ниже, чем у Mini, но все же является значительным улучшением по сравнению с предыдущими моделями класса nano. А на OS World, тесте навигации по рабочему столу, Nano достигла 39%. Так что вы определенно не будете использовать ее для чего-либо, что требует фактической навигации по интерфейсам, но это не то, для чего она предназначена. Она предназначена для конвейеров, которые обрабатывают огромные объемы простых структурированных задач. Представьте, что у вас есть система, которая обрабатывает тысячи документов, классифицирует их, извлекает поля, маршрутизирует. Вот где Nano имела бы смысл.

Ценообразование также делает это довольно ясным. Mini стоит 75 центов за миллион входных токенов и 4,50 доллара за миллион выходных токенов. Nano еще дешевле: 20 центов за миллион входных токенов и 1,25 доллара за миллион выходных токенов. И чтобы поставить это в контекст, полная GPD 5.4 стоит 2,50 доллара за вход и 15 долларов за выход за миллион токенов. Таким образом, Nano примерно в 12 раз дешевле по выводу, чем флагман. Для любого рабочего процесса, который обрабатывает большой объем легких задач, математика довольно убедительна.

Блог также включает некоторые ранние отзывы от корпоративных клиентов, которые тестировали обе модели. Hebia, которая моделирует ИИ-инструменты для анализа финансовых, юридических и исследовательских документов, заявила, что GPD 5.4 mini соответствует или превосходит конкурентные модели по качеству вывода и точности цитирования при более низкой стоимости. И они фактически увидели более высокие сквозные показатели успешности и более сильное указание источников, чем получили от более крупной GPD 5.4 в аналогичных рабочих процессах, что довольно безумно. Компания, конкретно заявляющая, что mini превзошла полную модель в их собственном случае использования. Руководитель отдела ИИ-инженерии Notion также отметил значительный сдвиг. Небольшие модели, такие как Mini и Nano, теперь могут надежно управлять вызовами инструментов агентов, что ранее было возможностью, в основном ограниченной более крупными, медленными, премиальными моделями. Это снова реальный сдвиг. Это означает, что вы можете начать создавать более способных агентов, не направляя все через дорогую модель.

Что касается доступности, GPT 5.4 mini доступна сегодня в ChatGpt, Codeex и API OpenAI. Пользователи Free и Go найдут ее в опции "мышление", а платные пользователи увидят ее как запасной вариант, когда они достигнут лимитов скорости для GPT 5.4 мышления. Nano, с другой стороны, пока доступна только через API. OpenAI явно позиционирует ее как инфраструктуру для разработчиков, а не как потребительский продукт.

Таким образом, более широкая картина заключается в том, что OpenAI активно подталкивает разработчиков к многоуровневой архитектуре моделей. Используйте большую модель, когда она вам действительно нужна, а меньшие модели пусть справляются со всем остальным. И по мере того, как Mini и Nano продолжают совершенствоваться, список вещей, которые действительно требуют полного флагмана, становится все короче. За этим интересно наблюдать, потому что это означает, что стоимость запуска серьезных систем ИИ будет продолжать снижаться, даже по мере роста возможностей. И я видел некоторые похожие твиты, как тот, который я показываю сейчас. Но, по сути, он показывает, что вы говорите мне, что я заплатил за GPT5, когда мог бы просто подождать 6 месяцев и получить то же самое в mini. Самый мощный ИИ на Земле 6 месяцев назад теперь является бюджетной моделью. Они, по сути, просто сказали всем, кто купил GPT5, что они были бета-тестерами. И это мнение разделяют многие люди прямо сейчас. Фрустрация на первый взгляд имеет смысл. Вы платите за флагман, а через несколько месяцев появляется что-то дешевле, что почти так же способно. Но стоит четко понимать, что такое Mini на самом деле. Она не полностью соответствует GPT 5.4. На Software Engineering Bench Pro она набирает 54,4% против 57,7% у полной модели. И на GPQA похожая история. Она близка, но полная модель все еще впереди в сложных рассуждениях и решении трудных задач. Mini специально разработана для скорости и экономической эффективности. Это другой инструмент для другой рабочей нагрузки. Это не заменяющая модель. И более широкая закономерность здесь не уникальна для OpenAI. Это просто то, как сейчас развивается индустрия ИИ. Возможности, которые 6 месяцев назад требовали самой большой и дорогой модели, теперь упаковываются в более мелкие, быстрые и дешевые пакеты. Этот цикл будет только ускоряться. Является ли это хорошей или разочаровывающей вещью, вероятно, зависит от того, с какой стороны стола цен вы сидите, но это тоже стоит отметить. Но на сегодня это все. Убедитесь, что вы подписались на канал, подписались на нашу рассылку, подписались на Universe of AI в Twitter, а также на наш основной канал World of AI. Увидимся в следующем выпуске.