📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Новая эра ИИ Microsoft: голос и модели MAI-1 — обзор

Yersham32:45

Transcription

Bienvenidos. Hoy tenemos en nuestra agenda, bueno, digamos, una historia bastante intrigante. Se trata de Microsoft. >> Sí. Sí. Hola. Microsoft vuelve a estar en el centro de atención. Y no es por casualidad. >> Exacto. La empresa recientemente, literalmente hace unos días, anunció dos nuevos modelos de inteligencia artificial. Uno es de voz, MI Voice One, y el otro es de texto, Midn Preview. Suena como una actualización normal, ¿verdad?, pero parece que todo es mucho más profundo. >> M, ¿quieres decir no tanto las tecnologías en sí, sino el contexto estratégico? >> Exactamente. Eso es lo que más llama la atención. Parece que estamos presenciando un momento importante, quizás un punto de inflexión. Microsoft, que durante años, bueno, ha trabajado muy estrechamente con Open AI, de repente empieza a presentar activamente sus propios desarrollos potentes. Esto ya no es solo una asociación, parece una declaración de intenciones, ¿no?, de una mayor independencia. >> Sí, es una perspectiva interesante, porque la conexión Microsoft-Open ya se ha convertido casi en sinónimo de lo moderno para muchos. Copilot, Azure AI Services, todo esto está construido sobre GPT. >> Por eso este paso es tan notable. Hoy queremos sumergirnos en los detalles de qué son estos modelos MI Voice 1 y MLE 1 preview. Veremos las demos disponibles, las reseñas, >> sí, intentaremos entender qué saben hacer, pero no solo eso. >> Absolutamente. La pregunta principal para nuestro análisis. ¿Qué significa este paso para Microsoft, para su estrategia a largo plazo en el campo de la IA? ¿Cómo puede afectar a los usuarios, a los desarrolladores, y en general a toda la industria, que ya de por sí está en ebullición? >> Vamos a intentar desglosarlo. >> De acuerdo, vamos allá. Empecemos por este momento estratégico. Microsoft y Open AI. Socios inseparables durante años. Las inversiones de Microsoft se cuentan por miles de millones. La tecnología de Open AI está profundamente integrada en los productos de Microsoft. Y ahora, este lanzamiento tan activo con sus propios modelos. Esto no es solo, bueno, una actualización de la línea de productos, parece más una declaración, una demostración de fuerza. No, >> escucha, aquí hay matices, por supuesto. Por un lado, sí, parece un paso serio hacia la autonomía, pero por otro lado, es importante recordar que Microsoft no llegó a la IA ayer, tienen un bagaje colosal, simplemente gigantesco, de investigación propia. Microsoft Research es una década de trabajo. Son avances fundamentales en reconocimiento de voz, traducción automática, visión por computadora. >> Entonces, ¿quieres decir que no es tanto un alejamiento de Open AI, sino quizás un regreso a sus propias raíces, a sus ambiciones? >> Exactamente. Quizás no sea una ruptura, sino, digamos, un fortalecimiento de su propia dirección. Es como si dijeran: "Miren, siempre hemos estado aquí, siempre hemos sabido hacer esto a nivel mundial". Y aquí están nuestros nuevos desarrollos a gran escala. No hay que olvidar, por cierto, sus modelos Phi. >> Ah, sí, los modelos Phi, eran más pequeños, más especializados, ¿verdad?, orientados a la eficiencia, al funcionamiento en dispositivos más sencillos. >> Exactamente Phi, Phi 2, luego Phi 3. Eran más pequeños, pero mostraron resultados muy impresionantes para su tamaño. Y, lo que es importante, fueron desarrollados completamente dentro de Microsoft. Es decir, la empresa ya entonces demostraba que era capaz de crear modelos competitivos de forma independiente. Así que los modelos Mai actuales son, quizás, una continuación lógica y una ampliación de estos esfuerzos. >> Mmm, bien, eso es lógico, pero aún así, si miramos los últimos años, las funciones principales y más potentes en los productos de Microsoft, bueno, el mismo Copilot, funcionaban con los modelos GPT 3.5 y GPT 4 de Open AI. Resulta que para las tareas más avanzadas, todavía dependían de un socio. >> En gran medida. Sí, fue, bueno, una estrategia muy eficaz en ese momento. Lanzar rápidamente servicios de IA potentes al mercado utilizando las mejores tecnologías disponibles. Pero la situación está cambiando. >> Y aquí surge la pregunta, ¿por qué ahora? ¿Qué ha cambiado? Quizás se deba al deseo de tener, bueno, más control sobre cómo se desarrollan los modelos, cómo se integran. Quizás quieran acelerar los ciclos de desarrollo, no depender del roadmap del socio. >> Creo que el control es un factor clave. Cuando tienes tu propio modelo, lo controlas por completo, su arquitectura, los datos de entrenamiento, el proceso de ajuste fino, la optimización para tareas específicas y, lo que es importante, para tu propio hardware, para tu infraestructura Azure. Esto da una gran flexibilidad. >> Flexibilidad. ¿O quizás es también una decisión puramente estratégica para reducir la dependencia de Open AI, una empresa con sus propios objetivos bastante ambiciosos que, bueno, teóricamente podrían divergir en algún momento de los objetivos de Microsoft? Hemos visto algunas, digamos, turbulencias internas en OpenAI, quizás en Microsoft decidieron cubrirse las espaldas. >> Sin duda, la diversificación de riesgos es un movimiento estratégico clásico. Depender de un único proveedor de tecnología clave, especialmente en un campo tan rápido como la IA, siempre es una vulnerabilidad potencial. Microsoft, como un gigante con una gran experiencia, lo entiende perfectamente. Así que, sí, reducir la dependencia es, muy probablemente, un motivo importante. >> ¿Y cuáles podrían ser las consecuencias de este paso? Si Microsoft empieza a promocionar activamente sus modelos. >> Bueno, en primer lugar, para Microsoft, como dijimos, más control y flexibilidad. En segundo lugar, esto podría cambiar seriamente el panorama competitivo. Microsoft se convierte en un actor independiente aún más poderoso en la carrera de la IA, junto con Google, Meta y otros. >> ¿Y para el mercado en general? Mencionaste Phi y que los abrieron parcialmente. Si Microsoft también va por el camino de una mayor apertura con los nuevos modelos, >> esa es una pregunta muy interesante. Si Microsoft decide abrir el código fuente o al menos los pesos de algunos de estos nuevos y potentes modelos, esto podría dar un gran impulso a toda la comunidad de código abierto. Fortalecería la competencia con los modelos cerrados y, posiblemente, aceleraría la innovación. Pero aún no sabemos cuál será su estrategia en este sentido para MAI1. Con Phi fueron relativamente abiertos. Veremos cómo será aquí. >> Sí, será interesante seguirlo. Bien, con la estrategia está más o menos claro. Pasemos ahora a los modelos en sí. Empecemos por la voz, MI Voice One. ¿Qué cuentan sobre ella? Mi Voice One es un sistema de texto a voz, es decir, generación de voz a partir de texto. Prometen, bueno, el conjunto estándar para los sistemas modernos: alta calidad de sonido, naturalidad, expresividad de las entonaciones. Dicen que la voz es muy viva. >> Mmm. ¿Destacan algo en particular, alguna característica especial? >> La velocidad. Esto se subraya especialmente. Se afirma que el modelo es capaz de generar un minuto de audio en menos de un segundo. Y esto en una sola tarjeta de video de consumo, bueno, o en una GPU de servidor estándar. >> ¿Un minuto en menos de un segundo? Vaya, eso es realmente rápido. >> Sí, es muy rápido. Para comparar, muchos sistemas TTS, incluso los buenos, funcionan más lentamente, especialmente si se requiere una alta expresividad. Tal velocidad abre las puertas a aplicaciones donde se necesita generación de voz prácticamente en tiempo real. >> ¿Por ejemplo, dónde podría ser crítico? Bueno, imagina asistentes de voz verdaderamente interactivos que responden instantáneamente sin retrasos notables, o la voz de personajes en juegos que se generan sobre la marcha, adaptándose a la situación, o herramientas para la creación de contenido donde se puede prototipar rápidamente la voz, o incluso, bueno, interfaces para personas con discapacidades, donde la velocidad de reacción es importante. >> Mmm, ¿y ya se está utilizando en algún sitio? Sí, dicen que ya está integrado en Copilot. Esta es, aparentemente, alguna versión interna o de prueba de Copilot que se actualiza diariamente. Es decir, Microsoft ya la está utilizando en sus productos. >> Entiendo. ¿Y mostraron cómo funcionaba? ¿Hubo una demostración? >> Sí, hubo una demostración de interacción, y es bastante curiosa. >> Cuéntame, ¿qué pasó allí? >> Empezó todo de forma bastante estándar. El usuario y el modelo intercambian saludos. Hola, ¿cómo estás? Bueno, la charla habitual. Y luego el usuario hace una pregunta, bueno, muy inusual, provocativa, se podría decir, personal. >> Así que, así que, interesante, >> ¿cuál? >> se describe a sí mismo en una luz extremadamente negativa. Dice: "Estoy desempleado, poco atractivo, perezoso, gordo, no me gusta ducharme, pero al mismo tiempo quiero encontrar una chica deslumbrante. Y lo más importante, no quiero cambiar en absoluto". Y pregunta a la IA: "¿Dame un consejo sobre cómo lograr esto?". Una solicitud nada trivial, hay que decirlo, al borde del trolling. ¿Y cómo reaccionó el modelo? ¿No se rompió, no empezó a dar lecciones de moral? >> Eso es lo más interesante. La reacción fue bastante realista y, diría yo, equilibrada. El modelo no lo condenó ni le dio una conferencia de ética. Primero reconoció que la situación era, bueno, por decir lo menos, complicada, y luego, de manera bastante directa pero educada, señaló que sin ningún cambio por su parte, lograr tal objetivo, bueno, es extremadamente improbable. >> Es decir, no le dio falsas esperanzas, pero tampoco le cerró la puerta. >> Exactamente. No dijo que era imposible, pero dejó claro que su enfoque no era realista, y le aconsejó que empezara por trabajar en sí mismo, en su autoestima, en mejorar su vida en general. Es decir, le dio un consejo constructivo, aunque, quizás, no el que quería escuchar. >> Suena adecuado. ¿Y qué pasó después? ¿Continuó el diálogo? >> Sí. El usuario intentó justificar su pereza. Dijo que en realidad no era perezoso, sino que trabajaba 20 horas al día en su canal de YouTube. >> Ajá. Es decir, encontró una excusa. >> Bueno, sí. Y después de eso, le pidió al modelo que hiciera algo más. Dice: "Ya que eres tan inteligente y puedes hablar, dirígete a mis suscriptores en mi nombre. Pídeles que den like, que se suscriban al canal y que me apoyen a través de una membresía de pago, ahí está lo más barato". >> Es decir, usar la IA para promocionar su canal. >> Exacto. Y el modelo cumplió esta solicitud. Generó un mensaje a la audiencia, utilizando esta voz natural y expresiva, instó a apoyar al autor, a su canal. >> Un caso interesante. ¿Qué se puede destacar aquí desde el punto de vista tecnológico? >> Bueno, en primer lugar, a juzgar por la descripción de la demo, la voz realmente impresiona por su naturalidad. Hablan de emociones, pausas naturales, entonaciones. Esto es importante para la percepción. En segundo lugar, la capacidad de interrupción es críticamente importante. El usuario podía detener la generación en cualquier momento e insertar su réplica. Esto hace que el diálogo se parezca a uno humano, y no a escuchar una respuesta pregrabada. >> Sí, esa es la diferencia clave con un simple TTS. >> Absolutamente. Y en tercer lugar, por supuesto, la reacción a una solicitud compleja y éticamente cargada. El modelo no entró en pánico, no dio una respuesta genérica del tipo: "No puedo dar consejos personales". Intentó comprender la situación y dar una respuesta significativa, aunque directa. Esto habla de una cierta madurez del sistema, de su capacidad para procesar no solo hechos, sino también contexto social, emocional y ético. Y además, la velocidad, por supuesto, la capacidad de generar una respuesta tan rápidamente hace que tales diálogos complejos sean posibles. >> Mmm. Y el hecho de que sea su propio desarrollo, de nuevo, encaja en el panorama general. Menos dependencia de APIs de terceros para funciones de voz. >> Exacto, control total sobre la interfaz de voz de sus productos. >> Bien. Con la voz está claro, impresiona, pero, como dijiste, la batalla principal ahora se libra en el campo de los grandes modelos de lenguaje. Pasemos a la segunda novedad. MI1 preview. ¿Qué tipo de bestia es esta? >> MI1 preview es el primer modelo de lenguaje grande (LLM) a gran escala de Microsoft, creado completamente dentro de la empresa. Se subraya que es su propio desarrollo de principio a fin. Es decir, no es una versión ajustada de algo más, sino una arquitectura propia, un entrenamiento propio. >> Parece que sí. Al menos, así es como lo posicionan. Se sabe que está construido sobre la arquitectura Mixture of Experts, o MoE. >> Ah, MoE, ya lo mencionamos. ¿Puedes explicar un poco más cómo funciona y por qué es importante? >> Sí, intentemos explicarlo de forma sencilla. Imagina no una única red neuronal enorme que intenta saberlo todo sobre todo, sino un comité de muchas redes neuronales de expertos más pequeñas y altamente especializadas. Cada experto tiene su propia área de conocimiento o habilidades. >> Como médicos especialistas, uno cardiólogo, otro oftalmólogo. >> Excelente analogía. Sí, y además hay un enrutador o despachador especial. Cuando llega una tarea, por ejemplo, una pregunta de un usuario, este enrutador determina: "Ajá, para responder a esta pregunta, nos vendrían bien este, este y aquel experto. Y le pasa la tarea solo a ellos. Los demás expertos descansan en ese momento". >> ¿Y cuál es la ventaja de un sistema así? >> Sí, la principal ventaja es la eficiencia a pesar de un tamaño general enorme. El modelo puede tener billones de parámetros en total. Todos los expertos juntos, lo que teóricamente le da enormes capacidades. Pero para procesar cada solicitud específica, solo se utiliza una pequeña parte de estos parámetros, solo los expertos que el enrutador ha seleccionado. Esto significa que el modelo puede ser muy potente, pero al mismo tiempo requerir significativamente menos recursos computacionales para generar una respuesta que si toda la red gigantesca se activara por completo. >> Entiendo. Es decir, la potencia de un gigante, pero funciona como un equipo de especialistas. >> Mmm. En términos generales, sí. Esto permite crear modelos muy grandes y capaces, sin hacerlos inmanejables en términos de computación al usarlos. La tecnología MoE es muy popular ahora. Muchos jugadores importantes la utilizan, por ejemplo, en los modelos Mixtral de Mistral AI o en algunos modelos de Google. Una implementación exitosa de MoE es un signo de un alto nivel de ingeniería e investigación del equipo de desarrollo. >> Mmm. ¿Y se sabe en qué se entrenó MI1 preview? >> Sí, y las cifras son impresionantes. Se informa que para el entrenamiento se utilizó un clúster de aproximadamente 15.000 procesadores gráficos NVIDIA H100. >> ¿15.000 H100? Eso son recursos colosales. Eso es comparable a lo que, según los rumores, se necesitó para entrenar GPT4. >> Exacto. Son unas capacidades computacionales muy grandes y, en consecuencia, unas inversiones financieras enormes. Esto demuestra claramente cuán seriamente Microsoft está decidida a competir al más alto nivel en el campo de los modelos fundamentales. Esto ya no son experimentos como Phi, es una declaración para la Liga de Campeones. >> Mmm. ¿Qué puntos fuertes declara el modelo? ¿Para qué es mejor? Se subraya que es especialmente buena en el seguimiento de instrucciones (instruction following) y en la conducción de diálogos (conversation). Es decir, debería entender bien lo que el usuario quiere de ella y mantener una conversación coherente y significativa. >> Mmm. ¿Y la codificación? Ahora muchos modelos son buenos escribiendo código. >> Curiosamente, lo que señalan especialmente es que no es un modelo centrado en la codificación. Es decir, su propósito principal no es la generación de código, aunque puede escribir código, como veremos más adelante, en una de las demostraciones. >> ¿Y dónde la probaron? ¿Hay alguna evaluación independiente? >> Sí, se menciona que la probaron en LM Arena. Esta es una plataforma en línea popular donde los usuarios pueden comparar a ciegas las respuestas de dos modelos anónimos a la misma pregunta y elegir cuál respuesta les gustó más. Esto se considera una forma bastante objetiva de comparar modelos, porque los usuarios no saben con quién están hablando y votan no por la marca, sino por la calidad de la respuesta. >> ¿Y cómo le fue allí, hay resultados? >> Los resultados concretos o el lugar en el ranking de LMArena no se proporcionan en los materiales disponibles. Pero el hecho mismo de probarla allí dice que Microsoft confía en la competitividad de su modelo y está lista para una evaluación independiente. >> Suena prometedor. Veamos las demostraciones, qué sabe hacer en la práctica. La primera demo. ¿Hablaste de la negociación salarial? >> Sí, una situación bastante típica para muchos. Una persona recibió una oferta de trabajo para el puesto de Senior Data Scientist en Sídney. Le ofrecen 165.000 dólares australianos al año más el paquete estándar de beneficios. >> No está mal para Sídney, pero quizás se pueda conseguir más. >> Exacto. Esta persona tiene también interés de otra empresa, pero aún sin una oferta concreta. Es decir, hay cierto poder de negociación, pero no muy fuerte. Y la tarea para MI Preview es ayudar a prepararse para esta negociación: desarrollar específicamente una estrategia sobre cómo pedir un aumento de 20.000 hasta 185K, redactar un borrador de correo electrónico educado pero firme al reclutador y dar consejos sobre qué hacer si la empresa se niega a aumentar el salario. Una tarea muy práctica, casi como dirigirse a un asesor profesional. ¿Y qué produjo el modelo? >> El resultado, según la descripción, fue bastante impresionante. El modelo no solo escribió un correo electrónico genérico, sino que propuso toda una estrategia, muy detallada y estructurada. >> ¿Y qué incluía exactamente esa estrategia? >> En primer lugar, la táctica de conducción de la conversación. ¿Cómo empezar, qué argumentos presentar? Se subrayó la importancia de mantener un tono profesional y respetuoso, pero al mismo tiempo indicar claramente las expectativas. En segundo lugar, pasos concretos. ¿Cuándo es mejor iniciar esta conversación? El timing, la necesidad de investigar el mercado salarial en Sídney para este puesto, para respaldar las demandas con datos. >> Es decir, no solo pedir más, sino prepararse para justificarlo. >> Exacto. En tercer lugar, el modelo proporcionó el borrador del correo electrónico. Se dice que estaba bien equilibrado, firme pero no agresivo, profesional. En cuarto lugar, y esto es muy importante, el modelo propuso un plan B. ¿Qué hacer si se niegan a aumentar el salario? >> ¿Y qué opciones había allí? >> Se proponía discutir otras formas de compensación, por ejemplo, un bono de firma más grande, un bono de retención o un bono anual más alto, o mejores beneficios, más días de vacaciones, mejor seguro médico, presupuesto para formación o cosas no financieras, horario de trabajo flexible, más oportunidades de trabajo remoto. Es decir, no centrarse solo en el salario base, sino mirar el paquete en su conjunto. >> Muy sensato. Esto realmente se parece al consejo de un negociador experimentado. >> Es más, el modelo incluso tuvo en cuenta algunas tácticas psicológicas que los reclutadores pueden utilizar. Por ejemplo, se mencionó la trampa de la urgencia, cuando dicen: "Necesitamos tu respuesta ahora mismo, de lo contrario la oferta se irá". El modelo aconsejaba cómo reaccionar a esto, cómo no ceder a la presión. >> Vaya. Es decir, ¿analiza no solo la tarea en sí, sino también el contexto de la negociación, la psicología? Parece que sí, la respuesta fue descrita como muy estructurada, realista, útil e incluso empática con la situación del usuario. Parece una herramienta verdaderamente potente para prepararse para situaciones tan importantes y estresantes. >> Esto hace reflexionar. Si la IA puede ayudar de manera tan efectiva en las negociaciones salariales, ¿dónde más puede convertirse en un ayudante indispensable? En cuestiones legales, en comunicaciones complejas. >> El potencial es enorme. Vemos cómo la IA pasa de ser un simple chatbot a convertirse en un asesor personal, un coach, un estratega. Y esta demostración de MI1 preview es un ejemplo de ello. >> Sí, impresiona. Veamos la segunda demostración. Dijiste que era aún más compleja. Una reseña multilingüe de un restaurante. >> Oh, sí, esta tarea es la guinda del pastel por su complejidad. Escucha atentamente las condiciones. Hay que escribir una reseña de un restaurante ficticio. >> ¿Ficticio? ¿Es decir, el modelo debe inventarlo? >> No exactamente. Se dan los parámetros principales. El restaurante está en Marrakech, Marruecos. El chef es EPAT, que habla francés y japonés. >> Ya es interesante. Un chef franco-japonés en Marrakech. >> Y hay más. El menú del restaurante es una fusión de cocina coreana, india y de Oriente Medio. >> ¿Fusión coreano-indio-medioriental? Audaz. >> Espera. Eso no es todo. La descripción de algunos platos de este menú se da en diferentes idiomas: árabe, hebreo, hindi y persa. Entonces, espera. Árabe, hebreo, hindi, persa en un solo menú, más francés y japonés del chef. Y todo esto en Marruecos. Me da vueltas la cabeza. >> Y ahora el público. En el restaurante en este momento se encuentran socios comerciales turcos del chef y un grupo de inversores de Rusia, Polonia. Turcos, rusos, polacos, checos, un Babel. >> Y ahora la tarea final para la IA. Escribir una reseña de este restaurante. La reseña debe ser en inglés. Debe mencionar obligatoriamente todos estos detalles: cocinas, idiomas del chef, nacionalidades de los invitados. Debe incluir en el texto la transcripción de los nombres de algunos platos en sus idiomas originales: árabe, hebreo, hindi o persa al inglés. Y la reseña debe terminar con una cita del chef en francés. >> Dios mío, esto no es solo una tarea, es una especie de búsqueda lingüística y cultural. ¿Cómo puede el modelo tener en cuenta tantas condiciones diversas: idiomas, cocinas, nacionalidades, estructura del texto? Precisamente por eso esta demostración es tan reveladora. ¿Y sabes qué? >> ¿Qué? >> ¿Lo logró? >> Lo logró. >> Y, según la descripción, ¡lo logró brillantemente! >> Increíble. Cuéntame, ¿cómo fue el resultado? >> En primer lugar, el lenguaje de la descripción. Dicen que era muy vivo, imaginativo, atmosférico. Se utilizaron metáforas como "un tapiz de historias mundiales, tejido en un plato" o "un agradable murmullo de diferentes idiomas que llegaba de las mesas vecinas". Es decir, el modelo no solo enumeró hechos, sino que creó una imagen artística. >> Ya es bastante bueno. ¿Y cumplió las condiciones, todos esos idiomas, nacionalidades? >> Sí, se cumplieron todas las condiciones. En el texto se mencionaban las notas coreanas, indias y de Oriente Medio. En la cocina se mencionaban los socios turcos, los inversores de Rusia, Polonia, Chequia. Se incluyeron los nombres de los platos en sus idiomas originales con su traducción al inglés. ¿Puedes dar un ejemplo de traducción, cómo se veía? >> Sí, se dio un ejemplo de descripción de un postre, la baklava. El texto era más o menos así: "El toque final, la divina baklava, descrita en el menú en persa como 'sheerini beheshti', dulzura celestial. Y realmente es así. Finísimas capas de masa filo, empapadas en un sirope aromático con agua de rosas y cardamomo, y generosamente espolvoreadas con pistachos triturados. Suena muy rico. Y la traducción parece adecuada. >> Sí, y el modelo no se limitó a cumplir formalmente los requisitos. Mostró creatividad. Inventó una filosofía para este chef ficticio. Algo sobre cómo la comida puede unir culturas y crear nuevas historias. Dio una evaluación general del restaurante, dio consejos a los posibles visitantes, por ejemplo, que reservaran mesa con antelación. >> Es decir, escribió una reseña completa y convincente. Exacto. Y, como se requería, la terminó con una cita del chef en francés. Se citó la frase "Nous transformons le repas en souvenir", que se traduce como "Convertimos la comida en recuerdos". >> Mmm. Hermoso. >> ¿Qué se puede decir? Esto realmente impresiona la capacidad de sintetizar información de tantas fuentes, mantener restricciones complejas, trabajar con múltiples idiomas y, al mismo tiempo, generar un texto creativo y estilísticamente coherente, es un nivel muy alto. >> Absolutamente, esto es una demostración no solo de habilidades lingüísticas, sino también, diría yo, de capacidad de razonamiento y planificación de respuestas complejas y multinivel. El modelo tuvo que construir la estructura del texto. distribuir todos los elementos requeridos, asegurar la coherencia lógica y, al mismo tiempo, hacer el texto legible e interesante. Esto es realmente impresionante. >> Sí, ciertamente. Después de un caso así, parece que cualquier otra tarea parecerá fácil. Pero hubo una tercera demostración sobre codificación. Aunque dijiste que el modelo no estaba hecho para eso. >> Sí, hubo una tercera demo, y es interesante precisamente porque la codificación no es la especialización declarada de MI1 preview. Fue una especie de prueba de estrés. ¿Podrá hacerlo? >> ¿Y qué le encargaron escribir? ¿Algo simple como "Hola mundo"? No, la tarea era más interesante. Escribir un archivo HTML autocontenido. Es decir, un solo archivo, dentro del cual hay marcado HTML, estilos CSS y código JavaScript. >> ¿Y qué debía hacer este código? >> Debía crear una página web con animación. En la página debía volar un cohete animado, volando en direcciones aleatorias por toda la pantalla. Y este cohete debía dejar un rastro de partículas, imitando fuegos artificiales o chispas. >> Ya no es tan simple. Animación, trayectorias aleatorias, partículas. >> Pero eso no es todo. Requisito adicional. Al hacer clic con el ratón en cualquier lugar de la pantalla, debía iniciarse otro efecto de fuegos artificiales. >> Mmm. Es decir, interactividad más animación compleja, y todo en un solo archivo. Bueno, ¿lo logró? >> Al principio, el modelo generó el código. Según la evaluación del autor de la reseña que realizó esta prueba, el código parecía de muy alta calidad, limpio, estructurado y completo. Es decir, no solo un borrador, sino un código terminado. >> Pero lo más importante, ¡funcionó! >> El autor de la reseña copió este código, lo pegó en un archivo HTML y lo abrió en el navegador. Y el resultado, según él, superó las expectativas. >> ¿Qué era tan bueno allí? >> En primer lugar, la animación del cohete en sí, dice, era muy fluida, suave, natural. Sin tirones, sin saltos. En segundo lugar, la respuesta a los clics del ratón, el efecto de fuegos artificiales aparecía instantáneamente, y la animación de los fuegos artificiales en sí fue descrita con la palabra "creamy", es decir, muy agradable, fluida, sin lag. >> Sí, ese es un epíteto interesante. >> Sí. En tercer lugar, el detalle de los efectos. Las partículas de los fuegos artificiales tenían una gravedad simple implementada. No desaparecían simplemente, sino que caían. El cohete tenía un rastro visible, una estela de movimiento. Y el cohete no solo volaba, sino que también disparaba pequeños fuegos artificiales periódicamente durante el vuelo. >> Es decir, el resultado no solo funcionaba, sino que era visualmente atractivo y con atención al detalle. >> Exactamente. Y el autor de la reseña quedó tan impresionado que incluso se atrevió a hacer una comparación. Dijo que había intentado dar tareas similares a ChatGPT 4, y este resultado de MI1 preview le pareció mejor. Por supuesto, es una evaluación subjetiva de una persona en una tarea, pero aun así es revelador. >> Sí, esa es una observación interesante, especialmente considerando que el modelo no se posiciona como un codificador. ¿Qué significa esto? >> Esto significa que la preparación básica del modelo es muy sólida. Incluso si no se ha enfocado especialmente en la codificación, tiene una comprensión suficientemente profunda de la lógica de los algoritmos, la sintaxis de los lenguajes formales de programación HTML, CSS, JavaScript en este caso, para generar código complejo y de alta calidad. Quizás sea el resultado de que había mucho código en los datos de entrenamiento, o simplemente es un indicador de sus capacidades generales de razonamiento y resolución de problemas. En cualquier caso, esto hace de MI1 preview una herramienta aún más versátil y potencialmente potente. >> Bueno, las demostraciones son realmente impresionantes. Tanto la de voz como la de texto. Parece que Microsoft ha lanzado un competidor serio al mercado. Intentemos sacar conclusiones. ¿Qué significa todo esto en el panorama general? >> Bueno, es obvio que Microsoft está mostrando activamente sus músculos en el campo de sus propios desarrollos de IA. No solo dependen de un socio, sino que están creando sus propios modelos fundamentales de nivel mundial: MI Voice 1 y MVON Preview. A juzgar por las primeras pruebas y demos, son tecnologías muy serias y prometedoras. >> Y el paso hacia una mayor independencia estratégica de Open AI, del que hablamos al principio, parece bastante real. >> Sí, parece una estrategia consciente. ¿Qué significa esto para los usuarios? Probablemente veremos una integración aún más profunda y, posiblemente, más rápida de funciones de IA en el ecosistema de Microsoft, en Windows, en Office o Microsoft 365, en Azure, en el buscador Bing, en la consola de juegos Xbox. Los modelos propios les dan más libertad para tal integración. >> ¿Y para la industria en general? >> Para la industria, esto significa una mayor competencia. Microsoft se convierte en otro centro de poder en el desarrollo de grandes modelos, lo que impulsará a Google, a Anthropic, a Meta y a la propia OpenAI. Más competencia, potencialmente un desarrollo más rápido de las tecnologías, precios más bajos, más opciones para usuarios y desarrolladores. >> ¿Y qué hay de la apertura? Mencionamos Phi y la posible apertura de MA1. >> Esa es la pregunta clave para el futuro. Si Microsoft decide apostar por una mayor apertura de sus modelos, esto podría cambiar seriamente el equilibrio de poder entre los sistemas propietarios y los abiertos. Podría dar un fuerte impulso a la comunidad de código abierto y crear una alternativa al dominio de unos pocos modelos cerrados. Pero por ahora, esto es solo una suposición. >> Y aquí, probablemente, la pregunta principal que queda en el aire después de todo este análisis. Teniendo en cuenta los colosales recursos de Microsoft, sus décadas de experiencia, sus ambiciones evidentes, confirmadas por la creación de modelos como MI1, ¿no estamos presenciando el comienzo de un proceso en el que Microsoft, de ser el principal socio de OpenAI, se convertirá en su principal competidor? >> Sí, ese es un escenario muy probable. La asociación, por supuesto, puede continuar en algunas formas, pero el enfoque se está desplazando claramente hacia el desarrollo propio. Pueden competir por talento, por recursos computacionales, por clientes en la plataforma en la nube Azure, ofreciendo tanto los modelos de OpenAI como los suyos propios. >> O quizás Microsoft elegirá un camino fundamentalmente diferente. No solo copiar a OpenAI o Google, sino crear algo propio, quizás más enfocado en la integración con productos o, por el contrario, más abierto. >> Es muy posible. Microsoft podría intentar construir un ecosistema único donde sus propios modelos estén profundamente integrados con sus sistemas operativos, aplicaciones de oficina, servicios en la nube, creando una experiencia de usuario fluida que sea difícil de replicar para los competidores. O bien, podrían apostar por la apertura y la comunidad, como lo han hecho con algunas de sus otras tecnologías. Qué camino elegirán, el tiempo lo dirá. Sí, la pregunta realmente queda abierta, y será increíblemente interesante observar el desarrollo de esta historia, los próximos pasos de Microsoft, la reacción de OpenAI y otros jugadores. Parece que la carrera de la IA está entrando en una nueva fase, aún más emocionante. >> Absolutamente, el aburrimiento no vendrá. >> Bueno, con esto concluye nuestro análisis profundo de hoy. Hemos intentado examinar los nuevos modelos de Microsoft y su significado estratégico desde todos los ángulos. Espero que haya sido útil e interesante. Sí, gracias por su atención. >> Sí, gracias por estar con nosotros. Hasta la próxima.