📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Anthropic CEO Dario Amodei: AI's Potential, OpenAI Rivalry, GenAI Business, Doomerism

Alex Kantrowitz1:08:50

Transcription

Me enfado mucho cuando la gente me llama "doomer". Cuando, ya sabes, cuando alguien dice: "Este tipo es un doomer. Quiere que las cosas vayan más lentas". ¿Has oído lo que acabo de decir? Mi padre murió por curas que, ya sabes, podrían haber ocurrido unos años después. Entiendo el beneficio de esta tecnología. Estoy seguro de que has oído las críticas de gente como Jensen, que dice: "Bueno, Daario cree que es el único que puede construir esto de forma segura y, por lo tanto, quiere controlar toda la industria". Nunca he dicho, nunca he dicho nada parecido. Eso es una mentira escandalosa. Esa es la mentira más escandalosa que he oído jamás. El CEO de Anthropic, Dario Ammoday, se une a nosotros para hablar sobre el camino a seguir para la inteligencia artificial. Si la IA generativa es un buen negocio y para responder a quienes lo llaman doomer. Y está aquí con nosotros en el estudio en la sede de Anthropic en San Francisco. Dario, es genial verte de nuevo. Bienvenido al programa. Gracias por invitarme. Entonces, repasemos los últimos dos meses para ti. Dijiste que la IA podría eliminar la mitad de los trabajos de cuello blanco de nivel inicial. Cortaste el acceso de Windsurf a los modelos de nivel superior de Anthropic cuando te enteraste de que OpenAI iba a adquirirlos. Solicitaste al gobierno controles de exportación y molestaste al CEO de Nvidia, Jensen Wong. ¿Qué te pasa? Creo que Anthropic, yo y Anthropic siempre nos centramos en intentar hacer y decir las cosas en las que creemos. Y creo que a medida que nos hemos acercado a sistemas de IA más potentes, creo que he querido decir esas cosas de forma más contundente, más pública, para que el punto sea más claro. Llevo muchos años diciendo que tenemos estas, podemos hablar en detalle sobre ellas, pero tenemos estas leyes de escalamiento. Los sistemas de IA se están volviendo más potentes. Están pasando del nivel de, ya sabes, hace unos años apenas eran coherentes, ahora, hace un par de años estaban al nivel de un estudiante de secundaria inteligente. Ahora estamos llegando a un estudiante universitario inteligente, un doctorado, y están empezando a aplicarse en toda la economía. Y por eso creo que todos los problemas relacionados con la IA, desde los problemas de seguridad nacional hasta los problemas económicos, están empezando a acercarse mucho a donde, ya sabes, a donde realmente nos vamos a enfrentar a ellos. Y por eso, a medida que estos problemas se han acercado, aunque, ya sabes, de alguna forma Anthropic ha estado diciendo estas cosas durante un tiempo, creo que la urgencia de estas cosas ha aumentado y quiero asegurarme de que, ya sabes, quiero asegurarme de que decimos lo que creemos y que advertimos al mundo sobre las posibles desventajas, aunque, ya sabes, nadie puede decir lo que va a pasar. Estamos diciendo lo que, ya sabes, lo que creemos que podría pasar, lo que creemos que es probable que pase. Lo respaldamos lo mejor que podemos, aunque a menudo son extrapolaciones sobre el futuro donde nadie puede estar seguro. Pero, ya sabes, creo que nos vemos a nosotros mismos como si tuviéramos el deber de, ya sabes, de advertir al mundo sobre lo que va a pasar. Y eso no quiere decir que creo que hay un número increíble de aplicaciones positivas de la IA, ¿verdad? He seguido hablando de eso. Leí este ensayo, Máquinas de Gracia Amorosa. De hecho, siento que yo y Anthropic a menudo hemos sido capaces de articular mejor los beneficios de la IA que algunas de las personas que se autodenominan optimistas o aceleracionistas. Así que creo que probablemente apreciamos los beneficios más que nadie. Pero por la misma razón, porque podemos tener un mundo tan bueno si hacemos todo bien, me siento obligado a advertir sobre los riesgos.

Entonces, ¿todo esto viene de tu línea de tiempo? Básicamente, parece que tienes una línea de tiempo más corta que la mayoría y, por lo tanto, sentiste la urgencia de salir y decir esto porque crees que es inminente. Sí, no estoy seguro. Creo que es muy difícil predecir, especialmente en el lado social. Así que si dices, ¿cuándo desplegarán la IA las personas o cuándo usarán las empresas X X X dólares en IA o cuándo se utilizará la IA en estas aplicaciones o cuándo impulsará estas curas médicas, eso es más difícil de decir. Creo que la tecnología subyacente es más predecible, pero aún incierta, aún nadie lo sabe. Pero creo que en la tecnología subyacente me he vuelto más seguro. No hay incertidumbre al respecto. Creo que la exponencial en la que estamos podría, ya sabes, podría simplemente agotarse. Creo que hay quizás un 20 o 25% de posibilidades de que en los próximos 2 años los modelos simplemente dejen de mejorar por razones que no entendemos o quizás por razones que sí entendemos, como la disponibilidad de datos o de cómputo, y entonces todo lo que digo parecerá totalmente tonto y todos se burlarán de mí por todas las advertencias que he hecho, y estoy totalmente bien con eso dada la distribución que veo. Y debería decir que esto es parte de una entrevista para un perfil que estoy escribiendo sobre ti. He hablado con más de dos docenas de personas que han trabajado contigo, que te conocen, que han competido contigo, y lo enlazaré en las notas del programa si alguien quiere leerlo. Es gratuito leerlo. Pero uno de los temas que ha surgido entre todas las personas con las que he hablado es que tienes un plazo más corto que la mayoría de los líderes de los principales laboratorios y lo acabas de mencionar hace un momento. Entonces, ¿por qué tienes un plazo tan corto y por qué deberíamos creer en el tuyo? Realmente depende de a qué te refieras con plazo. Una cosa, y ya sabes, he sido coherente en esto a lo largo de los años, es que existen estos términos en el mundo de la IA como AGI y superinteligencia. Escucharás a los líderes de las empresas decir que hemos logrado la AGI, que estamos pasando a la superinteligencia o que es realmente emocionante que alguien haya dejado de trabajar en AGI y haya empezado a trabajar en superinteligencia. Así que creo que estos términos son totalmente inútiles. No sé qué es la AGI. No sé qué es la superinteligencia. Suena como un término de marketing. Sí, suena como, ya sabes, algo diseñado para activar la dopamina de las personas. Así que verás que en público nunca uso esos términos y, ya sabes, soy, de hecho, cuidadoso al criticar el uso de esos términos. Pero creo que a pesar de eso, soy, de hecho, uno de los más optimistas sobre la mejora muy rápida de las capacidades de la IA. Lo que creo que es real y que he dicho una y otra vez es la exponencial. La idea de que cada pocos meses obtenemos un modelo de IA que es mejor que el modelo de IA que obtuvimos antes. Y que obtenemos eso invirtiendo más cómputo en modelos de IA, más datos, más nuevos tipos de modelos de entrenamiento. Inicialmente, esto se hizo con lo que se llama pre-entrenamiento, que es cuando simplemente alimentas una gran cantidad de datos de Internet al modelo. Ahora tenemos una segunda etapa que es el aprendizaje por refuerzo o el cómputo en tiempo de prueba o el razonamiento o como quieras llamarlo. Yo lo considero una segunda etapa que implica aprendizaje por refuerzo. Ahora ambas cosas están escalando juntas, como hemos visto con nuestros modelos y como hemos visto con modelos de otras empresas, y no veo nada que bloquee el escalamiento adicional de eso. Hay algunas cosas sobre cómo ampliamos las tareas en el lado del RL. Hemos visto más progreso en, por ejemplo, matemáticas y código, donde los modelos están, ya sabes, muy cerca de un nivel profesional alto y menos en tareas más subjetivas, pero creo que ese es un obstáculo muy temporal. Así que cuando lo miro, veo esta exponencial y digo, mira, la gente no es muy buena para entender las exponenciales, ¿verdad? Como si algo se duplica cada seis meses, entonces, ya sabes, dos años antes de que suceda, parece que solo está a 1/16 del camino. Y estamos aquí sentados a mediados de 2025, y los modelos realmente están empezando a explotar en la economía. Si miras las capacidades del modelo, están empezando a saturar todos los puntos de referencia. Si miras los ingresos, y los ingresos de Anthropic han crecido 10 veces cada año. Cada año somos conservadores y decimos, no puede crecer 10 veces esta vez. Nunca asumo nada y, de hecho, siempre soy muy conservador al decir, creo que se ralentizará en el lado del negocio, pero pasamos de cero a 100 millones en 2023, pasamos de 100 millones a mil millones en 2024, y este año, en esta primera mitad del año, hemos pasado de mil millones a, creo que al momento de hablar hoy, está muy por encima de cuatro, quizás 4.5. Y así, si lo piensas, supongamos que esa exponencial continuara por dos años, no digo que lo hará, pero supongamos que continuara por dos años, estás muy por encima de los cien mil millones. No digo que eso sucederá. Digo que la situación es que cuando estás en una exponencial, puedes ser realmente engañado por ella. A dos años de que la exponencial se vuelva totalmente loca, parece que apenas está empezando a ser algo. Y esa es la dinámica fundamental. Vimos eso con Internet en los años 90, ¿verdad? Donde las velocidades de red y la velocidad subyacente de las computadoras se estaban volviendo rápidas y, a lo largo de unos años, fue posible construir una red global de comunicaciones digitales sobre todo esto, cuando no era posible hace solo unos años, y casi nadie, excepto unas pocas personas, vio las implicaciones de eso y cuán rápido sucedería. Y ahí es de donde vengo, eso es lo que pienso ahora. No sé, si un montón de satélites se estrellaran, tal vez Internet habría tardado más. Si hubiera habido una crisis económica, tal vez habría tardado un poco más. Así que no podemos estar seguros de los plazos exactos, pero creo que la gente está siendo engañada por la exponencial y no se da cuenta de lo rápido que podría ser. Qué rápido creo que probablemente será, aunque no estoy seguro.

Pero tanta gente en la industria de la IA habla de rendimientos decrecientes del escalamiento. Ahora, eso realmente no encaja con la visión que acabas de presentar. ¿Están equivocados? Por lo que hemos visto, solo puedo hablar en términos de los modelos en Anthropic, pero lo que creo que se ha visto en términos de los modelos en Anthropic, si miramos, tomemos la codificación, la codificación es un área en la que creo que los modelos de Anthropic han avanzado muy rápidamente, la adopción ha sido muy rápida. No somos solo una empresa de codificación, planeamos expandirnos a muchas áreas, pero si miras la codificación, cada, lanzamos 3.5 Sonnet, un modelo que llamamos 3.5 Sonnet V2, que, llamémoslo 3.6 Sonnet ahora, 3.7 Sonnet y luego 4.0 Sonnet y 4.0 Opus, y esa serie de cuatro o cinco modelos, cada uno mejoró sustancialmente en codificación que el anterior. Si quieres mirar los puntos de referencia, puedes mirar, por ejemplo, SweetBench, que creció de, creo que hace 18 meses estaba en alrededor del 3% o algo así, creciendo hasta el 72 al 80%, dependiendo de cómo lo midas, y el uso real también ha crecido exponencialmente, donde nos dirigimos cada vez más hacia lo autónomo, simplemente puedes usar estos modelos. Creo que la mayoría real del código que se escribe en Anthropic es, en este punto, escrito por o al menos con la participación de uno de los modelos de garra y varias otras empresas han dicho declaraciones similares. Así que vemos que el progreso es muy rápido y la exponencial continúa y no vemos rendimientos decrecientes.

Pero hay algunas responsabilidades, parece, con los modelos de lenguaje grandes. Por ejemplo, el aprendizaje continuo. Tuvimos a Dark Kesh hace un par de semanas. Así es como lo planteó y escribió sobre ello en su Substack. La falta de aprendizaje continuo es un problema enorme. La línea base de los LM en muchas tareas puede ser más alta que la de un humano promedio, pero te quedas atascado con las habilidades que obtienes de inmediato. Así que simplemente haces el modelo y eso es todo. No aprende. Eso parece una responsabilidad flagrante. ¿Qué piensas de eso? En primer lugar, diría que incluso si nunca resolviéramos el aprendizaje continuo, incluso si nunca resolviéramos el aprendizaje continuo y la memoria, creo que el potencial de los LLM para hacerlo increíblemente bien, para afectar las cosas a la escala de la economía, será muy alto. Si pienso en el campo en el que solía estar, la biología y la medicina, digamos que tenía un ganador del Premio Nobel muy inteligente y le dije: "Está bien, has descubierto todas estas cosas, tienes esta mente increíblemente inteligente, pero no puedes leer nuevos libros de texto ni absorber nueva información". Quiero decir, eso sería difícil, pero aún así, si tuvieras 10 millones de esos, aún así harían muchos avances en biología. Estarían limitados, podrían hacer algunas cosas que los humanos no pueden y hay algunas cosas que los humanos pueden hacer que ellos no. Pero incluso eso, incluso si imponemos eso como un techo, hombre, eso es bastante impresionante y transformador, e incluso si dijera que nunca resuelves eso, creo que la gente está subestimando el impacto. Pero mira, las ventanas de contexto se están alargando y los modelos realmente aprenden durante la ventana de contexto, ¿verdad? Así que, a medida que hablo con el modelo durante la ventana de contexto, tengo una conversación, absorbe información, los pesos subyacentes del modelo pueden no cambiar, pero, ya sabes, al igual que estoy hablando contigo aquí y tenemos una conversación y escucho las cosas que dices y pienso y respondo a ellas. Los modelos son capaces de hacer eso y, desde una perspectiva de aprendizaje automático, desde una perspectiva de IA, no hay razón por la que no podamos hacer que la longitud del contexto sea de cien millones de palabras hoy, ¿verdad? Que es aproximadamente lo que un humano escucha en su vida. No hay razón por la que no podamos hacer eso. Es realmente soporte de inferencia. Y así, de nuevo, incluso eso llena muchas de las lagunas, no todas las lagunas, pero llena muchas de las lagunas, y luego hay una serie de cosas como el aprendizaje y la memoria que nos permiten actualizar los pesos. Así que, hay una serie de cosas sobre tipos de aprendizaje por refuerzo, aprendizaje, entrenamiento, solíamos hablar hace muchos años de bucles internos y bucles externos, ¿verdad? El bucle interno es como si tuviera un episodio y aprendo algunas cosas en ese episodio y estoy tratando de optimizar para la vida de ese episodio, y el bucle externo es el agente aprendiendo a través de episodios. Y así, creo que tal vez esa estructura de bucle interno/bucle externo es una forma de aprender el aprendizaje continuo. Una cosa que aprendimos en IA es que cada vez que parece que hay un obstáculo fundamental, como hace dos años pensábamos que había un obstáculo fundamental en torno al razonamiento, resultó ser solo RL, simplemente entrenas con RL y dejas que el modelo escriba algunas cosas, ya sabes, dejas que el modelo escriba cosas para intentar resolver problemas matemáticos objetivos, sin ser demasiado específico, creo que ya tenemos alguna evidencia que sugiere que este es otro de esos problemas que no es tan difícil como parece, que caerá ante la escala más una forma ligeramente diferente de pensar las cosas.

¿Crees que tu obsesión por la escala podría cegarte a algunas de las nuevas técnicas como dice Deis Sabis, para llegar a AGI o como tú lo llamarías AGI súper potente, la inteligencia a nivel humano es de lo que todos estamos hablando. Podríamos necesitar un par de nuevas técnicas para que eso suceda. Si estás desarrollando nuevas técnicas, estamos desarrollando nuevas técnicas todos los días. Claude es muy bueno en código y no hablamos mucho externamente sobre por qué Claude es tan bueno en código. ¿Por qué es tan bueno en código? Como dije, no hablamos externamente de ello. Cada nueva versión de Claude que hacemos tiene mejoras en la arquitectura, mejoras en los datos que ponemos en ella, mejoras en los métodos que usamos para entrenarla. Así que estamos desarrollando nuevas técnicas todo el tiempo. Las nuevas técnicas son parte de cada modelo que construimos. Y por eso he dicho estas cosas sobre, estamos tratando de optimizar la densidad de talento tanto como sea posible, necesitas esa densidad de talento para inventar las nuevas técnicas.

Hay una cosa que ha estado pendiente en esta conversación, y es que tal vez Anthropic es la empresa con la idea correcta, pero con los recursos equivocados. Porque miras lo que está sucediendo con XAI y dentro de Meta, donde Elon ha construido su clúster masivo, Mark Zuckerberg está construyendo este centro de datos de 5 gigavatios y están invirtiendo tantos recursos en escalar. ¿Es posible? Quiero decir, Anthropic obviamente ha recaudado miles de millones de dólares, pero estas son empresas de billones de dólares. Sí. Así que hemos recaudado, creo que hasta ahora, un poco menos de 20 mil millones de dólares. No está mal. Así que eso no es nada. Y también diría que si miras el tamaño de los centros de datos que estamos construyendo con, por ejemplo, Amazon. No creo que nuestro escalamiento de centros de datos sea sustancialmente menor que el de cualquier otra empresa en el sector. Ya sabes, en muchos casos, estas cosas están limitadas por la energía. Están limitadas por la capitalización. Ya sabes, cuando la gente habla de estas grandes cantidades de dinero, hablan de ello durante varios años, ¿verdad? Y cuando escuchas algunos de estos anuncios, a veces aún no están financiados. Hemos visto el tamaño de los centros de datos que la gente está construyendo y, de hecho, estamos bastante seguros de que estaremos dentro de un rango aproximado del tamaño de los centros de datos que construyen.

Hablaste de densidad de talento. ¿Qué piensas de lo que está haciendo Mark Zuckerberg en el frente de la densidad de talento? Quiero decir, combinando eso con estos centros de datos masivos, parece que podrá competir. Sí. Así que esto es realmente muy interesante porque notamos que, en comparación con otras empresas, creo que muy, muy menos personas de Anthropic han sido atrapadas por esto. Y no es por falta de intento. He hablado con mucha gente que recibió estas ofertas en Anthropic y que simplemente las rechazó. Que ni siquiera hablaron con Mark Zuckerberg, que dijeron, no, me quedo en Anthropic. Y nuestra respuesta general a esto fue que publiqué algo en el Slack de toda la empresa donde dije: mira, no estamos dispuestos a comprometer nuestros principios de compensación, nuestros principios de equidad para responder individualmente a estas ofertas. La forma en que funcionan las cosas en Anthropic es que hay una serie de niveles. Un candidato entra, se le asigna un nivel, y no negociamos ese nivel. Porque pensamos que es injusto. Queremos tener una forma sistemática. Si Mark Zuckerberg lanza un dardo a una diana y golpea tu nombre, eso no significa que debas recibir 10 veces más que el tipo de al lado que es igual de hábil, igual de talentoso. Y mi visión de la situación es que la única forma en que realmente puedes verte perjudicado por esto es si permites que destruya la cultura de tu empresa al entrar en pánico, al tratar a las personas de manera injusta en un intento de defender la empresa. Y creo que en realidad este fue un momento unificador para la empresa, donde no cedimos. Nos negamos a comprometer nuestros principios porque teníamos la confianza de que la gente está en Anthropic porque realmente creen en la misión. Y creo que eso llega a cómo veo esto. Creo que lo que están haciendo es intentar comprar algo que no se puede comprar. Y eso es la alineación con la misión. Y creo que hay efectos de selección aquí, como, ¿están obteniendo a las personas que están más entusiasmadas, que están más alineadas con la misión, que están más emocionadas? Pero tienen talento y GPUs. No los estás subestimando. Ya veremos cómo se desarrolla. Soy bastante pesimista sobre lo que están tratando de hacer.

Hablemos un poco de tu negocio porque mucha gente se ha estado preguntando, ¿es el negocio de la IA generativa algo real? Y también tengo curiosidad. Tengo preguntas todo el tiempo. Hablaste de cuánto dinero has recaudado, cerca de 20 mil millones. Has recaudado tres mil millones, tres mil millones de Google, 8 mil millones de Amazon, tres mil quinientos millones de una nueva ronda liderada por Lightseed, con quien he hablado. ¿Cuál es tu argumento? Porque no eres parte de una gran empresa tecnológica, estás solo. ¿Simplemente traes las leyes de escalamiento y dices: "Me das algo de dinero"? Mi visión de esto siempre ha sido que el talento es lo más importante. Así que, si retrocedes tres años, estábamos en una posición en la que habíamos recaudado meros cientos de millones. OpenAI ya había recaudado 13 mil millones de Microsoft. Y, por supuesto, las grandes empresas tecnológicas de alta capitalización tenían 100 mil millones, 200 mil millones. Y básicamente, el argumento que hicimos entonces es que sabemos cómo hacer que estos modelos sean mejores que otros, ¿verdad? Puede haber una curva. Puede haber una curva de leyes de escalamiento. Pero, mira, si estamos en una posición en la que podemos hacer por cien millones lo que otros pueden hacer por mil millones y podemos hacer por diez mil millones lo que ellos pueden hacer por cien mil millones, entonces es 10 veces más eficiente en capital invertir en Anthropic que invertir en estas otras empresas. ¿Preferirías estar en una posición en la que puedas hacer cualquier cosa 10 veces más barato o en la que empieces con una gran cantidad de dinero? Si puedes hacer las cosas 10 veces más barato, el dinero es un defecto temporal que puedes remediar. Si tienes esta capacidad intrínseca de construir cosas al mismo precio, mucho mejor que nadie o tan bien como nadie a un precio mucho menor. Los inversores no son idiotas, o al menos no siempre lo son. Depende de a quién vayas. No voy a nombrar nombres. Pero básicamente entienden el concepto de eficiencia de capital. Y así, hemos estado en una posición, hace 3 años, donde estas diferencias eran como mil veces, y ahora dices, con 20 mil millones, ¿puedes competir? ¿Puedes competir con cien mil millones? Y mi respuesta es básicamente sí, debido a la densidad de talento. Lo he dicho antes, pero Anthropic es en realidad la empresa de software de más rápido crecimiento en la historia a la escala en la que se encuentra. Crecimos de cero a 100 millones en 2023, de 100 millones a mil millones en 2024. Y este año hemos crecido de mil millones a, creo que dije esto antes, 4.5. Así que ese crecimiento de 10 veces al año, quiero decir, cada año sospecho que creceremos a esa escala y cada año casi tengo miedo de decirlo públicamente porque pienso, no, no podría volver a suceder. Así que creo que el crecimiento a esa escala habla por sí mismo en términos de nuestra capacidad para competir con los grandes jugadores.

Entonces, CNBC dice que entre el 60 y el 75% de las ventas de Anthropic son a través de la API. Eso fue según documentos internos. ¿Sigue siendo exacto? No daré cifras exactas, pero la mayoría proviene de la API, aunque también tenemos un próspero negocio de aplicaciones y creo que más recientemente, el nivel máximo que utilizan los usuarios avanzados, así como Claude Code, que utilizan los programadores. Así que creo que tenemos un negocio de aplicaciones próspero y de rápido crecimiento, pero sí, la mayoría proviene de la API.

Entonces, ¿estás haciendo la apuesta más pura en esta tecnología? Como, ya sabes, OpenAI podría estar apostando por ChatGPT y Google podría estar apostando por el hecho de que no importa hacia dónde vaya la tecnología, puede integrarse en Gmail y el calendario. Entonces, ¿por qué has hecho esta apuesta, la apuesta pura por la tecnología en sí? Me gustaría decir que no lo pondría exactamente así. Creo que hemos apostado más por los casos de uso de negocio del modelo que por la API en sí. Y es solo que los primeros casos de uso de negocio del modelo vienen a través de la API. Así que, como mencionaste, OpenAI está muy centrado en el lado del consumidor. Google está muy centrado en los productos existentes de Google. Nuestra opinión es que, si acaso, el uso empresarial de la IA será mayor incluso que el uso de la IA por parte de los consumidores, o debería decir el uso empresarial, porque es empresarial, son startups, son desarrolladores y son, ya sabes, usuarios avanzados que utilizan el modelo para la productividad. También creo que ser una empresa centrada en los casos de uso empresarial nos da mejores incentivos para mejorar los modelos. Un experimento mental que creo que vale la pena hacer es, supongamos que tengo este modelo y es tan bueno como un estudiante de pregrado en bioquímica. Y luego lo mejoro y es tan bueno como un estudiante de doctorado en bioquímica. Si voy a un consumidor, si le doy el chatbot y le digo: "Grandes noticias. He mejorado el modelo de, ya sabes, nivel de pregrado a posgrado en bioquímica". Quizás el 1% de los consumidores se preocupan por eso en absoluto, ¿verdad? El 99% simplemente dirán: "No lo entiendo de ninguna manera". Pero ahora supongamos que voy a Pfizer y digo: "He mejorado esto de bioquímica de pregrado a bioquímica de posgrado". ¡Esto va a ser el mayor negocio del mundo! Podrían pagar 10 veces más por algo así. Podría tener 10 veces más valor para ellos. Y así, el objetivo general de hacer que los modelos resuelvan los problemas del mundo, hacerlos cada vez más inteligentes, pero también capaces de aportar muchas de las aplicaciones positivas, las cosas sobre las que escribí en máquinas de gracia amorosa, como resolver los problemas de la biomedicina, resolver los problemas de la geopolítica, resolver los problemas del desarrollo económico, así como cosas más prosaicas como finanzas, derecho, productividad o seguros. Creo que da un mejor incentivo para desarrollar los modelos lo más posible. Y creo que en muchos sentidos, puede ser incluso un negocio más positivo. Así que diría que estamos haciendo una apuesta por el uso empresarial de la IA porque está más alineado con la exponencial.

Entonces, brevemente, ¿cómo decidiste optar por el caso de uso de la codificación? Originalmente, como sucede con la mayoría de las cosas, estábamos tratando de optimizar para que el modelo fuera mejor en un montón de cosas, y la codificación en particular se destacó en cuanto a lo valiosa que era. He trabajado con miles de ingenieros y hubo un momento hace aproximadamente un año o año y medio en el que uno de los mejores con los que había trabajado dijo: "Cada modelo de codificación anterior ha sido inútil para mí y este finalmente pudo hacer algo que yo no podía". Y luego, después de que lo lanzamos, comenzó a tener una rápida adopción. Esto fue alrededor del momento en que muchas de las empresas de codificación como Cursor, Windsurf, GitHub, Augment Code comenzaron a explotar en popularidad, y luego, cuando vimos lo popular que era, redoblamos la apuesta. Mi opinión es que la codificación es particularmente interesante porque la adopción es rápida y mejorar en codificación con los modelos realmente te ayuda a desarrollar el próximo modelo. Así que tiene una serie de ventajas. Y ahora vendes tu codificación de IA a través de Claude Code. Pero es muy interesante el modelo de precios ha sido confuso para algunos. Puedes gastar 200 dólares al mes y obtener el equivalente. Hablé con un desarrollador que obtuvo el equivalente a 6.000 dólares al mes de tu API. Ed Zitetron ha señalado que cuanto más populares sean tus modelos, más dinero perderás si la gente es superusuario de esta tecnología. Entonces, ¿cómo tiene sentido eso? Los esquemas de precios y los límites de tasa son sorprendentemente complicados. Así que, en parte, esto es el resultado de cuando lanzamos nuestro, cuando lanzamos Claude Code y el nivel máximo, que eventualmente unimos, en realidad no entendimos completamente las implicaciones de las formas en que las personas podían usar los modelos y cuánto podían obtener realmente. Así que en los últimos días, a partir del momento de esta entrevista, hemos ajustado eso, particularmente en los modelos más grandes como Opus. Creo que ya no es posible gastar tanto con una suscripción de 200 dólares. Y es posible que haya más cambios en el futuro, pero siempre tendremos una distribución de usuarios que usan mucho y usuarios que usan poco. Y no significa necesariamente que estemos perdiendo dinero, que haya algunos usuarios que obtengan más, si lo midieras por el gasto en créditos de API, obtienen un mejor trato en la suscripción de consumidor que en los productos de API. Hay muchas suposiciones ahí. Y puedo decirte que algunas de ellas son incorrectas. De hecho, no estamos perdiendo dinero.

Pero supongo que hay otra pregunta sobre si puedes seguir prestando estos casos de uso y no aumentar los precios. Así que, para darte un par de estadísticas, hay algunos desarrolladores que están molestos porque usar los modelos más nuevos de Anthropic en Cursor les cuesta más que nunca. Las startups con las que he hablado dicen que Anthropic está muy por debajo porque no pueden acceder a las GPUs. Al menos eso es lo que imaginan que está sucediendo. Y estuve con Amjad Masad en Replit en una entrevista que emitiremos la próxima semana, quien dijo que hubo un período en el que el precio por token, el precio por usar estos modelos, estaba bajando y dejó de bajar. Entonces, ¿lo que está sucediendo es que estos modelos son simplemente tan caros de ejecutar para Anthropic que está golpeando, es un muro propio? De nuevo, creo que estás haciendo suposiciones aquí. Por eso le pregunto al CEO. La forma en que lo pienso es que pensamos en los modelos en términos de cuánto valor están creando. Así que a medida que los modelos mejoran cada vez más, pienso en cuánto valor crean y hay una pregunta separada sobre cómo se distribuye el valor entre quienes hacen el modelo, quienes hacen los chips y quienes hacen las aplicaciones subyacentes. Así que, de nuevo, sin ser demasiado específico, creo que hay algunas suposiciones en tu pregunta que no son necesariamente correctas. Dime cuáles. Diré esto. Espero que el precio de proporcionar un nivel dado de inteligencia baje. Espero que el precio de proporcionar la vanguardia de la inteligencia, que proporcionará un valor económico creciente, pueda subir o bajar. Mi suposición es que probablemente se mantenga donde está. Pero de nuevo, el valor que se crea aumenta mucho. Así que, dentro de dos años, mi suposición es que tendremos modelos que costarán del mismo orden de magnitud que hoy, excepto que serán mucho más capaces de hacer trabajo de manera mucho más autónoma y mucho más amplia de lo que son capaces hoy.

Una de las cosas que mencionó Amjad es que cree que los modelos más grandes no son tan intensivos de ejecutar o son más intensivos de ejecutar dado su tamaño debido a la arquitectura y algunas de estas técnicas de las que hablamos, que solo activan ciertas secciones del modelo. Así que su idea, espero transmitirla honestamente, es que Anthropic puede ejecutar estos modelos sin demasiado volumen en el backend, pero aún mantiene esos precios donde están. Y creo que la línea que trazaré ahí es tal vez que para alcanzar los márgenes de software, hubo algunos informes de que Anthropic está ligeramente por debajo de los márgenes brutos de software. Tendrás que cobrar un poco más por estos modelos. Sí, de nuevo, creo que los modelos más grandes cuestan más de ejecutar que los modelos más pequeños. Creo que la técnica a la que te refieres es quizás mezcla de expertos o algo así. Así que, ya sea que tus modelos sean mezcla de expertos o no, la mezcla de expertos es una forma de ejecutar modelos más baratos que tienen un número dado de parámetros. Es una forma de entrenar modelos. Pero si no usas esa técnica, entonces los modelos más grandes que no usan esa técnica cuestan más de ejecutar que los modelos más pequeños que no usan esa técnica. Y si usas esa técnica, los modelos más grandes que usan esa técnica cuestan, ya sabes, más de ejecutar que los modelos más pequeños que usan esa técnica. Así que creo que eso es como una distorsión de la situación. Básicamente, estoy adivinando y tratando de averiguar la verdad de ti. Sí, mira, en términos de, ya sabes, el costo de los modelos, una cosa que te sorprendería es que la gente imputa esto a, oh, hombre, va a ser muy difícil obtener los márgenes de x% a y%. Hacemos mejoras todo el tiempo que hacen que los modelos sean un 50% más eficientes de lo que son. Estamos solo al principio de la optimización de la inferencia. La inferencia ha mejorado enormemente en comparación con hace un par de años y donde está ahora. Por eso los precios están bajando.

¿Y cuánto tiempo va a llevar ser rentable? Porque creo que la pérdida será como de tres mil millones este año. Eso es lo que distinguen cosas diferentes. Está el costo de ejecutar el modelo, ¿verdad? Así que, por cada dólar que gana el modelo, cuesta una cierta cantidad. Eso ya es bastante rentable. Hay cosas separadas. Está el costo de pagar a la gente y los edificios, que en realidad no es tan grande en el esquema de las cosas. El gran costo es el costo de entrenar el próximo modelo. Y creo que esta idea de que las empresas pierden dinero y no son rentables es un poco engañosa. Y empiezas a entenderlo mejor cuando miras las leyes de escalamiento. Así que, como ejercicio mental, estos números no son exactos ni siquiera cercanos para Anthropic. Imaginemos que en 2023 entrenas un modelo que cuesta 100 millones de dólares. Y luego, en 2024, despliegas el modelo de 2023 y genera 200 millones de dólares en ingresos, pero gastas mil millones de dólares para entrenar, ya sabes, para entrenar un nuevo modelo en 2024. Y luego, en 2025, el modelo de mil millones de dólares genera dos mil millones en ingresos y gastas 10 mil millones para entrenar el próximo modelo. Así que la empresa es cada año no rentable. Perdió 800 millones en 2024 y luego en 2025 perdió 8 mil millones. Así que esto parece una empresa enormemente no rentable, pero si en cambio pienso en términos de si cada modelo es rentable, piensa en cada modelo como una empresa. Invertí 100 millones en el modelo y luego obtuve 200 millones de ese modelo al año siguiente. Así que ese modelo tuvo un 50% de márgenes y me hizo 100 millones el año siguiente. La empresa invirtió mil millones de dólares e hizo 2 mil millones en ingresos o, lo siento, el próximo modelo, la empresa invirtió mil millones de dólares, así que cada modelo es rentable, pero la empresa no es rentable cada año. No estoy reclamando estos números para Anthropic ni afirmando estos hechos, pero esta dinámica general, esta dinámica general es, en términos generales, la explicación de lo que está sucediendo. Y así, en cualquier momento, si los modelos dejaran de mejorar o si una empresa dejara de invertir en el próximo modelo, probablemente tendrías un negocio viable con los modelos existentes, pero todos están invirtiendo en el próximo modelo y, por lo tanto, eventualmente alcanzará cierta escala. Pero el hecho de que estemos gastando más para invertir en el próximo modelo sugiere que la escala del negocio será mayor el próximo año que el año anterior. Ahora, por supuesto, lo que podría suceder es que los modelos dejen de mejorar y haya un costo único como un despilfarro y gastemos mucho dinero, pero luego la industria volverá a esta meseta, a este nivel de rentabilidad, o la exponencial puede continuar. Así que creo que esa es una forma larga de decir que no creo que sea la forma correcta de pensar las cosas.

Pero, ¿qué pasa con el código abierto? Porque si te detuvieras, digamos que dejaste de invertir en los modelos y el código abierto se pusiera al día, entonces la gente podría cambiar al código abierto. Me encantaría escuchar tu perspectiva sobre esto, porque una de las cosas de las que la gente ha hablado conmigo cuando se trata del negocio de Anthropic es que existe ese riesgo eventual de que el código abierto se vuelva lo suficientemente bueno como para que puedas eliminar Anthropic y poner código abierto. La gente ha, creo que una de las cosas que ha sido cierta en esta industria es que, y lo vi temprano en la historia de la IA. Cada comunidad por la que ha pasado la IA tiene este conjunto de heurísticas sobre cómo funcionan las cosas. Como cuando estaba en IA allá por 2014, había una comunidad de investigación de IA y aprendizaje automático existente que pensaba las cosas de cierta manera y decían: esto es solo una moda, esto es algo nuevo, esto no puede funcionar, esto no puede escalar, y luego, debido a la exponencial, todas esas cosas resultaron ser falsas. Luego sucedió algo similar con la gente que implementaba IA dentro de las empresas en varias aplicaciones, luego hubo el mismo pensamiento en el ecosistema de startups, y creo que ahora estamos en la fase en la que los líderes empresariales del mundo, los inversores y los negocios tienen todo un léxico de modos de comoditización, ¿a qué capa va a acumularse el valor y a qué capa va a acumularse el valor? Y el código abierto es esta idea de que puedes ver todo lo que está sucediendo, que tiene una importancia que socava el hecho de que socava el negocio. Y, de hecho, como alguien que no proviene de ese mundo en absoluto, que nunca pensó en términos de ese léxico, esta es una de esas situaciones en las que no saber nada a menudo te lleva a hacer mejores predicciones que las personas que tienen su forma de pensar sobre las cosas de la generación anterior de tecnología. Y creo que todo esto es una forma larga de decir que no creo que el código abierto funcione de la misma manera en la IA que en otras áreas. Principalmente porque con el código abierto puedes ver el código fuente del modelo, no podemos ver dentro del modelo. A menudo se le llama "pesos abiertos" en lugar de código abierto para distinguirlo, pero muchos de los beneficios, como que mucha gente pueda trabajar en él, que sea aditivo, no funciona exactamente de la misma manera. Así que, de hecho, siempre lo he visto como una cortina de humo. Cuando veo un nuevo modelo, no me importa si es de código abierto o no. Si hablamos de DeepSeek, no creo que haya importado que DeepSeek sea de código abierto. Me pregunto si es un buen modelo. ¿Es mejor que nosotros en las cosas que nos importan? Eso es lo único que me importa. En realidad, no importa de ninguna manera. Porque, en última instancia, tienes que alojarlo en la nube. Las personas que lo alojan en la nube realizan inferencias. Son modelos grandes, son difíciles de inferir. Y a la inversa, muchas de las cosas que puedes hacer cuando ves los pesos, cada vez más las ofrecemos en la nube donde puedes ajustar el modelo. Incluso estamos investigando formas de investigar las activaciones del modelo como parte de una interfaz de interpretabilidad. Hicimos algunas pequeñas cosas sobre la dirección.

Última vez. Um, así que creo que es el eje equivocado para pensar en términos de cuando pienso en competencia, pienso en qué modelos son buenos en la tarea que hacemos. Um, creo que el código abierto es en realidad una cortina de humo. Pero si es gratis y barato de ejecutar, no es gratis. Tienes que, tienes que, tienes que, tienes que ejecutarlo en inferencia y alguien, alguien tiene que hacerlo rápido en inferencia. Muy bien. Así que quiero aprender un poco más sobre Daario, la persona. Sí. Así que tenemos un poco de tiempo. Um, así que tengo algunas preguntas para ti sobre tu vida temprana y luego cómo te convertiste en quien eres. Sí. Entonces, ¿cómo fue crecer en San Francisco? Sí. Um, yo, sabes, la ciudad cuando crecí aquí no se había gentrificado realmente, uh, uh, tanto. Sabes, cuando crecí, el auge tecnológico no había, no había sucedido todavía. Um, sabes, sucedió mientras yo estaba en la escuela secundaria. Y, de hecho, no tenía ningún interés en ello. Um, era totalmente, era totalmente aburrido para mí. Um, sabes, estaba interesado en ser como un científico. Estaba interesado en física y matemáticas y, sabes, la idea de, sabes, sabes, como escribir algún sitio web, en realidad no me interesaba en absoluto, o como fundar una empresa, esas no eran cosas que me interesaran en absoluto. Um, sabes, estaba interesado en descubrir verdades científicas fundamentales y estaba interesado en, sabes, cómo puedo, cómo puedo hacer algo que, sabes, haga el mundo mejor. Um, uh, así que, así que, sabes, eso fue, eso fue más o menos y, sabes, vi el auge tecnológico suceder a mi alrededor, pero creo que, sabes, había todo tipo de cosas que probablemente podría haber aprendido de él que habrían sido útiles ahora, pero simplemente no estaba prestando atención y no tenía ningún interés en ello, a pesar de que estaba justo en el centro de todo.

Así que eras hijo de una madre judía y un padre italiano, eso es cierto. De donde yo soy en Long Island, llamamos a eso un "pizza bagel". Un "pizza bagel". Nunca, nunca había oído ese término antes. Entonces, ¿cómo era tu relación con tus padres? Sí, quiero decir, sabes, yo siempre, yo siempre, yo siempre fui bastante cercano a ellos. Sabes, siento que me dieron un sentido de, sabes, de lo correcto y lo incorrecto y de lo que era importante en el mundo. Siento que, sabes, inculcar un fuerte sentido de responsabilidad es quizás lo que más recuerdo. Sabes, siempre fueron personas que sintieron ese sentido de responsabilidad y, sabes, querían, querían hacer el mundo, um, uh, querían hacer el mundo mejor. Y, y siento que, sabes, esa es una de las, una de las cosas principales que aprendí de ellos. Sabes, siempre fue una familia muy, muy, um, una familia muy cariñosa, una familia muy atenta. Estaba muy unido a mi hermana Daniela, quien, por supuesto, se convirtió en mi, se convirtió en mi, se convirtió en mi cofundadora. Y, sabes, creo que decidimos muy temprano que queríamos trabajar juntos de alguna, de alguna capacidad. No sé si imaginamos que sucedería, sabes, a la escala que, que, que ha sucedido. Um, uh, pero, sabes, creo que creo que realmente, um, sabes, eso fue, eso fue algo que decidimos temprano que queríamos hacer.

Las personas con las que he hablado y que te han conocido a lo largo de los años me han dicho que la enfermedad de tu padre tuvo un gran impacto en ti. ¿Puedes compartir un poco sobre eso? Um, sí. Sí, él lo estaba. Um, sí, sabes, estuvo enfermo durante mucho tiempo. Um, y, uh, finalmente, uh, uh, murió en, finalmente murió en, uh, en 2006. Um, uh, así que, sabes, eso fue en realidad una de las cosas que me impulsó a, sabes, no creo que lo hayamos mencionado todavía en esta entrevista, pero antes, um, sabes, antes de entrar en la IA, um, sabes, entré en la biología. Así que, sabes, había ido a, uh, yo, sabes, había aparecido en, había aparecido en Princeton, um, uh, queriendo ser un físico teórico y, sabes, hice algo, hice algo de trabajo en cosmología durante los primeros meses de mi tiempo allí. Um, sabes, y, y, sabes, eso fue alrededor de la época en que mi padre murió y, sabes, eso tuvo una influencia en mí y, de alguna manera, fue una de las cosas que me convenció, um, sabes, de entrar en la biología, sabes, para intentar abordar, um, uh, uh, sabes, enfermedades humanas y problemas biológicos. Y así, comencé a hablar con algunas de las personas que trabajaban en biofísica y neurociencia computacional en el departamento en el que estaba en Princeton, y eso fue lo que llevó al cambio a la biología y la neurociencia computacional, y luego, sabes, por supuesto, después de eso, eventualmente, eventualmente entré en la IA. Y la razón por la que entré en la IA fue en realidad una continuación de esa motivación, que es que, um, sabes, a medida que pasé muchos años en biología, me di cuenta de que la complejidad de los problemas subyacentes en biología parecía estar más allá de la escala humana. Sabes, para entenderlo todo, necesitabas cientos, miles de, sabes, investigadores humanos y, sabes, a menudo tenían dificultades para colaborar o compartir su, sabes, combinar su conocimiento. Y la IA, que apenas estaba comenzando a ver los descubrimientos en ella, me pareció la única tecnología que podía, de alguna manera, cerrar esa brecha, podía llevarnos más allá de la escala humana para, sabes, para entender y resolver completamente los problemas de la biología.

Así que, sí, hay una línea conductora ahí, ¿verdad? Y puedo estar equivocado. Uh, pero una cosa que escuché fue que su enfermedad era, um, en gran medida incurable cuando la tuvo. Y ha habido avances que han sido. ¿Puedes compartir un poco más? Sí. Hay avances que la han hecho mucho más manejable hoy en día. Sí. Sí. Eso es, eso es, eso es, eso es, eso es cierto. De hecho, de hecho, solo, um, uh, solo en los, um, uh, quizás 3 o 4 años después de su muerte, la tasa de curación de la enfermedad que tuvo pasó de, pasó del 50% a, uh, uh, a aproximadamente el 95%. Sí.

Quiero decir, debe haber parecido tan injusto que tu padre te fuera arrebatado por algo que podría haberse curado. Por supuesto, por supuesto, um, pero también te dice la urgencia de resolver los problemas relevantes, ¿verdad? Que, um, sabes, que, que, sabes, hubo alguien que trabajó en la cura para esta enfermedad que, sabes, logró curarla y salvar la vida de muchas personas, pero, sabes, podría haber, podría haber salvado aún más vidas si, si, sabes, hubieran logrado encontrar esa, esa cura, sabes, unos años antes de lo que lo hicieron. Um, y creo que esa es una de las tensiones aquí, ¿verdad? Que, sabes, um, creo que la IA tiene todos estos beneficios. Um, y, sabes, quiero que todos obtengan esos beneficios lo antes posible. Sabes, probablemente entiendo, sabes, mejor que casi nadie, cuán urgentes son esos beneficios. Um, y así, realmente entiendo lo que está en juego. Sabes, cuando hablo sobre que la IA tiene estos riesgos y estoy preocupado por estos riesgos, me enfado mucho cuando la gente me llama "doomster" (pesimista). Me enfadé mucho cuando, sabes, cuando alguien dice: "Este tipo es un pesimista. Quiere que las cosas vayan más lentas". Escuchaste lo que acabo de decir, como, sabes, mi padre murió por, sabes, curas que, sabes, podrían haber, podrían haber sucedido unos años después. Entiendo el beneficio de esta tecnología. Cuando me senté a escribir "Machines of Loving Grace", sabes, escribí todas las formas en que las vidas de miles de millones de personas podrían ser mejores con esta tecnología. Algunas de estas personas, algunas de estas personas que en Twitter, sabes, animan a la aceleración. No creo que tengan un sentido humanista del beneficio de la tecnología. Sus cerebros están llenos de adrenalina y les gusta animar algo. Quieren acelerar. No tengo la impresión de que les importe. Um, y así, cuando estas personas me llaman pesimista, creo que creo que simplemente carecen por completo de cualquier credibilidad moral al hacerlo. Um, uh, sabes, realmente me hace perder el respeto por ellos.

Y he estado preguntándome qué ha sido esta palabra "impacto" porque ha surgido con tanta frecuencia que quienes te han rodeado han dicho que has estado singularmente obsesionado con tener impacto. De hecho, hablé con alguien que te conocía bien y que dijo que no veías "Juego de Tronos" porque no estaba ligado al impacto, que era una pérdida de tiempo y que querías centrarte en el impacto. En realidad, eso no es del todo correcto. No lo veía porque era una suma tan negativa que la gente jugaba, jugaba de forma tan negativa. Era como si estas personas empezaran y fueran en parte la situación y en parte porque son personas horribles. Crean esta situación en la que al final todos están peor que antes. Um, estoy, estoy realmente, estoy realmente emocionado por crear situaciones de suma positiva. Um, te recomiendo que lo veas. Es un gran, es un gran programa. Pero escucho, escucho algunas partes de él, fui muy reacio y no lo vi durante mucho tiempo.

Volvamos al impacto. Volvamos al impacto. Así que eso es lo que es el impacto, efectivamente, tu carrera ha sido esta, esta búsqueda de tener ese impacto, de poder decirme si voy demasiado lejos para evitar que otras personas se encuentren en situaciones similares. Yo, sabes, yo, sabes, creo que, sabes, creo que creo que esa es una parte de ello. Quiero decir, sabes, he mirado, sabes, muchos, uh, sabes, muchos intentos de ayudar a las personas y, sabes, algunos de ellos son más efectivos que otros. Um, y, sabes, creo que creo que siempre he intentado, sabes, debería haber una estrategia detrás de ello. Debería haber cerebro detrás de, um, sabes, intentar, intentar ayudar a las personas. Um, sabes, lo que a menudo significa que hay un camino largo, ¿verdad? Puede pasar por una empresa y, sabes, muchas actividades que son técnicas y no están inmediatamente ligadas al tipo de impacto que estás intentando tener. Pero, sabes, el, el, el arco es que siempre estoy intentando inclinar el arco hacia eso. Creo que creo que esa es mi, esa es mi imagen de ello. Eso es, eso es realmente por lo que, eso es realmente por lo que me metí en esto, ¿verdad? Sabes, um, creo que, sabes, similar a la razón para entrar en la IA fue que, um, sabes, yo, yo vi los problemas de la biología como casi intratables sin ella o al menos demasiado lentos. Um, sabes, creo que mi razón para empezar una empresa fue que había trabajado en otras empresas y yo, yo, yo simplemente no sentía que la forma en que esas empresas se dirigían estuviera realmente orientada hacia, sabes, intentar, intentar, intentar tener ese impacto. Había una historia a su alrededor que se usaba a menudo para reclutar, pero me quedó claro con los años que esa historia no era sincera.

Voy a dar una vuelta porque está claro que te refieres a OpenAI. Um, por lo que entiendo, tenías el 50% de la computación de OpenAI. Quiero decir, dirigiste el proyecto GPT3. Así que, si alguien iba a centrarse en el impacto y la seguridad, ¿no habrías sido tú? Uh, sí. Yo, yo estaba, sabes, hubo un período durante el cual, durante el cual eso fue, eso fue cierto. Eso no fue cierto todo el tiempo. Eso fue, por ejemplo, cuando estábamos escalando GPT3. Um, sí. Así que, sabes, yo, cuando estaba en OpenAI, yo y muchos de mis colegas, incluyendo a las personas que, sabes, eventualmente, um, eventualmente fundaron Anthropic, los pandas, um, los pandas. Ese es el nombre que les diste. Ese no es un nombre que les di yo. El nombre que tomaron. Uh, ese no es un nombre que tomaron. Um, ese es el nombre que otras personas les dieron. Uh, yo, quizás es un nombre que otras personas les dieron. Uh, ese no es un nombre que yo usara para mi equipo. De acuerdo. Lo siento. Continúa. Uh, esa es una buena aclaración. Gracias. Um, uh, así que, uh, sí, um, sabes, estábamos involucrados en escalar estos modelos. De hecho, la razón original para construir GPT2 y GPT3 fue una consecuencia del tipo de trabajo de alineación de IA que estábamos haciendo, ¿verdad? Donde yo y Paul Cristiano y algunos de los cofundadores de Anthropic habíamos inventado esta técnica llamada RL de retroalimentación humana, um, uh, y eso fue diseñado para ayudar a dirigir los modelos en, um, uh, sabes, una dirección para seguir la intención humana. Fue en realidad un precursor de, sabes, estábamos tratando de escalar otro método llamado supervisión escalable, que creo que recién está comenzando a funcionar muchos años después para ayudar a los modelos a seguir una intención humana más escalable, um, uh, uh, humana. Pero lo que encontramos es que incluso con la técnica más primitiva, RL de retroalimentación humana, no funcionaba con los modelos de lenguaje pequeños, con, sabes, GPT1 al que lo aplicamos y que había sido construido por otras personas en OpenAI. Así que la escalada de GPT2 y GPT3 se hizo para, de alguna manera, estudiar estas técnicas para aplicar RL de retroalimentación humana a escala. Um, uh, sabes, esto va a una cosa, que es que creo que en este campo la alineación de los sistemas de IA y la capacidad de los sistemas de IA están entrelazadas de esta manera que siempre termina siendo más ligada y más entrelazada de lo que pensamos. De hecho, lo que esto me hizo darme cuenta es que es muy difícil trabajar en la seguridad de los sistemas de IA y en la capacidad de los sistemas de IA por separado. Es muy difícil trabajar en uno y no en el otro. De hecho, creo que el valor y la forma de influir en el campo de una manera más positiva proviene de las decisiones a nivel organizacional. cuándo lanzar cosas, cuándo estudiar cosas internamente, qué tipo de trabajo hacer en los sistemas. Um, y esa fue una de las cosas que motivó, sabes, a mí y a algunos de los otros, sabes, fundadores de Anthropic a, de alguna manera, irse y hacerlo a nuestra manera. Pero de nuevo, como si estuvieras conduciendo, si crees que el lenguaje, si crees que las capacidades y la seguridad están interconectadas y tú eras el que conducía los modelos de vanguardia dentro de OpenAI, sabes, si te ibas, sabías que iban a ser una empresa que todavía hacía estas cosas. Es correcto. Parece que si estás dirigiendo las capacidades, serías el que está al volante para ayudar a que sea seguro de la manera que querías. De nuevo, diré, um, sabes, si hay una decisión sobre el lanzamiento de un modelo, si hay una decisión sobre la gobernanza de la empresa, si hay una decisión sobre, sabes, cómo trabaja el personal de la empresa, um, sabes, cómo se representa la empresa externamente, las decisiones que toma la empresa con respecto al despliegue, las afirmaciones que hace sobre cómo opera con respecto a la sociedad. Um, sabes, muchas de esas cosas no son cosas que controlas solo por, solo por entrenar el modelo y, sabes, creo que la confianza es realmente importante. Creo que los líderes de la empresa, de una empresa, tienen que ser personas dignas de confianza, tienen que ser personas cuyas motivaciones son sinceras, sin importar cuánto impulses la empresa técnicamente, si estás trabajando para alguien cuyas motivaciones no son sinceras, que no es una persona honesta, que no quiere realmente hacer el mundo mejor, no va a funcionar, solo estás contribuyendo a algo malo.

Entonces, y estoy seguro de que has escuchado la crítica de personas como Jensen, que dicen: "Bueno, Daario cree que es el único que puede construir esto de forma segura y, por lo tanto, hablando de esa palabra control, quiere controlar toda la industria". Nunca he dicho, nunca he dicho nada parecido. Eso es una mentira escandalosa. Esa es la mentira más escandalosa que he oído. Um, por cierto, lamento si me equivoqué con las palabras de Jensen, pero No, no, no. Las palabras eran correctas. De acuerdo. Las, pero, pero, pero las palabras son, las palabras son escandalosas. De hecho, he dicho varias veces y creo que las acciones de Anthropic lo han demostrado que, um, sabes, estamos apuntando a algo que llamamos una carrera hacia la cima. Um, sabes, he dicho esto en podcasts a lo largo de los años y creo que las acciones de Anthropic lo han demostrado, donde, sabes, con una carrera hacia el abismo, ¿verdad?, todos compiten para, sabes, sacar las cosas lo más rápido posible. Y así, digo que cuando tienes una carrera hacia el abismo, no importa quién gane, todos pierden, ¿verdad? Porque creas el sistema inseguro que ayuda a tu adversario o causa problemas económicos o, sabes, es inseguro desde una perspectiva de alineación. La forma en que pienso sobre la carrera hacia la cima es que, um, no importa, no importa quién gane, todos ganan, ¿verdad? Así que la forma en que funciona la carrera hacia la cima es que estableces un ejemplo de cómo funciona el campo. Para decir, um, uh, uh, sabes, vamos a participar en esta práctica. Así que un ejemplo clave de esto son las políticas de escalado responsable. Fuimos los primeros en publicar una política de escalado responsable y, sabes, no dijimos que todos los demás deberían hacer esto o son chicos malos. No dijimos, sabes, no intentamos usarlo a su favor. Lo publicamos y luego animamos a todos los demás a hacerlo. Um, y muchos, y, y luego descubrimos en los meses posteriores que, sabes, había personas dentro de las otras empresas que estaban tratando de publicar políticas de escalado responsable, pero el hecho de que lo hubiéramos hecho permitió, sabes, dio permiso a esas personas, ¿verdad?, de alguna manera, permitió a esas personas, um, sabes, hacer el argumento ante el liderazgo: "Oye, Anthropic está haciendo esto, así que nosotros también deberíamos hacerlo". Lo mismo ha ocurrido con la inversión en interpretabilidad. Publicamos nuestra investigación de interpretabilidad para todos, um, uh, y permitimos que otras empresas la copien, aunque hemos visto que a veces tiene ventajas comerciales, lo mismo ocurre con cosas como la IA constitucional, lo mismo con la medida, la medida, la, sabes, la medición de los peligros de nuestros sistemas, las capacidades peligrosas, las evaluaciones. Así que estamos tratando de establecer un ejemplo para el campo, pero hay una interacción donde ayuda ser un competidor comercial poderoso. No he dicho nada que, que, que se parezca remotamente a la idea de que esta empresa debería ser la única en construir la tecnología. No sé cómo alguien podría derivar eso de algo que he dicho. Um, es, es, es, es solo sí. Sí. Es solo, es solo, es solo una distorsión increíble y de mala fe.

Muy bien, veamos si podemos aligerar un poco el ambiente con una o dos cosas antes de hacerte la última pregunta, para la que tendremos cinco minutos. ¿Qué pasó con SPF? ¿Qué pasó con SPF? Quiero decir, él era uno de... Adelante. No podría decírtelo. No podría... ¿Qué no respondiste? Probablemente conocí al tipo cuatro o cinco veces. Um, uh, así que no tengo una gran visión, um, de la, sabes, qué, um, de la psicología de SPF o, sabes, por qué hizo cosas tan estúpidas o inmorales como, como, como, como lo hizo. Creo que lo único, lo único que había visto antes de SPF fue, sabes, un par de personas me mencionaron que era difícil trabajar con él, que, sabes, era como un tipo de "muévete rápido y rompe cosas". Um, y yo estaba como, "De acuerdo", sabes, hay mucha gente. Bienvenido a Silicon Valley. Sí. Como, bienvenido, bienvenido a Silicon Valley. Um, y así, recuerdo haber dicho: "Está bien, le daré a este tipo sillas sin derecho a voto. No lo pondré en la junta directiva. Suena como una persona desagradable con la que tratar todos los días". Um, pero, sabes, está entusiasmado con la IA. Está entusiasmado con la seguridad de la IA. Él está, sabes, él es un alcista en, en, en la IA y está interesado en la seguridad de la IA. Así que, sabes, parece una, parece una cosa sensata, parece una cosa sensata que hacer. Sabes, en, uh, en, en, sabes, en, como, en, en, en retrospectiva, um, sabes, que, sabes, ese, sabes, movimiento rápido y, y, y romper cosas, sabes, resultó ser mucho, mucho, mucho más extremo y malo de lo que, sabes, de lo que, de lo que, de lo que jamás imaginé.

De acuerdo. Así que terminemos aquí. Así que encontraste tu impacto. Quiero decir, estás trabajando el sueño, más o menos, ¿verdad? Quiero decir, piensa en todas las formas en que la IA puede ser utilizada para la biología, solo para empezar. También dices que esta es una tecnología peligrosa y tengo curiosidad si tu deseo de impacto podría estar empujándote a acelerar esta tecnología, mientras que, sabes, potencialmente devalúas la posibilidad de que controlarla pueda no ser factible.

Así que, creo que he advertido más que nadie en la industria sobre los peligros de la tecnología. ¿Verdad? Acabamos de pasar 10, 20 minutos hablando sobre, sabes, el, el aterrador, el, sabes, la gran variedad de, sabes, personas que dirigen, sabes, empresas de billones de dólares criticándome por, sabes, por hablar de los peligros de estas tecnologías, ¿verdad? Tengo funcionarios del gobierno de EE. UU. Tengo personas que dirigen empresas de 4 billones de dólares criticándome por hablar de los peligros de la tecnología, ¿verdad? Imputándome todas estas motivaciones extrañas que no tienen relación con, sabes, con nada de lo que he dicho, no respaldadas en nada de lo que he hecho. Y, sin embargo, voy a seguir haciéndolo. De hecho, creo que, sabes, a medida que los ingresos, a medida que el negocio económico de la IA aumenta, y está aumentando exponencialmente, sabes, si tengo razón, en un par de años, será la mayor fuente de ingresos del mundo, ¿verdad? Será la industria más grande del mundo. Y las personas que dirigen empresas ya lo piensan. Así que, de hecho, tenemos esta situación aterradora en la que, uh, sabes, cientos de miles de millones a billones, diría que quizás 20 billones de capital están del lado de acelerar la IA lo más rápido posible. Tenemos esta, sabes, empresa que es muy valiosa en términos absolutos, pero, sabes, parece muy pequeña en comparación, ¿verdad? 60, 60 mil millones, 60 mil millones. Y sigo hablando, incluso si, sabes, hace que la gente en, ha habido estos artículos, uh, sabes, algunas personas en el gobierno de EE. UU. están molestas con nosotros, por ejemplo, por oponernos a la moratoria sobre la regulación de la IA, por estar a favor de los controles de exportación de chips a China, por hablar de los impactos económicos de la IA. Cada vez que hago eso, soy atacado por muchos de mis colegas. ¿Verdad?

Pero sigues asumiendo que podemos controlarla. Eso es lo que estoy señalando. Pero solo te estoy diciendo cuánto, cuánto esfuerzo, cuánta persistencia, cuánta a pesar de todo lo que se ha acumulado, a pesar de todos los peligros, a pesar del riesgo que tiene para la empresa de estar dispuesto a hablar, estoy dispuesto a hacerlo. Y y y eso es, eso es por lo que digo que mira, si, si creyera que no había forma de controlar la tecnología, ¿verdad? Si creyera que incluso, incluso si creyera que esto es solo una apuesta, ¿verdad? Algunas personas dicen: "Oh, ¿crees que hay un 5 o 10% de posibilidades de que la IA salga mal? Estás tirando los dados". Esa no es la forma en que lo pienso. Este es un juego de varios pasos, ¿verdad? Das un paso, construyes el siguiente paso de los modelos más potentes, tienes un régimen de pruebas más intensivo. A medida que nos acercamos cada vez más a los modelos más potentes, hablo cada vez más y tomo acciones cada vez más drásticas porque me preocupa que los riesgos de la IA se estén acercando cada vez más. Estamos trabajando para abordarlos. Hemos logrado una cierta cantidad de progreso, pero cuando me preocupa que el progreso que hemos logrado en los riesgos no, sabes, no esté completamente alineado con el, um, uh, sabes, no esté yendo tan rápido como necesitamos ir para la velocidad de la tecnología, entonces acelero, entonces hablo más fuerte. Um, y así, sabes, me preguntas por qué estoy hablando, sabes, qué, sabes, empezaste esta entrevista diciendo qué te ha pasado, por qué estás hablando de esto. Es porque lo exponencial está llegando al punto en que me preocupa que podamos tener una situación en la que nuestra capacidad para manejar el riesgo no esté al día con la velocidad de la tecnología. Y así es como estoy respondiendo a ello. Si creyera que no había forma de controlar una tecnología, lo cual, yo, yo, yo, yo no veo absolutamente ninguna evidencia para esa proposición, hemos mejorado en el control de modelos con cada modelo, con cada modelo que lanzamos, ¿verdad? Todas estas cosas salen mal, pero como, realmente, realmente tienes que probar las tensiones de los modelos bastante. Eso no significa que no puedas tener un comportamiento malo emergente. Y creo que, sabes, si llegáramos a modelos mucho más potentes con solo las técnicas de alineación que tenemos ahora, entonces estaría muy preocupado. Entonces estaría diciendo que todos deberían dejar de construir estas cosas. Incluso China debería dejar de construir estas. No creo que me escuchen, que es una de las razones por las que creo que los controles de exportación son una mejor, es, es, es una mejor medida. Pero si, si nos adelantáramos unos años en modelos y solo tuviéramos las técnicas de alineación y dirección que tenemos hoy, entonces, sabes, definitivamente estaría abogando por que, sabes, que, que, que, que frenemos mucho. La razón por la que advierto sobre el riesgo es para que no tengamos que frenar. Para que podamos invertir en técnicas de seguridad y continuar el progreso, continuar el progreso del campo. Sería un esfuerzo económico enorme, incluso si una empresa estuviera dispuesta a frenar la tecnología. Sabes, eso no detiene a todas las demás empresas, eso no detiene a nuestros adversarios geopolíticos ante quienes esta es una lucha existencial por la supervivencia. Así que, sabes, hay, hay, hay muy poca, sabes, hay muy poca latitud aquí, ¿verdad? Estamos atrapados entre todos los beneficios de la tecnología, la carrera para acelerarla y el hecho de que esa es una carrera multipartidista. Y así, estoy haciendo lo mejor que puedo, que es invertir en tecnología de seguridad para acelerar, para acelerar el progreso de la seguridad. He escrito ensayos sobre la importancia de la interpretabilidad, sobre lo importantes que son varias direcciones en, uh, en, en seguridad. Publicamos todo nuestro trabajo de seguridad abiertamente porque creemos que eso es un bien público. Eso es algo que todos, que, que, que, que todos necesitan compartir.

Así que, si tienes una mejor estrategia para equilibrar los beneficios, la inevitabilidad de la tecnología y los riesgos que enfrenta, estoy muy abierto a escucharla porque me duermo cada noche pensando en ello porque tengo una comprensión tan increíble de lo que está en juego en términos de los beneficios, en términos de, sabes, lo que puede hacer, las vidas que puede salvar. He visto eso personalmente. También he visto los riesgos personalmente. Ya hemos visto cosas salir mal con los modelos. Sabes, tenemos un ejemplo de eso con Grok. Y, sabes, la gente descarta esto, pero ya no se reirán cuando los modelos tomen acciones, cuando estén fabricando y cuando estén a cargo de, sabes, intervenciones médicas, ¿verdad? La gente puede reírse de los riesgos cuando los modelos solo están hablando. Pero creo que es muy serio. Y así, creo que lo que esta situación exige es una comprensión muy seria tanto de los riesgos como de los beneficios. Estas son decisiones de alto riesgo. Deben tomarse con, deben, deben, deben tomarse con seriedad. Y, y creo que algo que me preocupa mucho es que, por un lado, tenemos un grupo de personas que son simplemente pesimistas. La gente me llama pesimista. Yo no lo soy. Pero hay pesimistas ahí fuera. Personas que dicen que saben que no hay forma de construir esto de forma segura. Sabes, yo, yo, yo, yo he mirado sus argumentos. Son un montón de tonterías. La idea de que estos modelos tienen peligros asociados, incluidos peligros para la humanidad en su conjunto, eso tiene sentido para mí. La idea de que podemos probar lógicamente que no hay forma de hacerlos seguros, eso me parece una tontería. Así que, así que creo que esa es una forma intelectual y moralmente poco seria de responder a la situación en la que nos encontramos.

También creo que es intelectual y moralmente poco serio para las personas que tienen 20 billones de dólares en capital que trabajan juntas porque sus incentivos están todos en la misma dirección. Hay signos de dólar en todos sus ojos, um, sentarse allí y decir que no deberíamos regular esta tecnología durante 10 años. Cualquiera que diga eso, que deberíamos preocuparnos por la seguridad de estos modelos, es alguien que solo quiere controlar la tecnología ellos mismos. Esa es una afirmación escandalosa y es una afirmación moralmente poco seria. Nos hemos sentado aquí y hemos hecho todas las investigaciones posibles. Hablamos cuando creemos que es apropiado hacerlo. Hemos intentado respaldar, sabes, cuando hacemos afirmaciones sobre el impacto económico de la IA. Tenemos un consejo de investigación económica. Tenemos un, tenemos un índice económico que utilizamos para seguir el modelo en tiempo real. Y estamos otorgando subvenciones para que las personas comprendan el impacto económico, el impacto económico de la tecnología. Creo que para las personas que están mucho más invertidas financieramente en el éxito de la tecnología que, que, que yo, simplemente, sabes, lanzar ataques ad hominem a la ligera, sabes, creo que eso es tan intelectual y moralmente poco serio como la posición del pesimista. Um, creo que lo que necesitamos aquí es más reflexión, necesitamos más honestidad, necesitamos más personas dispuestas a ir en contra de sus intereses, dispuestas a no tener, sabes, peleas triviales en Twitter, "hot takes". Necesitamos que las personas inviertan realmente en comprender la situación, que hagan el trabajo, que publiquen la investigación y que aporten algo de luz y perspectiva a la situación en la que nos encontramos. Estoy tratando de hacer eso. No creo que lo esté haciendo perfectamente, como ningún humano puede. Estoy tratando de hacerlo lo mejor que puedo. Sería muy útil si hubiera otros que intentaran hacer lo mismo.

Bueno, Dario, dije esto fuera de cámara, pero quiero asegurarme de decirlo mientras terminamos. Aprecio cuánto publica Anthropic. Hemos aprendido mucho de los experimentos, desde el "red teaming" de los modelos hasta la máquina expendedora de Claude, de la que no tuvimos tiempo de hablar hoy. Pero creo que el mundo está mejor solo por escuchar todo lo que está sucediendo aquí. Y, y en ese sentido, gracias por sentarte conmigo y pasar tanto tiempo juntos. Gracias por invitarme. Gracias a todos por escuchar y ver. Y nos vemos la próxima vez en Big Technology Podcast.