Transcription
Il y a un nouvel agent IA qui vient d'égaler le modèle 70 fois plus grand tout en étant 462 fois moins cher à exécuter. Et cela a été réalisé en supprimant toute la couche d'orchestration. Et il y a un article qui le prouve. Voyez-vous, toute l'industrie s'est ralliée autour de ces frameworks d'orchestration, n'est-ce pas ? Vous avez LangGraph, CrewAI, il y en a d'autres, mais ils sont très populaires. Et l'idée est assez simple, n'est-ce pas ? Vous prenez un modèle IA et au-dessus, vous mettez un contrôleur de trafic. C'est cette orchestration externe qui injecte des instructions et des décisions de routage à chaque tour. Et le problème avec cela est que, comme cela s'exécute à chaque tour, cela ajoute plus de complexité. Il y a plus de tokens, n'est-ce pas ? Donc, il y a plus de coûts et cela ajoute plus de points de défaillance. Dans l'article, ils donnent un exemple. Il y a un taux d'échec de 24% juste sur la réservation de voyages en utilisant cette approche d'orchestration externe. Mais l'article dit : "Non, nous allons nous débarrasser de tout cela." ce qui signifie que nous allons compiler toute l'orchestration directement dans les poids d'un modèle plus petit. Vous généreriez des conversations synthétiques à partir de la procédure, vous les affineriez, et maintenant le petit modèle devient votre orchestrateur, ce qui signifie qu'à l'exécution, il n'y a pas d'orchestrateur. Nous ne routons aucun appel. Nous n'avons pas besoin d'appels API à chaque tour. Le modèle connaît déjà la procédure parce qu'il l'a vécue pendant l'entraînement. Les chercheurs ont testé cela dans trois domaines et le modèle compilé de 8 milliards a atteint 87 à 98% sur la qualité de pointe, et ce, contre l'orchestrateur LangGraph fonctionnant sur un modèle 70 fois plus grand. Donc, le meilleur avantage que cette approche offre est qu'elle est 462 fois moins chère sur les flux de travail les plus complexes et 2,8 fois plus rapide car il n'y a plus d'API externe entre chaque tour. Et comme le modèle s'exécute sur votre infrastructure, vos flux de travail propriétaires ne touchent jamais une API tierce. Et je sais ce que vous pensez. Et si mon flux de travail change ? Dans ce cas, vous pouvez le compiler en moins de 30 à 50 minutes avec vos nouvelles modifications. Donc, pour résumer, vous prenez votre flux de travail entier, vous l'intégrez directement dans un petit modèle, et le modèle devient simplement l'orchestrateur. Et selon l'article, c'est la même qualité, une fraction du coût, et beaucoup plus rapide à l'exécution. Suivez-moi et je vous tiendrai informé.