Transcription
Et si vous pouviez exécuter un modèle d'IA de 70 milliards de paramètres sans aucun supercalculateur ? C'est maintenant possible avec une bibliothèque Python open-source appelée AirLLM. Au lieu de charger un modèle massif d'un coup, il le charge couche par couche depuis votre disque dur, un peu comme lire un livre page par page au lieu de mémoriser le tout d'abord. Il existe également une fonctionnalité appelée "flash attention", qui maintient l'utilisation de la mémoire presque plate même avec de longues entrées. Avec elle, des modèles comme Llama 3.3 70 milliards de paramètres peuvent fonctionner directement sur votre MacBook ou votre ordinateur de jeu. Pour les étudiants, les chercheurs et les développeurs indépendants, cela change complètement la donne.