Martial ZinsouLa problématique Le grand public ne voit que la partie émergée de l'iceberg : un prompt, une réponse....
La problématique
Le grand public ne voit que la partie émergée de l'iceberg : un prompt, une réponse. En coulisses, la réalité technique et financière est d'une tout autre ampleur. Faire tourner un modèle, calculer chaque token un à un pour des milliers d'utilisateurs sans exploser les budgets serveurs, c'est un défi d'ingénierie colossal que l'on appelle l'inférence.
Le paradigme a changé : les poids d'un modèle performant peuvent occuper près d'un téraoctet de mémoire, les cartes spécialisées pour data centers (type NVIDIA B200) coûtent des fortunes, et chaque requête consomme mémoire temporaire et calculs intermédiaires. Trois questions hantent les directions :
Combien coûte vraiment chaque token ? : hébergement, énergie, latence, passage à l'échelle.
Comment rentabiliser les modèles open-weights ? : un cerveau gratuit de centaines de gigaoctets reste cher à servir.
Quel hardware pour demain ? : GPU polyvalents ou puces dédiées type Groq et Cerebras face à des architectures qui évoluent vite.
Verdict de Martial Zinsou : la valeur se déplace de la création de l'IA vers la mécanique complexe de son exécution. Et avec des modèles open-weights matures, la question n'est plus « quelle est la meilleure IA ? » mais « qui peut me la servir de façon sécurisée, au meilleur prix, avec la plus faible latence, intégrée à mon SI ? ».
Interview : cinq questions à Martial Zinsou
Le public ne voit que le prompt. Que se passe-t-il vraiment en coulisses ?
C'est le cœur du problème : l'inférence. Générer du texte, c'est faire tourner le modèle et calculer chaque token un à un pour formuler la réponse. On croit que la valeur est dans la création du modèle par les grands laboratoires, mais une fois que vous avez ce « cerveau », parfois open source et gratuit, pesant des centaines de gigaoctets, le faire fonctionner pour des milliers d'utilisateurs sans exploser vos budgets serveurs est un défi d'ingénierie colossal. La valeur se déplace de la création de l'IA vers la mécanique complexe de son exécution.
Faire tourner ces IA, est-ce vraiment si cher ?
C'est faramineux si ce n'est pas optimisé. Les poids d'un modèle récent occupent près d'un téraoctet de mémoire, et il faut des cartes graphiques spécialisées pour data centers qui coûtent des fortunes à l'achat comme à la location horaire. Et le modèle n'occupe pas tout l'espace à lui seul : mémoire temporaire, calculs intermédiaires, requêtes simultanées. Sans infrastructure logicielle optimisée, vous gaspillez énormément de ressources. Dans mon métier, l'enjeu est de produire des tokens pour le coût le plus bas possible tout en garantissant des performances optimales.
Comment rentabiliser les modèles open source ? Quelles astuces ?
L'optimisation extrême, à trois niveaux. D'abord la gestion des flux avec le batching continu : on groupe les requêtes au lieu de traiter un utilisateur après l'autre, comme remplir un bus plutôt que faire rouler une voiture par personne. Ensuite la mémoire avec le KV cache : face à un contexte énorme, le système garde les calculs intermédiaires des parties qui ne changent pas au lieu de tout recalculer, une économie monumentale à l'échelle de millions de requêtes. Enfin le hardware lui-même, avec des custom kernels qui réduisent les allers-retours entre mémoire et unités de calcul. Le goulet, ce n'est pas toujours la puissance pure, c'est le déplacement de l'information.
Groq, Cerebras : les puces dédiées sont-elles l'avenir ?
C'est une évolution logique, avec un risque à peser. Les GPU NVIDIA sont formidables car polyvalents, adaptables à beaucoup d'architectures. Mais pour un besoin très spécifique, un outil sur-mesure sera toujours plus efficace : les LPU de Groq pré-planifient chaque calcul comme une chaîne de montage, les processeurs Cerebras intègrent tout sur un seul wafer pour éviter les transferts. Cela dit, l'IA évolue très vite, et du matériel hyper-spécialisé peut devenir obsolète si les architectures de modèles changent radicalement. Le GPU reste aujourd'hui le meilleur compromis entre puissance et flexibilité.
Face à ces bouleversements, quel cap doivent se fixer les entreprises ?
Faire le pont entre complexité technique et stratégie d'entreprise. Créer un modèle et le servir à grande échelle sont deux métiers distincts, et c'est cette deuxième moitié qui décide du succès. L'enjeu de la transformation numérique, ce n'est plus l'adoption technologique de principe, c'est l'intégration stratégique et l'orchestration de ces outils : sécurité, coût, latence, intégration au SI existant. C'est exactement ce que je veux approfondir et mettre en pratique, comme je l'ai fait pour l'IA locale avec KarenOs et la sobriété des agents avec McpEasy.
Les solutions apportées par Martial Zinsou
De l'optimisation du token à l'orchestration stratégique : trois leviers qui relient l'ingénierie au CODIR.
Inférence optimisée et sobre
Batching continu : grouper les requêtes, remplir le bus
KV cache : ne jamais recalculer l'inchangé
Custom kernels : attaquer le vrai goulet, les transferts
Coût par token mesuré et piloté comme un budget
Stratégie hardware éclairée
GPU polyvalents : le compromis puissance-flexibilité
LPU et wafer-scale : l'efficacité du sur-mesure
Risque d'obsolescence intégré aux arbitrages
Dimensionnement prouvé, pas de surachat spéculatif
Souveraineté et orchestration
Modèles open-weights servis en local, données protégées
Intégration au SI existant, latence maîtrisée
Pont assumé entre complexité technique et stratégie
Orchestration pensée pour le CODIR, pas pour la démo
Lire aussi