Étude de cas
Pipeline IA : de 24 heures à moins de 3 heures
Refonte de l’architecture d’un pipeline de classification d’appels : optimisation des modèles, du traitement audio et de l’exécution, ramenant une journée de traitement de plus de 24 heures à moins de 3 heures de compute.
Le contexte
Un pipeline IA était utilisé pour transcrire et classifier automatiquement une journée complète d’appels.
Son temps d’exécution dépassait initialement 24 heures, ce qui limitait la fréquence de traitement et entraînait une utilisation prolongée des ressources de calcul.
L’objectif était double : réduire fortement le temps de traitement et rendre l’exécution plus efficiente économiquement, sans dégrader la qualité de la classification.
Repenser le traitement de bout en bout
L’optimisation ne consistait pas simplement à augmenter les ressources de calcul.
J’ai repris l’architecture du projet afin d’identifier les principaux leviers de performance :
- utilisation d’un modèle LLM mieux dimensionné pour le besoin de classification ;
- évolution du traitement Speech-to-Text ;
- prise en compte des deux canaux audio d’un appel ;
- reconstitution intelligente de la conversation afin de préserver le contexte des échanges ;
- optimisation du packaging et de l’image Docker ;
- correction de problèmes d’exécution qui maintenaient inutilement certains processus actifs ;
- rationalisation du cycle d’exécution afin d’adapter les ressources au besoin réel.
Un arbitrage entre qualité, performance et coût
Le principal enjeu était de trouver le bon équilibre entre qualité de traitement, temps d’exécution et coût de calcul.
Le choix d’un modèle plus léger devait notamment rester compatible avec les exigences de classification. De même, la nouvelle approche de transcription devait améliorer la représentation de la conversation tout en restant compatible avec les objectifs de performance.
La reconstitution des deux canaux permet également de restituer le contexte global de l’échange plutôt que de traiter les flux audio indépendamment.
Résultats
>24 h → <3 h
Une journée complète d’appels est désormais traitée en moins de trois heures de compute, contre plus de 24 heures auparavant.
>8× plus rapide
Le temps de traitement a été divisé par plus de huit.
Compute à la demande
La réduction du temps d’exécution permet de limiter l’utilisation des ressources de calcul à la durée réelle du traitement.
Les applications conteneurisées peuvent ainsi revenir à zéro une fois le traitement terminé, plutôt que de maintenir des ressources actives en continu.
La performance devient donc également un levier de maîtrise des coûts d’infrastructure.
Ce que j’en retiens
L’optimisation d’un système d’IA ne se résume pas au choix d’un modèle.
Les gains les plus importants peuvent venir de la combinaison de plusieurs leviers : modèle, représentation des données, traitement du contexte, architecture logicielle, packaging et cycle de vie des ressources.
Dans ce cas, la réduction du temps de traitement est le résultat d’une approche globale d’AI Engineering, combinant optimisation des modèles et refonte de l’exécution.
Le résultat n’est pas seulement un pipeline plus rapide : c’est un système dont les ressources sont davantage alignées sur le besoin réel.