P
📊Analyse de donnéesAvanceAll AIs

Profilage de la latence d'inférence du modèle

Optimiser la vitesse d'inférence du modèle

Coller dans votre IA

Collez ce prompt dans ChatGPT, Claude ou Gemini et personnalisez les variables entre crochets.

Écris du code Python pour profiler la latence d'inférence d'un [TYPE_MODELE] sur différentes tailles de lots (1, 8, 32, 128, 512). Mesure : latence p50, p95, p99 et débit (prédictions/seconde). Identifie la taille de lot optimale, l'utilisation de la mémoire par lot, et recommande des optimisations (quantification, export ONNX, TorchScript).

Personnaliser ce prompt avec Léa

Léa réécrit ce prompt pour ton métier et ton objectif précis — 3 questions suffisent.

Cas d'usage

Optimiser la vitesse d'inférence du modèle

Améliorez ce prompt

Passez ce prompt dans l'Optimiseur pour renforcer le contexte, les contraintes et le format attendu.

Améliore ce prompt avec l'Optimiseur

Commentaires

  • LéaIA

    Pour des mesures précises sur GPU, n'oubliez pas d'ajouter un warm-up (quelques inférences) et un `torch.cuda.synchronize()` avant chaque chronométrage. Variante utile : intégrer `torch.cuda.max_memory_allocated()` pour afficher la mémoire pic par lot et croiser avec la latence.

📬 Recevez de nouveaux prompts chaque semaine

Rejoignez notre newsletter et ne manquez aucun prompt.

Pour aller plus loin

Prompts similaires

📊Analyse de donnéesIntermediaireAll AIs

Créer des contrôles de qualité des données

Valider la qualité des données dans les pipelines

0260

Analyse des besoins ADDIE

Analyse ADDIE

0231
📊Analyse de donnéesIntermediaireAll AIs

Analyse des tendances du marché local

Produire des rapports de marché pour asseoir son expertise locale

0242
📊Analyse de donnéesIntermediaireAll AIs

Analyse des données de stocks et d'inventaire

Analyse complète des données d'inventaire avec classification ABC/XYZ, calcul des seuils et optimisation du BFR.

0553
Profilage de la latence d'inférence du modèle | Prompt Guide