# Replicate triple la vitesse de démarrage de PyTorch

> Replicate met en cache les artefacts de torch.compile et réduit jusqu’à 62 % les démarrages à froid de plusieurs modèles PyTorch.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-26 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/replicate-reduit-jusqua-62-pourcent-les-demarrages-pytorch
Tags : ia, inférence, pytorch, performance, infrastructure, ia-image, inference

---

## En résumé

- Replicate met en cache les artefacts compilés entre les cycles de vie des conteneurs.
- Flux-Kontext-dev démarre en environ 60 secondes contre 120 secondes auparavant.
- La version compilée de flux-kontext-dev dépasse de 30 % la version non compilée.

**Le signal :** Replicate réduit le démarrage à froid de flux.1-dev-lora d’environ 400 à 150 secondes.

**Replicate accélère** les démarrages de modèles PyTorch grâce à la mise en cache des artefacts de `torch.compile`. L’entreprise a annoncé cette évolution le 8 septembre 2025. Les modèles `black-forest-labs/[flux-kontext-dev](/signal-ia/actu/torchcompile-bouscule-la-vitesse-avec-62pourcent-de-gain)`, `prunaai/flux-schnell` et `prunaai/flux.1-dev-lora` démarrent désormais deux à trois fois plus rapidement. Le mécanisme conserve les artefacts compilés entre plusieurs cycles de vie de conteneurs. Replicate indique aussi une amélioration du délai entre le démarrage du conteneur et la première prédiction réussie. Cette évolution cible donc les phases de lancement, avant l’exécution normale des inférences. La présentation complète est disponible sur le [blog de Replicate](https://replicate.com/blog/torch-compile-caching).

**La compilation intervient** lors du premier appel à une fonction compilée. Cette étape trace ensuite le code et le compile, ce qui ajoute une surcharge initiale. Les appels suivants utilisent le code optimisé et s’exécutent nettement plus rapidement. Replicate indique que plusieurs modèles, notamment dans la famille FLUX, utilisent différentes techniques liées à `torch.compile`. Dans ses tests sur `black-forest-labs/flux-kontext-dev`, la version compilée dépasse de 30 % la vitesse d’[inférence](/signal-ia/actu/torch-compile-enfonce-62pourcent-des-delais-de-demarrage) de la version non compilée. La mise en cache vise précisément cette compilation initiale. Elle évite de recommencer la même opération après chaque nouveau cycle de vie du conteneur.

## Replicate réduit trois démarrages

**Les temps chutent** sur les trois modèles cités par Replicate. `black-forest-labs/flux-kontext-dev` passe d’environ 120 secondes à 60 secondes, soit une réduction de 50 %. `prunaai/flux-schnell` passe d’environ 150 secondes à 70 secondes, soit une réduction de 53 %. `prunaai/flux.1-dev-lora` passe d’environ 400 secondes à 150 secondes, soit une réduction de 62 %. Ces mesures concernent les démarrages à froid. Replicate précise également que le cache améliore le délai entre le lancement du conteneur et la première prédiction réussie. Les gains observés varient donc selon le modèle concerné.

**Le cache fonctionne** selon un principe comparable à celui de nombreux systèmes de cache d’intégration et de livraison continues. Au démarrage, le conteneur recherche des artefacts compilés déjà disponibles. Lorsqu’il les trouve, Torch les réutilise au lieu de recompiler le modèle depuis zéro. Lorsqu’un conteneur s’arrête correctement, il peut mettre à jour le cache si nécessaire. Les fichiers sont indexés par version du modèle. Ils sont stockés à proximité des nœuds équipés de processeurs graphiques. Cette organisation relie donc chaque artefact à une version précise du modèle et à une [infrastructure](/signal-ia/actu/ai2-deploie-olmoearth-pour-cartographier-des-continents) proche des ressources d’exécution.

## Les artefacts suivent chaque version

**Le guide détaille** l’utilisation de `torch.compile` et les méthodes d’amélioration des performances des modèles. Replicate renvoie vers sa propre documentation pour approfondir cette mise en œuvre. L’entreprise recommande également le [tutoriel officiel de PyTorch](https://docs.pytorch.org/tutorials/intermediate/torch_compile_tutorial.html). Les résultats publiés portent sur trois modèles précis de l’écosystème FLUX. Replicate précise toutefois que le cache améliore le délai jusqu’à la première prédiction pour tous les modèles utilisant `torch.compile`. L’approche concerne donc la phase de préparation des conteneurs. Elle ne remplace pas la compilation, mais réutilise ses artefacts lorsque les conditions de version permettent leur usage.
