Aller au contenu
AvisAchats et opérations · 3 min de lecture

Avant d'acheter plus de GPUs, découvrez pourquoi les actuels attendent

Notre point de vue : la planification de la capacité devrait commencer par un travail utile terminé, et non par un tableau d'utilisation ou une liste de nouveaux accélérateurs.

Opinion · Notre point de vue, soutenu par les sources ci-dessous.

Illustration éditoriale de tuiles informatiques actives et inactives reliées par une connexion fluide
La capacité installée et la capacité productive sont des mesures différentes. Illustration conceptuelle ; aucune donnée d'utilisation n'est représentée.Illustration éditoriale · Notre œuvre d'art, créée avec AI

Une machine coûteuse peut être occupée et improductive

L'utilisation de GPU est un signal utile, mais ce n'est pas l'objectif d'un service AI. Une machine peut être fortement occupée par des tentatives ou des travaux ne répondant pas aux exigences de qualité de l'application. Il peut également sembler peu utilisé parce que les demandes arrivent de manière inégale ou qu’une autre partie du système les retarde.

Notre position est que la première question de capacité devrait être la quantité de travail acceptable que le service accomplit. Ce n'est qu'alors que l'équipe devrait se demander quelles limites ce résultat et si un autre GPU l'améliorera.

Suivez la demande via le système

Mesurez le temps passé à recevoir des données, à préparer les entrées, à attendre dans les files d'attente, à exécuter l'inférence et à terminer les étapes en aval. Séparez les demandes ordinaires de celles inhabituellement exigeantes. Enregistrez les échecs et la latence de queue au lieu de vous fier uniquement aux moyennes.

Si le stockage ou un service CPU constitue le goulot d'étranglement, des accélérateurs supplémentaires peuvent augmenter la capacité inutilisée. Si la mémoire limite la simultanéité, une modification de planification ou une configuration de mémoire différente peut être plus pertinente qu'un calcul nominal supplémentaire.

NVIDIA La prise en charge par Dynamo du routage contextuel et de l'inférence distribuée illustre comment le logiciel peut modifier la façon dont le matériel est utilisé. Cela ne garantit pas une amélioration pour chaque application, mais cela donne une raison d’examiner l’architecture de service avant de supposer que le seul remède réside dans un plus grand nombre de périphériques. NVIDIA Dynamo : architecture d'inférence distribuée ↗

L'utilisation doit laisser la place au service

Il y a une limite à cet argument. Un système orienté client peut avoir besoin de capacité de réserve en cas de sursauts, de pannes ou de maintenance. Conduire chaque accélérateur vers une saturation constante peut nuire aux temps de réponse et à la résilience.

La cible doit donc suivre l'exigence de service. Une file d'attente par lots hors ligne peut souvent tolérer une planification différente de celle d'un produit interactif. Ni l’un ni l’autre ne doit être jugé par rapport à un pourcentage d’utilisation universelle.

De même, l'optimisation a un coût. Passer des mois d'efforts d'ingénierie pour éviter un ajout de matériel abordable peut être une mauvaise décision commerciale. La comparaison doit inclure le temps de travail du personnel et l’intérêt de livrer le produit plus tôt.

Achetez la contrainte que vous avez identifiée

Après mesure, la réponse peut en effet être plus GPUs. Il s’agit d’un argument d’achat plus solide lorsque l’équipe peut expliquer la charge que supportera la nouvelle capacité et les conditions dans lesquelles elle sera nécessaire.

Gardez une prévision simple avec une demande ordinaire, une demande de pointe et un scénario de croissance. Revisitez-le après des modifications du logiciel et du modèle, car ces modifications peuvent modifier le profil des ressources.

Nous soutenons l'achat d'un calcul important lorsque la charge de travail le justifie. Nous prenons également en charge la réparation du pipeline de données, l'ajustement de la planification ou le choix préalable d'un système de meilleure taille. L'objectif commercial est un service qui fonctionne de manière fiable à un coût acceptable, et non un rack qui semble simplement entièrement occupé.

Sources et lectures complémentaires

Sources primaires pour les développements rapportés et le contexte technique. L'analyse et les conclusions sont les nôtres ; les spécifications et la documentation liées peuvent changer.

Sources vérifiées le 29 septembre 2026.

Comment nous couvrons l'industrie

Notre équipe éditoriale écrit sur l'infrastructure AI, l'approvisionnement en équipements et l'industrie qui la sous-tend. L'analyse de l'actualité distingue les développements rapportés de nos conclusions ; les articles d’opinion sont étiquetés comme tels.

Les références techniques et industrielles sont liées dans chaque article. Les dates de publication décrivent le moment où un article a été rédigé, plutôt que d'impliquer que chaque spécification ou condition du marché reste inchangée.