Plus de débit d'IA. Moins d'énergie par jeton généré.
Résultats de calcul par rupture validés sur réelLLMcharge de travail de l'inférence en utilisantNVIDIA A40 hardware.
Mesuré sur réelLLM workloads.
Sélectionne les essais de validation effectués à partir du courantNVIDIA A40des preuves.
Résultats qui ont survécu à la validation.
Aucun pourcentage universel n'est réclamé.
DistilGPT-2
31,3 % énergie inférieure par jeton généré
54%+ débit de génération supérieure
100% identique sortie cupidité validée
Qwen 2.5 0.5B
35,1% d'énergie inférieure par jeton généré
70,3 % plus de production
100% identique sortie cupidité validée
Qwen 2.5 1.5B
36,4 % énergie inférieure par jeton généré
131,4 % de production de production supérieure
100% identique sortie cupidité validée
ExécuterVarion Computecontre votre propre charge de travail.
La mise en liberté commerciale comprend 10 gratuitGPU-heures pour les tests mesurés, plus le chemin d'auto-test hors ligne. Aucune carte de crédit n'est requise pour l'essai gratuit.
Limite de validation actuelle
NVIDIA A40les résultats sont validés.GPUles réclamations ne sont présentées qu'après avoir obtenu des résultats supplémentaires.
Inspectez l'instantané de validation publié.
La machine lisibleJSONenregistre le courantNVIDIA A40les résultats de validation et les résultats principaux utilisés sur cette page. Les résultats restent spécifiques à la charge de travail et ne sont pas une garantie d'économie universelle.