Varion Compute· Mise en liberté commerciale

Plus de débit d'IA. Moins d'énergie par jeton généré.

Résultats de calcul par rupture validés sur réelLLMcharge de travail de l'inférence en utilisantNVIDIA A40 hardware.

La validation actuelle est en coursNVIDIA A40. Les résultats varient selon le modèle, le matériel et la charge de travail;GPUla validation est en cours.
Résultats validés

Mesuré sur réelLLM workloads.

Sélectionne les essais de validation effectués à partir du courantNVIDIA A40des preuves.

36.4%énergie plus faible par jeton généré ·Qwen 2.5 1.5B
131.4%débit de production plus élevé ·Qwen 2.5 1.5B
100%sortie cupide identique dans les tests KV-cache validés
1.5BparamètreQwenmodèle validé
Ensemble de preuves

Résultats qui ont survécu à la validation.

Aucun pourcentage universel n'est réclamé.

DistilGPT-2

31,3 % énergie inférieure par jeton généré
54%+ débit de génération supérieure
100% identique sortie cupidité validée

Qwen 2.5 0.5B

35,1% d'énergie inférieure par jeton généré
70,3 % plus de production
100% identique sortie cupidité validée

Qwen 2.5 1.5B

36,4 % énergie inférieure par jeton généré
131,4 % de production de production supérieure
100% identique sortie cupidité validée

10 gratuitsGPU-heures

ExécuterVarion Computecontre votre propre charge de travail.

La mise en liberté commerciale comprend 10 gratuitGPU-heures pour les tests mesurés, plus le chemin d'auto-test hors ligne. Aucune carte de crédit n'est requise pour l'essai gratuit.

Limite de validation actuelle

NVIDIA A40les résultats sont validés.GPUles réclamations ne sont présentées qu'après avoir obtenu des résultats supplémentaires.

Données de référence ouvertes

Inspectez l'instantané de validation publié.

La machine lisibleJSONenregistre le courantNVIDIA A40les résultats de validation et les résultats principaux utilisés sur cette page. Les résultats restent spécifiques à la charge de travail et ne sont pas une garantie d'économie universelle.