Varion Compute· Lanzamiento comercial

Más rendimiento de IA. Menos energía por token generado.

Resultados de eficacia de cálculo de avance validados en realesLLMvolumen de trabajo de inferenciaNVIDIA A40 hardware.

La validación actual está en marchaNVIDIA A40Los resultados varían según el modelo, el equipo y el volumen de trabajo;GPULa validación está en curso.
Resultados validados

Medido en realesLLM workloads.

La validación completada seleccionada se ejecuta desde el actualNVIDIA A40pruebas.

36.4%menor energía por token generado ·Qwen 2.5 1.5B
131.4%producción de mayor generación ·Qwen 2.5 1.5B
100%Producción de generación codiciosa idéntica en pruebas de caché KV validadas
1.5BparámetroQwenmodelo validado
Conjunto de pruebas

Resultados que sobrevivieron a la validación.

No se afirma ningún porcentaje universal.

DistilGPT-2

31,3% menor energía por token generado
Rendimiento de generación superior al 54%
100% idéntico validado codiciosos salida

Qwen 2.5 0.5B

35,1% menos energía por token generado
70,3% de mayor rendimiento de generación
100% idéntico validado codiciosos salida

Qwen 2.5 1.5B

36,4% menos energía por token generado
131,4% mayor rendimiento de generación
100% idéntico validado codiciosos salida

10 libresGPU-horas

EjecutarVarion Computecontra su propia carga de trabajo.

Lanzamiento comercial incluye 10 gratisGPU-horas para pruebas medidas, además de la ruta de auto-prueba sin conexión. No se requiere tarjeta de crédito para la prueba gratuita.

Límite de validación actual

NVIDIA A40Los resultados se validaron.GPUlas reclamaciones no se hacen hasta que se completen los resultados adicionales del hardware.

Datos de referencia abiertos

Inspeccione la instantánea de validación publicada.

La máquina legibleJSONregistra el actualNVIDIA A40resultados de validación de límites y titulares utilizados en esta página. Los resultados siguen siendo específicos de la carga de trabajo y no son una garantía de ahorro universal.