Varion Compute· 商业释放

更多的AI 输送量, 降低每个生成的代号的能量 。

以实际有效验证的分空计算效率结果LLM使用NVIDIA A40 hardware.

目前的验证正在进行NVIDIA A40成果因模式、硬件和工作量而异;更广泛的交叉GPU正在验证。
审定结果

以真实数据计量LLM workloads.

选中的已完成验证运行运行, 从当前运行NVIDIA A40成套证据。

36.4%降低每个生成的标牌的能量 ;Qwen 2.5 1.5B
131.4%· 高代量的提高Qwen 2.5 1.5B
100%在经过验证的 KV 缓存测试中, 相同的贪婪生成输出
1.5B参数参数Qwen验证的模型
成套证据

证明结果有效

没有声称具有普遍百分比。

DistilGPT-2

将每件电荷的能量降低31.3%
54 高代输送量
100%相同的验证贪婪输出

Qwen 2.5 0.5B

将每份生成的标牌的能量降低35.1%
70.3% 高代输送量
100%相同的验证贪婪输出

Qwen 2.5 1.5B

降低每件所产标牌的能源量36.4%
高代经销量占131.4%
100%相同的验证贪婪输出

10个免费GPU- 小时数

运行运行中Varion Compute相对于你自己的工作量而言。

商业释放包括10种免费GPU免费试验不需要信用卡。

目前的审定边界

NVIDIA A40测试结果得到验证。GPU只有在其他硬件结果完成后才能提出索赔。

开放基准数据

检查已公布的鉴定快照。

机器可读JSON记录当前NVIDIA A40本页使用的验证边界和标题结果:结果仍然是具体工作量,不是普遍节省的保证。