3 Tačke
Članak

Nvidia otkriva detalje Rubin arhitekture za efikasnije AI zaključivanje

Nvidia predstavlja optimizacije Rubin GPU arhitekture koje poboljšavaju performanse i efikasnost inferencije, od nivoa čipa do celog rack sistema.

3 Tačke
45 sekundi čitanja

Nvidia je objavila nove detalje o Vera Rubin platformi koja stiže kasnije ove godine, sa fokusom na poboljšanja za inferenciju u eri agentičke veštačke inteligencije. Rubin GPU sadrži 224 streaming multiprocesora sa 896 tenzorskih jezgara i 288 GB HBM4 memorije, uz 50 PFLOPS NVFP4 inferencije. Ključne novine uključuju unapređeni Tensor Memory Accelerator (TMA) koji efikasnije upravlja MoE ekspertima, dupliranje rada na K dimenziji u tenzorskim jezgrima, i četvorostruko povećanje propusnosti za BF16/FP16 eksponencijalne operacije.

Rubin donosi i finiju kontrolu zavisnosti između kernela, što smanjuje kašnjenje i povećava iskorišćenost GPU-a. Na nivou racka, nova funkcija "counted writes" smanjuje saobraćaj i kašnjenje na NVLink fabrici. Ove optimizacije, zajedno sa Vera CPU-om, ciljaju na povećanje broja tokena po sekundi i smanjenje cene po tokenu u velikim AI sistemima.

Povezani članci