Wir entwickeln die nächste Stufe der agentischen KI – jetzt in voller Produktion.
Überblick
NVIDIA Vera Rubin NVL72 vereint bahnbrechende Technologien von NVIDIA – 72 Rubin-GPUs, 36 Vera-CPUs, NVIDIA ConnectX™-9 SuperNICs und BlueField™-4-DPUs. Die Lösung skaliert Intelligenz auf einer Rack-Scale-Plattform mit dem NVIDIA NVLink™ 6-Switch vertikal und mit NVIDIA Quantum-X800 InfiniBand und Spectrum-X™-Ethernet horizontal, um die industrielle KI-Revolution in großem Maßstab voranzutreiben. Bei der Bereitstellung mit NVIDIA Groq 3 LPX-Racks liefert Vera Rubin NVL72 eine neue Klasse der Inferenzleistung für Modelle mit Billionen von Parametern und Kontexte mit Millionen von Token.
Vera Rubin NVL72 baut auf dem Rack-Design der dritten Generation von NVIDIA MGX™ NVL72 auf und ermöglicht einen nahtlosen Übergang von Vorgängergenerationen. Im Vergleich zu NVIDIA Blackwell bietet diese Lösung KI-Training mit einem Viertel der GPUs und KI-Inferenz zu einem Zehntel der Kosten pro Million Token. Mit modularen Tray-Designs ohne Verkabelung und der Unterstützung von über 80 MGX-Ökosystempartnern bietet der KI-Supercomputer im Rack-Maßstab erstklassige Leistung bei schneller Bereitstellung.
Leistung
Änderungen der LLM-Inferenzleistung vorbehalten. Kosten pro 1 Million Token basierend auf dem Kimi-K2-Thinking-Modell unter Verwendung von 32K/8K ISL/OSL im Vergleich von NVIDIA GB200 NVL72 und NVIDIA Vera Rubin NVL72.
NVIDIA Vera Rubin NVL72 bietet ein Zehntel der Kosten pro Million Token im Vergleich zu NVIDIA GB200 NVL72 für hochinteraktive agentische KI mit Deep Reasoning.
NVIDIA Vera Rubin NVL72 bietet bis zu 10-mal mehr Token pro Megawatt als NVIDIA GB200 NVL72 und ermöglicht so die Skalierung der Intelligenz bei gleichbleibendem Energiebedarf.
Änderungen der LLM-Inferenzleistung vorbehalten. Token pro Sekunde pro MW basierend auf dem Kimi-K2 Thinking-Modell unter Verwendung von 32K/8K ISL/OSL beim Vergleich von NVIDIA GB200 NVL72 und NVIDIA Vera Rubin NVL72.
Die voraussichtliche Leistung kann Änderungen unterliegen. Anzahl der GPUs auf Basis eines 10T-MoE-Modells, das in einem festen Zeitrahmen von einem Monat mit 100T Token trainiert wurde, im Vergleich von NVIDIA GB200 NVL72 und NVIDIA Vera Rubin NVL72.
NVIDIA Vera Rubin NVL72 trainiert MoE-Modelle (Mixture-of-Experts) mit einem Viertel der Anzahl der GPUs im Vergleich zu NVIDIA GB200 NVL72.
Agentische Systeme verbrauchen bis zu 15-mal mehr Token als herkömmliche KI-Anwendungen. KI-Fabriken müssen ein hohes Token-Volumen und umfangreiche Kontextfenster mit geringer Latenz und effizienter Wirtschaftlichkeit gewährleisten. In Kombination mit LPX bietet Vera Rubin NVL72 einen bis zu 35-mal höheren Durchsatz pro Megawatt für Modelle mit Billionen Parametern.
Die voraussichtliche Leistung kann Änderungen unterliegen. Kostenlose Stufe (0 USD): Qwen-3-Modell mit 235 Milliarden Parametern und 32.000 im KV-Cache gespeicherten Token. Mittlere Stufe (3 USD): Kimi K2.5-Modell mit 1 Billion Parametern und 128.000 im KV-Cache gespeicherten Token. Hohe Stufe (6 USD): GPT-MoE-Modell mit 2 Billionen Parametern und 128.000 im KV-Cache gespeicherten Token. Premium-Stufe (45 USD) und Ultra-Stufe (150 USD): GPT-MoE-Modell mit 2 Billionen Parametern und 400.000 im KV-Cache gespeicherten Token.
Vorantreiben der Ära der KI-Agenten
Die Vera Rubin-Plattform eröffnet neue Horizonte der agentischen KI mit fünf Racks zur Skalierung der weltweiten KI-Fabriken – NVIDIA Vera Rubin NVL72, NVIDIA Vera CPU, NVIDIA Groq 3 LPX, NVIDIA Vera BlueField-4 STX und NVIDIA Spectrum-6 SPX Ethernet. Die Racks sind darauf ausgelegt, gemeinsam als ein einziger leistungsstarker KI-Supercomputer zu arbeiten und unterstützen alle Phasen der KI – vom Pre-Training in großem Maßstab über das Nachtrainieren und die Skalierung in der Testphase bis hin zu agentischer Inferenz in Echtzeit.
NVIDIA Vera Rubin NVL4 bietet revolutionäre Leistung durch vier NVIDIA Rubin-GPUs, die durch eine NVLink-Brücke der zweiten Generation mit NVIDIA NVLink der sechsten Generation miteinander verbunden sind, kombiniert mit zwei NVIDIA Vera CPUs über NVLink-C2C. Die Lösung ist mit flüssigkeitsgekühlten modularen NVIDIA MGX™-Servern kompatibel und bietet im Vergleich zu Grace Hopper bis zu viermal höhere Leistung bei wissenschaftlichen Computing-Simulationen, eine bis zu sechsmal höhere Leistung beim Training von KI für die Wissenschaft und eine bis zu achtmal höhere Leistung bei der Inferenz von KI für die Wissenschaft.
Technische Daten
| KI-Fabrik auf Basis der NVIDIA Vera Rubin NVL72¹ | |
|---|---|
| Konfiguration der KI-Fabrikgröße | 40.000 NVIDIA Rubin-GPUs mit MaxLPS |
| NVFP4 Inferenz² | 2 ZFLOPS |
| NVFP4 Training³ | 1,4 ZFLOPS |
| FP8/FP6 Training³ | 700 EFLOPS |
| FP16/BF16³ | 160 EFLOPS |
| TF32³ | 80 EFLOPS |
| GPU-Speicher | Bandbreite | 12 PB HBM4 | 800 PB/s |
| CPU-Speicher | Bis zu 30 PB LPDDR5X |
| Schneller Arbeitsspeicher | Bis zu 42 PB |
| NVIDIA Vera Rubin NVL72 | NVIDIA Vera Rubin Superchip | NVIDIA Rubin GPU | |
|---|---|---|---|
| Konfiguration | 72 NVIDIA Rubin GPUs | 36 NVIDIA Vera CPUs | 2 NVIDIA Rubin GPUs | 1 NVIDIA Vera CPU | 1 NVIDIA Rubin GPU |
| NVFP4 Inferenz² | 3.600 PFLOPS | 100 PFLOPS | 50 PFLOPS |
| NVFP4 Training³ | 2.520 PFLOPS | 70 PFLOPS | 35 PFLOPS |
| FP8/FP6 Training³ | 1.260 PFLOPS | 35 PFLOPS | 17,5 PFLOPS |
| FP16/BF16³ | 288 PFLOPS | 8 PFLOPS | 4 PFLOPS |
| TF32³ | 144 PFLOPS | 4 PFLOPS | 2 PFLOPS |
| FP32 | 9.360 TFLOPS | 260 TFLOPS | 130 TFLOPS |
| FP64 | 2.400 TFLOPS | 67 TFLOPS | 33 TFLOPS |
| GPU-Speicher | Bandbreite | 20,7 TB HBM4 | 1.400 TB/s | 576 GB HBM4 | 38,5 TB/s | 288 GB HBM4 | 19,2 TB/s |
| NVIDIA NVLink | Sechste Generation | ||
| Bandbreite von NVLink | 216 TB/s |
6 TB/s | 3 TB/s |
| NVLink-C2C Bandbreite | 65 TB/s | 1,8 TB/s | – |
| Anzahl der CPU-Recheneinheiten | 3.168 maßgeschneiderte NVIDIA Olympus-Kerne | 6.336 Threads | 88 maßgeschneiderte NVIDIA Olympus-Kerne | 176 Threads | – |
| CPU-Speicher | Bis zu 54 TB LPDDR5X | Bis zu 1,5 TB LPDDR5X | – |
| Netzwerkbandbreite (Scale-Out)⁴ | 32,4 TB/s | 0,9 TB/s | 0,45 TB/s |
| NVIDIA + HBM4-Chips insgesamt | 1.296 | 30 | 12 |
| GPUs in 100 MW¹ | 40.000 GPUs | ||
| Eingangstemperatur | 45°C | ||
1. Spezifikationen basierend auf einer KI-Fabrik im industriellen Maßstab unter Verwendung von NVIDIA DSX mit MaxLPS.
2. Sparse-Spezifikation.
3. Dense-Spezifikation.
4. Bidirektionale Bandbreite.
Erste Schritte
Melden Sie sich an, um aktuelle Nachrichten, Updates und mehr von NVIDIA zu erhalten.