TensorRT erhält Multi-Device-Inferenz, um generative Workloads über mehrere GPUs zu verteilen, ohne Optimierungen wie Kernel-Fusion, Speicherplanung und Quantisierung aufzugeben. Damit lassen sich Medien-Generierungspipelines skalieren, die das Speicher- und Rechenbudget einzelner GPUs sprengen, ohne Produktionsleistung zu verlieren.
Nvidia stellt ModelExpress vor, das riesige Modell-Checkpoints von Hunderten Gigabyte effizienter durch den Cluster bewegt. Da Cold Starts, Autoscaling und RL-Nachtraining ständig Gewichte kopieren, senkt die Technik Ladezeiten und Kosten für GPU-Deployments spürbar.
25.07.2026 · NVIDIA Generative AI (developer.nvidia.com) · Infrastruktur
Laut einem Vertreter des Weissen Hauses griff Moonshot AI in Thailand auf Nvidias GB300-Chips zu, trotz chinesischer Exportbeschränkungen. Das Unternehmen trainierte damit sein leistungsstarkes Modell Kimi K3. Der Fall verdeutlicht, wie schwer sich die US-Exportkontrollen gegen Umgehungswege durch Drittländer durchsetzen lassen.
Nvidia zeigt, wie sich das Modell Nemotron 3 Nano über das Prime Intellect Lab in Minuten auf eigene Anwendungsfälle, Domänen und Sprachen zuschneiden lässt. Die vorkonfigurierte Umgebung senkt Hürden bei Infrastruktur, GPU-Zugang und Fachwissen, die individuelle Anpassungen sonst aufwendig machen.
24.07.2026 · NVIDIA Generative AI (developer.nvidia.com) · Infrastruktur
NVIDIA zeigt, wie sich lange TensorRT-Engine-Builds in Python oder C++ überwachen und vorzeitig abbrechen lassen. Bislang blockieren grosse Modelle und kalte Timing-Caches auf neuen GPU-SKUs den Prozess ohne Rückmeldung. Die neue Beobachtbarkeit erspart Entwicklern und Agenten unnötiges Warten oder Neustarts.
23.07.2026 · NVIDIA Generative AI (developer.nvidia.com) · Agenten
Nvidia beschreibt die Rubin-GPU-Architektur für Dauerbetrieb-Rechenzentren, die agentische Lasten mit Planen, Werkzeugnutzung und mehrstufigen Aufgaben über grosse Kontexte bedienen. Der Fokus verschiebt sich vom reinen Training und Chat hin zur Inferenz autonomer Agenten. Das definiert Kapazitätsanforderungen künftiger KI-Infrastruktur neu.
22.07.2026 · NVIDIA Generative AI (developer.nvidia.com) · Agenten
Nvidia-Aktien schneiden 2026 schwächer ab, während die Wall Street auf Firmen setzt, die den KI-Infrastrukturausbau tragen. Der Machtkampf um die höchste Marktkapitalisierung zeigt, wie stark die Kapitalströme von reinen Chip-Erwartungen zu den Betreibern von Rechenkapazität wandern.