Google und Metas PyTorch schließen sich zusammen, um Nvidias KI-Dominanz herauszufordern

Letzte Aktualisierung: 12/17/2025
  • Google entwickelt „TorchTPU“, um seine KI-Chips vollständig mit PyTorch kompatibel zu machen und die Migration von Nvidia-GPUs zu erleichtern.
  • Mit diesem Schritt sollen TPUs zu einer gängigen Alternative in der Cloud und On-Premises-Umgebung werden, wodurch die Abhängigkeit vom CUDA-Ökosystem von Nvidia verringert wird.
  • Google arbeitet eng mit Meta, dem Entwickler von PyTorch, zusammen und erwägt, Teile des Technologie-Stacks als Open Source zu veröffentlichen, um die Verbreitung zu beschleunigen.
  • Eine stärkere Unterstützung für PyTorch könnte die Kosten und technischen Hürden für Unternehmen senken, die ihre KI-Infrastruktur diversifizieren möchten.

KI-Hardware- und Software-Ökosystem

Google überarbeitet still und leise seine Strategie im Wettlauf um die Rechenleistung künstlicher Intelligenz . Nach Jahren der Konzentration auf seine eigenen Grenzen legt das Unternehmen nun großen Wert darauf, dass seine KI-Chips nahtlos mit PyTorch zusammenarbeiten, dem Open-Source-Toolkit, das sich weltweit zur Standardwahl für die meisten KI-Entwickler entwickelt hat.

Im Zentrum dieser Umstrukturierung steht ein intern als „TorchTPU“ bekanntes Projekt , das die Kluft zwischen der Hardwareentwicklung von Google und der tatsächlichen Implementierung von KI-Systemen durch Kunden schließen soll. Indem Google die PyTorch-Unterstützung auf seinen Tensor Processing Units (TPUs) auf erstklassigen Status hebt, will das Unternehmen den enormen Vorsprung von Nvidia, den das CUDA-Software-Ökosystem aufgebaut hat, verringern.

Google macht aus TPUs einen ernstzunehmenden Konkurrenten für Nvidia-GPUs.

Googles TPUs wurden lange als Hochleistungschips speziell für KI-Anwendungen beworben , konnten aber nicht mit der Verbreitung von Nvidias GPUs mithalten. Ein wesentlicher Grund dafür ist, dass Nvidia jahrelang dafür sorgte, dass PyTorch optimal auf seiner Hardware läuft, während Google sich hauptsächlich auf eigene Tools und interne Workflows konzentrierte.

Innerhalb von Alphabet haben sich TPUs zu einem entscheidenden Wachstumsmotor für Google Cloud entwickelt . Der Verkauf des Zugangs zu diesen Chips über seine Cloud-Plattform ist heute ein zentraler Bestandteil der Strategie von Google, Investoren zu beweisen, dass sich seine KI-Investitionen in konkrete Umsätze umwandeln lassen und nicht nur in Forschungsprestige oder experimentelle Produkte.

Hardware allein überzeugt Entwickler jedoch nicht. Unternehmen, die sich für TPUs interessieren, haben Google wiederholt mitgeteilt, dass die Softwarekompatibilität ein Knackpunkt ist : Teams, die stark auf PyTorch standardisiert sind, wollen ihren Code nicht neu strukturieren oder Mitarbeiter umschulen, nur um einen neuen Chip auszuprobieren.

Hier setzt TorchTPU an. Die Initiative soll die Nutzung von TPUs mit PyTorch für Entwickler so einfach gestalten wie die von Nvidia-GPUs heute . Ziel ist es, bestehende PyTorch-Modelle und -Pipelines mit minimalen Anpassungen zu übertragen, um Kosten und Risiken beim Experimentieren mit TPUs deutlich zu reduzieren.

Ein Sprecher von Google Cloud vermied es, auf technische Details einzugehen, bestätigte aber, dass das übergeordnete Ziel darin besteht, den Kunden eine deutlich größere Flexibilität bei der Ausführung von KI-Workloads zu bieten , unabhängig davon, welche Hardware sie darunter wählen.

Was TorchTPU für PyTorch-Entwickler wirklich ändert

PyTorch, ursprünglich von Meta entwickelt und gefördert, hat sich zum De-facto-Standard-Framework für die Entwicklung moderner KI-Systeme entwickelt . Die meisten Entwickler im Silicon Valley und darüber hinaus programmieren keine Kernel für Chips von Nvidia, AMD oder Google mehr selbst; stattdessen nutzen sie PyTorch und ähnliche Frameworks, die vorgefertigte Komponenten und Trainingsfunktionen bereitstellen.

Seit seiner Veröffentlichung im Jahr 2016 ist das Wachstum von PyTorch eng mit CUDA und den zugehörigen Bibliotheken verknüpft – dem Software-Stack, den viele Wall-Street-Analysten als Nvidias wichtigsten strategischen Vorteil betrachten. Nvidias Ingenieure haben massiv investiert, um die maximale Effizienz von PyTorch auf ihren GPUs zu gewährleisten. Dadurch ist diese Kombination die Standardwahl für das Training und den Einsatz umfangreicher KI-Modelle.

Google hingegen investierte jahrelang in Jax , ein weiteres Software-Framework, das insbesondere in den eigenen Forschungs- und Produktteams beliebt war. TPUs nutzten eine Compiler-Schicht namens XLA , um Jax-basierten Code effizient auszuführen, und ein Großteil von Googles internem KI-Software-Stack und seinen Leistungsoptimierungen basierte auf dieser Kombination.

Das Ergebnis ist eine zunehmende Diskrepanz zwischen der Art und Weise, wie Google seine Chips selbst nutzt, und den Arbeitspräferenzen der meisten externen Kunden. Viele Unternehmen haben sich fast vollständig auf PyTorch standardisiert, was bedeutet, dass der Wechsel zu TPUs in der Regel einen tiefgreifenden Umbruch bei Tools, Code und Entwicklerkenntnissen mit sich brachte.

Mit TorchTPU will Google diese Hürde beseitigen. Das Projekt zielt darauf ab, PyTorch vollständig auf TPUs zu implementieren , sodass Unternehmen weiterhin auf vertraute Bibliotheken, Trainingsschleifen und Bereitstellungsmuster zurückgreifen können und lediglich die zugrundeliegende Hardware ändern müssen. Dies könnte den Entwicklungsaufwand und die Einarbeitungszeit für Teams, die die Leistung oder Kostenvorteile von TPUs evaluieren möchten, deutlich reduzieren.

Mehr Ressourcen, Open Source und ein tieferes Engagement

Laut Insidern ist TorchTPU nicht nur ein weiteres Nebenprojekt. Anders als frühere Versuche, PyTorch auf TPUs zum Laufen zu bringen, misst Google diesem Vorhaben nun mehr organisatorische Aufmerksamkeit, Budget und strategische Bedeutung bei und behandelt es als zentralen Pfeiler seiner KI-Infrastruktur-Roadmap und nicht als Nischenprojekt zur Kompatibilität.

Eines der wichtigsten Elemente, die derzeit geprüft werden, ist die Veröffentlichung von Teilen des Software-Stacks von TorchTPU als Open Source. Durch die Freigabe wichtiger Komponenten für die Community erhofft sich Google eine schnellere Verbreitung, die Gewinnung externer Mitwirkender und das Vertrauen großer Kunden, die Transparenz und langfristige Stabilität ihrer KI-Plattformen wünschen.

Diese offenere Haltung soll auch Unternehmen beruhigen, die die TPU-Unterstützung bisher als zu eng an Googles interne Vorgehensweise gebunden empfunden haben. Indem externen Entwicklern die Möglichkeit gegeben wird, die TorchTPU-Komponenten zu untersuchen, zu erweitern und zu debuggen, könnten TPUs weniger wie eine proprietäre Insel und mehr wie ein vollwertiges Mitglied des breiteren PyTorch-Ökosystems wahrgenommen werden.

Für Unternehmen ist dies in praktischer Hinsicht relevant. Sollte TorchTPU erfolgreich sein, könnten die Migrationskosten von Nvidia-GPUs zu Google-TPUs deutlich gesenkt werden , wodurch eine Diversifizierung der Recheninfrastruktur ohne mehrjährige Software-Neuentwicklung einfacher wird.

Kunden haben Google wiederholt mitgeteilt, dass die bisherige Notwendigkeit, auf Jax umzusteigen, ein erhebliches Hindernis darstellte. PyTorch ist bereits unter KI-Entwicklern weit verbreitet, und in schnelllebigen Märkten sind nur wenige Unternehmen bereit, ihre Produktplanung zu unterbrechen, während ihre Teams auf ein neues Framework umstellen, nur um alternative Hardware nutzen zu können.

Von interner Hardware bis hin zu einem umfassenden Unternehmensangebot

Lange Zeit nutzte Alphabet den Großteil seiner TPU-Kapazität intern bei Google , um damit Such-, Übersetzungs- und Empfehlungssysteme sowie frühe KI-Forschung zu unterstützen. Diese Strategie begann sich 2022 zu ändern, als die Cloud-Computing-Sparte mehr Einfluss auf die Produktentwicklung und den Vertrieb von TPUs erhielt.

Seitdem hat die Verfügbarkeit von TPUs über Google Cloud deutlich zugenommen . Angesichts des gestiegenen Interesses von Unternehmen an KI positioniert Google seine Chips als Möglichkeit für Kunden, High-End-Rechenleistung zu nutzen, ohne eigene, eng gekoppelte GPU-Cluster verwalten zu müssen.

Google ist vor Kurzem noch einen Schritt weiter gegangen und verkauft TPUs direkt für den Einsatz in den eigenen Rechenzentren der Kunden , nicht nur über seine öffentliche Cloud. Diese Umstellung ermöglicht es größeren Unternehmen mit strengen regulatorischen Anforderungen oder Latenzvorgaben, TPUs in ihre On-Premise-Infrastruktur zu integrieren und gleichzeitig von Googles Hardware-Roadmap zu profitieren.

Diese Erweiterung verändert auch Googles interne Prioritäten. Das Unternehmen benötigt TPU-Kapazität sowohl für den Betrieb eigener KI-Produkte – vom Gemini-Chatbot bis hin zu KI-gestützten Suchfunktionen – als auch zur Bedienung externer Google Cloud-Kunden, darunter namhafte KI-Unternehmen wie Anthropic, die auf gemietete TPU-Kapazität angewiesen sind.

Um all dies zu koordinieren, hat Google die Führung im Bereich KI-Infrastruktur gestärkt: Der erfahrene Manager Amin Vahdat wurde zum Leiter der KI-Infrastruktur ernannt und berichtet nun direkt an CEO Sundar Pichai . Diese Berichtslinie unterstreicht, wie zentral die Hardware- und Softwarearchitektur für Googles umfassendere KI-Ambitionen geworden ist.

Partnerschaft mit Meta zur Stärkung von PyTorch auf TPUs

Google verfolgt TorchTPU nicht allein. Laut Insidern arbeitet das Unternehmen eng mit Meta, dem Entwickler und Betreuer von PyTorch , zusammen, um die Unterstützung für TPUs zu beschleunigen und sich auf technische Richtungen abzustimmen, die beiden Partnern zugutekommen.

Die Gespräche zwischen den Unternehmen umfassen Vereinbarungen, die Meta Zugriff auf mehr TPU-Kapazität verschaffen würden . Frühere Vorschläge sahen dies Berichten zufolge als Managed Services vor: Google würde seine Chips in Umgebungen einsetzen, in denen Meta seine eigene Software und Modelle ausführen könnte, wobei Google einen Großteil des Betriebsaufwands übernehmen würde.

Für Meta ist es von strategischer Bedeutung, PyTorch auf einer breiteren Hardwarepalette effizient laufen zu lassen. Das Unternehmen hat ein klares Interesse daran, die Inferenzkosten zu senken und die Abhängigkeit von Nvidia-GPUs zu verringern , um sowohl die eigenen Ausgaben zu reduzieren als auch die Verhandlungsposition bei zukünftigen Chipkäufen zu stärken.

Durch die Zusammenarbeit mit Google kann Meta dazu beitragen, dass PyTorch hardwareunabhängig und breit optimiert bleibt und nicht als eng an das Ökosystem eines einzelnen Herstellers gebunden wahrgenommen wird. Dies wiederum stärkt PyTorchs Status als Community-Standard und hält das Framework für Forscher und Unternehmen gleichermaßen attraktiv.

Meta hat sich bisher geweigert, diese konkreten Vereinbarungen öffentlich zu kommentieren, aber die Übereinstimmung der Interessen ist klar : Der Social-Media- und KI-Riese möchte Alternativen zu Nvidia, während Google möchte, dass sich PyTorch auf seinen TPUs nativ anfühlt, damit mehr Kunden bereit sind, sie auszuprobieren.

Den CUDA-Vorsprung von Nvidia schrittweise verringern

Nvidias Vormachtstellung im Bereich KI beruht nicht allein auf der Bereitstellung leistungsstarker GPUs. Über viele Jahre hat das Unternehmen einen umfassenden Software-Stack entwickelt, dessen Kernstück die tief in Frameworks wie PyTorch integrierte Technologie bildet. Diese Kombination aus Hardware und Software hat sich zur Standardplattform für das Training und die Inferenz modernster KI-Modelle entwickelt.

Aufgrund dieser engen Integration betrachten viele Unternehmen einen Wechsel weg von Nvidia als riskant und kostspielig . Codebasen, Arbeitsabläufe und das Fachwissen der Mitarbeiter sind optimal auf CUDA abgestimmt, wodurch alternative Chips selbst bei vermeintlich günstigeren Preisen oder höherer Leistung auf dem Papier als potenzielle Fehlerquelle erscheinen.

Googles TorchTPU-Initiative zielt direkt darauf ab, diesen Vorteil zu verringern. Wenn PyTorch auf TPUs ähnlich einfach und mit vergleichbarer Leistungsoptimierung wie auf Nvidia-GPUs läuft, erhalten Unternehmen eine ernstzunehmende Alternative für große KI-Workloads . In einem Markt, in dem die Nachfrage nach KI-Rechenleistung explosionsartig steigt und Angebotsengpässe häufig auftreten, könnte eine weitere ernstzunehmende Option sehr attraktiv sein.

Gleichzeitig signalisiert Googles Entscheidung, wichtige Teile des TorchTPU-Stacks als Open Source zu veröffentlichen, einen anderen Ansatz als Nvidias stärker vertikal integrierte Vorgehensweise. Indem Google mehr von der zugrundeliegenden Software offenlegt, will das Unternehmen das Vertrauen von Entwicklern stärken, die Wert auf Transparenz und Portabilität legen.

Nichts davon garantiert, dass TPUs GPUs ersetzen werden, aber es verändert die Ausgangslage. Anstatt zwischen Nvidias ausgereiftem Ökosystem und einer Alternative, die eine vollständige Migration der Toolsets erfordert, wählen zu müssen, könnten Kunden Leistung, Kosten und Verfügbarkeit abwägen und dabei in der vertrauten PyTorch-Umgebung bleiben.

Sowohl bei Cloud- als auch bei On-Premises-Bereitstellungen könnte diese Verlagerung es Unternehmen erleichtern, im Laufe der Zeit verschiedene Hardwareanbieter zu kombinieren , anstatt ihre KI-Roadmaps standardmäßig an einen einzigen Anbieter zu binden.

Da Google sein Engagement für PyTorch durch TorchTPU verstärkt, den Unternehmenszugang zu TPUs ausbaut und die Zusammenarbeit mit Meta intensiviert, wird die Wettbewerbslandschaft im Bereich KI-Infrastruktur dynamischer. Nvidias Vorsprung, der auf jahrelanger Hardware- und CUDA-Integration beruht, ist zwar weiterhin beträchtlich, doch Kunden sehen nun realistischere Möglichkeiten, die Ausführung ihrer KI-Workloads zu diversifizieren und die Kosten für die zugrunde liegende Rechenleistung zu senken.

Notausschalter
In Verbindung stehender Artikel:
Nvidia wehrt sich gegen „Kill Switch“-Vorwürfe und Richtlinienvorschläge für KI-Chips
Zusammenhängende Posts: