GPU-Cloud-Bursting: Multi-Cloud-GPU-as-a-Service auf Ihrer eigenen Plattform
Die Basis besitzen, nur die Spitzen mieten. Cloud Bursting lässt Sie stetige GPU-Workloads auf selbst kontrollierter Hardware betreiben und Inferenz- oder Training-Spitzen bei Bedarf in Public- oder souveräne Clouds auslagern — und die Zusatzkapazität danach wieder abbauen. Ænix baut das als GPU-as-a-Service auf einer einzigen Kubernetes-Plattform, damit Ihre Teams elastische GPU erhalten — ohne Hyperscaler-Lock-in, ohne intransparente Abrechnung, ohne komplette Migration.
Passt zu: Ænix AI Platform — Multi-Tenant-GPU-Scheduling, fraktionales Sharing und fertige Blueprints für Inferenz und Fine-Tuning. Für die elastische Self-Service-Cloud darunter: kombinieren mit Public Cloud Platform. Rechnen Sie die Zahlen mit den ROI- & TCO-Rechnern durch.
Was Sie bekommen
GPU-Cloud-Bursting auf der Ænix-Plattform ist ein elastischer GPU-Pool, verteilt über die Infrastruktur, die Sie bereits haben, und die Clouds, die Sie erreichen wollen.
- Bursten in Public- und souveräne Clouds. Basis-Workloads laufen auf eigenem Bare Metal. Bei Lastspitzen wird Kapazität in einem Public-Hyperscaler, einer souveränen Cloud oder beiden ergänzt — und danach freigegeben. Eine souveräne Cloud kann ein vollwertiges Burst-Target sein, wenn ein Regulator GPU-Verarbeitung an eine Jurisdiktion bindet oder ihre GPUs schlicht günstiger sind.
- Fraktionales GPU-Sharing. Mit HAMi über dem NVIDIA-GPU-Operator teilen sich mehrere Jobs eine physische Karte. Ein Notebook, ein kleiner Inferenz-Endpoint und ein Batch-Job koexistieren auf einer GPU, statt jeweils ein ganzes Gerät zu belegen.
- Eine Cluster API. Bare Metal, Hyperscaler und souveräne Cloud liegen hinter einer einzigen Cluster API. Teams fordern GPU überall gleich an; die Plattform entscheidet, wo sie landet.
- GPU-bewusstes Autoscaling. Der Cluster Autoscaler fügt GPU-Nodes hinzu, wenn Pods nicht planbar sind, und entfernt sie nach der Spitze — Sie zahlen Spitzenkapazität nur, solange die Spitze dauert.
- Ein verschlüsseltes Mesh über Standorte. Ein WireGuard-Mesh verbindet jeden Standort und jede Cloud zu einem Pod- und Service-Netzwerk, wobei neue Nodes sich beim Hochfahren selbst registrieren.
- Pro-Tenant-Isolation. Jeder Tenant erhält eine eigene Hosted Control Plane, sodass beliebiger User-Code und Multi-Tenant-GPU-Sharing die Plattform nicht kompromittieren.
Für wen ist das?
AI/ML-Teams mit sprunghaftem Training- und Inferenz-Bedarf, Forschungseinrichtungen und Universitäten mit geteilten GPU für Kurse und Experimente sowie Plattform-Betreiber, die GPU-as-a-Service anbieten wollen, ohne einen Hyperscaler weiterzuverkaufen. Ist Ihr GPU-Bedarf flach und planbar, brauchen Sie womöglich kein Bursting — kaufen Sie für die Grundlast — mehr braucht es nicht. Springt er, liegt in Bursting die Ökonomie.
Wie es funktioniert
Das Muster besteht aus Standard-Kubernetes-Primitiven, zusammengesetzt und durchgängig betrieben.
- Cluster Autoscaler erkennt GPU-Pods, die nicht geplant werden können, und provisioniert Nodes auf dem richtigen Ziel — Bare Metal, Hyperscaler oder souveräne Cloud — über die Cluster API, Kubernetes’ deklarativen Standard für den Lebenszyklus von Clustern und Maschinen. Leert sich die Warteschlange, werden die Nodes wieder abgebaut.
- Cilium plus WireGuard-Mesh (Kilo) liefern die CNI und ein verschlüsseltes Overlay über Clouds hinweg. Frisch autoskalierte Nodes melden sich ins Mesh und erreichen geteilten Storage ohne manuelle Schritte — das Kubernetes-Netzwerkmodell behandelt sie, als wären sie lokal.
- NVIDIA-GPU-Operator übernimmt Treiber-Installation, Device-Discovery und Passthrough auf jedem Node, und HAMi ergänzt fraktionales Sharing, sodass eine Karte mehrere Pods bedient.
- Talos Linux und Kamaji bilden die Basis: ein immutables, API-verwaltetes OS für die Nodes und Hosted Control Planes für Tenant-Cluster, sodass jeder Tenant von Grund auf isoliert ist.
Das ist dieselbe Klasse offener, CNCF-naher Bausteine, auf die sich das Cloud-Native-Ökosystem stützt — keine proprietäre Orchestrierungsschicht, keine Control-Plane-Abgabe pro GPU.
Die Ökonomie
GPU ist die knappe, teure Ressource, und ihr Preis steht unter Druck: GPU-Preise sind volatil und sind in kurzen Zeiträumen stark gestiegen. Die Basis zu besitzen und die Spitzen zu bursten — statt GPU rund um die Uhr in einem Hyperscaler zu mieten — ist genau der Punkt, an dem dieser Druck aufgefangen wird.
In der akademischen Multi-Cloud-Case-Study verlagerte ein europäischer akademischer Computing-SaaS sein Backend und die User-Workloads von einem Public-Hyperscaler auf eigenes Bare Metal auf Cozystack, behielt eine einzige Cluster API über Bare Metal, einen Hyperscaler und eine souveräne Schweizer OpenStack-Cloud und burstete GPU bei Bedarf. GPU in der souveränen Cloud war rund 5x günstiger als das vorherige Hyperscaler-Setup — bei intaktem fraktionalem Sharing und Pro-Tenant-Isolation und ohne Ausfallzeit für Tausende aktiver Nutzer.
Ihr Mix aus Grundlast, Spitze und Burst-Target entscheidet über die Ersparnis. Modellieren Sie ihn mit den ROI- & TCO-Rechnern, bevor Sie sich auf Hardware oder einen Burst-Target-Vertrag festlegen.
Ænix ist das Team hinter Cozystack — einem CNCF-Projekt (heute Sandbox; Incubating erwartet für Spätsommer 2026), Apache 2.0. Ænix kommerzialisiert es als Ænix Platform — drei Plattformen auf einer Engine: Public Cloud, Private Cloud und AI — kombinierbar statt sich gegenseitig ausschließend. Wir bauen Multi-Cloud-GPU-Plattformen für AI/ML-, Forschungs- und Plattform-Betreiber-Organisationen in der EU und DACH.