Für regulierte Workloads ist KI kein reines Hyperscaler-Thema mehr. Sensible Datenklassen, sektorale Vorgaben und die Ökonomie von Inferenz im großen Maßstab drängen Finanzdienstleister, Gesundheitswesen, öffentlichen Sektor und KI-Plattform-Betreiber zu souveräner KI-Infrastruktur — GenAI, Inferenz und Analytics auf der eigenen Hardware des Kunden, in der vom Kunden gewählten Jurisdiktion, unter den Verschlüsselungsschlüsseln des Kunden.
Ænix baut und betreibt souveräne KI-Infrastruktur für Organisationen, deren Datenklasse, Regulator oder Wirtschaftlichkeit Hyperscaler-KI-Services unpraktikabel machen. Ergebnis: eine Architektur, ein Deployment und ein Betriebsmodell, das Ihr Team tatsächlich selbst betreiben kann.
Passt zu: Ænix AI Platform — KI-Plattform-Automatisierung out-of-the-box (Multi-Tenant-GPU-Scheduling für H100/H200/L40S/A100/Blackwell, fertige Blueprints für Inferenz + Fine-Tuning + RAG, Vector DB + Object Storage inkludiert, Souveränitätskontrollen). Für regulierte KI-Workloads auf einer breiteren souveränen Cloud: kombinieren mit Private Cloud Platform. Kostenloser Sovereign-AI-Architektur-Leitfaden →.
Wer souveräne KI braucht
Souveräne KI ist nicht für jeden Workload sinnvoll. Sie ist die richtige Antwort, wenn mindestens drei der folgenden Punkte zutreffen:
- Die Datenklasse ist sensibel — regulierte personenbezogene Daten, Finanzdatensätze, Gesundheitsakten, klassifizierte Informationen, internes geistiges Eigentum, das Modellanbietern nicht offengelegt werden darf.
- Der Regulator bindet die KI-Verarbeitung an eine Jurisdiktion — DORA, NIS2, sektorale Regeln, Souveräne-Cloud-Mandate (EU-Mitgliedstaaten, Kasachstan, mehrere APAC-Länder).
- Inferenz im Maßstab ist beim Hyperscaler wirtschaftlich schmerzhaft — GPU-Preise, Egress-Kosten und unvorhersehbare Ausgaben machen dedizierte Infrastruktur für 24/7-Inferenz-Workloads besser geeignet.
- Das Modellverhalten muss reproduzierbar und auditierbar sein — der Dialog mit dem Regulator verlangt „genau welches Modell diese Ausgabe erzeugt hat, mit welchen Gewichten, mit welchen Eingabedaten.“
- Air-gap oder eingeschränkter Egress ist erforderlich — klassifizierte Workloads des öffentlichen Sektors, verteidigungsnahe oder kritische Infrastruktur.
Trifft keiner dieser Punkte zu, ist souveräne KI Over-Engineering. Treffen drei oder mehr zu, lautet die Frage nicht ob — sondern wie, bis wann und zu welchen Kosten.
Was souveräne KI tatsächlich bedeutet
1. Das Modell läuft auf Ihrer Hardware Inferenz (und, wo zutreffend, Training) auf GPUs, die Sie besitzen oder betreiben, nicht auf GPU-Instanzen oder Modell-APIs eines Hyperscalers. NVIDIA H100 / H200 / L40S / Blackwell, AMD MI-series oder passende Alternativen.
2. Die Daten verlassen den Perimeter nie Trainingsdaten, Prompts, Completions, Embeddings und alle abgeleiteten Artefakte bleiben innerhalb der kundenkontrollierten Umgebung. Kein Traffic zu Modellanbieter-Endpunkten; keine Observability-Daten an SaaS-Anbieter, die außerhalb des Perimeters verarbeiten.
3. Die Modellgewichte liegen unter Ihrer Kontrolle Open-Weight-Modelle (Llama, Mistral, Qwen, DeepSeek, Phi usw.), die lokal laufen; oder feinabgestimmte Varianten, deren Gewichte Ihnen gehören. Keine Modell-API mit Prompt-Routing in ein Modell eines Dritten.
4. Die Plattform wird von Ihnen betrieben, unter Ihrer Governance Kubernetes-native KI-Plattform mit klarer Verantwortlichkeit für GPU-Scheduling, Autoscaling, Modellverwaltung und Audit-Trails. Keine Black-Box-Appliance mit anbieterkontrolliertem Betrieb.
Das ist keine „private KI“ als Marketing-Fassade vor einem SaaS-Endpunkt mit einer Datenschutzklausel. Es ist ein architektonisch souveräner Stack mit benannten Komponenten und nachweisbaren Kontrollen.
Wo gängige KI-Plattform-Ansätze am Souveränitätstest scheitern
„Private Bereitstellung“ einer SaaS-Modell-API Der Modellanbieter führt die Inferenz aus; die Daten fließen zum Endpunkt des Anbieters. Datenschutzklausel hin oder her — die Daten haben den Perimeter verlassen. Souveränität gescheitert.
Hyperscaler-verwaltete GPU mit proprietären Diensten Die GPU steht in der richtigen Region, aber Modell-Orchestrierung, Observability und Storage-Anbindung binden den Workload an proprietäre Dienste. Die Exit-Kosten steigen; das Konzentrationsrisiko steigt.
Single-Tenant-SaaS in einer „souveränen“ Hyperscaler-Region Die Region ist souverän, aber die Service-Ebene wird vom Hyperscaler betrieben. Verschlüsselungsschlüssel, Control-Plane-Zugriff und Software-Update-Kanäle verbleiben bei einem nicht-souveränen Anbieter.
Selbst gehostetes LLM ohne Plattform darunter Ein Team betreibt vLLM oder llama.cpp auf ein paar Bare-Metal-Servern und nennt das private KI. Funktioniert für einen PoC. Scheitert an Multi-Tenancy, GPU-Autoscaling, Audit-Bereitschaft oder betrieblicher Verfügbarkeit für die Produktion.
Die ehrliche Antwort ist meist eine Kubernetes-native KI-Plattform auf kundenkontrollierter Hardware mit einem definierten Betriebsmodell. Dieses Muster haben wir für KI/GPU-Betreiber und regulierte Unternehmen in Produktion ausgeliefert.
Wie Ænix hilft
Das Sovereign-AI-Engagement läuft als Teil unseres Platform Readiness Assessment mit Schwerpunkt auf den Workstreams Souveränität und KI-Plattform. Führt das Engagement zur Implementierung, liefert Ænix die Plattform End-to-End.
Die Assessment-Phase liefert:
- Architekturoptionen — konkrete Plattform-Designs für Inferenz / Training / Fine-Tuning in Ihrem Maßstab, inklusive Hardware-Sizing.
- Souveränitätskontrollen — Design für Datenresidenz, Schlüsselverwahrung und Audit-Trail, spezifisch für KI-Workloads.
- GPU-Strategie — Sizing für NVIDIA / AMD / Alternativen, Modell-zu-Hardware-Eignung, Skalierungsannahmen.
- Betriebsmodell — wer die Plattform betreibt, welche Self-Service-Oberfläche Produkt- / Data-Science-Teams erhalten, wie das On-Call-Modell aussieht.
- Phase-2-Implementierungs-Roadmap — von Ænix gelieferter Aufbau, mit Zeitplan, Aufwandsschätzungen und Erfolgskriterien.
Die Implementierungsphase liefert:
- Cozystack-basierte KI-Plattform mit KubeVirt für VMs, Kubernetes für Inferenz-Workloads, NVIDIA vGPU für VM-basierte GPU-Workloads sowie dem NVIDIA GPU Operator mit HAMi für fraktionales GPU-Sharing und PCI-Passthrough bei container-basierten GPU-Workloads.
- Validiertes Model Serving — vLLM, Triton oder Alternativen, passend zur Modellarchitektur.
- Self-Service für Data-Science-Teams — Provisionierungspfade, Observability, Audit-Trails.
- Air-gapped-Deployment, wo der Regulator es verlangt.
Zu den validierten GPU-Modellen zählen NVIDIA A100, H100, H200, L40S und Blackwell. Die konkrete Modelleignung wird im Assessment ermittelt.
Warum gerade Ænix
- KI-Infrastruktur ist unser Tagesgeschäft. Cozystack ist bei KI/GPU-Betreibern in der EU und Zentralasien in Produktion. Wir haben GPU-Plattformen ausgeliefert, die Inferenz- und Fine-Tuning-Workloads End-to-End tragen.
- Keine Modellanbieter-Voreingenommenheit. Wir haben keine kommerzielle Beziehung zu einem bestimmten LLM-Anbieter. Die Architektur empfiehlt das Open-Weight-Modell, das zu Ihrer Datenklasse, Ihrem Regulator und Ihrer Ökonomie passt — Llama, Mistral, Qwen, DeepSeek, Phi oder feinabgestimmte Varianten — und den dazu passenden Serving-Stack.
- Open-Source-Plattform als Fundament. Cozystack ist ein CNCF-Projekt, das auf der vom Kunden gewählten Hardware in der gewählten Jurisdiktion läuft. Der Cluster-Level-Zugriff bleibt beim Kunden; wir arbeiten unter Ihrer Governance, nicht gegen sie.
Wie das Engagement abläuft
| Wann | Was | Ergebnis |
|---|---|---|
| Tag 0 | 30-minütiger Discovery-Call (kostenlos) | Eignung bestätigen, KI-Workload-Scope eingrenzen, Sponsor + Data-Science-Lead identifizieren |
| Tage 1-13 (oder 1-27) | Vier parallele Workstreams; Schwerpunkt Souveränität + KI-Plattform | Architekturoptionen, GPU-Strategie, Souveränitätskontrollen, tägliche asynchrone Updates |
| Tag 14 (oder 28) | Executive-Readout (60-90 Min.) | Schriftlicher Bericht: Architektur, Souveränitätskontrollen, GPU-Strategie, Betriebsmodell, Phase-2-Roadmap |
| Phase 2 (3-9 Monate) | Implementierung — Ænix baut und übergibt | Produktive souveräne KI-Plattform |
Zur vollständigen Assessment-Methodik siehe Platform Readiness Assessment.
Souveräne KI-Plattformen, die wir gebaut haben
Wir haben KI-Plattformen für KI/GPU-Betreiber, Finanzdienstleister und Initiativen des öffentlichen Sektors in der EU und Zentralasien gebaut und betrieben. Zu den Workload-Mustern zählen Inferenz im Maßstab (24/7), Fine-Tuning, RAG-Pipelines und Multi-Tenant-Model-Serving.
Preise und Engagement-Umfang
Das Sovereign-AI-Engagement läuft in zwei Phasen.
Assessment (14- oder 28-tägig)
Architekturoptionen, GPU-Strategie, Souveränitätskontrollen, Betriebsmodell, Phase-2-Roadmap. Festpreis. Auf Anfrage
Phase-2-Implementierung
Von Ænix gelieferter Aufbau der souveränen KI-Plattform. Fester Umfang oder nach Aufwand, je nach Anzahl und Komplexität der Workloads. Typischerweise 3-9 Monate Laufzeit. Auf Anfrage
Folgt Phase 2 auf das Assessment, werden die Assessment-Kosten je nach Umfang auf das Implementierungs-Engagement angerechnet.
Wir akzeptieren RFI / RFP über die üblichen Beschaffungskanäle in EU-Mitgliedstaaten und Kasachstan.
Beginnen Sie mit einem 30-minütigen Discovery-Call
Kostenlos. Keine Vorbereitung nötig. Wir bestätigen die Eignung, grenzen den KI-Workload-Scope auf Ihre Datenklasse und Ihren Regulator ein und sagen Ihnen, ob das 14-tägige oder das 28-tägige Assessment zu Ihrer Situation passt.
Oder lesen Sie weiter:
- Private-LLM-Deployment-Leitfaden — praktische Architektur
- Datensouveränität — angrenzender regulatorischer Auslöser
- DORA-Compliance — regulatorischer Auslöser im Finanzsektor
- Platform Readiness Assessment — Assessment-Methodik
- Cozystack — die Plattform, auf der wir KI-Workloads betreiben
Ænix ist das Unternehmen hinter Cozystack — einem CNCF-Projekt, einer Kubernetes Certified Distribution mit OpenSSF Best Practices. Wir bauen souveräne KI-Plattformen für KI/GPU-Betreiber, Finanzdienstleister und Organisationen des öffentlichen Sektors in der EU, DACH-Region und Zentralasien.




