Das ist das AI- & GPU-Modul. Die Ænix Platform hat drei Plattformen — Provider und Enterprise — und diese Fähigkeit erweitert beide: Ein Anbieter verkauft sie als GPU-as-a-Service, ein Unternehmen betreibt darauf die eigene Inferenz.
KI-Plattform-Automatisierung out-of-the-Box. Standard-KI-Workloads, Service-APIs und fertige Blueprints, Datenbanken, Apps und Modelle — damit Ihr KI-Team von der Idee zu laufenden Jobs schneller kommt. Multi-Tenant-GPU-Scheduling, Vector-DBs, Souveränitätskontrollen inklusive. Gebaut für KI-native Organisationen und regulierte KI-Deployments im großen Maßstab.
Was in der AI Platform enthalten ist
KI-Plattform-Automatisierung out-of-the-Box
Vor-integrierter Stack für Inferenz-, Fine-Tuning- und RAG-Workloads. Service-APIs zum Hochfahren von Model-Serving-Endpoints, Fine-Tuning-Jobs, Vector-Indexen, Evaluation-Harnesses — ohne dass Sie für jedes davon eigenes MLOps-Engineering aufbauen müssen.
Fertige Blueprints
Vorvalidierte Patterns für gängige KI-Workload-Typen:
- Single-Tenant Inferenz-Cluster — für einen Kunden, eine Workload-Klasse
- mandantenfähige Inferenz-Flotte — Gemeinsamer GPU-Pool mit logischer Mandantentrennung
- Inferenz + Fine-Tuning + RAG — Full-Stack-Pattern mit heterogenen GPU-Pools
- Air-Gapped souveränes Deployment — für Verteidigung, isolierte Industrie, souveräne-Cloud-Kunden
(Siehe Sovereign-AI-Architektur-Leitfaden für Blueprint-Details.)
Multi-Tenant-GPU-Scheduling
Per-Tenant-GPU-Pools, GPU-Class-aware-Scheduling (z.B. L40S für Inferenz, H100 für Fine-Tuning), fraktionales GPU-Sharing über HAMi auf dem NVIDIA GPU Operator. Quotas + RBAC + Observability per Tenant für KI-Workloads.
Modelle, Datenbanken, Apps inklusive
Vorinstallierte Open-Weight-Modelle (Llama, Mistral, Qwen, DeepSeek, Phi, Gemma Familien). Vector DB (pgvector via PostgreSQL-Operator, oder Qdrant). Managed Databases (PostgreSQL, MariaDB, Redis, Kafka, ClickHouse, RabbitMQ). Object Storage (S3-kompatibel) für Trainingsdaten + Modell-Checkpoints.
Service-APIs
Inferenz-API (standardmäßig vLLM-kompatibel; Triton unterstützt). Fine-Tuning-Job-API. Embedding-Generations-API. RAG-Retrieval-API. Alle Multi-Tenant-aware.
Souveränitätskontrollen
Kundenkontrollierte Verschlüsselungsschlüssel für Modellgewichte im Ruhezustand, Trainingsdaten, Vector-Indexe. Lieferantentransparenz zur zweiten Stufe. Audit-isoliertes Environment. Anbieter-Personal-Zugang protokolliert + zeitlich begrenzt. Air-Gap-Deployment unterstützt.
GPU-Sizing-Referenz
Praktische Sizing-Tabellen für gängige Workload-Profile (Llama 7B / 13B / 70B / 405B, Mistral, Qwen, DeepSeek, Phi, Gemma — Single-Card / Multi-Card / Multi-Node-Konfigurationen). Ænix-Engagement inkludiert Capacity-Planning für dauerhaft ausgelastete Workloads.
Hosting-Panel + Admin-Interface
Gebrandetes Admin-Dashboard für den KI-Plattform-Betreiber. Service-Erstellungs-Wizards für Endnutzer (ML-Engineers, Data Scientists, App-Teams).
Observability für KI-Workloads
Metriken zu Inferenz-Latenz und Durchsatz. GPU-Auslastung per Tenant. Model-Serving SLOs. Kostenverfolgung je Token. Anomalie-Erkennung für Qualitätsdrift der Inferenz.
Migrations-Tooling und -Expertise
Produktisierte Patterns für Migration von Hyperscaler-KI (AWS Bedrock, Azure OpenAI Service, GCP Vertex AI) zu souveräner KI-Infrastruktur. Besonders für Organisationen mit dauerhaft ausgelasteten Inferenz-Workloads, bei denen sich Hyperscaler-API-Preise wirtschaftlich nicht mehr rechnen.
Wer kauft AI Platform
| Käuferprofil | Typisches Engagement |
|---|---|
| KI-natives Startup im Wachstum | Souveräne Inferenz-Fleet, ersetzt Ausgaben für Hyperscaler-APIs |
| Reguliertes KI-Deployment (Bank / öffentlicher Sektor / Gesundheitswesen) | KI-Infrastruktur mit Souveränitätsauflagen mit kundenkontrollierten Schlüsseln |
| GPU-lastiges Produkt-Unternehmen | Multi-Tenant-GPU-Plattform mit strikter Kosten-Disziplin |
| Telco / großes Unternehmen mit KI | Interne KI-Plattform, die über Geschäftsbereiche hinweg genutzt wird |
Preise
Projekt plus Managed-Retainer nach dem Deployment, Angebot nach RFP.
Engagement-Struktur
- Discovery-Call (30 min, kostenlos)
- Sovereign-AI-Architektur-Review (1-2 Wochen, Festpreis) — unter Verwendung des Sovereign-AI-Architektur-Leitfaden Frameworks + Ænix-Expertise
- Pilot-Engagement (3-6 Monate) — definierter Slice (eine Workload-Klasse, ein Tenant, eine Modell-Familie)
- Vollständiger AI Platform Build (6-12 Monate) — produktive KI-Infrastruktur mit allen Ziel-Workload-Typen
- Managed-Retainer (optional, laufend) — Ænix betreibt die KI-Plattform unter SLA
AI Platform Build Service → | Kostenloser Sovereign AI Decision Guide →
Referenzen
Die Kunden der AI Platform sind NDA-geschützt. KI-native Organisationen und regulierte KI-Deployments laufen in Produktion; für eine konkrete Opportunity lassen sich Referenzgespräche unter NDA arrangieren.
Wie starten
Buchen Sie einen 30-Minuten-Discovery-Call. Bringen Sie Ihr KI-Workload-Profil (durchgängige Inferenz, Training, Fine-Tuning, RAG oder eine Mischung), regulatorischen Scope und Ziel-Deployment-Modell mit.
Ænix AI Platform basiert auf Cozystack — einem CNCF-Projekt, das wir erstellt haben und pflegen (derzeit CNCF Sandbox; CNCF Incubating erwartet Spätsommer 2026). Apache 2.0. Ænix ist das Open-Core-Unternehmen.