Private LLM: Self-Hosted GenAI auf Ihren eigenen GPUs
Betreiben Sie Ihr eigenes großes Sprachmodell auf selbst kontrollierter Hardware — Open-Weight-Modelle wie Llama, Mistral und Qwen, für Inferenz bereitgestellt, mit RAG auf Ihre eigenen Dokumente gestützt und bei Bedarf auf Ihren Daten fine-getunt. Ein Private LLM hält Prompts, Embeddings, Weights, Keys und den Audit-Trail innerhalb Ihres Perimeters, sodass Sie moderne GenAI erhalten, ohne sensiblen Text an eine Drittanbieter-API zu senden. Ænix baut diese Plattformen auf Cozystack, auf Ihren eigenen GPUs.
Passt zu: Ænix AI Platform — GPU-Scheduling, fraktionales Sharing und Blueprints für Inferenz und Fine-Tuning. Für die elastische GPU-Kapazität darunter: kombinieren mit GPU-Cloud-Bursting. Für die umfassendere Strategie: Sovereign AI.
Warum ein Private LLM statt einer Cloud-KI-API?
Für viele Organisationen ist der Blocker für GenAI nicht das Modell — es ist der Datenpfad. Ein gehosteter Assistent bedeutet, Prompts und oft die Dokumente dahinter an eine externe API zu senden, die Sie nicht auditieren können.
- Daten dürfen die Grenze nicht verlassen. Banken, Gesundheitsversorger und öffentliche Stellen verarbeiten personenbezogenen, finanziellen oder klassifizierten Text, den die Datenverarbeitungsbedingungen einer Drittanbieter-API nicht ausreichend abdecken. Ein Self-Hosted LLM hält diesen Text von Grund auf in der Jurisdiktion und in der Infrastruktur.
- Planbare Ökonomie im Volumen. Pro-Token-Preise sind für einen Pilot in Ordnung und bei Skalierung teuer. Die GPUs zu besitzen, verwandelt eine variable API-Rechnung in eine Kapazität, die Sie kontrollieren — dieselbe Logik hinter GPU-Cloud-Bursting.
- Versionsstabilität. Ein fixiertes Open-Weight-Modell ändert sein Verhalten nicht unter Ihnen, wenn ein Anbieter ein neues Release ausliefert — wichtig, wenn Ihre Workflows und Evaluationen von konsistenter Ausgabe abhängen.
Das ist speziell das Problem „Private LLM / Self-Hosted LLM / On-Prem GenAI“. Es sitzt innerhalb — ist aber enger als — die umfassendere Sovereign-AI-Strategie, die KI-Compute, Daten und Governance über eine ganze Jurisdiktion abdeckt.
Woraus eine Private-LLM-Plattform besteht
Eine On-Prem-GenAI-Plattform ist mehr als eine Modelldatei. Ænix setzt den gesamten Stack aus offenen, CNCF-nahen Bausteinen zusammen, sodass nichts Sie zurück zu einem proprietären KI-Dienst zwingt.
- Open-Weight-Modell-Serving. Modelle wie Llama, Mistral und Qwen für Inferenz auf Ihren GPUs, den Teams als gewöhnliche Kubernetes-Services statt als externer Endpoint bereitgestellt.
- RAG über Ihre Dokumente. Eine Qdrant-Vektordatenbank indexiert Ihre eigenen Inhalte und ruft zur Anfragezeit die relevanten Passagen ab, um Antworten auf Ihre eigenen Daten zu stützen. Sowohl die Quelldokumente als auch die generierten Antworten bleiben innerhalb der Grenze.
- Effiziente Inferenz. NVIDIA Dynamo liefert disaggregiertes Serving und KV-Cache-bewusstes Routing über die GPU-Flotte, was die Auslastung teurer Karten ohne zusätzliche Anbieter-Lizenzen erhöht.
- GPU-Scheduling und Isolation. Der Kubernetes-Scheduler plus der NVIDIA-GPU-Operator machen GPUs zu einer erstklassigen, planbaren Ressource; Pro-Tenant Hosted Control Planes halten Teams auf geteilter Hardware isoliert.
- Fine-Tuning vor Ort. Weil GPUs und Daten in derselben Plattform liegen, können Sie Open-Weight-Modelle auf proprietären Daten anpassen, ohne dass diese Daten Ihre Infrastruktur verlassen.
Weights, Keys und Audit-Trail auf Ihrer Seite halten
Das bestimmende Merkmal eines Private LLM ist die Verwahrung: wer Gewichte, Schlüssel und Protokolle tatsächlich hält. Auf dieser Plattform liegen die Modell-Weights auf Storage, den Sie besitzen; Single Sign-on läuft über Ihr eigenes Keycloak; und jede Anfrage erzeugt Logs, die Sie halten, nicht die Telemetrie eines Anbieters. Für einen Regulator oder ein internes Risk-Team verwandelt das „die KI ist sicher“ in eine prüfbare Aussage: Sie können zeigen, wohin die Daten gingen, wer das Modell aufrief und dass nichts die Grenze überquerte. Verschlüsselung im Ruhezustand und ein verschlüsseltes Mesh zwischen Standorten halten dieselben Garantien, wenn die Plattform mehr als ein Rechenzentrum umspannt.
Beleg: eine RAG-und-Inferenz-Plattform, ausgeliefert in die Grenze eines Kunden
Das Muster ist bereits in Produktion. In unserer anonymisierten AI-Universal-Installer-Case-Study baute ein Telekom-Integrator eine unternehmensweite KI-Plattform auf Cozystack — unternehmensweite LLM-Assistenten, RAG-Suche über regulatorische Dokumentation und Computer Vision — und nutzte dieselbe Distribution, um diese Dienste in die Umgebung eines staatlichen Endkunden auszuliefern, wobei die Daten innerhalb der Grenze des Kunden blieben.
Konkret paketierte das Team Qdrant als Plattform-App für RAG neben den GPU-Workloads, paketierte NVIDIA Dynamo als vollständigen Inferenz-Stack zur Steigerung der GPU-Auslastung und betrieb einen geo-verteilten GPU-Cluster, der über ein verschlüsseltes WireGuard-Mesh mit dem Hauptcluster verbunden war — Modelle für jeden Tenant als gewöhnliche Services erreichbar. Das ist eine Private-LLM-Plattform bei echter Arbeit: 141 von 141 Managed Releases gesund, Single Sign-on, Multi-Tenancy und keine Prompts, die die Jurisdiktion des Kunden verlassen.
Welche Modelle und welche Workloads?
„Private LLM“ ist nicht ein Workload — es ist eine kleine Familie, und jede hat eine andere Infrastruktur-Form.
- Inferenz / Assistenten. Ein Open-Weight-Chat- oder Instruct-Modell hinter einer internen API für Copilots, Support-Triage oder Dokument-Q&A. Das ist der häufigste Einstieg und am GPU-latenzsensitivsten.
- RAG-Suche. Antworten über eine Vektordatenbank in Ihrem eigenen Korpus erden, sodass das Modell Ihre Dokumente zitiert statt zu halluzinieren. Oft mit einem Assistenten kombiniert, aber allein wertvoll für internes Wissens-Retrieval.
- Fine-Tuning und Anpassung. Ein Open-Weight-Basismodell auf Ihre Domäne, Terminologie oder Aufgabe auf proprietären Daten anpassen — in der Grenze ausgeführt, sodass der Trainingsdatensatz den Perimeter nie verlässt.
- Batch und Klassifizierung. Hochdurchsatz-, latenztolerante Jobs — Massen-Zusammenfassung, Extraktion, Tagging — bei denen fraktionales GPU-Sharing und Off-Peak-Scheduling die Auslastung hoch halten.
Die GPU-Flotte gegen diesen Mix richtig zu dimensionieren, ist genau das, was ein Assessment klärt, bevor Hardware festgelegt wird.
Wie Ænix bei Private LLM arbeitet
Das Engagement läuft als AI Platform Build: GPU-Architektur und Sizing, der Inferenz-Stack, eine Qdrant-Vektordatenbank für RAG, Multi-Tenant-Isolation und SSO und — wo relevant — eine Fine-Tuning-Pipeline, alles auf Ihrer eigenen Hardware bereitgestellt. Wo GPU-Bedarf sprunghaft ist, kombiniert es mit GPU-Cloud-Bursting, sodass Sie die Grundlast besitzen und Spitzen bursten; wo der Treiber Jurisdiktion und Governance statt eines einzelnen Workloads ist, rollt es in ein Sovereign-AI-Programm auf der AI Platform ein.
Ænix ist das Team hinter Cozystack — einem CNCF-Projekt (heute Sandbox; Incubating erwartet für Spätsommer 2026), Apache 2.0. Ænix kommerzialisiert es als Ænix Platform — drei Plattformen auf einer Engine: Public Cloud, Private Cloud und AI — kombinierbar statt sich gegenseitig ausschließend. Wir bauen Private-LLM- und On-Prem-GenAI-Plattformen für Unternehmen und öffentliche Organisationen in der EU und DACH.