Private LLM: Self-Hosted und On-Prem GenAI auf Ihren GPUs

Open-Source Cozystack (CNCF-Projekt, von uns entwickelt und gepflegt) Ænix Platform, die unterstützte kommerzielle Distribution Aenix baut, betreibt und migriert sie.

Ein Private LLM ist ein großes Sprachmodell, das Sie auf Ihren eigenen GPUs und in Ihrem eigenen Netzwerk betreiben, sodass Prompts, Embeddings, Modell-Weights und der Audit-Trail nie Ihre Kontrolle verlassen. Es nutzt typischerweise Open-Weight-Modelle — Llama, Mistral, Qwen und ähnliche — für Inferenz, angereichert mit Retrieval (RAG) über Ihre eigenen Dokumente und bei Bedarf fine-getunt auf Ihren Daten. Aenix baut diese Plattformen auf Cozystack (ein CNCF-Projekt, Apache 2.0): GPU-Scheduling, eine Vektordatenbank für RAG und effiziente Inferenz, alles auf Infrastruktur, die Sie besitzen. Es passt für Banken, das Gesundheitswesen, den öffentlichen Sektor und jedes Unternehmen, das sensiblen Text nicht an eine Drittanbieter-KI-API senden kann. Anders als ein gehosteter Assistent hält ein Private LLM die Weights, die Keys und die Logs innerhalb Ihres Perimeters.

Auf einen Blick

  • Was es ist Ein großes Sprachmodell, betrieben auf eigenen GPUs und im eigenen Netzwerk, mit Weights, Keys und Logs unter Ihrer Kontrolle.
  • Modelle Open-Weight-Modelle — Llama, Mistral, Qwen und ähnliche — für Inferenz; keine Abhängigkeit von einer Drittanbieter-KI-API.
  • RAG Retrieval-augmented Generation über Ihre eigenen Dokumente mit einer Qdrant-Vektordatenbank neben den GPU-Workloads.
  • Inferenz-Effizienz NVIDIA Dynamo für disaggregiertes Serving und KV-Cache-bewusstes Routing — höhere GPU-Auslastung, keine zusätzlichen Anbieter-Lizenzen.
  • Datengrenze Prompts, Embeddings und Fine-Tuning-Daten bleiben innerhalb Ihrer Jurisdiktion und Infrastruktur.
  • Plattform-Lizenz Cozystack ist Open Source unter Apache 2.0 — keine Lizenz pro GPU oder pro CPU.
  • Abgrenzung zu Sovereign AI Private LLM ist der Workload; Sovereign AI ist die umfassendere Jurisdiktions- und Kontrollstrategie, in die es sich einfügt.

Source: CNCF Landscape, AI-Universal-Installer-Case-Study

Private LLM: Self-Hosted GenAI auf Ihren eigenen GPUs

Betreiben Sie Ihr eigenes großes Sprachmodell auf selbst kontrollierter Hardware — Open-Weight-Modelle wie Llama, Mistral und Qwen, für Inferenz bereitgestellt, mit RAG auf Ihre eigenen Dokumente gestützt und bei Bedarf auf Ihren Daten fine-getunt. Ein Private LLM hält Prompts, Embeddings, Weights, Keys und den Audit-Trail innerhalb Ihres Perimeters, sodass Sie moderne GenAI erhalten, ohne sensiblen Text an eine Drittanbieter-API zu senden. Ænix baut diese Plattformen auf Cozystack, auf Ihren eigenen GPUs.

Passt zu: Ænix AI Platform — GPU-Scheduling, fraktionales Sharing und Blueprints für Inferenz und Fine-Tuning. Für die elastische GPU-Kapazität darunter: kombinieren mit GPU-Cloud-Bursting. Für die umfassendere Strategie: Sovereign AI.


Warum ein Private LLM statt einer Cloud-KI-API?

Für viele Organisationen ist der Blocker für GenAI nicht das Modell — es ist der Datenpfad. Ein gehosteter Assistent bedeutet, Prompts und oft die Dokumente dahinter an eine externe API zu senden, die Sie nicht auditieren können.

  • Daten dürfen die Grenze nicht verlassen. Banken, Gesundheitsversorger und öffentliche Stellen verarbeiten personenbezogenen, finanziellen oder klassifizierten Text, den die Datenverarbeitungsbedingungen einer Drittanbieter-API nicht ausreichend abdecken. Ein Self-Hosted LLM hält diesen Text von Grund auf in der Jurisdiktion und in der Infrastruktur.
  • Planbare Ökonomie im Volumen. Pro-Token-Preise sind für einen Pilot in Ordnung und bei Skalierung teuer. Die GPUs zu besitzen, verwandelt eine variable API-Rechnung in eine Kapazität, die Sie kontrollieren — dieselbe Logik hinter GPU-Cloud-Bursting.
  • Versionsstabilität. Ein fixiertes Open-Weight-Modell ändert sein Verhalten nicht unter Ihnen, wenn ein Anbieter ein neues Release ausliefert — wichtig, wenn Ihre Workflows und Evaluationen von konsistenter Ausgabe abhängen.

Das ist speziell das Problem „Private LLM / Self-Hosted LLM / On-Prem GenAI“. Es sitzt innerhalb — ist aber enger als — die umfassendere Sovereign-AI-Strategie, die KI-Compute, Daten und Governance über eine ganze Jurisdiktion abdeckt.


Woraus eine Private-LLM-Plattform besteht

Eine On-Prem-GenAI-Plattform ist mehr als eine Modelldatei. Ænix setzt den gesamten Stack aus offenen, CNCF-nahen Bausteinen zusammen, sodass nichts Sie zurück zu einem proprietären KI-Dienst zwingt.

Ihre Daten + Open-Weight-Modell
PromptsDokumenteLlama / Mistral / Qwen
für Inferenz bereitgestellt auf
Cozystack-GPUs
NVIDIA DynamoQdrant-RAGDaten bleiben in der Grenze
erzeugt
Private Inferenz
Antworten bleiben in der GrenzeWeights, Keys, Logs bei Ihnen
  • Open-Weight-Modell-Serving. Modelle wie Llama, Mistral und Qwen für Inferenz auf Ihren GPUs, den Teams als gewöhnliche Kubernetes-Services statt als externer Endpoint bereitgestellt.
  • RAG über Ihre Dokumente. Eine Qdrant-Vektordatenbank indexiert Ihre eigenen Inhalte und ruft zur Anfragezeit die relevanten Passagen ab, um Antworten auf Ihre eigenen Daten zu stützen. Sowohl die Quelldokumente als auch die generierten Antworten bleiben innerhalb der Grenze.
  • Effiziente Inferenz. NVIDIA Dynamo liefert disaggregiertes Serving und KV-Cache-bewusstes Routing über die GPU-Flotte, was die Auslastung teurer Karten ohne zusätzliche Anbieter-Lizenzen erhöht.
  • GPU-Scheduling und Isolation. Der Kubernetes-Scheduler plus der NVIDIA-GPU-Operator machen GPUs zu einer erstklassigen, planbaren Ressource; Pro-Tenant Hosted Control Planes halten Teams auf geteilter Hardware isoliert.
  • Fine-Tuning vor Ort. Weil GPUs und Daten in derselben Plattform liegen, können Sie Open-Weight-Modelle auf proprietären Daten anpassen, ohne dass diese Daten Ihre Infrastruktur verlassen.

Vergleichen Sie noch? Preise & Plattformen ansehen →

Weights, Keys und Audit-Trail auf Ihrer Seite halten

Das bestimmende Merkmal eines Private LLM ist die Verwahrung: wer Gewichte, Schlüssel und Protokolle tatsächlich hält. Auf dieser Plattform liegen die Modell-Weights auf Storage, den Sie besitzen; Single Sign-on läuft über Ihr eigenes Keycloak; und jede Anfrage erzeugt Logs, die Sie halten, nicht die Telemetrie eines Anbieters. Für einen Regulator oder ein internes Risk-Team verwandelt das „die KI ist sicher“ in eine prüfbare Aussage: Sie können zeigen, wohin die Daten gingen, wer das Modell aufrief und dass nichts die Grenze überquerte. Verschlüsselung im Ruhezustand und ein verschlüsseltes Mesh zwischen Standorten halten dieselben Garantien, wenn die Plattform mehr als ein Rechenzentrum umspannt.


Beleg: eine RAG-und-Inferenz-Plattform, ausgeliefert in die Grenze eines Kunden

Das Muster ist bereits in Produktion. In unserer anonymisierten AI-Universal-Installer-Case-Study baute ein Telekom-Integrator eine unternehmensweite KI-Plattform auf Cozystack — unternehmensweite LLM-Assistenten, RAG-Suche über regulatorische Dokumentation und Computer Vision — und nutzte dieselbe Distribution, um diese Dienste in die Umgebung eines staatlichen Endkunden auszuliefern, wobei die Daten innerhalb der Grenze des Kunden blieben.

Konkret paketierte das Team Qdrant als Plattform-App für RAG neben den GPU-Workloads, paketierte NVIDIA Dynamo als vollständigen Inferenz-Stack zur Steigerung der GPU-Auslastung und betrieb einen geo-verteilten GPU-Cluster, der über ein verschlüsseltes WireGuard-Mesh mit dem Hauptcluster verbunden war — Modelle für jeden Tenant als gewöhnliche Services erreichbar. Das ist eine Private-LLM-Plattform bei echter Arbeit: 141 von 141 Managed Releases gesund, Single Sign-on, Multi-Tenancy und keine Prompts, die die Jurisdiktion des Kunden verlassen.


Welche Modelle und welche Workloads?

„Private LLM“ ist nicht ein Workload — es ist eine kleine Familie, und jede hat eine andere Infrastruktur-Form.

  • Inferenz / Assistenten. Ein Open-Weight-Chat- oder Instruct-Modell hinter einer internen API für Copilots, Support-Triage oder Dokument-Q&A. Das ist der häufigste Einstieg und am GPU-latenzsensitivsten.
  • RAG-Suche. Antworten über eine Vektordatenbank in Ihrem eigenen Korpus erden, sodass das Modell Ihre Dokumente zitiert statt zu halluzinieren. Oft mit einem Assistenten kombiniert, aber allein wertvoll für internes Wissens-Retrieval.
  • Fine-Tuning und Anpassung. Ein Open-Weight-Basismodell auf Ihre Domäne, Terminologie oder Aufgabe auf proprietären Daten anpassen — in der Grenze ausgeführt, sodass der Trainingsdatensatz den Perimeter nie verlässt.
  • Batch und Klassifizierung. Hochdurchsatz-, latenztolerante Jobs — Massen-Zusammenfassung, Extraktion, Tagging — bei denen fraktionales GPU-Sharing und Off-Peak-Scheduling die Auslastung hoch halten.

Die GPU-Flotte gegen diesen Mix richtig zu dimensionieren, ist genau das, was ein Assessment klärt, bevor Hardware festgelegt wird.


Wie Ænix bei Private LLM arbeitet

Das Engagement läuft als AI Platform Build: GPU-Architektur und Sizing, der Inferenz-Stack, eine Qdrant-Vektordatenbank für RAG, Multi-Tenant-Isolation und SSO und — wo relevant — eine Fine-Tuning-Pipeline, alles auf Ihrer eigenen Hardware bereitgestellt. Wo GPU-Bedarf sprunghaft ist, kombiniert es mit GPU-Cloud-Bursting, sodass Sie die Grundlast besitzen und Spitzen bursten; wo der Treiber Jurisdiktion und Governance statt eines einzelnen Workloads ist, rollt es in ein Sovereign-AI-Programm auf der AI Platform ein.


Ænix ist das Team hinter Cozystack — einem CNCF-Projekt (heute Sandbox; Incubating erwartet für Spätsommer 2026), Apache 2.0. Ænix kommerzialisiert es als Ænix Platform — drei Plattformen auf einer Engine: Public Cloud, Private Cloud und AI — kombinierbar statt sich gegenseitig ausschließend. Wir bauen Private-LLM- und On-Prem-GenAI-Plattformen für Unternehmen und öffentliche Organisationen in der EU und DACH.

Häufig gestellte Fragen

Was ist ein Private LLM?

Ein Private LLM ist ein großes Sprachmodell, das Sie auf Ihren eigenen GPUs und in Ihrem Netzwerk hosten, statt eine Drittanbieter-KI-API aufzurufen. Prompts, abgerufene Dokumente, Embeddings, Modell-Weights und der Audit-Trail bleiben alle innerhalb Ihrer Infrastruktur und Jurisdiktion, sodass sensibler Text nie Ihre Kontrolle verlässt. Die meisten Private-LLM-Deployments nutzen Open-Weight-Modelle wie Llama, Mistral oder Qwen.

Warum ein Self-Hosted LLM statt einer Cloud-KI-API?

Regulierte Organisationen können Prompts und Dokumente mit personenbezogenen, finanziellen oder klassifizierten Daten oft nicht an eine externe API senden, deren Datenverarbeitung sie nicht auditieren können. Ein Self-Hosted LLM hält die Daten in der Grenze, entfernt Pro-Token-Anbieterpreise bei hochvolumigen Workloads und lässt Sie die Modellversion fixieren, ohne dass sich das Verhalten unbemerkt ändert.

Wie funktioniert RAG auf einer Private-LLM-Plattform?

Retrieval-augmented Generation indexiert Ihre eigenen Dokumente in eine Vektordatenbank — Qdrant auf dieser Plattform — und ruft zur Anfragezeit die relevantesten Passagen ab, um die Antwort des Modells zu erden. Es läuft neben den GPU-Inferenz-Workloads innerhalb derselben Grenze, sodass sowohl die Quelldokumente als auch die generierten Antworten privat bleiben.

Kann ich Modelle auf meinen eigenen Daten fine-tunen?

Ja. Weil GPUs und Daten in derselben Plattform liegen, können Sie Open-Weight-Modelle auf proprietären Daten fine-tunen oder anpassen, ohne dass diese Daten Ihre Infrastruktur verlassen. Die AI Platform liefert GPU-Scheduling, fraktionales Sharing und Blueprints für Inferenz- und Fine-Tuning-Workloads.

Wie unterscheidet sich ein Private LLM von Sovereign AI?

Sie sind verwandt, aber nicht dieselbe Suchintention. Private LLM benennt den konkreten Workload — ein Self-Hosted-Modell auf Ihren GPUs. Sovereign AI ist die umfassendere Strategie, KI-Compute, Daten und Governance innerhalb einer von Ihnen kontrollierten Jurisdiktion zu halten. Ein Private LLM ist meist eine Komponente eines Sovereign-AI-Programms; die Sovereign-AI-Seite zeigt das größere Bild.

Was umfasst ein Aenix Private-LLM-Engagement?

Es läuft als AI Platform Build: GPU-Architektur, ein Inferenz-Stack, eine Qdrant-Vektordatenbank für RAG, Multi-Tenant-Isolation und Single Sign-on, bereitgestellt auf Ihrer eigenen Hardware. In einem realen Engagement paketierte dieselbe Plattform NVIDIA-Dynamo-Inferenz und einen Qdrant-RAG-Stack und wurde in die Grenze eines staatlichen Kunden ausgeliefert.

Bereit für ein Gespräch?

Buchen Sie einen 30-minütigen Discovery-Call — unverbindlich. Wir klären den Fit, die passende Plattform und die nächsten Schritte.