Bereitstellungsmuster für private KI: lokal, in der VPC, selbst gehostet und hybrid
Fortgeschritten10 Min. LesezeitPrivate / lokale KI

Bereitstellungsmuster für private KI: lokal, in der VPC, selbst gehostet und hybrid

Private KI ist keine einzelne Architektur. Ein praktischer Vergleich lokaler Modelle, Enterprise-SaaS, VPC-Bereitstellungen, selbst gehosteter Inferenz und hybrider Muster für KMU, denen Datenschutz und Kontrolle wichtig sind.

Das sollten Sie danach können

Private KI umfasst mehrere Bereitstellungsentscheidungen und ist kein Slogan. Richten Sie die Architektur an den Daten aus: Öffentliche Aufgaben können SaaS nutzen, vertrauliche Aufgaben benötigen Kontrollen für Unternehmen und besonders geschützte Aufgaben möglicherweise lokale, VPC-basierte oder selbst gehostete Muster.

Nur in diesem Browser gespeichert.
In diesem Artikel

Der Begriff „private KI“ wird für alles Mögliche verwendet: von „wir haben das Training in unserem SaaS-Konto deaktiviert“ bis zu „wir betreiben Modelle mit offenen Gewichten in unserer eigenen Infrastruktur“. Diese Varianten bilden nicht dieselbe Kontrollgrenze.

Für KMU hängt die richtige Architektur für private KI von den Daten, der Aufgabe, den Qualitätsanforderungen und der Fähigkeit des Teams ab, die Infrastruktur zu betreiben. Die privateste Option ist nicht immer die beste. Die leistungsfähigste Option ist für die jeweiligen Daten nicht immer zulässig. Die günstigste Option kann teuer werden, wenn sie fortlaufend technische Betreuung erfordert.

Dieser Artikel bietet eine Entscheidungshilfe. Ziehen Sie außerdem den maßgeblichen DSGVO-Text, das NIST-Rahmenwerk zum KI-Risikomanagement, Anbieterverträge, die Dokumentation zu Datenkontrollen sowie die Sicherheitshinweise der gewählten Inferenzsoftware heran, etwa Sicherheit von vLLM.

Beginnen Sie mit der Datenklassifizierung, nicht mit der Modellpräferenz. Ein schwächeres Modell innerhalb der richtigen Datenschutzgrenze ist besser als ein Frontier-Modell, das Daten erhält, die es nicht verarbeiten darf.

Die fünf Bereitstellungsmuster

MusterBeschreibungGeeigneter AnwendungsfallHauptnachteil
Enterprise SaaSGeschäftstarif mit Admin-Funktionen, SSO, Aufbewahrungskontrollen und Ausschluss vom TrainingDie meisten üblichen UnternehmensaufgabenDaten verlassen dennoch Ihre Umgebung
VPC oder Private CloudVerwalteter Modellendpunkt innerhalb einer kontrollierten Cloud-GrenzeVertrauliche Aufgaben, die eine stärkere Isolation erfordernHöhere Kosten und Einrichtungsaufwand
Selbst gehostete InferenzSie betreiben offene Modelle auf Ihrer eigenen InfrastrukturBesonders geschützte Daten, individuelle Modelle, SkaleneffekteBetrieblicher Aufwand
Modelle auf lokalen GerätenModell läuft auf Laptop, Workstation oder Edge-GerätOffline-Aufgaben sowie sensible, eng begrenzte Aufgaben mit niedriger LatenzKleinere Modelle und Geräteeinschränkungen
Hybrides RoutingWeiterleitung jedes Anwendungsfalls zur passenden GrenzePortfolios mit gemischter SensitivitätErfordert Disziplin bei der Klassifizierung

Persönliche Konten für Privatnutzer bieten in der Regel nicht die zentral verwaltete Konfiguration des Unternehmens für Identitäten, Aufbewahrung, Konnektoren, Verträge und Audits. Die Unternehmensrichtlinie sollte festlegen, ob solche Konten überhaupt erlaubt sind und für welche Daten.

Eine Organisation kann ein einzelnes Muster oder ein kontrolliertes Portfolio benötigen. Ziel ist es, für jeden freigegebenen Anwendungsfall eine Grenze auszuwählen und regelmäßig neu zu validieren, statt eine Produktbezeichnung als dauerhafte Garantie zu behandeln.

Klassifizieren Sie die Daten zuerst

Die folgenden vier Kategorien bilden eine beispielhafte Ausgangstaxonomie. Stimmen Sie Bezeichnungen und Verarbeitungsregeln mit der tatsächlichen Informationsklassifizierung der Organisation und den rechtlichen Anforderungen ab:

DatenBeispieleStandardgrenze für KI
ÖffentlichWebsite-Texte, veröffentlichte Dokumente, öffentliche ForschungGenehmigtes Tool nach Prüfung von Rechten, Authentizität, Prompt-Injection und Nutzungsbedingungen
InternProzessnotizen, anonymisierte Beispiele, nicht-sensitive EntwürfeEnterprise SaaS
VertraulichKundendaten, Verträge, Quellcode, Finanzdaten, StrategieEnterprise SaaS mit Kontrollen, VPC oder selbst gehostet
Besonders geschütztGesundheitsdaten, dem Anwaltsgeheimnis unterliegende Unterlagen, HR-Ermittlungen, regulierte UnterlagenRechtliche und sicherheitsbezogene Prüfung; möglicherweise ist ein freigegebener lokaler, VPC-basierter, selbst gehosteter oder KI-freier Weg erforderlich

Diese Einstufung verhindert einen häufigen Fehler: denselben Assistenten für öffentliche Blogentwürfe und vertrauliche Kundendaten zu verwenden, nur weil dies bequem ist.

Zugangsdaten, private Schlüssel, Authentifizierungstoken und Wiederherstellungscodes sind keine Kategorie für das Modellrouting. Halten Sie sie aus Prompts, Retrieval-Korpora, Telemetrie und modellzugänglichen Tools heraus. Verwenden Sie einen Secrets-Manager und eine eng begrenzte Bereitstellung zur Laufzeit, wenn eine deterministische Integration Zugangsdaten benötigt.

Muster 1: Enterprise SaaS als Standard

Enterprise SaaS kann die Option mit der geringsten betrieblichen Komplexität sein. Produktnamen, Tarifleistungen und Vertragsbedingungen ändern sich. Prüfen Sie jeden Tarif in der engeren Auswahl auf folgende Punkte:

  • Vertragliche Regelungen zur Datennutzung und zum Modelltraining.
  • Administrative Kontrollen.
  • Single Sign-On (SSO) und Zugriffsverwaltung.
  • Aufbewahrungskontrollen.
  • Auditprotokolle.
  • Sicherheitsdokumentation.
  • Anbieterunterstützung.

Diese Kontrollen können freigegebene Arbeiten unterstützen. Der Kauf eines Tarifs belegt jedoch nicht, dass eine bestimmte Datenkategorie oder ein bestimmter Workflow rechtmäßig oder sicher ist.

Entscheidend ist die Konfiguration. Der Kauf eines Teamtarifs reicht nicht aus. Legen Sie Aufbewahrung, Freigaben, Konnektorzugriff, genehmigte Arbeitsbereiche und Datenregeln fest.

Muster 2: VPC oder Private Cloud

VPC- oder Private-Cloud-Muster kommen infrage, wenn Daten die Anwendung verlassen dürfen, aber innerhalb einer festgelegten Cloud- und Vertragsgrenze bleiben müssen. „Innerhalb einer VPC“ beweist nicht, dass jeder Pfad der Steuerungsebene, des Modelldienstes, der Protokollierung, des Supports oder der Backups dort verbleibt. Bilden Sie den vollständigen Datenfluss ab und testen Sie ihn.

  • KI-Assistent für den Kundensupport bei vertraulichen Tickets.
  • Interner Wissensassistent für sensible Dokumente.
  • Dokumentenerfassung für Verträge oder Rechnungen.
  • Domänenspezifischer Assistent, wenn Sie eine stärkere Datenisolierung als bei SaaS benötigen.

Zu prüfende potenzielle Vorteile:

  • Stärkere Isolation im gewählten Dienstkonzept.
  • Mehr Kontrolle über Netzwerk und Protokolle.
  • Nachweise, die definierte Beschaffungsanforderungen erfüllen können.
  • Eine andere operative Aufteilung im Vergleich zum vollständigen Selbsthosting.

Mögliche Einschränkungen, die Sie kalkulieren und testen sollten:

  • Die Kosten können einen gemeinsamen SaaS-Plan für die gemessene Arbeitslast überschreiten.
  • Zusätzliche Integrations- und Plattformarbeiten.
  • Die Modellwahl kann enger gefasst sein.
  • Sie sind weiterhin von der Infrastruktur des Anbieters abhängig.

Betrachten Sie dies als eine mögliche Zwischenlösung, nicht als Standard für jedes KMU.

Muster 3: Selbst gehostete Inferenz

Selbsthosting bedeutet, dass Sie die Laufzeitumgebung des Modells selbst betreiben: vLLM, TGI, SGLang, llama.cpp, Ollama oder einen anderen Inferenz-Stack. Dies ist sinnvoll, wenn:

  • Die Daten Ihre Umgebung nicht verlassen dürfen.
  • Sie benötigen ein eigenes oder feinabgestimmtes offenes Modell.
  • Das Inferenzvolumen ist hoch genug, um die Infrastruktur zu rechtfertigen.
  • Latenz- oder Verfügbarkeitsanforderungen erfordern direkte Kontrolle.
  • Sie verfügen über Personen, die das System betreiben können.

Hosten Sie nicht allein deshalb selbst, weil es sich konsequenter anfühlt. Der Betriebsaufwand ist real: GPU-Kapazität, Überwachung, Upgrades, Sicherheitspatches, Modellevaluation, Skalierung und Reaktion auf Vorfälle.

Selbsthosting ist eine starke Wahl für die passende Organisation. Für ein kleines Team ohne Erfahrung in der ML-Infrastruktur kann es zu einem fragilen Nebenprojekt werden.

Muster 4: Modelle auf lokalen Geräten

Lokale Modelle kommen für datenschutzsensible Einzelaufgaben infrage, wenn das gesamte Gerät einschließlich Updates, Telemetrie, Backups und Zugriffsgrenzen kontrolliert wird:

  • Lokale Notizen zusammenfassen.
  • Entwürfe aus privaten Dokumenten erstellen.
  • Interne Textausschnitte klassifizieren.
  • Offline-Feldarbeit.
  • Edge-Workflows, bei denen die Latenz wichtig ist.

Der Qualitätskompromiss hängt von Aufgabe und Modell ab. Bewerten Sie die lokale Option anhand repräsentativer Aufgaben zur Zusammenfassung, Klassifizierung, Extraktion oder Erstellung von Entwürfen, statt Gleichwertigkeit oder Unterlegenheit vorauszusetzen.

Verwenden Sie ein lokales Modell nur, wenn es die Evaluation für die Aufgabe besteht und die vollständige lokale Grenze freigegeben wurde. „Läuft auf dem Gerät“ allein beweist keinen Datenschutz.

Muster 5: Hybrides Routing

Eine hybride Lösung kann Aufgaben anhand freigegebener Datenklassen weiterleiten:

  • Öffentliche und risikoarme Aufgaben werden an Enterprise-SaaS-Lösungen übergeben.
  • Retrieval für vertrauliche Daten erfolgt innerhalb eines privaten RAG-Systems.
  • Die Extraktion besonders geschützter Daten nutzt ausschließlich einen eigens freigegebenen lokalen, VPC-basierten, selbst gehosteten oder KI-freien Weg, nachdem der vollständige Datenfluss geprüft wurde.
  • Die endgültige Ausarbeitung kann ein Frontier-Modell verwenden, nachdem vertrauliche Felder entfernt wurden.
  • Protokolle und Evaluierungen entscheiden darüber, ob jede Route funktioniert.

Hybrides Routing kann verschiedene Datensätze unterschiedlichen freigegebenen Grenzen zuordnen. Dafür sind durchsetzbare Richtlinien erforderlich, nicht nur eine Klassifizierung per Prompt:

  • Datenklassifizierung vor dem Routing.
  • Möglichst umfassende Maskierung sensibler Angaben.
  • Klare Allowlist für Modelle und Tools.
  • Protokolle, die dokumentieren, welche Grenze verwendet wurde.
  • Ausweichweg, wenn das private Modell die Aufgabe nicht bewältigt.

Entscheidungsrahmen

Stellen Sie sechs Fragen:

  1. Welche Daten gelangen in das Modell? Öffentlich, intern, vertraulich, besonders geschützt.
  2. Welche Auswirkungen hat die Ausgabe? Entwurf, Empfehlung, Entscheidung, Aktion gegenüber Kunden.
  3. Welche Qualität ist erforderlich? Definieren Sie aufgabenspezifische Ziele für Genauigkeit, Sicherheit, Latenz, Ablehnung und menschliche Überprüfung anstelle von Bezeichnungen wie „Experteniveau“.
  4. Welche Latenz ist erforderlich? Interaktiv, Batch-Verarbeitung, Echtzeit, Offline.
  5. Welche Betriebskapazitäten stehen zur Verfügung? Kein Infrastrukturteam, Anwendungsteam, Plattformteam oder MLOps.
  6. Welche Nachweise benötigen Kunden oder Aufsichtsbehörden? Anbieterdokumentation, Protokolle, Datenresidenz, Auditprotokoll, Isolation.

Wählen Sie dann das Muster mit der geringsten Komplexität, das die Daten- und Qualitätsanforderungen erfüllt.

Tun Sie dies noch nicht

Setzen Sie Selbsthosting erst ein, nachdem Sie Arbeitslast und Qualitätsanforderung gemessen haben.

Senden Sie keine besonders geschützten Daten an Tools für Privatnutzer.

Gehen Sie nicht davon aus, dass „Open Source“ automatisch Datenschutz bedeutet. Eine Lösung ist nur dann privat, wenn Bereitstellung, Protokolle, Zugriff und Datenfluss privat sind.

Führen Sie kein KI-Gateway ohne identitätsbezogene, technisch durchgesetzte Datenklassifizierung und standardmäßig gesperrte Routen ein. Ein zentrales Gateway kann Richtlinien nur dann wirksam durchsetzen, wenn Umgehungsmöglichkeiten, Ausweichwege, Protokolle und Fehlerverhalten getestet wurden.

Ignorieren Sie Evaluierungen nicht. Privat und trotzdem falsch ist immer noch falsch.

Ein praktischer Einstiegspunkt für KMU

Eine mögliche Startsequenz für KMU, vorbehaltlich der Prüfung:

  1. Genehmigen Sie einen einzigen Enterprise-SaaS-Assistenten für allgemeine Aufgaben.
  2. Erstellen Sie eine Regel zur Datenklassifizierung.
  3. Blockieren Sie besonders geschützte Daten, solange keine Prüfung erfolgt ist.
  4. Erstellen Sie einen privaten RAG- oder VPC-Workflow für den wertvollsten vertraulichen Anwendungsfall.
  5. Verwenden Sie lokale Modelle für enge, sensible Aufgaben, bei denen die Qualität akzeptabel ist.
  6. Prüfen Sie Selbsthosting nur dann erneut, wenn Datenschutz, Anpassungsmöglichkeiten oder Kosten dies eindeutig rechtfertigen.

So entsteht ein gestufter Entscheidungsweg. Datenschutz durch Technikgestaltung und datenschutzfreundliche Voreinstellungen erfordert weiterhin dokumentierte Entscheidungen zu Zweck, Minimierung, Zugriff, Aufbewahrungsdauer, Löschung, Auftragsverarbeitern, Übermittlungen und Sicherheit (Leitfaden der Europäischen Kommission).

Architektur, abgestimmt auf Daten, Risiko und Betrieb

Private KI ist eine Architektur, die auf Daten, Risiken und Betriebsabläufe abgestimmt ist. Ein Portfolio kann angemessen sein, doch jeder Weg benötigt einen expliziten Verantwortlichen und eine verifizierte Grenze.

Entscheiden Sie anhand von Daten, Auswirkungen, Qualität, Latenz, Betrieb und Nachweisen.

Weiterlesen

Fahren Sie mit demselben Lernpfad fort und lesen Sie die nächsten praktischen Artikel.