Private, lokale und selbst gehostete KI
Lokale Modelle, private Bereitstellungsmuster, selbst gehostete Inferenz und hybride Architekturen.
18 Beiträge (12 Artikel · 6 Videos)
Hier beginnen
Einige gute Beiträge für den Einstieg, bevor Sie die vollständige Übersicht durchsuchen.
10 Min. LesezeitLokale KI auf Ihrem Mac: Ollama, LM Studio und was 7B-Modelle wirklich können
Das lokale Ausführen von KI hat sich weiterentwickelt. Mit Ollama oder LM Studio und einem modernen Mac können Sie leistungsstarke Modelle offline, kostenlos und privat nutzen. Was funktioniert, was nicht und welche Anwendungsfälle wirklich davon profitieren.
Mittelstufe
10 Min. LesezeitBereitstellungsmuster für private KI: lokal, in der VPC, selbst gehostet und hybrid
Private KI ist keine einzelne Architektur. Ein praktischer Vergleich lokaler Modelle, Enterprise-SaaS, VPC-Bereitstellungen, selbst gehosteter Inferenz und hybrider Muster für KMU, denen Datenschutz und Kontrolle wichtig sind.
Fortgeschritten
11 Min. LesezeitSelf-Hosting oder gehostete Inferenz: ein überprüfbares Break-even-Modell
Ab welchem Umfang ist Self-Hosting günstiger als API-Aufrufe? Die tatsächliche Kostenrechnung, die betrieblichen Anforderungen und die Merkmale, anhand derer Teams zwischen Eigenbetrieb und verwalteter Inferenz entscheiden können.
FortgeschrittenWeitere in diesem Thema
8 Min. LesezeitZwei DGX Sparks verbinden: QSFP, SSH, RoCE und Cluster Assistant
Ein praktischer Leitfaden zum Verbinden zweier NVIDIA DGX Sparks mit QSFP und ConnectX-7: gleicher Benutzername, passwortloses SSH, RoCE für verteilte Workloads, NVIDIA Sync Cluster Assistant und Rollback.
Fortgeschritten
8 Min. LesezeitLokale Inferenz auf DGX Spark: Speicher, Stack und wann die Cloud weiterhin gewinnt
So ordnen Sie NVIDIAs Angaben zu 128 GB kohärentem Speicher und zur ~200B-Klasse auf einem Knoten ein, wählen Serving-Stacks aus und entwerfen die Hardwaretests, die über den Einsatz lokaler Inferenz entscheiden.
Fortgeschritten
9 Min. LesezeitDGX Spark: was es ist, für wen es gedacht ist und was sich für lokale Agenten geändert hat
Eine sachliche Einordnung von NVIDIA DGX Spark: die Grace-Blackwell-GB10-Spezifikationen von NVIDIA, kohärenter Unified Memory, ConnectX-7-Clustering und die Frage, wann ein Agentenrechner am Schreibtisch die richtige Wahl für private KI ist.
Fortgeschritten
7 Min. LesezeitHermes Agent: Was er ist, was er nicht ist und wann Sie ihn einsetzen sollten
Ein klarer Überblick über Hermes Agent von Nous Research: persistentes Gedächtnis, Skills, Tools und Messaging-Gateways sowie eine Entscheidungshilfe, wann ein Chatbot ausreicht und wann eine Agent-Runtime das richtige Werkzeug ist.
Mittelstufe
8 Min. LesezeitvLLM und andere OpenAI-kompatible Endpunkte aus n8n aufrufen
Rufen Sie einen lokalen OpenAI-kompatiblen /v1/chat/completions-Endpunkt über den HTTP Request-Node von n8n auf, mit expliziter Authentifizierung, gemessenen Zeitlimits, geprüfter Basis-URL und einer privaten Netzwerkgrenze.
Mittelstufe
10 Min. LesezeitNemoClaw auf DGX Spark: Deployment- und Sicherheitsplan
OpenClaw, Hermes oder Deep Agents Code in NVIDIA OpenShell auf DGX Spark planen und bewerten: aktuelles Onboarding, Policy-Schichten, geroutete Inferenz und die erforderlichen Abnahmenachweise.
Fortgeschritten
9 Min. LesezeitPersönliches OpenClaw-Gateway einrichten: Installation, Onboarding und Dashboard
Was OpenClaw ist, wie Sie das selbst gehostete Multikanal-Gateway installieren und einrichten, die Control UI auf Port 18789 öffnen und unterstützte Node-Versionen wählen, ohne die grundlegenden Sicherheitsmaßnahmen zu überspringen.
Mittelstufe
10 Min. LesezeitExperimenteller Stack aus zwei DGX Sparks, DeepSeek-V4-Flash, n8n und Hermes
So bewerten Sie einen experimentellen Community-Pfad für DeepSeek-V4-Flash auf zwei DGX-Spark-Systemen, mit n8n für die deterministische Automatisierung und Hermes für Urteilsaufgaben.
Fortgeschritten
37 MinutenUpdate von Broadcom zu Funktionen und Möglichkeiten der VMware Private AI Foundation
Tech Field Day. Das Video zeigt private KI als mehrschichtige Infrastruktur: kontrollierte Rechenressourcen, isolierte Umgebungen, Kubernetes, Inferenzcontainer, Modell-Governance, Self-Service-Bereitstellung, gemeinsame GPU-Nutzung und Monitoring. Das entspricht direkt der Warnung des Artikels, dass Datenschutz von Bereitstellungsgrenzen, Logs, Zugriffen und Betriebsprozessen abhängt und nicht vom Etikett „lokal“.
Fortgeschritten
13 Min. LesezeitFine-Tuning 2026: ein evidenzgeleitetes LoRA- und QLoRA-Experiment
Prüfen Sie, ob parametereffizientes Fine-Tuning gerechtfertigt ist, verwalten Sie die Daten, legen Sie ein reproduzierbares Experiment fest, vergleichen Sie Ergebnisse mit zurückgehaltenen Daten und Sicherheitstests und benchmarken Sie den Serving-Betrieb vor dem Deployment.
Fortgeschritten
LLM-Modelle feinabstimmen – Kurs zu generativer KI
freeCodeCamp.org. Ein ausführlicher Kurs, der von der Theorie zum Code führt und Quantisierung, LoRA, QLoRA sowie vollständiges PEFT mit Llama 2 und Gemma auf Hardware behandelt, die vielen Entwicklern zur Verfügung steht. Auf YouTube kommt er der Erfahrung, einer fachkundigen Person bei der Arbeit über die Schulter zu schauen, am nächsten. Mit konkreten VRAM-Budgets untermauert er die Aussage des Artikels, dass kein Cluster erforderlich ist.
Fortgeschritten
Ein LLM entwickeln: Aufbau, Training und Fine-Tuning
Sebastian Raschka. Sebastian Raschka ordnet Fine-Tuning in die umfassendere LLM-Trainingspipeline ein: Instruction Tuning, Klassifikations-Fine-Tuning, parameter-effiziente Methoden und die Zielkonflikte, die der Artikel vor seiner LoRA-Empfehlung hervorhebt. Das bietet eine gute Einordnung vor dem Start, insbesondere wenn Ihr Team noch diskutiert, ob Fine-Tuning überhaupt der richtige Schritt ist.
Fortgeschritten
14 MinutenOllama in 15 Minuten lernen – LLMs lokal und KOSTENLOS ausführen
Tech With Tim. Eine kompakte Ollama-Anleitung ohne Umwege — installieren, ein Modell abrufen, chatten, anschließend die lokale HTTP-API mit Python testen und mithilfe eines Modelfile ein benutzerdefiniertes Modell erstellen. Sie deckt genau den Workflow ab, den der Artikel für die tägliche Nutzung auf einem Mac beschreibt, einschließlich des Verhältnisses zwischen Modellgröße und Arbeitsspeicher des Geräts.
Mittelstufe
6 MinutenLM Studio Tutorial: Führen Sie große Sprachmodelle (LLM) auf Ihrem Laptop aus
Kevin Stratvert. Derselbe Workflow wie mit Ollama, aber über eine grafische Oberfläche: LM Studio installieren, ein Llama- oder Gemma-Modell laden, chatten, eine PDF hinzufügen und Fragen dazu stellen. Das eignet sich für Leser, die nicht im Terminal arbeiten möchten, und vermittelt einen Eindruck davon, wie ein Modell mit 1B–3B Parametern im Vergleich zu einem größeren Modell tatsächlich abschneidet.
Mittelstufe
32 MinutenSchnelle LLM-Bereitstellung mit vLLM und PagedAttention
Anyscale. Der Vortrag erklärt, weshalb naives LLM-Serving 60–80% des GPU-Speichers verschwendet, wie PagedAttention dieses Problem mit einem an Betriebssysteme angelehnten Paging-Verfahren löst und warum Continuous Batching den 24× höheren Durchsatz ermöglicht, den der Artikel in seiner Berechnung verwendet. Danach wirkt die Aussage des Artikels, dass bereits 50% Auslastung ein guter Wert wären, nicht mehr abstrakt.
Fortgeschritten