Thema

Private, lokale und selbst gehostete KI

Lokale Modelle, private Bereitstellungsmuster, selbst gehostete Inferenz und hybride Architekturen.

18 Beiträge (12 Artikel · 6 Videos)

Hier beginnen

Einige gute Beiträge für den Einstieg, bevor Sie die vollständige Übersicht durchsuchen.

Weitere in diesem Thema

8 Min. Lesezeit
Artikel

Zwei DGX Sparks verbinden: QSFP, SSH, RoCE und Cluster Assistant

Ein praktischer Leitfaden zum Verbinden zweier NVIDIA DGX Sparks mit QSFP und ConnectX-7: gleicher Benutzername, passwortloses SSH, RoCE für verteilte Workloads, NVIDIA Sync Cluster Assistant und Rollback.

Fortgeschritten
8 Min. Lesezeit
Artikel

Lokale Inferenz auf DGX Spark: Speicher, Stack und wann die Cloud weiterhin gewinnt

So ordnen Sie NVIDIAs Angaben zu 128 GB kohärentem Speicher und zur ~200B-Klasse auf einem Knoten ein, wählen Serving-Stacks aus und entwerfen die Hardwaretests, die über den Einsatz lokaler Inferenz entscheiden.

Fortgeschritten
9 Min. Lesezeit
Artikel

DGX Spark: was es ist, für wen es gedacht ist und was sich für lokale Agenten geändert hat

Eine sachliche Einordnung von NVIDIA DGX Spark: die Grace-Blackwell-GB10-Spezifikationen von NVIDIA, kohärenter Unified Memory, ConnectX-7-Clustering und die Frage, wann ein Agentenrechner am Schreibtisch die richtige Wahl für private KI ist.

Fortgeschritten
7 Min. Lesezeit
Artikel

Hermes Agent: Was er ist, was er nicht ist und wann Sie ihn einsetzen sollten

Ein klarer Überblick über Hermes Agent von Nous Research: persistentes Gedächtnis, Skills, Tools und Messaging-Gateways sowie eine Entscheidungshilfe, wann ein Chatbot ausreicht und wann eine Agent-Runtime das richtige Werkzeug ist.

Mittelstufe
8 Min. Lesezeit
Artikel

vLLM und andere OpenAI-kompatible Endpunkte aus n8n aufrufen

Rufen Sie einen lokalen OpenAI-kompatiblen /v1/chat/completions-Endpunkt über den HTTP Request-Node von n8n auf, mit expliziter Authentifizierung, gemessenen Zeitlimits, geprüfter Basis-URL und einer privaten Netzwerkgrenze.

Mittelstufe
10 Min. Lesezeit
Artikel

NemoClaw auf DGX Spark: Deployment- und Sicherheitsplan

OpenClaw, Hermes oder Deep Agents Code in NVIDIA OpenShell auf DGX Spark planen und bewerten: aktuelles Onboarding, Policy-Schichten, geroutete Inferenz und die erforderlichen Abnahmenachweise.

Fortgeschritten
9 Min. Lesezeit
Artikel

Persönliches OpenClaw-Gateway einrichten: Installation, Onboarding und Dashboard

Was OpenClaw ist, wie Sie das selbst gehostete Multikanal-Gateway installieren und einrichten, die Control UI auf Port 18789 öffnen und unterstützte Node-Versionen wählen, ohne die grundlegenden Sicherheitsmaßnahmen zu überspringen.

Mittelstufe
10 Min. Lesezeit
Artikel

Experimenteller Stack aus zwei DGX Sparks, DeepSeek-V4-Flash, n8n und Hermes

So bewerten Sie einen experimentellen Community-Pfad für DeepSeek-V4-Flash auf zwei DGX-Spark-Systemen, mit n8n für die deterministische Automatisierung und Hermes für Urteilsaufgaben.

Fortgeschritten
37 Minuten
Video

Update von Broadcom zu Funktionen und Möglichkeiten der VMware Private AI Foundation

Tech Field Day. Das Video zeigt private KI als mehrschichtige Infrastruktur: kontrollierte Rechenressourcen, isolierte Umgebungen, Kubernetes, Inferenzcontainer, Modell-Governance, Self-Service-Bereitstellung, gemeinsame GPU-Nutzung und Monitoring. Das entspricht direkt der Warnung des Artikels, dass Datenschutz von Bereitstellungsgrenzen, Logs, Zugriffen und Betriebsprozessen abhängt und nicht vom Etikett „lokal“.

Fortgeschritten
13 Min. Lesezeit
Artikel

Fine-Tuning 2026: ein evidenzgeleitetes LoRA- und QLoRA-Experiment

Prüfen Sie, ob parametereffizientes Fine-Tuning gerechtfertigt ist, verwalten Sie die Daten, legen Sie ein reproduzierbares Experiment fest, vergleichen Sie Ergebnisse mit zurückgehaltenen Daten und Sicherheitstests und benchmarken Sie den Serving-Betrieb vor dem Deployment.

Fortgeschritten
Video

LLM-Modelle feinabstimmen – Kurs zu generativer KI

freeCodeCamp.org. Ein ausführlicher Kurs, der von der Theorie zum Code führt und Quantisierung, LoRA, QLoRA sowie vollständiges PEFT mit Llama 2 und Gemma auf Hardware behandelt, die vielen Entwicklern zur Verfügung steht. Auf YouTube kommt er der Erfahrung, einer fachkundigen Person bei der Arbeit über die Schulter zu schauen, am nächsten. Mit konkreten VRAM-Budgets untermauert er die Aussage des Artikels, dass kein Cluster erforderlich ist.

Fortgeschritten
Video

Ein LLM entwickeln: Aufbau, Training und Fine-Tuning

Sebastian Raschka. Sebastian Raschka ordnet Fine-Tuning in die umfassendere LLM-Trainingspipeline ein: Instruction Tuning, Klassifikations-Fine-Tuning, parameter-effiziente Methoden und die Zielkonflikte, die der Artikel vor seiner LoRA-Empfehlung hervorhebt. Das bietet eine gute Einordnung vor dem Start, insbesondere wenn Ihr Team noch diskutiert, ob Fine-Tuning überhaupt der richtige Schritt ist.

Fortgeschritten
14 Minuten
Video

Ollama in 15 Minuten lernen – LLMs lokal und KOSTENLOS ausführen

Tech With Tim. Eine kompakte Ollama-Anleitung ohne Umwege — installieren, ein Modell abrufen, chatten, anschließend die lokale HTTP-API mit Python testen und mithilfe eines Modelfile ein benutzerdefiniertes Modell erstellen. Sie deckt genau den Workflow ab, den der Artikel für die tägliche Nutzung auf einem Mac beschreibt, einschließlich des Verhältnisses zwischen Modellgröße und Arbeitsspeicher des Geräts.

Mittelstufe
6 Minuten
Video

LM Studio Tutorial: Führen Sie große Sprachmodelle (LLM) auf Ihrem Laptop aus

Kevin Stratvert. Derselbe Workflow wie mit Ollama, aber über eine grafische Oberfläche: LM Studio installieren, ein Llama- oder Gemma-Modell laden, chatten, eine PDF hinzufügen und Fragen dazu stellen. Das eignet sich für Leser, die nicht im Terminal arbeiten möchten, und vermittelt einen Eindruck davon, wie ein Modell mit 1B–3B Parametern im Vergleich zu einem größeren Modell tatsächlich abschneidet.

Mittelstufe
32 Minuten
Video

Schnelle LLM-Bereitstellung mit vLLM und PagedAttention

Anyscale. Der Vortrag erklärt, weshalb naives LLM-Serving 60–80% des GPU-Speichers verschwendet, wie PagedAttention dieses Problem mit einem an Betriebssysteme angelehnten Paging-Verfahren löst und warum Continuous Batching den 24× höheren Durchsatz ermöglicht, den der Artikel in seiner Berechnung verwendet. Danach wirkt die Aussage des Artikels, dass bereits 50% Auslastung ein guter Wert wären, nicht mehr abstrakt.

Fortgeschritten