Selbst gehostete KI

    5 selbst gehostete KI-Workflow-Setups mit n8n und Ollama für Datenschutz in 2026

    Cloud-KI ist schnell und einfach – bedeutet aber, dass Ihre Daten Ihre Infrastruktur verlassen. Diese 5 selbst gehosteten Workflow-Setups kombinieren n8n und Ollama, um KI-Automatisierung vollständig auf Ihren eigenen Servern auszuführen und Ihnen vollständige Datensouveränität zu geben, ohne auf Workflow-Fähigkeiten zu verzichten.

    9 Min. Lesezeit
    5 selbst gehostete KI-Workflow-Setups mit n8n und Ollama für Datenschutz in 2026

    Datenschutz ist nicht nur ein Compliance-Kontrollkästchen für jedes Unternehmen – es ist eine echte betriebliche Anforderung. Anwaltskanzleien, die Kundenkommunikation verarbeiten. Gesundheitsunternehmen, die Patientendaten handhaben. Finanzdienstleistungsunternehmen mit regulatorischen Verpflichtungen. Jedes Unternehmen, dessen Kunden vertraglich verbieten, dass Daten ihre Umgebung verlassen.

    Für diese Teams ist das Standard-KI-Automatisierungs-Playbook – Claude oder GPT-4 in Ihren Workflow einstecken und Ihre Daten in die Cloud senden – keine Option. Die Alternative ist ein selbst gehosteter Stack: n8n läuft auf Ihrer Infrastruktur, verbunden mit Ollama, das lokale KI-Modelle bedient, ohne dass Daten Ihr Netzwerk verlassen.

    Dieser Beitrag beschreibt fünf Workflow-Setups mit diesem Stack und erklärt, was Sie gewinnen und was Sie aufgeben im Vergleich zu Cloud-KI-Alternativen.

    Der selbst gehostete Stack: Was Sie vor dem Start benötigen

    Vor den Workflows, die Komponenten:

    n8n (selbst gehostet): Die Workflow-Automatisierungsschicht. Entweder auf Ihrem eigenen Server via Docker bereitgestellt oder in n8n Cloud mit Ihrer Ollama-Instanz, die über eine sichere URL zugänglich ist. n8n's Ollama-Knoten macht die Verbindung unkompliziert.

    Ollama: Läuft lokal auf Ihrem Server. Modelle herunterladen mit ollama pull mistral oder ollama pull llama3.3. Stellt eine lokale API auf Port 11434 bereit. Kompatibel mit dem OpenAI-API-Format, sodass die meisten n8n-KI-Knoten darauf abzielen können.

    Empfohlene Mindesthardware für den Business-Einsatz: 16-32 GB RAM, moderner CPU (M-Serie Mac oder aktuelles AMD/Intel), optionaler GPU mit 8-16 GB VRAM für schnellere Inferenz. Ein Mac Studio M2 Max (96 GB Unified Memory) handhabt 70B-Modelle komfortabel. Eine NVIDIA RTX 4090 handhabt 13-14B-Modelle schnell.

    Modellempfehlung für die meisten Workflows: Beginnen Sie mit mistral:7b-instruct oder llama3.3:8b. Diese laufen auf bescheidener Hardware und handhaben die meisten Textklassifikations-, Zusammenfassungs- und strukturierten Extraktionsaufgaben angemessen.

    Die 5 Workflow-Setups

    1. Vertrauliche Dokumentklassifikation und -weiterleitung

    Anwendungsfall: Anwaltskanzleien, Gesundheitsunternehmen oder jede Organisation, die sensible Dokumente erhält, die nach Typ klassifiziert und an das richtige interne Team weitergeleitet werden müssen – ohne dass Dokumentinhalt externe Server berührt.

    Der Workflow:

    1. Auslöser: Ein Dokument landet in einem überwachten Ordner auf Ihrem Netzwerkspeicher (Nextcloud, SharePoint on-prem oder ein einfaches überwachtes Verzeichnis)
    2. n8n liest den Dokumenttext (mit dem Read Binary Files-Knoten für PDFs oder Dokumentkonvertierung)
    3. Ein Prompt wird an Ollama (Mistral 7B) gesendet: „Klassifizieren Sie dieses Dokument als eines der folgenden: [Vertrag, Rechnung, Krankenakte, Rechtseinreichung, Compliance-Dokument, Sonstiges]. Geben Sie nur das Kategorie-Label und einen 1-Satz-Grund zurück."
    4. Basierend auf der Klassifikation leitet n8n die Datei weiter: verschiebt sie in den entsprechenden Ordner, erstellt eine Aufgabe in Ihrem Projektmanagementsystem für das verantwortliche Team und sendet eine interne Benachrichtigung
    5. Ein Klassifikationsprotokoll-Eintrag wird in eine interne Datenbank für den Prüfpfad geschrieben

    Warum das selbst gehostet sein muss: Dokumentinhalt (Kundennamen, medizinische Informationen, Finanzbedingungen, Rechtsstrategie) darf aufgrund von Kundenvertraulichkeitsvereinbarungen oder regulatorischen Anforderungen keine Cloud-KI-APIs berühren.

    Hinweis zur Modellleistung: 7B-Modelle sind bei klaren Klassifikationen genau, aber weniger zuverlässig, wenn Dokumente mehrdeutig sind oder mehrere Kategorien umfassen. Bauen Sie eine „Konfidenz erforderlich"-Regel ein: Wenn das Modell Unsicherheit markiert oder eine Kategorie mit einem niedrigen Konfidenz-Signal ausgibt, leiten Sie zur menschlichen Überprüfung weiter statt zur automatischen Weiterleitung.


    2. Interne Wissensdatenbank-Q&A mit RAG

    Anwendungsfall: Ein Team muss interne Dokumente (Richtlinienhandbücher, SOPs, Kundenverträge, technische Dokumentation) mit natürlicher Sprache abfragen – ohne dass diese Dokumente an Cloud-KI-Dienste gesendet werden.

    Der Workflow (mit Retrieval-Augmented Generation):

    1. Indexierungsphase (läuft einmal, dann inkrementell):

      • n8n liest alle Dokumente aus Ihrer internen Wissensdatenbank
      • Text wird in Chunks aufgeteilt und mit einem lokalen Embedding-Modell eingebettet (Ollama unterstützt Embedding-Modelle: nomic-embed-text oder mxbai-embed-large)
      • Embeddings werden in einer lokalen Vektordatenbank gespeichert (Qdrant selbst gehostet oder pgvector auf Ihrem PostgreSQL)
    2. Abfragephase (durch Benutzeranfrage ausgelöst):

      • Benutzer übermittelt eine Frage über ein einfaches Webformular oder eine Slack-Nachricht an einen privaten Slack-Kanal
      • n8n bettet die Frage mit demselben lokalen Embedding-Modell ein
      • Die Vektordatenbank gibt die Top-5 semantisch ähnlichsten Dokument-Chunks zurück
      • Die abgerufenen Chunks plus die Frage des Benutzers werden an Ollama gesendet (Llama 3.3 8B oder Mistral 7B)
      • Das Modell generiert eine Antwort, die im abgerufenen Inhalt verankert ist, mit Quellzitaten
      • Antwort wird dem Benutzer in Slack oder per E-Mail zurückgegeben

    Warum das wichtig ist: Standard-Cloud-RAG-Lösungen (OpenAI Assistants, Azure OpenAI) senden Ihre Dokumente zur Einbettung und Speicherung an Infrastruktur von Drittanbietern. Dieses Setup hält alles auf Ihrer Hardware.

    Realistische Erwartung: Lokale Modelle handhaben sachliches Q&A über gut strukturierte Dokumente gut. Sie kämpfen mit Multi-Hop-Reasoning („Was ist unsere Richtlinie zu X angesichts unseres Vertrags mit Kunde Y?") und mehrdeutigen Fragen. Für komplexe Abfragen planen Sie menschliche Nachverfolgung für ungefähr 20-30% der Fälle ein.

    Mehr über RAG und Vektordatenbanken finden Sie unter Was ist eine Vektordatenbank? Pinecone, Weaviate erklärt.


    3. Lokale E-Mail-Entwurfserstellung und -Triage für vertrauliche Kommunikation

    Anwendungsfall: Professionelle Dienstleistungsunternehmen, bei denen E-Mail-Inhalt vertraulich ist – Anwaltskanzleien, Buchhalter, Finanzberater –, die KI-Entwurfsunterstützung möchten, ohne dass E-Mail-Inhalt ihre Umgebung verlässt.

    Der Workflow:

    1. Auslöser: Eine eingehende E-Mail wird in einem überwachten Posteingang über IMAP erkannt (n8n unterstützt IMAP-Trigger ohne Cloud-E-Mail-Scanning)
    2. Ollama liest die E-Mail und führt zwei Aufgaben aus:
      • Klassifiziert die E-Mail: dringend, standard, nur zur Information oder Spam
      • Generiert eine 2-Satz-Zusammenfassung des Kerninhalts und der Anfrage der E-Mail
    3. Beides wird in einem internen Dashboard protokolliert (Baserow oder NocoDB, selbst gehostet)
    4. Bei als „dringend" klassifizierten E-Mails wird eine Slack-Benachrichtigung mit der Zusammenfassung an das verantwortliche Teammitglied gesendet
    5. Separat ist ein Entwurfs-Antwort-Workflow verfügbar: Wenn ein Teammitglied eine Schaltfläche im Dashboard anklickt, wird ein Antwortentwurf von Ollama mit dem E-Mail-Inhalt als Kontext generiert, dann in ihrem E-Mail-Client zur Überprüfung und zum Senden aufgetaucht

    Datenschutzhinweis: Dieser Workflow erfordert, dass Ihre n8n-Instanz IMAP-Zugang zum E-Mail-Server hat. E-Mail-Inhalt wird von n8n (läuft auf Ihrer Infrastruktur) gelesen und an Ollama (läuft auf Ihrer Infrastruktur) gesendet. Kein E-Mail-Inhalt berührt externe Dienste.

    Einschränkung: Dieser Workflow erfordert, dass Ihre E-Mail über IMAP zugänglich ist, was die meisten Unternehmens-E-Mail-Systeme unterstützen. Google Workspace und Microsoft 365 erfordern OAuth-Setup für IMAP – was bedeutet, dass n8n Anmeldedaten für den Zugang zu Ihrer E-Mail benötigt. Stellen Sie sicher, dass Ihre internen Sicherheitsrichtlinien dieses Muster erlauben, bevor Sie es implementieren.


    4. Automatisierte Finanzdokument-Datenextraktion

    Anwendungsfall: Buchhaltungsunternehmen, Finanzteams oder Unternehmen, die Rechnungen, Quittungen oder Finanzberichte als PDFs erhalten und strukturierte Daten (Anbieter, Datum, Betrag, Positionen) extrahieren müssen, ohne Finanzdaten an Cloud-OCR- oder KI-Dienste zu senden.

    Der Workflow:

    1. Auslöser: Ein PDF landet in einem überwachten Ordner (Rechnungseingang, Ausgabenbelege-Ordner)
    2. n8n führt das PDF bei Bedarf durch einen lokalen OCR-Schritt (Tesseract über einen Docker-Sidecar oder ein selbst gehostetes Dokumentverarbeitungstool wie Docling)
    3. Der extrahierte Text wird mit einem strukturierten Extraktions-Prompt an Ollama gesendet: „Extrahieren Sie die folgenden Felder aus dieser Rechnung als JSON: Anbietername, Rechnungsnummer, Rechnungsdatum, Fälligkeitsdatum, Positionen (Beschreibung, Menge, Stückpreis, Gesamt), Zwischensumme, Steuerbetrag, Gesamtbetrag. Geben Sie nur gültiges JSON zurück."
    4. n8n validiert das zurückgegebene JSON auf Vollständigkeit und Datentypkorrektheit
    5. Gültige Extraktionen werden über API in Ihr Buchhaltungssystem oder Ihre Tabellenkalkulation geschrieben
    6. Ungültige oder niedrigkonfidente Extraktionen werden in eine menschliche Überprüfungswarteschlange markiert

    Warum lokale KI hier angemessen ist: Rechnungs- und Finanzdokumentdaten enthalten hochsensible Geschäftsinformationen. Das Senden dieser an Cloud-OCR/KI-Dienste (auch solche mit Datenschutzversprechen) ist ein Risiko, das viele Buchhaltungsunternehmen mit Kundendaten nicht akzeptieren können.

    Modellhinweis: Strukturierte JSON-Extraktion ist eine Aufgabe, bei der lokale 7-8B-Modelle gut abschneiden, wenn der Prompt sorgfältig strukturiert ist. Die Genauigkeit liegt typischerweise bei 85-93% bei sauberen, standardmäßigen Rechnungsformaten. Komplexe, nicht standardmäßige Rechnungen (insbesondere mehrseitige Dokumente mit ungewöhnlichen Layouts) profitieren vom größeren Qwen 2.5 14B-Modell.


    5. Vertragsüberprüfung und Identifikation roter Flaggen

    Anwendungsfall: Rechtsteams oder Unternehmen, die Standardverträge vor der Unterzeichnung überprüfen – NDAs, Anbietervereinbarungen, Arbeitsverträge –, die KI-Unterstützung beim Markieren ungewöhnlicher oder potenziell problematischer Klauseln wünschen, ohne Vertragstext an Cloud-Dienste zu senden.

    Der Workflow:

    1. Eingabe: Ein Vertrags-PDF wird in einen überwachten Ordner hochgeladen oder über ein einfaches internes Webformular eingereicht
    2. n8n extrahiert den Text und teilt ihn in Abschnitte auf
    3. Jeder Abschnitt wird von Ollama (mit einem größeren Modell – Llama 3.3 70B wenn Hardware erlaubt, oder Mistral 7B für schnellere aber weniger gründliche Analyse) gegen einen Überprüfungs-Prompt analysiert: „Sie überprüfen einen Rechtsvertrag für ein Unternehmen. Identifizieren Sie: ungewöhnliche Schadensersatzklauseln, zu breite IP-Abtretungssprache, nicht standardmäßige Kündigungsbestimmungen, automatische Verlängerungsklauseln, unangemessene Haftungsbeschränkungen oder jede Klausel, die für diesen Vertragstyp ungewöhnlich erscheint. Markieren Sie jedes Problem mit einer kurzen Erklärung des Anliegens."
    4. Markierte Probleme werden in einem Überprüfungsbericht zusammengestellt, formatiert als Google Doc oder PDF
    5. Der Bericht wird per E-Mail an das anfragende Teammitglied gesendet mit einem Hinweis, dass er eine Rechtsüberprüfung erfordert, bevor Maßnahmen ergriffen werden

    Kritischer Vorbehalt, der in jede Implementierung aufzunehmen ist: KI-Vertragsüberprüfung ist ein Vorscreening-Tool, keine Rechtsberatung. Jedes markierte Element muss von einem qualifizierten Anwalt überprüft werden, bevor eine Geschäftsentscheidung getroffen wird. Dieser Workflow identifiziert Kandidaten für Anwaltsaufmerksamkeit; er ersetzt nicht die Anwaltsüberprüfung.

    Warum das wichtig ist: Der Vorscreening-Wert ist real – eine KI-Überprüfung, die 3 Minuten dauert, kann die drei Klauseln in einem 40-seitigen Vertrag markieren, die am meisten Anwaltsaufmerksamkeit benötigen, und so die Anwaltsüberprüfungszeit reduzieren ohne sie zu ersetzen.


    Der Trade-off: Was Sie mit Self-Hosting aufgeben

    Ehrlich über das, was Sie verlieren, wenn Sie von Cloud-KI zu selbst gehostetem Ollama wechseln:

    DimensionCloud-KI (Claude, GPT-4)Selbst gehostetes Ollama
    Modell-FähigkeitFrontier-Qualität80-90% der Frontier-Qualität für Standardaufgaben
    Setup-ZeitMinuten (API-Schlüssel)Stunden bis Tage (Server-Setup, Modell-Downloads)
    WartungNullServer-Uptime, Modell-Updates, Hardware
    Kosten bei SkalierungPro-Token-PreisgestaltungFeste Hardware-Kosten, nahezu null Grenzkosten
    DatensouveränitätDaten verlassen Ihr NetzwerkDaten bleiben auf Ihrer Hardware
    VerfügbarkeitCloud-SLAHängt von Ihrem Server ab
    GleichzeitigkeitHoch (Cloud skaliert)Durch Hardware begrenzt

    Die richtige Wahl hängt von Ihren Datenschutzanforderungen und der technischen Kapazität Ihres Teams ab, die Infrastruktur zu betreiben.

    Für die meisten Unternehmen ohne strenge Datensouveränitätsanforderungen ist Cloud-KI der bessere Ausgangspunkt. Für Unternehmen mit echten Datenschutzbeschränkungen – Recht, Gesundheit, Finanzen – lohnt sich der selbst gehostete Stack trotz des Betriebsaufwands.

    Nicht sicher, ob selbst gehostete oder Cloud-KI der richtige Weg für Ihren Workflow ist? Buchen Sie einen Strategieanruf unter evalics.com/contact, um Ihre Datenschutzanforderungen zu bewerten und die richtige Automatisierungsarchitektur für Ihre Situation zu identifizieren.

    Bereit, Ihr Unternehmen zu automatisieren?

    Buchen Sie eine kostenlose Beratung und erfahren Sie, wie KI-Automatisierung Ihnen jede Woche Stunden sparen kann.

    Häufig gestellte Fragen