Das Wichtigste

Lokal heißt: Der Text verlässt den Rechner nicht. Lokal heißt nicht, dass die Antwort stimmt. Prüfen Sie die Ergebnisse genauso streng wie bei einem Onlinedienst.

Wann ein lokales Modell die bessere Wahl ist

In einer Kanzlei liegt ein 40-seitiger Schriftsatz. In einer Praxis stapeln sich Befunde, in der Personalabteilung Kündigungsschreiben. Für all das wäre eine Zusammenfassung praktisch, aber die Unterlagen sollen den Betrieb nicht verlassen. Genau hier beginnt die Frage, wie man KI ohne Cloud nutzen kann.

Die Antwort lautet: Das Modell läuft auf Ihrem eigenen Rechner. Es lädt einmal herunter, danach bleibt jede Anfrage im Haus. Wir beschreiben den Ablauf mit Ollama, weil der Hersteller Installation, Schnittstelle und Grenzen öffentlich dokumentiert. Dies ist ein recherchierter Ablaufvorschlag anhand dieser Dokumentation. Thümmler AI hat dafür keinen eigenen Leistungs- oder Qualitätstest durchgeführt.

Eine Warnung vorweg, die den ganzen Beitrag trägt: Lokal betrieben heißt nicht automatisch datenschutzkonform und erst recht nicht inhaltlich richtig. Es heißt nur, dass Sie die Kontrolle über den Übertragungsweg behalten. Wo ein Onlinedienst doch die bessere Wahl ist, lassen sich wenigstens Namen und Kontodaten vor dem Prompt maskieren.

Was Sie brauchen, bevor Sie starten

Der wichtigste Punkt ist der Arbeitsspeicher. Im Schnellstart empfiehlt der Hersteller für das kleine Modell gemma4:e2b 8 GB verfügbaren VRAM oder Unified Memory auf einem Mac; das Modell selbst ist rund 7,2 GB groß. Die Modellbibliothek zeigt, wie schnell das wächst: E4B mit 9,6 GB, 12B mit 7,6 GB, 31B mit 20 GB. Der Download ist nicht der Speicherbedarf beim Rechnen, aber er ist eine brauchbare Untergrenze für die Planung. Schnellstart, Modellvarianten.

  • Rechner: Ein Arbeitsplatz mit ausreichend Speicher, der nicht nebenbei die Buchhaltung rechnet. Ein aufgerüsteter Bürorechner reicht für kleine Modelle.
  • Grafikkarte: Unterstützt werden Nvidia ab Compute Capability 5.0 mit Treiber 550, AMD Radeon über ROCm unter Linux und Windows, Apple über Metal sowie Vulkan. Ohne erkannte Karte rechnet die CPU. Ob die Antwortzeit dann für Ihren Ablauf reicht, hängt von Modell, Rechner und Aufgabe ab und gehört in den eigenen Test.
  • Speicherplatz: Je Modell mehrere Gigabyte. Die Ablage liegt unter ~/.ollama/models, unter Linux in /usr/share/ollama/.ollama/models und unter Windows im Benutzerordner.
  • Zuständigkeit: Jemand aus der IT oder dem externen IT-Dienst muss Installation, Updates und Zugriffe verantworten.
  • Testmaterial: Fünf bis zehn echte, aber freigegebene Dokumente, bei denen Sie die richtige Antwort bereits kennen.

Schritt 1: Installieren und das erste Modell starten

Der Hersteller bietet Downloads für macOS, Windows und Linux an. Nach der Installation startet „ollama run gemma4:e2b“ das Modell und öffnet einen Chat im Terminal; „/bye“ beendet ihn. Unter Linux wird der Dienst mit „ollama serve“ gestartet. Beim ersten Aufruf lädt das Modell herunter, das dauert je nach Leitung einige Minuten. Installation und erster Start.

Bleiben Sie zunächst beim kleinsten Modell, das auf die Maschine passt. Wer sofort mit einer 31B-Variante beginnt, misst vor allem die Grenzen der Hardware und nicht die Brauchbarkeit für den eigenen Ablauf. Wenn die kleine Variante die Aufgabe im Kern löst, können Sie später gezielt vergrößern.

Schritt 2: Den lokalen Dienst sicher einbinden

Ollama bindet sich laut Dokumentation standardmäßig an 127.0.0.1 auf Port 11434, ist also nur auf dem eigenen Rechner erreichbar. Über die Umgebungsvariable OLLAMA_HOST lässt sich das ändern. Tun Sie das nicht nebenbei: Für lokale Anfragen wird laut Hersteller kein Schlüssel benötigt. Wer den Dienst im Netz freigibt, gibt ihn damit im Zweifel für jeden im Netz frei. Bindung und Speicherorte, Schnittstelle und Schlüssel.

Für eigene Anwendungen steht die Adresse http://localhost:11434/api mit dem Endpunkt /api/chat bereit, zusätzlich ein OpenAI-kompatibler Zugang unter /v1. Das ist praktisch, wenn Sie ein vorhandenes Programm umstellen wollen, ohne alles neu zu schreiben.

Zwei Einstellungen sollten Sie kennen. Der Kontext ist standardmäßig 4096 Token groß und lässt sich über OLLAMA_CONTEXT_LENGTH oder num_ctx erhöhen; ein langer Schriftsatz passt sonst schlicht nicht hinein, und es wird stillschweigend abgeschnitten. Und Modelle bleiben nach der letzten Anfrage fünf Minuten im Speicher, steuerbar über keep_alive. Das erklärt, warum die erste Anfrage nach einer Pause spürbar länger dauert.

Schritt 3: Antworten in eine feste Form bringen

Freier Fließtext ist schwer zu prüfen. Über den Parameter „format“ lässt sich ein JSON-Schema vorgeben, sodass jede Antwort gleich aufgebaut ist. Für eine Aktenzusammenfassung können das etwa die Felder Sachverhalt, Fristen, offene Punkte und Fundstelle sein. Der Hersteller empfiehlt dazu, die Temperatur auf 0 zu setzen. Bemerkenswert für diesen Beitrag: Die Cloud-Variante unterstützt feste Antwortformen derzeit nicht, die lokale schon. Feste Antwortform über ein Schema.

Ein festes Feld „Fundstelle“ macht das Nachprüfen zur Routine, ersetzt es aber nicht. Das Schema erzwingt nur, dass das Feld gefüllt ist; ob die genannte Seite oder der Abschnitt wirklich existiert und die Aussage trägt, prüft es nicht. Ein Modell kann eine überzeugend aussehende Fundstelle erfinden. Behandeln Sie das Feld deshalb als Suchhilfe, nicht als Beleg: Wer freigibt, schlägt die genannte Stelle im Originaldokument nach. Bei Akten, Befunden und Personalunterlagen gilt das ausnahmslos.

Technisch hilft es, die Seiten- oder Abschnittsmarken beim Einlesen zu erhalten und dem Modell nur benannte Abschnitte zu übergeben. Dann lässt sich jede Fundstelle einem übergebenen Abschnitt zuordnen, und eine Angabe außerhalb dieser Liste ist sofort als erfunden erkennbar. Denselben Gedanken verfolgt unsere Anleitung zu Antworten mit geprüften Quellen in NotebookLM, dort allerdings mit einem Onlinedienst.

Vorsicht: Cloud-Modelle im selben Programm

Dieselbe Anwendung kann auch Modelle ansprechen, die nicht auf Ihrem Rechner laufen. Sie tragen den Zusatz cloud im Namen, etwa gemma4:cloud, brauchen keinen Download und setzen eine Anmeldung voraus. Der Hersteller gibt an, Anfragen und Antworten würden zur Beantwortung verarbeitet, aber nicht zum Modelltraining verwendet; wer keine Übertragung möchte, könne ausschließlich lokale Modelle nutzen. Das ist eine Herstellerangabe, die wir wiedergeben und nicht unabhängig geprüft haben. Angaben zu Cloud-Modellen.

Für einen Ablauf, der vertrauliche Unterlagen im Haus halten soll, ist das der gefährlichste Punkt der ganzen Anleitung. Legen Sie schriftlich fest, welche Modellnamen erlaubt sind, und prüfen Sie stichprobenartig, welches Modell tatsächlich geantwortet hat. Ein Name mit dem Zusatz cloud in einer Konfigurationsdatei ist kein Schreibfehler, sondern eine Datenübermittlung.

Wenn Texte dagegen ohnehin nach außen gehen dürfen, kann ein Onlinedienst die einfachere Wahl sein. Für Produkttexte zeigen wir das in der Anleitung Produkttexte mit KI übersetzen.

Fünf Fälle für den ersten Test

Diese Prüffälle sind Empfehlungen für die Abnahme. Sie wurden hier nicht auf einem produktiven Rechner ausgeführt. Nehmen Sie Unterlagen, deren richtige Antwort Sie selbst kennen.

  • Bekannter Fall: Eine Zusammenfassung eines Dokuments, das jemand im Haus genau kennt. Stimmen Namen, Daten und Beträge?
  • Langes Dokument: Ein Text, der die eingestellte Kontextlänge übersteigt. Wird das erkannt, oder verschwindet der Schluss unbemerkt?
  • Fehlende Angabe: Eine Frage, deren Antwort im Dokument nicht steht. Die richtige Reaktion ist „steht nicht drin“, nicht eine plausible Erfindung.
  • Netzstecker-Probe: Verbindung trennen und dieselbe Frage stellen. Antwortet das System weiter, kann diese Anfrage offline laufen. Mehr zeigt die Probe nicht: Sie ist ein Verfügbarkeitstest, kein Datenschutznachweis.
  • Wiederholung: Dieselbe Frage zweimal stellen. Weichen die Antworten stark ab, ist die Aufgabe für die feste Freigabe noch nicht reif.

Typische Fehler beim lokalen Betrieb

Die Fehler ähneln sich in fast jedem Betrieb, der damit anfängt.

  • Zu großes Modell: Der Rechner lagert aus, die Antwort dauert Minuten, und das Vorhaben stirbt an der Geduld der Beteiligten.
  • Dienst im Netz geöffnet: OLLAMA_HOST wird auf alle Adressen gesetzt, damit die Kollegin zugreifen kann. Ohne vorgelagerte Absicherung ist das eine offene Tür.
  • Kontext vergessen: Bei 4096 Token Standard wird ein langer Vertrag abgeschnitten, und niemand merkt es an der Antwort.
  • Keine Protokollierung: Ohne Vermerk, welches Modell in welcher Version geantwortet hat, lässt sich später kein Ergebnis nachvollziehen.
  • Vertrauliches ohne Regel: Wer ohne schriftliche Freigabe Personalakten oder Gesundheitsdaten hineingibt, hat die Aufgabe nur verlagert, nicht gelöst.

Kosten und Grenzen

Es gibt keine Rechnung pro Anfrage, aber kostenlos ist das nicht. Sie zahlen mit Hardware, mit Strom und vor allem mit Arbeitszeit: Installation, Modellauswahl, Tests, Updates und die laufende Prüfung der Antworten. Konkrete Euro-Beträge nennen wir hier nicht, weil sie von Ihrer Maschine, Ihren Strompreisen und Ihrer Nutzung abhängen und wir dafür keine Messung vorgenommen haben.

Inhaltlich gilt dieselbe Grenze wie bei jedem anderen Sprachmodell: Es kann Angaben erfinden, die richtig klingen. Wie gut ein bestimmtes lokales Modell Ihre Unterlagen trifft, ist damit offen: Wir haben es nicht gemessen und nennen deshalb auch keinen Vergleich mit Onlinediensten. Genau dafür sind die Testfälle oben da. Setzen Sie das Modell so lange nur dort ein, wo ein Mensch die Antwort ohnehin gegenliest, und nicht dort, wo eine Frist oder eine Diagnose daran hängt.

Rechtlich bleibt die Verantwortung bei Ihnen. Lokal betrieben heißt: keine Übermittlung an einen Dritten. Es heißt nicht, dass Verarbeitungsverzeichnis, Zugriffsrechte, Löschfristen und Mitbestimmung erledigt wären. Prüfen Sie außerdem die Lizenz des verwendeten Modells für gewerbliche Nutzung. Wie Sie so einen Ablauf abgesichert einführen, beschreibt unser Testplan für KI-Agenten; Unterstützung bei internen KI-Abläufen begleiten wir auf Wunsch.

Häufige Fragen

Was Betriebe vor dem ersten Versuch am häufigsten wissen wollen.

  • Wie prüfe ich, dass nichts nach außen geht? Eine einzelne Probe ohne Netz reicht dafür nicht; sie zeigt nur, dass diese Anfrage offline laufen kann. Prüfen Sie zusätzlich die Konfiguration auf Modellnamen mit dem Zusatz cloud und lassen Sie den ausgehenden Netzwerkverkehr des Rechners im Betrieb beobachten. Diese Kontrolle gehört in die Hände Ihrer IT und wird wiederholt, nicht einmal abgehakt.
  • Reicht ein normaler Bürorechner? Für die kleinen Modelle oft ja, wenn genug Speicher vorhanden ist. Der Hersteller empfiehlt für das kleinste Modell 8 GB verfügbaren VRAM oder Unified Memory; ohne erkannte Grafikkarte rechnet die CPU. Messen Sie die Antwortzeit auf Ihrer eigenen Maschine, statt sich auf allgemeine Angaben zu verlassen.
  • Kann ich mehrere Personen anschließen? Technisch ja, über die Schnittstelle. Dann brauchen Sie aber eine geplante Absicherung, weil lokale Anfragen laut Dokumentation keinen Schlüssel benötigen.
  • Was ist mit eigenen Dokumenten als Wissensbasis? Das ist ein zweiter Schritt mit eigener Technik und eigenen Prüfungen. Beginnen Sie mit einzelnen Dokumenten pro Anfrage, bevor Sie eine Suche darüberlegen.

Quellenstand und Einordnung

Geprüft am 19.09.2026. Alle technischen Angaben stammen aus geöffneten Originalseiten des Herstellers: Schnellstart, häufige Fragen, Cloud-Modelle, Schnittstelle, feste Antwortformen, Grafikkartenseite und Modellbibliothek. Der Beitrag beschreibt eine verfügbare Software und behauptet keinen heutigen Produktstart.

Aussagen zu Geschwindigkeit, Stromverbrauch und Antwortqualität fehlen bewusst: Dafür lag uns keine Primärquelle vor, und ein eigener Test hat nicht stattgefunden. Weitere Anleitungen zum Nachbauen sammeln wir unter KI-Anwendungen für Unternehmen.

Quellen & Stand

Quellen zuletzt geprüft: 19.09.2026. Herstellerangaben und unsere Einordnung werden im Text unterschieden.

  1. Ollama: Schnellstart
  2. Ollama: Häufige Fragen
  3. Ollama: Cloud-Modelle
  4. Ollama: Schnittstelle
  5. Ollama: Feste Antwortform
  6. Ollama: Grafikkarten
  7. Ollama: Modellbibliothek Gemma 4

Korrekturhinweise: [email protected].

Was heißt das für Ihren Betrieb?

Wir besprechen einen konkreten Ablauf und prüfen, ob KI dabei helfen kann.

Kostenloses Erstgespräch buchen →