KI ohne Cloud: So findest du das richtige Modell für deinen Rechner
Wer KI-Modelle lokal betreibt, schickt keine Daten an externe Server. Doch welches Modell auf welcher Hardware läuft, ist nicht immer offensichtlich.

Lokale KI bedeutet: Das Modell läuft auf dem eigenen Rechner, kein Anbieter sieht die Anfragen, kein Abo ist nötig. Für kleine Unternehmen, die mit sensiblen Kundendaten arbeiten, ist das kein Luxus, sondern ein handfestes Datenschutzargument. Der Haken: Nicht jedes Modell läuft auf jeder Hardware. Wer das falsch einschätzt, verschwendet Zeit.
Was lokale KI konkret bedeutet
Bei Cloud-Diensten wie ChatGPT verlässt jede Anfrage den eigenen Computer. Sie landet auf Servern eines US-Anbieters, wird dort verarbeitet, und die Antwort kommt zurück. Bei lokalen Modellen passiert das nicht. Man lädt ein offenes Modell einmal herunter. Danach läuft es ohne Internetverbindung, direkt auf der eigenen Hardware.
Das hat praktische Folgen. Vertragsentwürfe, Kundendaten, interne Kalkulationen: All das bleibt auf dem Gerät. Für Branchen mit Geheimhaltungspflichten, etwa Steuerberatung, Rechtsdienstleistungen oder Medizin, kann das ein relevantes Argument sein.
Gängige Werkzeuge für den Einstieg sind Ollama, LM Studio und GPT4All. Sie sind Oberflächen, über die offene Modelle geladen und angesteuert werden. Die Modelle selbst kommen meist von Plattformen, auf denen Entwickler sie frei veröffentlichen.
Das zentrale Problem: Hardware-Passung
Der größte Stolperstein ist die Frage, welches Modell auf welchem Rechner überhaupt läuft. Das hängt vor allem vom verfügbaren Arbeitsspeicher und vom Grafikspeicher, dem sogenannten VRAM, ab.
Größere Modelle brauchen mehr Ressourcen. Ein Modell mit sieben Milliarden Parametern benötigt je nach Komprimierungsstufe, der sogenannten Quantisierung, zwischen vier und acht Gigabyte Speicher. Modelle mit 70 Milliarden Parametern sind auf normalen Notebooks kaum sinnvoll nutzbar.
Quantisierung: Was steckt dahinter?
Quantisierung bezeichnet eine Methode, Modelle zu verkleinern, ohne sie komplett neu zu trainieren. Dabei werden die internen Zahlenwerte des Modells vereinfacht. Das spart Speicher, kostet aber etwas Genauigkeit. Ein Modell in der Stufe Q4 ist kleiner und schneller als dasselbe Modell in Q8, liefert aber leicht schlechtere Ergebnisse. Für die meisten Alltagsaufgaben in kleinen Betrieben ist der Unterschied kaum spürbar.
llmfit: Raten entfällt
Ein Open-Source-Tool namens llmfit löst das Problem der Hardware-Einschätzung direkt. Es liest die technischen Daten des Rechners aus, prüft Tausende verfügbare Modelle und schätzt, welche davon laufen, wie schnell sie reagieren und wie viel VRAM sie brauchen. Statt selbst zu recherchieren, bekommt man eine konkrete Liste passender Modelle für die eigene Hardware.
Das ist besonders nützlich ohne technische Vorbildung. Die Frage, ob ein bestimmtes Modell in der Quantisierungsstufe Q5_K_M auf einer Grafikkarte mit acht Gigabyte VRAM noch flüssig läuft, ist ohne Erfahrung kaum zu beantworten. llmfit beantwortet sie automatisch.
Welche Software eignet sich für den Einstieg?
Für kleine Unternehmen ohne eigene IT-Abteilung kommen vor allem zwei Werkzeuge in Frage. LM Studio hat eine grafische Oberfläche, mit der sich Modelle herunterladen und testen lassen, ohne eine einzige Zeile Code zu schreiben. Ollama läuft über die Kommandozeile, ist schlanker und lässt sich gut in eigene Abläufe einbinden.
GPT4All richtet sich an Einsteiger, die möglichst wenig einrichten wollen. Es bringt eigene Modelle mit und läuft nach der Installation sofort. AnythingLLM geht einen Schritt weiter: Es erlaubt, eigene Dokumente hochzuladen und das Modell darüber zu befragen. Nützlich etwa, wenn AGB, Verträge oder Handbücher als Wissensbasis dienen sollen.
Was lässt sich damit in der Praxis erledigen?
Lokale Modelle eignen sich für Textarbeit, das Zusammenfassen von Dokumenten, das Formulieren von E-Mails und einfache Code-Aufgaben. Wer die Modelle mit agentenbasierter Software verbindet, kann ihnen auch Aufgaben auf dem Computer übertragen, etwa das Sortieren von Dateien oder das Auswerten von Tabellen.
Bildgenerierung ist ebenfalls möglich, braucht aber deutlich mehr Ressourcen. Für einen Soloselbstständigen mit einem aktuellen Notebook mit 16 Gigabyte RAM ist ein Sprachmodell mit sieben Milliarden Parametern ein realistischer Startpunkt.
Fazit
Lokale KI ist für kleine Unternehmen, die Datenschutz ernst nehmen, eine konkrete Alternative zu Cloud-Diensten. Der Einstieg ist mit den richtigen Werkzeugen auch ohne IT-Kenntnisse machbar. Tools wie llmfit nehmen dabei eine wesentliche Hürde weg: herauszufinden, welches Modell auf der eigenen Hardware funktioniert. Wer sensible Daten verarbeitet, sollte sich das zumindest einmal ansehen.


