Erik Weber
Zurück zu Tools

Bibliothek · Tool

llama.cpp: KI-Modelle auf dem eigenen Rechner

Erik Weber · · 9 Min. Lesezeit

Die meisten KI-Werkzeuge schicken deine Fragen in ein fremdes Rechenzentrum. llama.cpp macht es umgekehrt: Das Rechenzentrum bist du.

Was brauchst du wofür?

Die wichtigste Frage zuerst: Was willst du mit lokaler KI machen?

Du möchtest …Passender EinstiegAufwand
lokale KI erst mal ausprobierenllama.appgering
im Browser mit einem lokalen Modell chattenWeb-Oberflächegering
lokale KI in n8n oder eigene Tools einbindenSchnittstellemittel
Tempo und Speicherbedarf feinjustierenParameter-Guidehoch

Allen Wegen liegt derselbe Motor zugrunde. Auch bekannte Programme wie Ollama und LM Studio nutzen llama.cpp unter der Haube und legen eine bequemere Bedienung darüber.

Wie funktioniert llama.cpp?

Du brauchst zwei Dinge: das Programm und ein Modell. Das Modell ist eine einzelne Datei im Format GGUF, die du zum Beispiel bei Hugging Face herunterlädst, der größten Plattform für offene KI-Modelle. llama.cpp lädt diese Datei und rechnet damit, auf dem Prozessor, der Grafikkarte oder beidem.

Schematische Grafik in einem hellen Rahmen mit der Beschriftung „Dein Rechner“: links eine ungeordnete Wolke aus grauen und einigen farbigen Punkten mit der Beschriftung „Modell (GGUF-Datei)“, in der Mitte eine senkrechte salbeigrüne Linie mit einem leuchtenden salbeigrünen Kreis und der Beschriftung „llama.cpp“, rechts drei geordnete salbeigrüne Punkte mit den Beschriftungen „Web-Oberfläche“, „Kommandozeile“ und „Schnittstelle (API)“
Modell, Motor und Ergebnis bleiben innerhalb des Rahmens: auf deinem Rechner

llama.app: der Einstieg

Seit Mai 2026 gibt es mit llama.app einen offiziellen Installer für macOS, Windows und Linux. Auf dem Mac und unter Windows ist das eine kleine App in der Menüleiste, die aktuelle offene Modelle startet. Dazu kommt ein einheitlicher Befehl llama für das Terminal.

Erst ausprobieren, dann konfigurieren. Für den ersten Eindruck reicht die App.

Die Web-Oberfläche

Startest du den Server (llama serve, in älteren Anleitungen llama-server), öffnet sich unter http://localhost:8080 eine Chat-Oberfläche im Browser. Sie sieht aus wie ein schlichtes ChatGPT, nur dass alles auf deinem Gerät läuft. Du kannst Gespräche verwalten, Dateien hochladen und Einstellungen am Modell ändern. Neuere Versionen bringen außerdem Werkzeuge mit, über die das Modell Dateien liest und schreibt oder Befehle ausführt, und binden MCP-Server an, also Zugänge zu externen Diensten und Daten.

Web-Oberfläche von llama.cpp im Browser: links eine Seitenleiste mit „New chat“, „Search“, „MCP Servers“, „Settings“ und einer Liste früherer Gespräche, rechts die Begrüßung „Hello there“ und ein Eingabefeld mit dem Modell „qwen3.6 27B“. Geöffnet ist das Menü „Tools“ mit sieben eingebauten Werkzeugen wie read_file, exec_shell_command und write_file, alle angehakt
Die Web-Oberfläche: Chat, Werkzeuge und MCP-Server. Bild: ggml-org/llama.cpp

Die Web-Oberfläche ist der Chat. Das Modell darunter wählst du selbst.

Die Schnittstelle

Derselbe Server stellt eine Schnittstelle (API) bereit, über die andere Programme mit dem Modell sprechen. Sie ist laut Projekt kompatibel mit dem Format von OpenAI und dem von Anthropic. Werkzeuge wie n8n, die mit diesen Anbietern umgehen können, lassen sich deshalb oft auf deinen lokalen Server umstellen.

Die Schnittstelle macht aus einem lokalen Modell einen Baustein für Automatisierungen.

Für schnelle Tests im Terminal gibt es außerdem llama cli. Dort holst du mit kurzen Befehlen Texte, Bilder oder Videos ins Gespräch.

Terminalfenster mit dem Befehl „llama cli -hf ggml-org/Qwen3.6-27B-GGUF:Q8_0“, darunter der Schriftzug „llama.cpp“, Angaben zu Build, Modell und Modalitäten (text, vision, video) und eine Liste der Befehle wie /read, /image und /video. Unten lädt der Nutzer ein Bild und eine Textdatei und bittet um eine Erklärung, das Modell antwortet auf Englisch
Die Kommandozeile: Modell starten, Dateien hinzufügen, Fragen stellen. Bild: ggml-org/llama.cpp

Welche Einstellungen haben Wirkung?

Für den Einstieg zählen drei Entscheidungen. Alle weiteren Parameter erklärt der Parameter-Guide.

Modellgröße: gemessen in Milliarden Parametern, den gelernten Gewichten. Größer heißt meist bessere Antworten, aber mehr Speicher und weniger Tempo.

Quantisierung: Das Modell wird komprimiert gespeichert. Q4 heißt grob vier Bit pro Gewicht statt sechzehn: viel kleiner und schneller, etwas ungenauer. Q4_K_M gilt als verbreiteter Kompromiss.

Kontextgröße: die Textmenge, die das Modell in einem Durchgang berücksichtigt. Mehr Kontext kostet mehr Speicher.

Eine verbreitete Faustregel für Q4: etwa 0,6 GB Arbeitsspeicher pro Milliarde Parameter, plus Reserve für Kontext und Betriebssystem. Daraus meine grobe Ableitung:

SpeicherModell (Q4)Wofür
8 GBbis ca. 8 Mrd.erste Tests
16 GBbis ca. 14 Mrd.Alltag
32 GBbis ca. 30 Mrd.längere Texte

Auf Macs mit Apple-Chip zählt der gesamte Arbeitsspeicher. Mit separater Grafikkarte zählt für das Tempo vor allem deren Speicher (VRAM). Richtwerte, kein Versprechen: Teste mit deinem Gerät.

Wofür taugt llama.cpp und wofür nicht?

Taugt für

  • Texte mit vertraulichen Inhalten zusammenfassen, sortieren, umformulieren
  • Experimente mit offenen Modellen wie Gemma oder Qwen
  • Automatisierungen, die ohne Cloud-Anbieter laufen sollen
  • Arbeiten ohne Internetverbindung, sobald das Modell geladen ist

Taugt nicht für

  • Aufgaben, bei denen du die Qualität der großen Cloud-Modelle brauchst
  • Rechner mit wenig Arbeitsspeicher, dort bleiben nur sehr kleine Modelle
  • Wer gar nicht konfigurieren will: Ollama und LM Studio sind bequemer
  • Aktuelles Wissen: Lokale Modelle kennen nur ihren Trainingsstand und suchen nicht selbst im Netz

Was kostet llama.cpp?

Die Software ist kostenlos und steht unter der MIT-Lizenz. Die GGUF-Modelle auf Hugging Face sind meist ebenfalls kostenlos. Kosten entstehen woanders:

PostenKostenHinweis
Software0 €MIT-Lizenz
Hardwareeinmaligvorhandener Rechner reicht oft
Stromlaufendje nach Dauerbetrieb

Rechenbeispiel mit Annahmen: Ein kleiner Server läuft rund um die Uhr mit im Schnitt 50 Watt. Das sind 50 W × 24 h × 30 Tage = 36 kWh im Monat, bei angenommenen 0,35 € pro kWh rund 12,60 €. Dein Wert hängt von Gerät und Auslastung ab. Mit einem Cloud-Abo ist das nicht direkt vergleichbar, weil die Modelle unterschiedlich leistungsfähig sind.

Was passiert mit deinen Daten?

Wo werden die Daten verarbeitet?

Auf deinem Gerät. Das Modell rechnet lokal, deine Eingaben gehen an keinen Modellanbieter. Eine Internetverbindung braucht llama.cpp vor allem zum Herunterladen von Modellen, etwa mit dem Zusatz -hf direkt von Hugging Face. Wie das funktioniert, beschreibt Hugging Face in seiner Anleitung zu GGUF und llama.cpp.

Werden deine Eingaben zum Training genutzt?

Nein. llama.cpp trainiert keine Modelle mit deinen Eingaben, und da kein Anbieter die Daten bekommt, kann auch niemand sonst sie dafür verwenden.

Wo werden Chats gespeichert?

Die Web-Oberfläche speichert Gespräche laut Projektdokumentation im Browser, nicht auf dem Server. Einstellungen liegen ebenfalls im Browser. Wenn du die Browserdaten löschst, ist der Verlauf weg. Nutzt ein anderes Programm die Schnittstelle, speichert dieses Programm die Inhalte nach seinen eigenen Regeln.

Was gilt beim geschäftlichen Einsatz?

Lizenzen: llama.cpp selbst darfst du laut MIT-Lizenz auch geschäftlich nutzen. Jedes Modell hat aber eigene Lizenzbedingungen. Prüfe sie auf der Modellseite, bevor du ein Modell im Unternehmen einsetzt.

DSGVO: Läuft alles auf eigener Hardware, gibt es keinen Modellanbieter, mit dem du eine Auftragsverarbeitung (AVV) vereinbaren müsstest. Die DSGVO gilt trotzdem: Rechtsgrundlage, Zugriffsschutz und Löschung bleiben deine Aufgabe. Betreibst du llama.cpp auf einem gemieteten Server, brauchst du eine AVV mit dem Hoster.

Sicherheit: 2026 wurden mehrere teils kritische Sicherheitslücken im Server von llama.cpp gemeldet, zum Beispiel CVE-2026-43631 mit einer Bewertung von 9,2 von 10. Halte llama.cpp deshalb aktuell. Der Server lauscht standardmäßig nur auf dem eigenen Gerät (127.0.0.1). Öffne ihn nicht ungeschützt ins Netz und setze einen Zugangsschlüssel (--api-key), wenn andere Geräte zugreifen sollen. Werkzeuge, mit denen das Modell Dateien schreibt oder Befehle ausführt, solltest du laut Projekt nicht in nicht vertrauenswürdigen Umgebungen aktivieren. Versteckte Anweisungen in Dateien oder Webseiten (Prompt Injection) können sonst Aktionen auslösen, die du nicht wolltest.

Wer steht hinter llama.cpp?

Gestartet hat llama.cpp Georgi Gerganov, heute pflegt es die Organisation ggml mit einer großen Gemeinschaft. Im Februar 2026 ist das Kernteam zu Hugging Face gewechselt. Laut Ankündigung bleibt das Projekt vollständig Open Source und entscheidet technisch weiter selbst.

Im September 2026 hat Nvidia vereinbart, Hugging Face für rund 12,9 Milliarden US-Dollar zu übernehmen; die behördlichen Freigaben stehen noch aus. Was das langfristig für llama.cpp heißt, ist offen.

Meine Einschätzung

Bei mir läuft llama.cpp auf einem Heimserver in einem eigenen Container. Darüber experimentiere ich mit lokalen Modellen wie Gemma und Qwen. Mein konkretes Setup mit Startbefehl steht im Parameter-Guide.

Produktiv setze ich es für Anfragen und Use Cases ein, die hohe Datenschutzanforderungen haben. Dort ist die Frage nicht, welches Modell das beste ist, sondern welches gut genug ist, ohne dass die Daten das Haus verlassen.

Meine Beobachtung: Für Sortieren, Zusammenfassen und Umformulieren reicht ein lokales Modell oft. Für anspruchsvolle Texte und lange Planungsaufgaben greife ich weiter zu den großen Cloud-Modellen wie Claude. Die beiden schließen sich nicht aus. Der Datenschutz entscheidet, welche Aufgabe wohin geht.

Quellen

Kontakt

Der beste Weg, mich zu erreichen ist per E-Mail:

info@easy-automation.ai
Erstgespräch buchenLinkedIn