Ollama auf dem Raspberry Pi 5 – lokale KI ohne Cloud
Aktion: Gratis-Lektionen anschauen ✓
NEWS
OLLAMA AUF DEM RASPBERRY PI 5 – LOKALE KI OHNE CLOUD

Ein Sprachmodell im eigenen Wohnzimmer: Ollama macht es möglich
Passende Hardware im Überblick
Boards – bei Sprachmodellen zählt jeder Gigabyte RAM:
Raspberry Pi 5 mit 16GB RAM – die Empfehlung für lokale KI (Link)*
Raspberry Pi 5 mit 8GB RAM – der vernünftige Einstieg (Link)*
Raspberry Pi 5 mit 4GB RAM – nur für Mini-Modelle (Link)*
iRasptek Set mit Pi 5 16GB und 256GB Speicher (Link)*
Pi 5 16GB Starter-Kit mit 128GB-Karte (Link)*
db-tronic Pi 5 Komplett-Set mit Gehäuse und Kühler (Link)*
Beelink S12 Pro N100 – wenn der Pi zu langsam wird (Link)*
Speicher – Modelle brauchen Platz und Tempo:
Geekworm X1001 M.2-HAT für den Pi 5 (Link)*
PCIe-M.2-HAT für NVMe-SSDs (Link)*
Crucial P310 NVMe SSD 500GB – die Empfehlung (Link)*
Intenso M.2 NVMe SSD 500GB – die günstige Variante (Link)*
SanDisk Extreme Portable SSD 1TB über USB (Link)*
SanDisk Extreme A2 128GB Speicherkarte (Link)*
Strom und Absicherung:
Offizielles 27-W-Netzteil für den Pi 5 (Link)*
Geekworm X1200 USV für den Dauerbetrieb (Link)*
NPU-Beschleuniger – für Bild-KI, nicht für Ollama:
Raspberry Pi AI HAT+ mit 26 TOPS (Link)*
Raspberry Pi AI HAT+ mit 13 TOPS (Link)*
Kurz gesagt: Lohnt sich Ollama auf dem Raspberry Pi 5?
Die Kurzfassung:
- Installation in einer Zeile: curl -fsSL https://ollama.com/install.sh | sh erkennt die ARM64-Architektur des Pi und richtet gleich einen systemd-Dienst ein.
- Alles läuft auf der CPU: Weder die Grafikeinheit des Pi 5 noch ein Hailo-Beschleuniger werden von Ollama genutzt. Die vier Cortex-A76-Kerne machen die Arbeit allein.
- RAM ist die harte Grenze: Faustregel – Modellgröße plus rund 1 bis 2 GB Verwaltung müssen in den Arbeitsspeicher passen. Auf 8 GB laufen Modelle bis etwa 4 Milliarden Parameter, auf 4 GB nur die Mini-Klasse.
- Realistische Erwartung: Berichte aus der Community zeigen bei 1-B-Modellen ein flüssiges Lesetempo, bei 3-B- und 4-B-Modellen eher Schreibmaschinen-Geschwindigkeit. Ein Cloud-Dienst ist um Größenordnungen schneller.
- Der eigentliche Gewinn: Keine Daten verlassen das Haus, keine Abogebühr, keine Abhängigkeit von einem Anbieter – und der Pi zieht dabei ein Vielfaches weniger Strom als ein PC mit Grafikkarte.
- Bedienung: Im Terminal über ollama run, im Browser über Open WebUI oder per HTTP-Schnittstelle aus eigenen Skripten.
Was Ollama auf dem Raspberry Pi leistet – und was nicht
Ollama auf dem Raspberry Pi ist im Kern ein Serverdienst, der Sprachmodelle herunterlädt, verwaltet und über eine einheitliche Schnittstelle bereitstellt. Statt sich mit Modellformaten, Quantisierungen und Bibliotheken zu beschäftigen, tippt man ollama run gemma3:1b – und hat einen Chat im Terminal. Was Ollama technisch genau macht, ist an anderer Stelle ausführlich beschrieben; auf dem Pi zählt vor allem, welche Grenzen die Hardware setzt.
Die wichtigste Einschränkung: Der Pi rechnet ausschließlich mit der CPU. Ollama unterstützt Beschleuniger von Nvidia und AMD sowie Vulkan-fähige Grafikchips – die VideoCore-Einheit des Raspberry Pi 5 gehört nicht dazu. Auch der AI HAT+ mit Hailo-8-Chip hilft hier nicht weiter: Er ist für Bildverarbeitung ausgelegt. Erst der Nachfolger AI HAT+ 2 mit Hailo-10H-NPU kann laut Raspberry Pi Ltd. auch Sprachmodelle beschleunigen – dann allerdings über einen eigenen Dienst namens hailo-ollama und dessen Modell-Zoo, nicht über die normale Ollama-Installation.
Der zweite Flaschenhals ist die Speicherbandbreite. Ein Sprachmodell muss für jedes einzelne erzeugte Wort seine kompletten Gewichte durch den Arbeitsspeicher schieben. Genau deshalb sinkt das Tempo fast linear mit der Modellgröße, und genau deshalb bringt Übertakten weniger, als man hofft. Ein 1-B-Modell antwortet auf dem Pi 5 zügig, ein 4-B-Modell tröpfelt, ein 8-B-Modell ist selbst mit 16 GB RAM eher ein Geduldsspiel.
Was der Pi dafür bietet, hat kein Cloud-Dienst: vollständige Datenhoheit bei rund zehn Watt im Betrieb. Für Zusammenfassungen, Textkorrekturen, Klassifizierung von Notizen, einfache Übersetzungen oder als Sprachlogik im eigenen Sprachassistenten reicht das aus. Für lange Codegenerierung oder komplexe Analysen reicht es nicht – diese Erwartung sollte man vor der Installation ablegen.
Ollama auf dem Raspberry Pi installieren – Schritt für Schritt
- System prüfen: Ollama braucht ein 64-Bit-System. uname -m muss aarch64 ausgeben. Aktuell ist Raspberry Pi OS auf Basis von Debian Trixie, das seit Oktober 2025 ausgeliefert wird. Vorher noch sudo apt update && sudo apt full-upgrade.
- Schnellen Speicher bereitstellen: Modelle sind mehrere Gigabyte groß und werden bei jedem Start komplett gelesen. Eine NVMe-SSD am PCIe-Anschluss ist hier kein Luxus, sondern der Unterschied zwischen zwei und zwanzig Sekunden Ladezeit.
- Ollama installieren: curl -fsSL https://ollama.com/install.sh | sh. Das Skript lädt das ARM64-Paket, legt den Benutzer ollama an und aktiviert einen systemd-Dienst, der beim Booten automatisch startet.
- Version kontrollieren: ollama -v zeigt die installierte Fassung – im Sommer 2026 ist die 0.32er-Reihe aktuell. systemctl status ollama bestätigt, dass der Dienst läuft.
- Erstes Modell holen: ollama pull gemma3:1b lädt rund 815 MB herunter. Danach startet ollama run gemma3:1b den Chat. Mit /bye geht es zurück ins Terminal.
- Speicherort verlegen (optional): Modelle landen unter /usr/share/ollama/.ollama/models. Wer sie auf ein anderes Laufwerk legen will, setzt die Variable OLLAMA_MODELS im Dienst: sudo systemctl edit ollama und dort Environment="OLLAMA_MODELS=/mnt/ssd/ollama" eintragen.
- Im Netzwerk freigeben (optional): Ollama lauscht ab Werk nur auf 127.0.0.1:11434. Für den Zugriff von anderen Geräten ergänzt man im selben Editor Environment="OLLAMA_HOST=0.0.0.0:11434", danach sudo systemctl daemon-reload && sudo systemctl restart ollama.
- Fehler suchen: Bei Problemen liefert journalctl -u ollama --no-pager -e das Protokoll des Dienstes – die erste Anlaufstelle, wenn ein Modell nicht startet.
Welche Modelle auf dem Raspberry Pi 5 sinnvoll sind
Die Modellgröße entscheidet über alles: Passt die Datei nicht in den freien Arbeitsspeicher, verweigert Ollama den Start oder das System beginnt zu swappen – was bei Sprachmodellen praktisch einem Stillstand gleichkommt. Diese Kandidaten sind auf dem Pi realistisch:
| Modell | Download | Sinnvoll ab | Wofür |
|---|---|---|---|
| qwen3:0.6b | 523 MB | 4 GB RAM | Klassifizierung, Stichwortextraktion, Testläufe |
| gemma3:1b | 815 MB | 4 GB RAM | Kurze Antworten, Umformulierungen – die schnellste brauchbare Wahl |
| llama3.2:1b | 1,3 GB | 4 GB RAM | Zusammenfassungen mit langem Kontextfenster |
| qwen3:1.7b | 1,4 GB | 8 GB RAM | Guter Kompromiss aus Tempo und Qualität |
| llama3.2:3b | 2,0 GB | 8 GB RAM | Deutlich bessere Texte, spürbar langsamer |
| qwen3:4b | 2,5 GB | 8 GB RAM | Anspruchsvollere Aufgaben, wenn Wartezeit egal ist |
| gemma3:4b | 3,3 GB | 16 GB RAM | Versteht zusätzlich Bilder – die Obergrenze des Sinnvollen |
Ein zweiter, oft übersehener Faktor ist das Kontextfenster. Ollama arbeitet auf Systemen ohne große Grafikspeicher mit 4096 Token Vorgabe. Wer mehr braucht, setzt OLLAMA_CONTEXT_LENGTH – bezahlt das aber mit zusätzlichem RAM-Bedarf und noch längeren Antwortzeiten. Auf dem Pi ist die Standardeinstellung fast immer die richtige.
Die Befehle und Kniffe für den Alltag
- Modelle verwalten: ollama list zeigt alle geladenen Modelle mit Größe, ollama rm name löscht eines wieder. Das schafft schnell mehrere Gigabyte Platz.
- Speicher freigeben: Ein Modell bleibt nach dem letzten Zugriff fünf Minuten im RAM. ollama ps zeigt, was gerade geladen ist, ollama stop name wirft es sofort hinaus – auf einem Pi mit knappem Speicher ein wichtiger Befehl.
- Dauerhaft im Speicher halten: Wer den Pi als kleinen KI-Dienst betreibt, setzt OLLAMA_KEEP_ALIVE auf einen negativen Wert. Dann entfällt die Ladezeit bei jeder Anfrage – auf Kosten von dauerhaft belegtem RAM.
- Weboberfläche: Open WebUI läuft am einfachsten als Container über Docker und macht aus dem Terminal-Werkzeug eine Chat-Oberfläche für die ganze Familie.
- Eigene Skripte: Die HTTP-Schnittstelle unter Port 11434 nimmt Anfragen im JSON-Format entgegen. Damit lassen sich Node-RED-Abläufe, Shell-Skripte oder Automationen im Smart Home anbinden, ohne eine Cloud einzubinden.
- Headless betreiben: Für einen reinen KI-Server braucht es keinen Desktop. Ein per SSH bedientes Raspberry Pi OS Lite lässt mehr Arbeitsspeicher für die Modelle übrig.
Fehler und Stolpersteine
- 32-Bit-System: Auf einer alten 32-Bit-Installation bricht das Installationsskript ab. Ein Blick auf uname -m vor dem Start spart Sucherei.
- Zu großes Modell: Wird ein Modell größer als der freie Speicher, killt der Kernel den Prozess. Im Protokoll steht dann ein Eintrag zum oom-killer – kein Ollama-Fehler, sondern schlicht Speichermangel.
- Swap als vermeintliche Rettung: Mehr Auslagerungsspeicher lässt große Modelle zwar starten, aber jedes Token muss dann vom Datenträger gelesen werden. Praktisch nutzbar ist das nicht.
- Hitze: Die Inferenz lastet alle vier Kerne dauerhaft aus. Ohne aktive Kühlung drosselt der Pi 5 und wird noch langsamer, als er ohnehin schon ist.
- Schwaches Netzteil: Volllast auf allen Kernen plus NVMe-SSD ist genau das Lastprofil, bei dem ein knappes Netzteil Unterspannungswarnungen auslöst.
- Offener Port im Internet: Die Schnittstelle von Ollama kennt keine Anmeldung. Wer OLLAMA_HOST auf 0.0.0.0 setzt und dann eine Portfreigabe im Router einrichtet, stellt seinen Dienst der Allgemeinheit zur Verfügung. Zugriff von außen gehört hinter ein VPN.
- Falsche Messlatte: Wer die Antwortqualität eines großen Cloud-Modells erwartet, wird von einem 1-B-Modell zwangsläufig enttäuscht. Kleine Modelle erfinden häufiger Fakten – für alles Wichtige gehört eine Kontrolle dazu.
Häufige Fragen zu Ollama auf dem Raspberry Pi
Läuft Ollama auch auf dem Raspberry Pi 4?
Ja, sofern ein 64-Bit-System installiert ist. Der Pi 4 hat aber weniger Rechenleistung und Speicherbandbreite, sodass praktisch nur Modelle unterhalb von einer Milliarde Parametern erträglich bleiben.
Wie viel RAM brauche ich wirklich?
Als Faustregel gilt Modellgröße plus ein bis zwei Gigabyte. 8 GB sind die vernünftige Basis, 16 GB geben Luft für größere Modelle und parallel laufende Dienste. Mit 4 GB bleibt es bei der Mini-Klasse.
Beschleunigt der AI HAT+ die Sprachmodelle?
Der AI HAT+ mit Hailo-8-Chip nicht – der ist für Bilderkennung gedacht und wird von Ollama nicht angesprochen. Nur der AI HAT+ 2 mit Hailo-10H-NPU kann laut Dokumentation von Raspberry Pi Ltd. Sprachmodelle beschleunigen, und zwar über einen eigenen Dienst mit eigenem Modellkatalog.
Kann ich Ollama in einem Container betreiben?
Ja, das offizielle Image läuft auch auf ARM64. Auf dem Pi bringt die native Installation allerdings keine Nachteile und spart eine Abstraktionsschicht – der Container lohnt vor allem, wenn ohnehin alles per Compose verwaltet wird.
Wo liegen die heruntergeladenen Modelle?
Unter /usr/share/ollama/.ollama/models. Über die Variable OLLAMA_MODELS lässt sich der Ordner auf eine SSD oder ein USB-Laufwerk verlegen, was bei mehreren Modellen schnell nötig wird.
Wie viel Strom zieht der Pi dabei?
Unter Volllast bewegt sich ein Pi 5 im Bereich von etwa zehn Watt. Ein Desktop-PC mit Grafikkarte liegt beim Betrieb eines Sprachmodells um ein Vielfaches darüber – das ist das eigentliche Argument für die Dauerlösung auf dem Pi.
Gehen meine Eingaben ins Internet?
Nein. Nach dem Herunterladen des Modells arbeitet Ollama vollständig lokal. Man kann den Pi anschließend sogar vom Netz nehmen – genau das macht die Lösung für sensible Notizen und Dokumente interessant.
Fazit
Ollama auf dem Raspberry Pi ist kein Ersatz für einen Cloud-Dienst, sondern etwas anderes: ein kleiner, sparsamer, dauerhaft verfügbarer KI-Dienst im eigenen Netz, der keine Daten weitergibt. Unsere klare Empfehlung: Nimm einen Pi 5 mit mindestens 8 GB RAM, eine NVMe-SSD und ein Modell mit ein bis zwei Milliarden Parametern – diese Kombination liefert Antworten in einem Tempo, mit dem man tatsächlich arbeiten kann. Wer stattdessen ein 8-B-Modell auf eine Speicherkarte legt, wird die Installation nach zwei Tagen wieder löschen. Und wer produktiv große Modelle braucht, ist mit einem anderen Ansatz oder einem Mini-PC mit mehr Speicherbandbreite besser bedient. Der Pi punktet nicht mit Leistung, sondern mit Unabhängigkeit – und die ist bei zehn Watt Dauerverbrauch erstaunlich günstig zu haben.
* = Affiliate Link (raspi-config.de ist Teilnehmer des Partnerprogramms von Amazon EU, das zur Bereitstellung eines Mediums für Websites konzipiert wurde, mittels dessen durch die Platzierung von Werbeanzeigen und Links zu Amazon.de Werbekostenerstattung verdient werden kann.)
Aktion: Gratis-Lektionen anschauen ✓
VORSCHAU
Was Dich im Raspberry Pi Videokurs erwartet.
Play klicken & Video abspielen.
NEWS
EMPFEHLUNG
Danke für Deine Weiterempfehlung!
© 2026 raspi-config.de | Datenschutz | Impressum


