In diesem Tutorial zeigen wir, wie du große Sprachmodelle (LLMs) lokal auf deinem Rechner mit Ollama betreiben kannst – komplett ohne Cloud und ohne Datenweitergabe.
Lade Ollama von der offiziellen Webseite herunter und installiere es:
curl -fsSL https://ollama.com/install.sh | shÖffne ein Terminal und führe aus:
ollama run llama3.2:3b
Dies lädt ein kleines, schnelles Allzweck-Modell (ca. 2 GB), das auch auf schwächerer Hardware gut läuft, und startet sofort einen interaktiven Prompt. Andere aktuell empfehlenswerte Modelle (Stand 2026):
ollama run qwen3.6:27b – aktuell eines der stärksten Allround-Modelle, die noch auf normaler Consumer-Hardware laufen (ca. 24 GB RAM/VRAM bei Q4-Quantisierung empfohlen)ollama run qwen3-coder:30b – starkes, aktuelles Modell speziell für Programmieraufgabenollama run deepseek-r1 – Reasoning-Modell mit sichtbarer Denk-Kette, gut für Mathe/Logik, dafür langsamerollama run gpt-oss:20b – guter Kompromiss für Systeme mit ca. 16 GB RAMHinweis: Größere Modelle brauchen entsprechend mehr RAM bzw. VRAM. Mit ollama show <modellname> kannst du nach dem Pull prüfen, wie viel Arbeitsspeicher ein Modell tatsächlich benötigt.
Nach dem Start kannst du direkt im Terminal Fragen stellen oder Befehle geben. Beispiel:
> Erkläre mir kurz, wie ein Transformer funktioniert.
> Schreibe mir ein Python‑Skript, das eine CSV‑Datei einliest und die Spalten summierst.
Ollama stellt eine lokale OpenAI‑kompatible API bereit (http://localhost:11434/v1). Du kannst sie in jeder Sprache nutzen, die HTTP‑Requests unterstützt. Beispiel mit Python und openai‑Bibliothek:
from openai import OpenAI
client = OpenAI(base_url='http://localhost:11434/v1', api_key='ollama')
response = client.chat.completions.create(
model='deepseek-coder:6.7b-instruct-q4_K_M',
messages=[{'role': 'user', 'content': 'Sag Hallo auf Deutsch!'}]
)
print(response.choices[0].message.content)
ollama list siehst du alle gezogenen Modelle.ollama rm <modellname>.ollama serve mit entsprechenden Treibern).ollama run llama3:8b --temperature 0.7.