Wie man ein LLM lokal mit Ollama ausführt

Jeder Aufruf einer gehosteten LLM-API schickt Ihren Prompt an den Server von jemand anderem und berechnet Ihnen Kosten pro Token. Fällt das Netzwerk aus, antwortet sie nicht mehr. Ollama beseitigt beide Probleme: Es lädt ein Modell mit offenen Gewichten auf Ihren Rechner und stellt es über eine REST-API auf localhost:11434 bereit. Eine einzige Binärdatei ist Modellverwaltung, Chat-Client und Server zugleich. Was Ollama tatsächlich macht Ollama kapselt llama.cpp und ähnliche Inferenz-Engines, sodass Sie nie ein Compiler-Flag oder einen CUDA-Bibliothekspfad anfassen müssen. ollama pull llama3.2 lädt eine quantisierte Modelldatei (GGUF-Format) aus Ollamas eigener Registry herunter statt von Hugging Face, kann aber auch GGUF-Dateien von dort importieren. Beim Ausführen des Modells übergibt Ollama diese Gewichte an einen Hintergrundserver, der sie in den RAM (oder VRAM, falls eine kompatible GPU gefunden wird) lädt, sie einige Minuten nach der letzten Anfrage im Speicher hält, damit die nächste Anfrage schnell beantwortet wird, und sie entlädt, sobald keine Anfragen mehr kommen. ...

19. September 2026 · 7 Minuten · 1383 Wörter · SpaghettiCoder

Was ist RAG: Retrieval-Augmented Generation Erklärt

Fragen Sie ein allgemeines LLM nach der Rückgaberichtlinie Ihres Unternehmens oder den Support-Tickets der letzten Woche, und es wird entweder sagen, dass es das nicht weiß, oder etwas Plausibles erfinden. Sein Wissen endet dort, wo die Trainingsdaten aufhören. Es hat Ihre Dokumente nie gesehen und kann sie nicht mitten im Gespräch nachschlagen. Retrieval-Augmented Generation (RAG) behebt genau das: Bevor das Modell antwortet, findet ein separater Schritt den relevanten Text in Ihren eigenen Daten und gibt ihn dem Modell als Teil des Prompts mit. ...

12. September 2026 · 7 Minuten · 1401 Wörter · SpaghettiCoder