Jak Uruchomić LLM Lokalnie z Ollama

Każde wywołanie hostowanego API LLM wysyła Twój prompt na cudzy serwer i obciąża Cię opłatą za token. Zerwij połączenie z siecią, a przestanie odpowiadać. Ollama usuwa oba te problemy: pobiera model o otwartych wagach na Twoją maszynę i udostępnia go przez API REST na localhost:11434. Jeden plik binarny pełni rolę menedżera modeli, klienta czatu i serwera. Co Ollama robi naprawdę Ollama opakowuje llama.cpp i podobne silniki wnioskowania, więc nigdy nie musisz dotykać flagi kompilatora ani ścieżki do biblioteki CUDA. ollama pull llama3.2 pobiera skwantyzowany plik modelu (format GGUF) z własnego rejestru Ollama, a nie z Hugging Face, choć potrafi też importować pliki GGUF stamtąd. Uruchomienie modelu przekazuje te wagi do serwera działającego w tle, który ładuje je do RAM-u (lub VRAM-u, jeśli znajdzie kompatybilną GPU), trzyma je w pamięci przez kilka minut po ostatnim zapytaniu, żeby kolejne było szybkie, i zwalnia pamięć, kiedy zapytania przestają napływać. ...

19 września 2026 · 6 min · 1272 słów · SpaghettiCoder

Czym Jest RAG: Retrieval-Augmented Generation Wyjaśnione

Zapytaj ogólny LLM o politykę zwrotów w twojej firmie albo o to, co było w zgłoszeniach supportu w zeszłym tygodniu, a usłyszysz albo “nie wiem”, albo coś wiarygodnie brzmiącego, ale zmyślonego. Jego wiedza kończy się tam, gdzie kończyły się dane treningowe. Nigdy nie widział twoich dokumentów i nie może w trakcie rozmowy ich sprawdzić. Retrieval-augmented generation (RAG) naprawia dokładnie to: zanim model odpowie, osobny krok znajduje odpowiedni fragment w twoich danych i przekazuje go modelowi jako część prompta. ...

12 września 2026 · 7 min · 1332 słów · SpaghettiCoder