Comment Exécuter un LLM en Local avec Ollama

Chaque appel à une API de LLM hébergée envoie votre prompt vers le serveur de quelqu’un d’autre et vous facture par token. Coupez la connexion, et elle arrête de répondre. Ollama supprime ces deux problèmes : il récupère un modèle à poids ouverts sur votre machine et le sert via une API REST sur localhost:11434. Un seul binaire fait office de gestionnaire de modèles, de client de chat et de serveur. ...

19 septembre 2026 Â· 8 min Â· 1526 mots Â· SpaghettiCoder

Qu'est-ce que le RAG : Retrieval-Augmented Generation

Demandez à un LLM généraliste quelle est la politique de remboursement de votre entreprise ou ce que disent les tickets de support de la semaine dernière, et il vous dira qu’il ne sait pas ou inventera quelque chose de plausible. Sa connaissance s’arrête à ce qui figurait dans ses données d’entraînement. Il n’a jamais vu vos documents et ne peut pas les consulter en cours de conversation. La retrieval-augmented generation (RAG) règle exactement ce problème : avant que le modèle ne réponde, une étape séparée trouve le texte pertinent dans vos propres données et le transmet au modèle dans le prompt. ...

12 septembre 2026 Â· 8 min Â· 1663 mots Â· SpaghettiCoder