Guide Ollama LLM local
18 articles dans cette série
Un parcours LLM local pour setup Ollama, gestion des modèles, API, Web UI, RAG local et choix matériel.
Ollama pour débutants : votre première étape pour exécuter un LLM en local
Vous voulez faire tourner un grand modèle de langage sur votre propre machine ? Ce guide pas à pas vous montre comment installer et configurer Ollama, découvrir la puissance des LLM locaux, avec installation multi-plateforme, gestion des modèles, accélération GPU et intégration API.

Gestion des modèles Ollama : guide complet du téléchargement, du basculement, de la suppression et du contrôle de version
Guide détaillé des commandes essentielles de gestion des modèles Ollama : téléchargement de versions spécifiques, basculement, scripts de suppression en lot et bonnes pratiques de contrôle de version pour gérer efficacement votre bibliothèque LLM locale, libérer de l'espace disque et éviter le chaos des versions. Idéal pour les développeurs IA et les déployeurs OpenClaw.

Retour de version Ollama en pratique : 3 étapes clés ignorées par 90 % des développeurs
Ollama instable après une mise à jour ? Trois méthodes complètes de retour de version (binaire, gestionnaire de paquets, Docker), scripts d'automatisation et guide de coexistence multi-versions pour résoudre rapidement la gestion des versions.

Paramètres Modelfile Ollama : guide complet pour créer des modèles personnalisés
Guide détaillé des 10 paramètres clés du Modelfile Ollama, avec conseils d'optimisation pour temperature, num_ctx, etc. Quatre modèles prêts à l'emploi pour créer votre modèle personnalisé.

Llama 70B en local : guide comparatif 5700XT, Mac M4 et CUDA
Vous voulez exécuter Llama 70B en local ? Cet article compare trois solutions — AMD 5700XT, Mac M4 et NVIDIA CUDA — avec des données de test pour choisir le matériel adapté : besoins en VRAM, performances et pièges à éviter.

Tableau de sélection matérielle Ollama : guide VRAM, quantification et GPU (2026)
Un tableau complet de sélection matérielle Ollama : besoins VRAM pour les modèles 7B/13B/70B, comparaison des quantifications Q4/Q8, et les trois accélérateurs NVIDIA CUDA, AMD ROCm et Apple Metal. Recommandations par niveau, du RTX 3060 au 5090, pour faire correspondre carte graphique et modèle.

Accélération GPU Ollama : guide pratique CUDA, ROCm et Metal sur toutes les plateformes
Guide complet de l'accélération GPU Ollama : configuration NVIDIA CUDA, AMD ROCm et Apple Metal, avec étapes de vérification, réglage multi-GPU et dépannage pour multiplier par 10 à 20 la vitesse d'inférence LLM locale.

Planification GPU Ollama et gestion des ressources : optimisation VRAM, équilibrage multi-GPU
Analyse approfondie de la planification GPU et de la gestion des ressources Ollama : paramètres d'optimisation VRAM, architecture d'équilibrage multi-GPU, principes llama.cpp. Trois cas réels pour stabiliser les grands modèles et exploiter plusieurs cartes.

Optimisation des performances Ollama : guide complet quantification, batch et mémoire
Stratégies de quantification Q4/Q5/Q8 pour Ollama, configuration num_batch pour augmenter le débit de 50 à 150 %, gestion mémoire GPU et solutions OOM. Benchmarks par configuration matérielle.

Ollama multi-modèles en parallèle : configuration Qwen, Llama et DeepSeek
Guide de configuration Ollama pour l'exécution parallèle de plusieurs modèles : comparaison de Qwen, Llama et DeepSeek, cas d'usage et astuces de gestion de la mémoire GPU pour un système de bascule intelligent.

Ollama + Open WebUI : créer une interface ChatGPT locale (guide complet)
Guide pas à pas pour déployer une interface de dialogue IA style ChatGPT en local avec Ollama et Open WebUI : installation, choix de modèles, base de connaissances RAG, intégration API et optimisation des performances — en 30 minutes.

Appels API Ollama : de curl à l'interface compatible OpenAI SDK
Apprenez les deux façons d'appeler l'API Ollama : l'API REST native (curl) et l'interface compatible OpenAI SDK. Exemples de code complets, gestion du streaming et bonnes pratiques.

Pratique Ollama API : guide de développement client Python et Node.js
Guide complet d'appel à l'API Ollama : SDK Python et Node.js, réponses en streaming, boucle Agent Loop pour l'appel d'outils, mode thinking et comparaison avec la compatibilité OpenAI

Intégration LangChain + Ollama : guide complet pour développer des applications LLM en local
Méthode complète d'intégration LangChain et Ollama avec exemples de code pour Chat, RAG et Agent, stratégies de bascule OpenAI/Ollama, pour construire des applications LLM de niveau entreprise avec des modèles locaux.

Ollama Embedding en pratique : recherche vectorielle locale et RAG
Construire un RAG local avec Ollama : comparaison mxbai-embed-large vs nomic-embed-text, choix ChromaDB/FAISS/Milvus, code Python complet de bout en bout

Quantification de modèles Ollama : format GGUF et perte de précision expliqués
Principes de la quantification GGUF dans Ollama, données Red Hat sur 500K+ évaluations pour mesurer la perte de précision, et recommandations par configuration matérielle pour exécuter de grands modèles sur GPU grand public.

Surveillance Ollama en production : logs et alertes Prometheus
Guide complet de surveillance Ollama en production : configuration des logs, collecte de métriques Prometheus, règles AlertManager et dashboard Grafana, avec surveillance multi-GPU et récupération automatique en cas de panne.

Mnemo avec Ollama : mémoire locale et déploiement
Mnemo donne à Ollama une mémoire intersession avec Rust, SQLite et un graphe. Testez son API puis évaluez suppression, migration et partage entre agents.

