Configurer un LLM local avec Ollama

🚀 Réponse rapide : Ollama permet d'héberger un modèle de langage (LLM) sur votre propre machine et de l'exposer sur le réseau local. L'adresse à utiliser dans vos outils est du type http://192.168.0.30:11434 (IP de la machine serveur + port 11434). Les 6 étapes : installer Ollama → démarrer le serveur → exposer sur le réseau → télécharger un modèle → vérifier → connecter vos outils.

Pour qui ? Toute personne ou cabinet qui veut utiliser une IA sans envoyer ses données sur Internet : confidentialité, coût maîtrisé, fonctionnement hors ligne.

🤖 C'est quoi Ollama et un LLM local ?

Ollama est un logiciel gratuit et open source qui permet de télécharger et faire tourner des modèles de langage (LLM) directement sur votre machine — un PC, un Mac, un serveur ou un Raspberry Pi. Il fournit une API locale, c'est-à-dire une adresse web (par exemple http://192.168.0.30:11434) à laquelle vos outils peuvent se connecter, exactement comme s'ils appelaient ChatGPT ou un autre service en ligne.

Un LLM local (ou « custom LLM ») est un modèle d'intelligence artificielle qui s'exécute chez vous, sur votre matériel, plutôt que dans le cloud d'un fournisseur. Vous gardez le contrôle total : les données ne quittent pas votre réseau.

🔒 Pourquoi utiliser un LLM local ?

Confidentialité : vos documents, données clients et informations comptables ne sont jamais envoyés à un serveur externe. C'est l'argument n°1 pour les professions réglementées (experts-comptables, avocats, notaires).

Coût maîtrisé : pas d'abonnement ni de paiement à l'usage. Une fois le modèle téléchargé, l'utilisation est gratuite et illimitée.

Fonctionnement hors ligne : le LLM continue de fonctionner sans connexion Internet, utile en déplacement ou dans les environnements isolés.

Personnalisation : plusieurs outils du réseau (assistants, automatisations, applications internes) peuvent se brancher sur le même serveur Ollama.

⚠️ Limite à connaître : un LLM local est moins puissant qu'un grand modèle en ligne (GPT, Claude, Gemini) sur les tâches complexes. Pour des usages simples et répétitifs (rédaction, résumé, extraction, reformulation), les modèles locaux sont très efficaces et bien suffisants.

📥 Étape 1 : Installer Ollama

Rendez-vous sur le site officiel ollama.com et téléchargez la version correspondant à votre système :

curl -fsSL https://ollama.com/install.sh | sh

⚠️ Matériel : les modèles de langage demandent de la mémoire vive (RAM) et idéalement une carte graphique (GPU). Pour un usage léger, 8 Go de RAM suffisent avec un petit modèle. Pour des modèles plus gros, prévoir 16 Go ou plus.

▶️ Étape 2 : Démarrer le serveur Ollama

Lancez Ollama. Sur Windows et macOS, l'application démarre automatiquement au premier lancement. Sur Linux, le service est installé et démarré automatiquement.

Par défaut, le serveur écoute sur le port 11434 de la machine. Pour vérifier qu'il tourne, ouvrez un terminal sur la machine serveur et tapez :

curl http://localhost:11434/api/tags

La réponse est un fichier JSON contenant la liste des modèles installés (vide au premier démarrage).

🌐 Étape 3 : Exposer Ollama sur le réseau local

⚠️ Point critique : par défaut, Ollama n'écoute que sur 127.0.0.1 (localhost). Les autres machines du réseau ne peuvent pas s'y connecter tant que vous n'avez pas modifié ce réglage.

Pour autoriser les connexions depuis le réseau local, lancez le serveur avec la variable d'environnement OLLAMA_HOST=0.0.0.0 :

# Linux / macOS (terminal)
OLLAMA_HOST=0.0.0.0 ollama serve

# Windows (invité de commandes)
set OLLAMA_HOST=0.0.0.0
ollama serve

Pour un démarrage permanent sous Linux (systemd), modifiez le fichier du service :

sudo systemctl edit ollama.service

# Ajoutez dans la section [Service] :
[Service]
Environment="OLLAMA_HOST=0.0.0.0"

# Puis redémarrez le service :
sudo systemctl restart ollama

Ouvrir le port 11434 dans le pare-feu :

# Linux (ufw)
sudo ufw allow 11434

# Windows : Pare-feu Windows > Règles de trafic entrant > Nouvelle règle
# Port 11434, autoriser la connexion, profils Privé + Domaine

⬇️ Étape 4 : Télécharger un modèle

Ollama fonctionne avec des modèles qu'il faut télécharger une première fois. Dans un terminal sur la machine serveur :

# Un bon modèle polyvalent (~4,4 Go)
ollama pull mistral

# Un modèle léger et rapide, adapté au CPU (~1 Go)
ollama pull qwen3.5:0.8b

# Un modèle de raisonnement (~4,7 Go)
ollama pull deepseek-r1:7b

Le téléchargement ne se fait qu'une seule fois : ensuite le modèle reste disponible sur le serveur pour tous les outils du réseau.

✅ Étape 5 : Vérifier l'accès depuis une autre machine

Depuis un autre poste du réseau (pas la machine serveur), ouvrez un terminal et testez l'adresse avec l'IP du serveur — ici 192.168.0.30 en exemple :

curl http://192.168.0.30:11434/api/tags

Si la connexion fonctionne, vous obtenez la liste des modèles :

{"models":[{"name":"mistral:latest","size":..., ...}]}

Vous pouvez aussi tester une génération de texte :

curl -X POST http://192.168.0.30:11434/api/generate \
  -d '{"model":"mistral","prompt":"Bonjour, réponds en une phrase.","stream":false}'

💡 Comment trouver l'IP de la machine serveur ? Sur la machine qui héberge Ollama : ipconfig (Windows) ou ip a (Linux/macOS). L'adresse IPv4 locale ressemble à 192.168.x.x ou 10.x.x.x.

🔌 Étape 6 : Connecter un outil au LLM

La plupart des outils qui acceptent un « custom LLM » (assistants, agents, applications de chat, logiciels métier) proposent deux réglages : l'adresse du serveur (base_url) et le nom du modèle.

Adresse du serveur (base_url) : http://192.168.0.30:11434

Nom du modèle : mistral:latest (ou celui que vous avez téléchargé)

Format : l'API d'Ollama est compatible avec le format OpenAI, la plupart des outils la reconnaissent directement.

Selon l'outil, l'adresse peut se saisir sous la forme :

Remplacez 192.168.0.30 par l'IP réelle de votre serveur Ollama, et mistral:latest par le modèle que vous avez téléchargé à l'étape 4.

📊 Quels modèles choisir ?

Usage Modèle Taille Commentaire
Léger / rapide qwen3.5:0.8b ~1 Go Répond vite, tourne même sur un petit PC ou un Raspberry Pi
Standard mistral:latest ~4,4 Go Bon équilibre qualité / performance, polyvalent
Standard qwen2.5:7b ~4,7 Go Bon pour la rédaction et les tâches métier
Raisonnement deepseek-r1:7b ~4,7 Go Réfléchit avant de répondre, utile pour l'analyse

Règle pratique : commencez par un petit modèle (qwen3.5:0.8b) pour valider votre configuration, puis passez à un modèle plus gros si le matériel le permet.

🛠️ Dépannage et questions fréquentes

Quelle IP utiliser pour se connecter à un serveur Ollama ?

L'adresse IP locale de la machine qui héberge Ollama, par exemple http://192.168.0.30:11434. Trouvez-la avec ipconfig (Windows) ou ip a (Linux/macOS). En dehors du réseau local, il faut une IP publique ou un VPN.

Comment exposer Ollama sur le réseau local ?

Lancez le serveur avec OLLAMA_HOST=0.0.0.0 (ou configurez cette variable dans le service systemd sous Linux), puis ouvrez le port 11434 dans le pare-feu : sudo ufw allow 11434 sous Linux, règle de trafic entrant sous Windows.

Quel port utilise Ollama ?

Le port 11434 par défaut. L'adresse complète est donc http://IP_DU_SERVEUR:11434.

Comment vérifier qu'Ollama fonctionne depuis une autre machine ?

Exécutez curl http://192.168.0.30:11434/api/tags depuis un autre poste. Si le serveur répond, la connexion fonctionne. Une erreur de connexion indique un pare-feu, une mauvaise IP ou un OLLAMA_HOST non configuré.

« Connection refused » ou « No route to host » : que faire ?

  • Vérifiez que le serveur tourne : curl http://localhost:11434/api/tags sur la machine serveur.
  • Vérifiez que OLLAMA_HOST=0.0.0.0 est bien actif (sinon Ollama n'écoute que sur localhost).
  • Vérifiez que le port 11434 est ouvert dans le pare-feu de la machine serveur.
  • Vérifiez l'IP : les deux machines doivent être sur le même réseau local.
  • Testez la connexion avec ping 192.168.0.30.

Le modèle n'est pas trouvé (« model not found ») ?

Le nom du modèle doit correspondre exactement à un modèle installé sur le serveur. Tapez ollama list sur la machine serveur pour voir les noms exacts, ou téléchargez-le avec ollama pull <nom>.


✅ Ce qu'il faut retenir

  • Ollama = LLM hébergé chez vous : vos données ne quittent pas votre réseau.
  • Adresse type : http://192.168.0.30:11434 (IP du serveur + port 11434).
  • 3 réglages indispensables : OLLAMA_HOST=0.0.0.0, port 11434 ouvert, modèle téléchargé (ollama pull).
  • Vérifiez toujours depuis une autre machine avec curl http://IP:11434/api/tags.
  • Commencez petit : un modèle léger (qwen3.5:0.8b) suffit pour valider la configuration.

← Revenir à la liste des tutoriels