Configurer un LLM local avec Ollama

Dernière mise à jour : 23/08/2026 — modèles mis à jour selon le benchmark SLM Compta Online, exemple de connexion à Hermes Agent ajouté.

🚀 Réponse rapide : Ollama permet d'héberger un modèle de langage (LLM) sur votre propre machine et de l'exposer sur le réseau local. L'adresse à utiliser dans vos outils est du type http://192.168.0.30:11434 (IP de la machine serveur + port 11434). Les 6 étapes : installer Ollama → démarrer le serveur → exposer sur le réseau → télécharger un modèle → vérifier → connecter vos outils.

Pour qui ? Toute personne ou cabinet qui veut utiliser une IA sans envoyer ses données sur Internet : confidentialité, coût maîtrisé, fonctionnement hors ligne.

🤖 C'est quoi Ollama et un LLM local ?

Ollama est un logiciel gratuit et open source qui permet de télécharger et faire tourner des modèles de langage (LLM) directement sur votre machine — un PC, un Mac, un serveur ou un Raspberry Pi. Il fournit une API locale, c'est-à-dire une adresse web (par exemple http://192.168.0.30:11434) à laquelle vos outils peuvent se connecter, exactement comme s'ils appelaient ChatGPT ou un autre service en ligne.

Un LLM local (ou « custom LLM ») est un modèle d'intelligence artificielle qui s'exécute chez vous, sur votre matériel, plutôt que dans le cloud d'un fournisseur. Vous gardez le contrôle total : les données ne quittent pas votre réseau.

🔒 Pourquoi utiliser un LLM local ?

Confidentialité : vos documents, données clients et informations comptables ne sont jamais envoyés à un serveur externe. C'est l'argument n°1 pour les professions réglementées (experts-comptables, avocats, notaires).

Coût maîtrisé : pas d'abonnement ni de paiement à l'usage. Une fois le modèle téléchargé, l'utilisation est gratuite et illimitée.

Fonctionnement hors ligne : le LLM continue de fonctionner sans connexion Internet, utile en déplacement ou dans les environnements isolés.

Personnalisation : plusieurs outils du réseau (assistants, automatisations, applications internes) peuvent se brancher sur le même serveur Ollama.

⚠️ Limite à connaître : un LLM local est moins puissant qu'un grand modèle en ligne (GPT, Claude, Gemini) sur les tâches complexes. Pour des usages simples et répétitifs (rédaction, résumé, extraction, reformulation), les modèles locaux sont très efficaces et bien suffisants.

📥 Étape 1 : Installer Ollama

Rendez-vous sur le site officiel ollama.com et téléchargez la version correspondant à votre système :

curl -fsSL https://ollama.com/install.sh | sh

⚠️ Matériel : les modèles de langage demandent de la mémoire vive (RAM) et idéalement une carte graphique (GPU). Pour un usage léger, 8 Go de RAM suffisent avec un petit modèle. Pour des modèles plus gros, prévoir 16 Go ou plus.

▶️ Étape 2 : Démarrer le serveur Ollama

Lancez Ollama. Sur Windows et macOS, l'application démarre automatiquement au premier lancement. Sur Linux, le service est installé et démarré automatiquement.

Par défaut, le serveur écoute sur le port 11434 de la machine. Pour vérifier qu'il tourne, ouvrez un terminal sur la machine serveur et tapez :

curl http://localhost:11434/api/tags

La réponse est un fichier JSON contenant la liste des modèles installés (vide au premier démarrage).

🌐 Étape 3 : Exposer Ollama sur le réseau local

⚠️ Point critique : par défaut, Ollama n'écoute que sur 127.0.0.1 (localhost). Les autres machines du réseau ne peuvent pas s'y connecter tant que vous n'avez pas modifié ce réglage.

Pour autoriser les connexions depuis le réseau local, lancez le serveur avec la variable d'environnement OLLAMA_HOST=0.0.0.0 :

# Linux / macOS (terminal)
OLLAMA_HOST=0.0.0.0 ollama serve

# Windows (invité de commandes)
set OLLAMA_HOST=0.0.0.0
ollama serve

Pour un démarrage permanent sous Linux (systemd), modifiez le fichier du service :

sudo systemctl edit ollama.service

# Ajoutez dans la section [Service] :
[Service]
Environment="OLLAMA_HOST=0.0.0.0"

# Puis redémarrez le service :
sudo systemctl restart ollama

Ouvrir le port 11434 dans le pare-feu :

# Linux (ufw)
sudo ufw allow 11434

# Windows : Pare-feu Windows > Règles de trafic entrant > Nouvelle règle
# Port 11434, autoriser la connexion, profils Privé + Domaine

⬇️ Étape 4 : Télécharger un modèle

Ollama fonctionne avec des modèles qu'il faut télécharger une première fois. Dans un terminal sur la machine serveur :

# Le meilleur rapport qualité / matériel selon notre benchmark (8 Mds)
ollama pull ministral-3:8b

# Un modèle de 3 Mds, très bon sur machine légère
ollama pull ministral-3:3b

# Un modèle très rapide pour les tâches simples d'exécution
ollama pull qwen3:0.6b

Le téléchargement ne se fait qu'une seule fois : ensuite le modèle reste disponible sur le serveur pour tous les outils du réseau.

💡 Choix éclairé : les modèles ci-dessus sont issus du benchmark de 44 modèles locaux publié sur Compta Online (voir la section « Quels modèles choisir ? »).

✅ Étape 5 : Vérifier l'accès depuis une autre machine

Depuis un autre poste du réseau (pas la machine serveur), ouvrez un terminal et testez l'adresse avec l'IP du serveur — ici 192.168.0.30 en exemple :

curl http://192.168.0.30:11434/api/tags

Si la connexion fonctionne, vous obtenez la liste des modèles :

{"models":[{"name":"ministral-3:8b","size":..., ...}]}

Vous pouvez aussi tester une génération de texte :

curl -X POST http://192.168.0.30:11434/api/generate \
  -d '{"model":"ministral-3:8b","prompt":"Bonjour, réponds en une phrase.","stream":false}'

💡 Comment trouver l'IP de la machine serveur ? Sur la machine qui héberge Ollama : ipconfig (Windows) ou ip a (Linux/macOS). L'adresse IPv4 locale ressemble à 192.168.x.x ou 10.x.x.x.

🔌 Étape 6 : Connecter un outil au LLM

La plupart des outils qui acceptent un « custom LLM » (assistants, agents, applications de chat, logiciels métier) proposent deux réglages : l'adresse du serveur (base_url) et le nom du modèle.

Adresse du serveur (base_url) : http://192.168.0.30:11434

Nom du modèle : ministral-3:8b (ou celui que vous avez téléchargé)

Format : l'API d'Ollama est compatible avec le format OpenAI, la plupart des outils la reconnaissent directement.

Selon l'outil, l'adresse peut se saisir sous la forme :

Remplacez 192.168.0.30 par l'IP réelle de votre serveur Ollama, et ministral-3:8b par le modèle que vous avez téléchargé à l'étape 4.

Exemple : connecter Hermes Agent à votre Ollama

Hermes Agent est un agent IA open source (développé par Nous Research) qui tourne sur votre machine et accepte un LLM local comme moteur. C'est un cas d'usage typique : l'agent reste chez vous, Ollama aussi, aucune donnée ne sort du réseau.

Configuration dans Hermes Agent :

# 1. Définir le provider Ollama local
hermes config set model.provider custom:ollama-local

# 2. Indiquer l'adresse de votre serveur Ollama
hermes config set model.base_url http://192.168.0.30:11434

# 3. Choisir le modèle (doit exister sur le serveur)
hermes config set model.default ministral-3:8b

# 4. Vérifier la configuration
hermes config show | grep -i -A5 model

⚠️ Important : les modifications prennent effet à la prochaine session de l'agent (relancez-le après la configuration). Le nom du modèle doit correspondre exactement à celui affiché par ollama list sur le serveur.

📊 Quels modèles choisir ?

Les recommandations ci-dessous s'appuient sur le benchmark de 44 modèles locaux (SLM) publié par Fabrice Heuvrard sur Compta Online : 170 questions métier (comptabilité, fiscalité, social, juridique, audit) exécutées en local via Ollama, avec sources documentaires fournies.

Usage Modèle Score benchmark Commentaire
Meilleur rapport qualité / matériel ministral-3:8b 77,1 % (n°1) Tête du classement, dans la zone d'efficience 3-8 Mds de paramètres
Haute qualité (machine musclée) mistral-small:24b 76,1 % (n°2) Excellent, mais exige une machine puissante (24 Mds)
Standard + raisonnement qwen3:8b [think] 74,7 % (n°3) Bon compromis, mode raisonnement activable
Machine légère (3 Mds) ministral-3:3b 73,0 % (n°9) Score corrigé à 89,4 % — tourne sur un portable correct
Machine légère (4 Mds) qwen3.5:4b [no-think] 71,4 % (n°14) Bon équilibre qualité / vitesse
Rapide / tâches simples qwen3:0.6b [no-think] 64,5 % Très rapide (48,9 s sur les 170 questions) mais médiocre en expertise → réservé au classement, extraction, reformulation

Règle pratique : commencez par ministral-3:8b pour valider votre configuration. Si votre machine est modeste, prenez ministral-3:3b.

📊 Ce que dit le benchmark (points clés) :

  • Trio de tête : ministral-3:8b (77,1 %), mistral-small:24b (76,1 %), qwen3:8b [think] (74,7 %). Les 16 premiers tiennent en moins de 7 points d'écart : « plusieurs modèles se valent, autour de 77 % ».
  • La taille n'est pas le critère décisif : un bon modèle récent de 3 à 8 Mds rivalise avec des modèles bien plus gros. Plancher toutefois sous 1 Md de paramètres (résultats médiocres ou erratiques).
  • Biais d'acquiescement : face à une affirmation erronée, les petits modèles penchent vers la confirmation. Ne jamais demander à un SLM de « valider » une affirmation : posez la question en format ouvert.
  • Méfiance sur les chiffres : le domaine comptable est le point faible (54,9 % de moyenne) — comptes, taux, prorata restent le talon d'Achille. Vérifiez systématiquement les réponses chiffrées.
  • Rôle conseillé : assistance sur pièces (résumer, extraire, comparer un texte fourni), pas une réponse livrée sans contrôle à un client.

🔗 Lire le benchmark complet : Benchmark des petits modèles de langage locaux (SLM) — Compta Online.

🛠️ Dépannage et questions fréquentes

Quelle IP utiliser pour se connecter à un serveur Ollama ?

L'adresse IP locale de la machine qui héberge Ollama, par exemple http://192.168.0.30:11434. Trouvez-la avec ipconfig (Windows) ou ip a (Linux/macOS). En dehors du réseau local, il faut une IP publique ou un VPN.

Comment exposer Ollama sur le réseau local ?

Lancez le serveur avec OLLAMA_HOST=0.0.0.0 (ou configurez cette variable dans le service systemd sous Linux), puis ouvrez le port 11434 dans le pare-feu : sudo ufw allow 11434 sous Linux, règle de trafic entrant sous Windows.

Quel port utilise Ollama ?

Le port 11434 par défaut. L'adresse complète est donc http://IP_DU_SERVEUR:11434.

Comment vérifier qu'Ollama fonctionne depuis une autre machine ?

Exécutez curl http://192.168.0.30:11434/api/tags depuis un autre poste. Si le serveur répond, la connexion fonctionne. Une erreur de connexion indique un pare-feu, une mauvaise IP ou un OLLAMA_HOST non configuré.

« Connection refused » ou « No route to host » : que faire ?

  • Vérifiez que le serveur tourne : curl http://localhost:11434/api/tags sur la machine serveur.
  • Vérifiez que OLLAMA_HOST=0.0.0.0 est bien actif (sinon Ollama n'écoute que sur localhost).
  • Vérifiez que le port 11434 est ouvert dans le pare-feu de la machine serveur.
  • Vérifiez l'IP : les deux machines doivent être sur le même réseau local.
  • Testez la connexion avec ping 192.168.0.30.

Le modèle n'est pas trouvé (« model not found ») ?

Le nom du modèle doit correspondre exactement à un modèle installé sur le serveur. Tapez ollama list sur la machine serveur pour voir les noms exacts, ou téléchargez-le avec ollama pull <nom>.

Quels modèles locaux sont les meilleurs selon le benchmark Compta Online ?

Le benchmark publié sur Compta Online (44 modèles, 170 questions métier) place en tête ministral-3:8b (77,1 %), mistral-small:24b (76,1 %) et qwen3:8b [think] (74,7 %). Sur machine légère, ministral-3:3b (73,0 %) est un excellent choix. Évitez les modèles sous 1 Md de paramètres pour des questions d'expertise.

Peut-on connecter Hermes Agent à Ollama ?

Oui. Hermes Agent (agent IA open source de Nous Research) accepte un LLM local comme moteur : définissez le provider custom:ollama-local, l'adresse http://192.168.0.30:11434 en base_url, et le modèle de votre choix. La configuration prend effet à la prochaine session.


✅ Ce qu'il faut retenir

  • Ollama = LLM hébergé chez vous : vos données ne quittent pas votre réseau.
  • Adresse type : http://192.168.0.30:11434 (IP du serveur + port 11434).
  • 3 réglages indispensables : OLLAMA_HOST=0.0.0.0, port 11434 ouvert, modèle téléchargé (ollama pull).
  • Vérifiez toujours depuis une autre machine avec curl http://IP:11434/api/tags.
  • Commencez raisonnable : un modèle de 3 à 8 Mds (ministral-3:8b) offre le meilleur compromis selon le benchmark.

← Revenir à la liste des tutoriels