Illustration éditoriale montrant un ordinateur qui exécute un modèle IA local avec Ollama, relié à un serveur domestique et à des panneaux de supervision.

Ollama : installer et utiliser un modèle IA en local sur son PC

En bref

Ollama est un serveur d’inférence qui permet de faire tourner des modèles d’IA en local sur un ordinateur.

On peut utiliser Ollama en ligne de commande, via une API locale HTTP ou via le client fourni lors de l’installation.

Ollama est intéressant pour tester des LLM open weight sans envoyer toutes ses requêtes vers un service cloud.

À quoi sert Ollama

Ollama simplifie trois opérations qui sont souvent pénibles quand on découvre l’IA locale :

  1. télécharger un modèle ;
  2. le lancer depuis le terminal ;
  3. l’exposer via une API locale.

Sans Ollama, il faut souvent manipuler directement des fichiers de modèles, choisir un moteur d’inférence, configurer des chemins, gérer des paramètres et comprendre les formats de quantification.

Avec Ollama, le premier test peut tenir en quelques commandes :

ollama pull llama3.2
ollama run llama3.2

Le modèle est téléchargé, stocké localement, puis lancé dans une session interactive.

Installation

Rendez-vous sur la page officielle de téléchargement.

Page officielle de téléchargement Ollama

On peut aussi installer Ollama dans un container Docker.

Choisir un modèle

Le choix du modèle est plus important que l’installation.

Un modèle trop gros peut être lent, instable ou inutilisable sur une machine modeste. Pour commencer, il vaut mieux choisir un modèle compact et populaire plutôt que viser directement un très gros modèle.

Bibliothèque officielle Ollama
Bibliothèque officielle Ollama

La bibliothèque officielle Ollama permet de rechercher des modèles et de voir les tags disponibles. Les noms suivent généralement ce format :

nom-du-modele:tag

Exemples :

ollama pull llama3.2
ollama pull qwen3
ollama pull gemma3

Le tag latest est utilisé par défaut quand aucun tag n’est indiqué. Pour un usage durable, il est préférable de noter le nom complet du modèle utilisé dans ses tests.

Utiliser Ollama

Avec le client Ollama fourni

Client Ollama sous Windows
Client Ollama sous Windows

Le client Ollama fourni avec l’application permet de lancer et gérer Ollama sans passer immédiatement par des commandes avancées. C’est le chemin le plus simple pour vérifier que le service démarre correctement, que les modèles installés sont visibles et que l’environnement local est prêt.

Cette interface reste surtout pratique pour débuter. Dès que l’on veut automatiser des tests, intégrer Ollama dans un outil ou reproduire une configuration, la ligne de commande et l’API locale deviennent plus adaptées.

En ligne de commande

La ligne de commande est la méthode la plus directe pour installer un modèle, le lancer, vérifier les versions et diagnostiquer un problème. Elle permet aussi de documenter précisément les commandes utilisées, ce qui est indispensable pour un tutoriel reproductible.

Les commandes suivantes couvrent les usages de base : lancer un modèle, lister les modèles présents, télécharger un modèle sans l’exécuter et vérifier la version d’Ollama.

Lancer un modèle

ollama run llama3.2

Cette commande ouvre une conversation dans le terminal.

Lister les modèles installés

ollama list

Cette commande permet de vérifier quels modèles sont déjà présents sur la machine.

Télécharger un modèle sans le lancer

ollama pull llama3.2

Vérifier la version

ollama -v

Via l’API locale en HTTP

Ollama expose une API locale. Par défaut, elle écoute sur :

http://localhost:11434

Pour se connecter à cette API locale, on peut utiliser des interfaces ou clients compatibles avec Ollama, comme Open WebUI, LibreChat, AnythingLLM, Dify, Continue ou certains outils capables d’appeler une API compatible OpenAI. Les outils HTTP comme PowerShell ou curl restent utiles surtout pour tester rapidement un endpoint ou diagnostiquer une erreur.

L’intérêt est simple : Ollama peut servir de moteur local pour un script, une interface web, un outil de développement ou un prototype de RAG, sans dépendre directement d’une API cloud.

Un appel simple à l’API native peut ressembler à ceci :

Invoke-RestMethod `
  -Uri "http://localhost:11434/api/generate" `
  -Method Post `
  -ContentType "application/json" `
  -Body '{"model":"llama3.2","prompt":"Explique Ollama en une phrase.","stream":false}'

L’endpoint /api/generate sert à générer une réponse à partir d’un prompt.

L’endpoint /api/chat sert plutôt aux conversations structurées avec des messages.

La documentation officielle indique aussi d’autres endpoints utiles :

  1. /api/pull pour télécharger un modèle ;
  2. /api/tags pour lister les modèles locaux ;
  3. /api/show pour afficher les informations d’un modèle ;
  4. /api/embed pour générer des embeddings ;
  5. /api/ps pour lister les modèles chargés en mémoire ;
  6. /api/version pour récupérer la version du serveur.

Compatibilité avec l’API OpenAI

Ollama fournit une compatibilité avec une partie de l’API OpenAI. Le but est de connecter plus facilement des outils existants à un serveur local.

Documentation officielle de compatibilité OpenAI
Documentation officielle de compatibilité OpenAI

Exemple Python avec le client OpenAI :

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1/",
    api_key="ollama",
)

response = client.chat.completions.create(
    model="llama3.2",
    messages=[
        {"role": "user", "content": "Explique Ollama en une phrase."}
    ],
)

print(response.choices[0].message.content)

Le champ api_key reste obligatoire côté client OpenAI, mais il est ignoré par Ollama dans cet usage local.

Attention : toutes les API OpenAI ne sont pas implémentées par Ollama.

Avantages

Ollama a plusieurs avantages pour un usage personnel ou technique :

  1. installation simple ;
  2. modèles stockés localement ;
  3. ligne de commande facile à tester ;
  4. API locale pratique ;
  5. compatibilité partielle avec le format OpenAI ;
  6. intégration possible avec des interfaces et des outils de développement ;
  7. bon point d’entrée pour comprendre l’IA locale.

Limites

Ollama ne supprime pas les contraintes matérielles.

Un modèle de grande taille demande beaucoup de RAM ou de VRAM. Si la carte graphique n’est pas compatible ou pas assez puissante, l’exécution peut basculer sur le CPU et devenir lente.

Les limites principales :

  1. performances très variables selon le matériel ;
  2. modèles volumineux à télécharger ;
  3. qualité dépendante du modèle choisi ;
  4. consommation mémoire parfois élevée ;
  5. compatibilité OpenAI partielle, à vérifier selon l’application ;
  6. usage serveur public à éviter sans couche de sécurité supplémentaire.

Pour un usage exposé sur un réseau, il faut traiter Ollama comme un service sensible. Laisser une API de génération accessible sans contrôle est une mauvaise idée.

Matériel et GPU

La documentation officielle indique une prise en charge des GPU NVIDIA, AMD Radeon via ROCm selon les systèmes, Apple Metal et Vulkan expérimental.

Pour un premier test, un CPU suffit parfois avec un petit modèle. Pour un usage confortable, une carte graphique compatible et assez de VRAM changent fortement l’expérience.

Sur Windows, il faut vérifier les pilotes NVIDIA ou AMD. Sur Linux, les pilotes GPU et les droits d’accès aux périphériques peuvent devenir le vrai sujet technique.

Vérification minimale après installation

Après installation, trois vérifications suffisent pour savoir si la base fonctionne :

ollama -v
ollama pull llama3.2
ollama run llama3.2

Puis vérifier l’API :

Invoke-RestMethod -Uri "http://localhost:11434/api/version"

Si l’API répond avec une version, le serveur local Ollama est actif.

Quand utiliser Ollama

Ollama est pertinent pour :

  1. tester des modèles open weight ;
  2. apprendre l’IA locale ;
  3. prototyper une application LLM ;
  4. travailler hors cloud sur des données non critiques ;
  5. comparer plusieurs modèles ;
  6. brancher une interface locale ;
  7. alimenter un petit pipeline RAG expérimental.

Il est moins adapté si l’objectif est d’obtenir immédiatement une haute disponibilité, une gestion fine des utilisateurs, une supervision avancée ou une exposition publique sécurisée. Dans ce cas, il faut ajouter d’autres briques autour.

Pour aller plus loin

Whisper.cpp : transcrire de l’audio en local avec Whisper : autre exemple concret d’IA locale, cette fois appliqu? ? la transcription audio.

Lexique

LLM : grand modèle de langage capable de générer ou analyser du texte.

Open weight : modèle dont les poids sont disponibles, mais pas forcément avec une licence totalement open source.

VRAM : mémoire de la carte graphique. Elle influence fortement la taille des modèles utilisables confortablement.

API locale : interface accessible sur la machine, ici via localhost, pour appeler Ollama depuis un script ou une application.

Endpoint : point d’entrée précis d’une API, généralement une URL ou un chemin comme /api/generate, qui correspond à une action ou à une ressource donnée.

Embedding : représentation numérique d’un texte, utilisée pour comparer des contenus, rechercher des passages proches et construire des systèmes de recherche sémantique.

RAG : méthode qui combine recherche documentaire et génération de réponse par un modèle. Le modèle répond à partir de documents retrouvés au moment de la requête.

Serveur d’inférence : service qui charge un modèle d’IA et reçoit des requêtes pour générer des réponses. Dans le cas d’Ollama, ce serveur fonctionne localement et expose une API HTTP.

Container Docker : environnement isolé qui embarque une application et ses dépendances pour l’exécuter de manière reproductible sur une machine compatible Docker.

Sources & Ressources

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *