Aller au contenu
Building SocietyGuide IA
← La Boîte à outils

Local et open source

Faire tourner un modèle chez toi : quand ça a du sens, et avec quoi.

Faire tourner un modèle sur ta machine ne te fera pas économiser d'argent dans la plupart des cas : une API vaut souvent moins cher que l'électricité et le matériel. L'intérêt est ailleurs, et il est parfois décisif : les données ne sortent pas, il n'y a pas de limite de débit, et rien ne peut être déprécié sous tes pieds.

C'est l'argument qui débloque des missions dans la santé, le droit, la défense et le secteur public, où la question « où partent les données ? » se pose avant toutes les autres.

Ollama

Adresse
ollama.com
Nature
Faire tourner un modèle ouvert en local, avec une API compatible
Prix
Gratuit, open source

VerdictL'installation la plus simple qui existe. `ollama run <modèle>` et tu as un modèle qui tourne chez toi.

Son coup de génie est l'ergonomie : une commande pour télécharger et lancer un modèle, et surtout une API locale compatible avec le format OpenAI. Concrètement, ton code écrit pour une API distante fonctionne en changeant l'adresse : le même scénario n8n, la même application, sans réécriture.

C'est aussi ce qui en fait le meilleur outil de démonstration en clientèle : tu montres le système qui répond, avec le câble réseau débranché. Cet effet ne rate jamais.

Ce qu'il faut savoir avant de promettre quoi que ce soit : la qualité d'un modèle qui tient sur une machine ordinaire reste nettement en dessous des meilleurs modèles distants sur le raisonnement complexe. En revanche, sur la classification, l'extraction, la reformulation et l'embedding (c'est-à-dire l'essentiel du travail réel d'un système), un bon petit modèle fait le travail.

LM Studio

Adresse
lmstudio.ai
Nature
Application de bureau pour essayer et servir des modèles locaux
Prix
Gratuit

VerdictLa version avec interface d'Ollama. Le meilleur point d'entrée pour quelqu'un qui n'aime pas le terminal.

Même fonction, avec un catalogue navigable, un espace de conversation intégré et des réglages visibles : quantité de mémoire utilisée, longueur de contexte, degré de compression du modèle. Pour comprendre concrètement ce que « un modèle 8B quantifié en 4 bits » veut dire, une demi-heure ici vaut trois articles.

Il expose lui aussi un serveur local compatible OpenAI.

Hugging Face

Adresse
huggingface.co
Nature
Le dépôt central des modèles ouverts et des jeux de données
Prix
Gratuit au téléchargement

VerdictLe lieu où l'on choisit, avant d'installer. Et où l'on lit la licence.

C'est la source de tout ce qu'Ollama et LM Studio te proposent, avec deux informations qu'eux n'affichent pas toujours : la licence exacte (« ouvert » ne veut pas dire « libre pour un usage commercial », et certaines licences imposent des conditions au-delà d'un certain nombre d'utilisateurs), et les classements comparatifs, notamment MTEB pour les modèles d'embedding.

Sur un projet francophone, le réflexe utile est de filtrer MTEB sur le français avant de choisir : le modèle le mieux classé en anglais n'est presque jamais le bon choix.

vLLM

Adresse
docs.vllm.ai
Nature
Moteur d'inférence pour servir un modèle ouvert à plusieurs utilisateurs
Prix
Open source, gratuit ; le coût est celui des cartes graphiques

VerdictL'étage professionnel du local. À sortir seulement quand plusieurs personnes tapent sur le même modèle.

Ollama sert une personne à la fois, correctement. vLLM sert des dizaines de requêtes simultanées en les regroupant intelligemment, ce qui multiplie le débit d'un même matériel. C'est le moteur qu'on retrouve derrière la plupart des déploiements internes sérieux.

C'est aussi le moment où le local cesse d'être gratuit : il faut des cartes graphiques, quelqu'un pour les exploiter, et le calcul de rentabilité face à une API devient une vraie question, qui se tranche au volume, pas au principe.

Faits vérifiés le 20 août 2026. Un prix ou une fonction a changé ? Cette page est faite pour être corrigée, pas pour avoir raison.

Local et open source · Boîte à outils · Building Society