Aller au contenu
Building SocietyGuide IA
← La Boîte à outils

Évaluation et observabilité

Prouver que ton système marche, et voir ce qu'il fait quand tu ne regardes pas.

C'est la catégorie qui sépare une démonstration d'un produit, et c'est la seule dont personne ne parle sur les réseaux parce qu'elle n'est pas spectaculaire. Deux besoins distincts : évaluer (est-ce que ça marche, sur un jeu de cas connus, avant la mise en ligne) et observer (qu'est-ce qui s'est réellement passé, en production, sur les vrais appels).

Un système sans jeu d'évaluation n'est pas améliorable : chaque modification de prompt est un pari, et personne ne peut dire si la version d'hier était meilleure.

Langfuse

Adresse
langfuse.com
Nature
Observabilité, traces, évaluation et gestion des prompts
Prix
Open source auto-hébergeable et gratuit ; offre infonuagique avec palier gratuit généreux

VerdictLe standard de fait de 2026, et le seul sérieux que tu peux héberger toi-même. Installe-le sur ton premier vrai système.

Il enregistre chaque appel sous forme de trace : la requête complète, le prompt assemblé, la réponse, les outils appelés, la durée, le coût en tokens. Sur un système agentique où le modèle boucle six fois avant de répondre, c'est la seule façon de comprendre pourquoi une réponse est mauvaise.

Il fait aussi trois choses qu'on sous-estime : la gestion versionnée des prompts (tu changes un prompt sans redéployer, et tu sais quelle version a produit quelle réponse), le recueil des retours utilisateurs rattachés à la trace, et l'exécution de jeux d'évaluation.

L'auto-hébergement compte plus qu'il n'y paraît : les traces contiennent les données de tes utilisateurs. Les envoyer chez un tiers américain est parfois exclu par le client, et c'est souvent ce point qui décide de l'outil.

Il s'intègre nativement avec LangGraph, CrewAI, le SDK Agents d'OpenAI et Mastra, et accepte le format ouvert OpenTelemetry, donc rien ne t'y enferme.

promptfoo

Adresse
promptfoo.dev
Nature
Évaluation de prompts et de systèmes, en ligne de commande et en intégration continue
Prix
Open source, gratuit

VerdictL'outil du jeu de tests. Un fichier YAML, une commande, un tableau de résultats. À brancher dans ta CI dès le premier jour.

Tu déclares tes cas de test dans un fichier lisible, tu déclares les vérifications attendues (contient tel élément, respecte tel schéma JSON, est jugé conforme par un modèle juge), et tu lances. Il compare plusieurs prompts et plusieurs modèles côte à côte sur les mêmes cas, ce qui répond enfin à la question « est-ce que ma modification a amélioré quelque chose ? ».

Son intérêt décisif est ailleurs : dans une action d'intégration continue, il bloque une régression avant qu'elle n'atteigne l'utilisateur. C'est le geste qui fait passer un système du statut de bricolage à celui de logiciel.

Il embarque aussi un mode d'attaque automatisée (injection de prompt, fuite de consigne système, contournement) qui sert d'audit de sécurité de premier niveau.

LangSmith

Adresse
smith.langchain.com
Nature
Observabilité et évaluation, par l'éditeur de LangChain et LangGraph
Prix
Palier gratuit ; abonnement à l'usage

VerdictLe plus intégré si tu construis déjà avec LangGraph. Infonuagique uniquement en pratique.

Même famille de fonctions que Langfuse, avec une intégration sans effort dans l'écosystème LangChain et un outillage d'annotation de jeux de données plus mûr. Le compromis est clair : plus de confort, moins de contrôle, et la question de l'auto-hébergement se pose vite en Europe.

Braintrust

Adresse
braintrust.dev
Nature
Plateforme d'évaluation orientée équipe produit
Prix
Palier gratuit ; abonnement

VerdictLe meilleur quand des non-développeurs doivent participer à l'évaluation. Le plus cher des quatre.

Sa différence est humaine plus que technique : l'interface permet à un expert métier (le juriste, le médecin, le responsable support) de noter des réponses et de constituer le jeu de référence sans passer par un développeur. Sur une mission où la qualité se définit par un métier que tu ne connais pas, c'est un argument sérieux.

Faits vérifiés le 20 août 2026. Un prix ou une fonction a changé ? Cette page est faite pour être corrigée, pas pour avoir raison.

Évaluation et observabilité · Boîte à outils · Building Society