Wasa Confidence — sécurité offensive de l'IA Accueil / Méthodes / Outils de red teaming

Méthodes — cadre 14

Les outils du red teaming IA

Un red teaming IA ne se réduit pas à une intuition et un clavier. Une poignée d'outils, la plupart open source, automatisent la génération d'attaques, l'exécution de campagnes et la production de rapports. Aucun ne remplace le jugement humain — mais ignorer leur existence, c'est refaire à la main ce qu'un scanner fait en quelques minutes.

Vue d'ensemble

Cinq outils reviennent systématiquement dans les campagnes de red teaming et d'audit IA menées en 2026. Ils ne se valent pas sur les mêmes critères : certains sont des scanners prêts à l'emploi, d'autres des boîtes à outils pour construire sa propre campagne.

OutilÉditeurLicenceLangageRapportsScripts persos
garakNVIDIAApache 2.0 — gratuitPython (CLI)JSONL + HTMLOui (plugins)
PyRITMicrosoft AI Red TeamMIT — gratuitPython (librairie)À construire soi-mêmeOui, c'est le principe
GiskardGiskard AI (Paris)Apache 2.0 + Hub payantPython (librairie)HTML interactifOui (Model/Dataset)
promptfooOpenAI (depuis 2026)MIT — gratuitConfig YAML (CLI Node.js)Interface web + exportOui (JS ou Python)
DeepTeamConfident AIGratuit + plateforme payante en optionPython (librairie)Rapport de risqueOui (vulnérabilités custom)

Deux points valent d'être notés avant le détail. D'abord, « open source » ne veut pas dire « gratuit à l'usage » : la plupart de ces outils appellent un modèle de langage pour générer ou juger les attaques, ce qui consomme des crédits d'API même sans payer de licence. Ensuite, promptfoo a rejoint OpenAI début 2026 — le projet reste open source et sous licence MIT, mais ce changement de propriété mérite d'être suivi si la neutralité de l'outil compte dans ton choix.

garak

Apache 2.0 — gratuit
Éditeur
NVIDIA (AI Red Team)
Langage
Python — CLI
Installation
pip install garak
Cibles
23 backends (API, Hugging Face, local)

Périmètre — Un scanner de vulnérabilités, dans l'esprit d'un nmap pour les LLM. Plus de 50 modules de sondes (probes) couvrant hallucination, fuite de données, injection de prompt, désinformation, toxicité et jailbreak, évalués par 28 types de détecteurs.

Rapports — Sortie JSONL brute pour l'intégration en pipeline, et rapport HTML lisible pour la restitution humaine. Chaque sonde et son verdict sont tracés individuellement.

Scripts personnalisés — Architecture entièrement en plugins : sondes, détecteurs, générateurs, évaluateurs et harnais sont chacun des classes Python remplaçables. Écrire une sonde maison revient à sous-classer une interface existante.

Avantage clé — Le plus simple à lancer en une commande pour obtenir une première photographie des vulnérabilités connues d'un modèle, sans écrire une ligne de code.

PyRIT

MIT — gratuit
Éditeur
Microsoft AI Red Team
Langage
Python — librairie
Installation
pip install pyrit
Cibles
Tout endpoint scriptable en Python

Périmètre — Pas un scanner, mais un framework d'orchestration : PyRIT fournit des briques (cibles, orchestrateurs d'attaque, convertisseurs, juges) que l'opérateur assemble pour construire sa propre campagne. Les stratégies multi-tours fournies (Crescendo, PAIR, TAP, Skeleton Key) automatisent l'escalade progressive d'une conversation vers un contournement.

Rapports — Pas de rapport HTML prêt à l'emploi : PyRIT journalise les résultats dans une base (DuckDB ou Azure SQL), à charge pour l'opérateur de construire son propre tableau de bord ou export. C'est le prix de la flexibilité.

Scripts personnalisés — C'est tout le principe de l'outil. PyRIT n'est pas conçu pour être lancé tel quel : il est conçu pour être composé en code Python, brique par brique, campagne par campagne.

Avantage clé — Le plus adapté à une équipe qui a déjà une méthodologie de red teaming et cherche une boîte à outils pour l'exécuter, plutôt qu'un produit fini.

Giskard

Apache 2.0 + Hub payant
Éditeur
Giskard AI (Paris, fondé 2021)
Langage
Python — librairie
Installation
pip install giskard
Cibles
LLM, RAG, agents, ML tabulaire

Périmètre — Deux couches distinctes. Une couche de sondes techniques classiques (injection, robustesse), gratuite et locale. Une couche « pilotée par les exigences » : Giskard fait décrire en langage naturel ce que l'application doit et ne doit jamais faire, puis un modèle génère des sondes sur mesure et juge les réponses — plus puissant, mais consommateur d'appels API. Le module RAGET génère automatiquement des questions de test à partir d'une base documentaire, pertinent pour qui audite un système RAG.

Rapports — Rapport interactif détaillé par catégorie (robustesse, contenu nuisible, fuite d'information sensible, stéréotypes). Le Hub (payant) ajoute la planification de scans réguliers, la collaboration d'équipe et l'alignement avec des cadres comme OWASP.

Scripts personnalisés — On enveloppe son propre modèle dans un objet giskard.Model et ses données dans un giskard.Dataset ; les exigences métier et les sondes associées se définissent aussi en Python.

Avantage clé — Le mieux outillé pour l'audit spécifique d'un RAG, grâce à RAGET — à recouper avec l'audit RAG & hallucinations déjà documenté ici.

promptfoo

MIT — gratuit
Éditeur
OpenAI (depuis mars 2026)
Langage
CLI Node.js — config YAML
Installation
npm, pip ou brew
Cibles
OpenAI, Anthropic, Azure, Bedrock, Ollama…

Périmètre — À la fois un outil d'évaluation comparative de prompts et modèles, et un scanner de red teaming dédié. Couvre la comparaison de modèles côte à côte, l'intégration CI/CD, et la revue de pull requests pour détecter des risques de sécurité liés à l'IA directement dans le code.

Rapports — Une interface web locale (promptfoo view) affiche une matrice de résultats interactive ; export possible pour partage d'équipe. Fonctionne entièrement en local — les prompts ne quittent la machine que pour atteindre l'API du modèle testé.

Scripts personnalisés — Le point notable pour qui n'est pas à l'aise en Python : l'usage courant ne demande aucun code, juste un fichier de configuration déclaratif. Pour aller plus loin, on peut écrire des fournisseurs ou des assertions personnalisés en JavaScript — et un pont Python existe pour qui préfère y rester.

Avantage clé — Le plus accessible à une équipe qui n'a pas de compétence Python profonde mais veut un outil CLI robuste et déclaratif.

DeepTeam

Gratuit + plateforme optionnelle
Éditeur
Confident AI
Langage
Python — librairie
Installation
pip install deepteam
Base
Construit sur DeepEval

Périmètre — Plus de 40 catégories de vulnérabilités et une dizaine de stratégies de jailbreak (escalade linéaire, arborescente, Crescendo, scénarios multi-tours, exploitation de grilles d'évaluation). Le point distinctif : chaque catégorie est mappée nativement sur les référentiels établis — OWASP Top 10 pour LLM, OWASP Top 10 pour agents, NIST AI RMF, MITRE ATLAS — ce qui simplifie l'ancrage réglementaire du rapport final. Propose aussi des garde-fous prêts à l'emploi pour filtrer en production, au-delà du seul audit ponctuel.

Rapports — Résultats structurés localement ; la plateforme Confident AI (optionnelle, payante) ajoute la gestion des évaluations de risque dans la durée et le partage d'équipe.

Scripts personnalisés — On enveloppe son application dans une simple fonction Python (model_callback), puis on choisit ou on définit ses propres vulnérabilités et attaques ; utilisable en ligne de commande avec un fichier YAML ou entièrement en Python.

Avantage clé — Le plus direct pour produire un rapport déjà structuré selon les référentiels de sécurité IA plutôt qu'une liste de failles à recatégoriser après coup.

Comment choisir

Ce qu'aucun outil ne fait à ta place

Ces cinq outils accélèrent l'exécution, pas le jugement. Un scanner ne sait pas ce qui constitue un échec inacceptable pour ton système, ni jusqu'où pousser une chaîne d'exploitation une fois une faille trouvée — c'est l'objet du cadrage méthodologique qui précède toute campagne. Et parce que ces outils envoient des sollicitations hostiles à un système réel, leur usage suppose un mandat, même en interne : voir hacking éthique appliqué à l'IA.