Comment faire du red-team sur un plan avec plusieurs LLM (guide étape par étape)
Le red-teaming — attaquer son propre plan avant que la réalité ne le fasse — est une pratique courante en sécurité et de plus en plus utilisée dans le travail produit et stratégique. Le goulot d'étranglement a toujours été humain : réunir des attaquants aux spécialités différentes nécessite d'organiser un atelier.
Avec plusieurs LLM, cela prend quelques minutes. Ce guide explique comment fonctionne le mode Test de résistance dans LLM Debate Council et comment obtenir des constats réellement exploitables, pas génériques.
Comment le mode Test de résistance est structuré
Un agent est désigné Défenseur de votre plan ; chaque autre agent est un Attaquant avec un angle fixe : sécurité, scalabilité, coût, UX ou juridique. Les attaquants doivent produire des scénarios d'échec concrets — quand et pourquoi ça casse — pas des inquiétudes vagues.
Dès la deuxième manche, les attaquants doivent viser spécifiquement la dernière réfutation du défenseur ('vous avez dit X — c'est faible parce que Y'), afin que l'attaque s'approfondisse au lieu de se répéter. La synthèse finale est une liste structurée de vulnérabilités : chaque constat avec la mesure d'atténuation du défenseur et un score de risque.
Étape par étape
- 1. Rédigez le plan sous forme de brief court : ce que vous faites, pour qui, avec quelles contraintes. Collez-le comme sujet du débat.
- 2. Choisissez 4 à 6 agents provenant d'au moins deux fournisseurs différents — la diversité des attaquants est tout l'enjeu.
- 3. Choisissez le mode Test de résistance. Le premier agent devient le Défenseur, placez-y donc votre modèle le plus solide.
- 4. Activez la vérification des faits si le plan s'appuie sur des chiffres ou des réglementations (les affirmations sont vérifiées avec des sources).
- 5. Lancez-le. Suivez les manches en direct ; si les attaquants ratent un angle que vous redoutez, injectez-le en cours de débat via le champ d'intervention d'expert.
- 6. Lisez le verdict comme une liste de tâches : chaque vulnérabilité, sa mitigation, son score de risque. Exportez en PDF/DOCX (Pro) pour l'équipe.
Obtenir des attaques plus incisives
La qualité de l'attaque suit celle du brief. Incluez de vraies contraintes (budget, échéance, taille de l'équipe, stack) — les attaquants s'en servent pour construire des scénarios d'échec crédibles. Nommez ce que vous savez déjà être un point faible : les attaquants vérifieront si votre correctif résiste à l'épreuve du réel.
Donnez aux agents des personas dans leurs instructions pour une attaque spécifique au domaine : 'vous êtes un avocat spécialisé RGPD', 'vous êtes un SRE qui a déjà vu cette architecture échouer'. Les personas orientent l'angle de chaque attaquant au-delà des cinq angles intégrés.
Ce qu'apporte le multi-fournisseur par rapport à un seul modèle s'attaquant lui-même
Un modèle unique auquel on demande d'attaquer son propre plan a tendance à soulever des risques polis et génériques. Les modèles de fournisseurs concurrents — entraînés sur des données différentes avec un alignement différent — trouvent réellement des failles différentes. En pratique, l'union des attaques de GPT + Claude + Grok couvre une surface nettement plus large, et le défenseur ne peut pas tous les satisfaire avec une seule réponse évasive.
Questions fréquentes
Combien d'attaquants dois-je utiliser ?
Quatre à six agents au total donnent les meilleurs résultats : un défenseur plus 3 à 5 attaquants, idéalement répartis sur deux fournisseurs ou plus. Au-delà, les manches s'allongent sans ajouter beaucoup de nouveaux constats.
Puis-je ajouter mon propre angle d'attaque ?
Oui — de deux façons : donnez à un agent un persona dans ses instructions ('attaque en tant qu'auditeur fiscal'), ou injectez une directive en cours de débat via le champ d'intervention d'expert, à laquelle chaque agent devra répondre à la manche suivante.
De quel plan tarifaire ai-je besoin ?
Test de résistance est une fonctionnalité Pro (20 $/mois). Chaque offre inclut des modèles intégrés et des crédits mensuels, si bien qu'une session complète ne consomme généralement qu'une petite part de vos crédits mensuels ; en option, vous pouvez brancher vos propres clés API et payer le fournisseur directement (0 crédit). L'export en PDF/DOCX est également réservé à Pro.
Offre gratuite · vos propres clés API · 15 langues