Come fare il red-team di un piano con più LLM (guida passo dopo passo)
Il red-teaming — attaccare il proprio piano prima che lo faccia la realtà — è pratica standard nella sicurezza e sempre più diffusa nel lavoro di prodotto e strategia. Il collo di bottiglia sono sempre state le persone: radunare attaccanti con specialità diverse richiede l'organizzazione di un workshop.
Con più LLM ci vogliono pochi minuti. Questa guida mostra come funziona la modalità Test di resistenza in LLM Debate Council e come ottenere risultati davvero attuabili, non generici.
Come è strutturata la modalità Test di resistenza
Un agente viene assegnato come Difensore del tuo piano; ogni altro agente è un Attaccante con un'angolazione fissa: sicurezza, scalabilità, costi, UX o legale. Gli attaccanti devono produrre scenari di fallimento concreti — quando e perché il piano si rompe — non preoccupazioni vaghe.
Dal secondo round in poi, gli attaccanti devono colpire specificamente l'ultima replica del difensore ('hai detto X — è debole perché Y'), così l'attacco si approfondisce invece di ripetersi. La sintesi finale è un elenco strutturato di vulnerabilità: ogni riscontro con la mitigazione del difensore e un punteggio di rischio.
Passo dopo passo
- 1. Scrivi il piano come un breve brief: cosa stai facendo, per chi, con quali vincoli. Incollalo come idea del dibattito.
- 2. Scegli da 4 a 6 agenti provenienti da almeno due fornitori diversi — la diversità degli attaccanti è tutto il punto.
- 3. Scegli la modalità Test di resistenza. Il primo agente diventa il Difensore, quindi metti lì il tuo modello più forte.
- 4. Attiva il fact-check se il piano si basa su numeri o normative (le affermazioni vengono verificate con fonti).
- 5. Avvialo. Osserva i round dal vivo; se gli attaccanti si perdono un'angolazione che temi, inseriscila a metà dibattito con il campo di intervento dell'esperto.
- 6. Leggi il verdetto come una lista di cose da fare: ogni vulnerabilità, la sua mitigazione, il suo punteggio di rischio. Esporta in PDF/DOCX (Pro) per il team.
Come ottenere attacchi più incisivi
La qualità dell'attacco segue la qualità del brief. Includi vincoli reali (budget, scadenza, dimensione del team, stack tecnologico) — gli attaccanti li usano per costruire scenari di fallimento credibili. Indica ciò che già sai essere debole: gli attaccanti verificheranno se la tua soluzione regge alla prova dei fatti.
Assegna agli agenti delle persona nelle loro istruzioni per un mordente specifico del dominio: 'sei un avvocato esperto di GDPR', 'sei un SRE che ha visto fallire questa architettura'. Le persona indirizzano l'angolazione di ciascun attaccante oltre le cinque predefinite.
Cosa aggiunge il multi-vendor rispetto a un solo modello che attacca se stesso
Un singolo modello a cui si chiede di attaccare il proprio piano tende a sollevare rischi educati e generici. Modelli di fornitori rivali — addestrati su dati diversi con allineamento diverso — trovano davvero falle diverse. In pratica, l'unione degli attacchi di GPT + Claude + Grok copre una superficie notevolmente maggiore, e il difensore non può soddisfarli tutti con una sola risposta evasiva.
Domande frequenti
Quanti attaccanti dovrei usare?
Da quattro a sei agenti in totale funziona meglio: un difensore più 3–5 attaccanti, idealmente distribuiti su due o più fornitori. Oltre questo numero i round si allungano senza aggiungere molti nuovi riscontri.
Posso aggiungere una mia angolazione di attacco?
Sì — in due modi: dai a un agente una persona nelle sue istruzioni ('attacca come un revisore fiscale'), oppure inserisci una direttiva a metà dibattito con il campo di intervento dell'esperto, a cui ogni agente dovrà rispondere nel round successivo.
Di quale piano tariffario ho bisogno?
Test di resistenza è una funzione Pro ($20/mese). Ogni piano include modelli integrati e crediti mensili, quindi una sessione completa consuma di solito solo una piccola parte dei tuoi crediti mensili; facoltativamente puoi collegare le tue chiavi API e pagare direttamente il fornitore (0 crediti). Anche l'esportazione in PDF/DOCX è riservata a Pro.
Piano gratuito · usa le tue chiavi API · 15 lingue