Cómo hacer red-team a un plan con varios LLM (guía paso a paso)

El red-teaming —atacar tu propio plan antes de que lo haga la realidad— es práctica habitual en seguridad y cada vez más en producto y estrategia. El cuello de botella siempre fueron las personas: reunir atacantes con especialidades distintas exige organizar un taller.

Con varios LLM se hace en minutos. Esta guía muestra cómo funciona el modo Prueba de resistencia en LLM Debate Council y cómo obtener hallazgos realmente accionables, no genéricos.

Cómo se estructura el modo Prueba de resistencia

Un agente se asigna como Defensor de tu plan; todos los demás agentes son Atacantes con un ángulo fijo: seguridad, escalabilidad, coste, UX o legal. Los atacantes deben producir escenarios de fallo concretos —cuándo y por qué se rompe— no preocupaciones vagas.

A partir de la segunda ronda, los atacantes deben apuntar específicamente a la última réplica del defensor ('dijiste X, eso es débil porque Y'), de modo que el ataque profundice en vez de repetirse. La síntesis final es una lista estructurada de vulnerabilidades: cada hallazgo con la mitigación del defensor y una puntuación de riesgo.

Paso a paso

  • 1. Escribe el plan como un briefing corto: qué haces, para quién, con qué restricciones. Pégalo como la idea del debate.
  • 2. Elige de 4 a 6 agentes de al menos dos proveedores distintos: la diversidad de atacantes es el punto central.
  • 3. Elige el modo Prueba de resistencia. El primer agente se convierte en el Defensor, así que coloca ahí tu modelo más fuerte.
  • 4. Activa la verificación de hechos si el plan se apoya en cifras o normativas (las afirmaciones se verifican con fuentes).
  • 5. Ejecútalo. Observa las rondas en vivo; si a los atacantes se les escapa un ángulo que temes, inyéctalo a mitad del debate con el campo de intervención de experto.
  • 6. Lee el veredicto como una lista de tareas: cada vulnerabilidad, su mitigación, su puntuación de riesgo. Exporta a PDF/DOCX (Pro) para el equipo.

Cómo conseguir ataques más afilados

La calidad del ataque depende de la calidad del briefing. Incluye restricciones reales (presupuesto, plazo, tamaño del equipo, stack): los atacantes las usan para construir escenarios de fallo creíbles. Nombra lo que ya sabes que es débil: los atacantes verificarán si tu solución resiste el contacto real.

Dales a los agentes personas en sus instrucciones para un ataque específico de dominio: 'eres un abogado de GDPR', 'eres un SRE que ha visto fallar esta arquitectura'. Las personas orientan el ángulo de cada atacante más allá de los cinco integrados.

Qué añade el uso de varios proveedores frente a un solo modelo atacándose a sí mismo

Un único modelo al que se le pide atacar su propio plan tiende a plantear riesgos educados y genéricos. Los modelos de proveedores rivales —entrenados con datos distintos y con un alineamiento distinto— encuentran huecos genuinamente diferentes. En la práctica, la unión de los ataques de GPT + Claude + Grok cubre notablemente más superficie, y el defensor no puede satisfacerlos a todos con una respuesta vaga.

Preguntas frecuentes

¿Cuántos atacantes debería usar?

Lo mejor es un total de cuatro a seis agentes: un defensor más de 3 a 5 atacantes, idealmente abarcando dos o más proveedores. Más allá de eso, las rondas se alargan sin añadir muchos hallazgos nuevos.

¿Puedo añadir mi propio ángulo de ataque?

Sí, de dos formas: dale a un agente una persona en sus instrucciones ('ataca como un auditor fiscal'), o inyecta una directiva a mitad del debate con el campo de intervención de experto, que todos los agentes deberán abordar en la siguiente ronda.

¿Qué plan necesito?

Prueba de resistencia es una función de Pro ($20/mes). Todos los planes incluyen modelos integrados y créditos mensuales, así que una sesión completa suele consumir solo una pequeña parte de tus créditos mensuales; opcionalmente puedes conectar tus propias claves de API y pagar directamente al proveedor (0 créditos). La exportación a PDF/DOCX también es de Pro.

Ataca tu plan antes de que lo haga la realidad

Plan gratuito · usa tus propias claves API · 15 idiomas

Cómo hacer red-team a un plan con varios LLM (guía paso a paso) · LLM Debate Council