Wie man einen Plan mit mehreren LLMs im Red-Team-Verfahren prüft (Schritt-für-Schritt-Anleitung)
Red-Teaming — den eigenen Plan angreifen, bevor es die Realität tut — ist gängige Praxis in der Sicherheit und zunehmend auch in Produkt- und Strategiearbeit. Der Engpass waren immer die Menschen: Angreifer mit unterschiedlichen Spezialgebieten zusammenzubringen erfordert einen ganzen Workshop.
Mit mehreren LLMs dauert das nur Minuten. Diese Anleitung zeigt, wie der Belastungstest-Modus in LLM Debate Council funktioniert und wie man Erkenntnisse erhält, die wirklich umsetzbar sind, nicht generisch.
Wie der Belastungstest-Modus aufgebaut ist
Ein Agent wird als Verteidiger deines Plans bestimmt; jeder andere Agent ist ein Angreifer mit festem Blickwinkel: Sicherheit, Skalierbarkeit, Kosten, UX oder Recht. Angreifer müssen konkrete Fehlerszenarien liefern — wann und warum es scheitert —, keine vagen Bedenken.
Ab der zweiten Runde müssen Angreifer gezielt die letzte Erwiderung des Verteidigers ins Visier nehmen ('du hast X gesagt — das ist schwach, weil Y'), damit sich der Angriff vertieft statt sich zu wiederholen. Die finale Synthese ist eine strukturierte Liste von Schwachstellen: jeder Befund mit der Gegenmaßnahme des Verteidigers und einem Risikowert.
Schritt für Schritt
- 1. Schreibe den Plan als kurzes Briefing: was du tust, für wen, mit welchen Einschränkungen. Füge es als Debattenidee ein.
- 2. Wähle 4–6 Agenten von mindestens zwei verschiedenen Anbietern — die Vielfalt der Angreifer ist der ganze Sinn der Sache.
- 3. Wähle den Belastungstest-Modus. Der erste Agent wird zum Verteidiger, also setze dort dein stärkstes Modell ein.
- 4. Aktiviere den Faktencheck, wenn sich der Plan auf Zahlen oder Vorschriften stützt (Behauptungen werden anhand von Quellen überprüft).
- 5. Starte es. Verfolge die Runden live; wenn die Angreifer einen Blickwinkel übersehen, den du fürchtest, füge ihn mitten in der Debatte über das Feld für Experten-Eingriffe ein.
- 6. Lies das Urteil als Aufgabenliste: jede Schwachstelle, ihre Gegenmaßnahme, ihr Risikowert. Exportiere als PDF/DOCX (Pro) für das Team.
Wie man schärfere Angriffe bekommt
Die Angriffsqualität folgt der Qualität des Briefings. Nimm reale Einschränkungen auf (Budget, Deadline, Teamgröße, Stack) — Angreifer nutzen sie, um glaubwürdige Fehlerszenarien zu konstruieren. Benenne, was du bereits als Schwachstelle vermutest: Angreifer prüfen, ob deine Lösung dem echten Praxistest standhält.
Gib den Agenten in ihren Anweisungen Personas für domänenspezifische Schärfe: 'du bist ein DSGVO-Anwalt', 'du bist ein SRE, der diese Architektur schon einmal hat scheitern sehen'. Personas lenken den Blickwinkel jedes Angreifers über die eingebauten fünf hinaus.
Was Multi-Vendor gegenüber einem sich selbst angreifenden Modell bringt
Ein einzelnes Modell, das gebeten wird, seinen eigenen Plan anzugreifen, neigt dazu, höfliche, generische Risiken anzusprechen. Modelle konkurrierender Anbieter — trainiert mit unterschiedlichen Daten und unterschiedlichem Alignment — finden tatsächlich unterschiedliche Lücken. In der Praxis deckt die Vereinigung der Angriffe von GPT + Claude + Grok merklich mehr Fläche ab, und der Verteidiger kann nicht alle mit einer vagen Antwort zufriedenstellen.
Häufige Fragen
Wie viele Angreifer sollte ich einsetzen?
Am besten funktionieren insgesamt vier bis sechs Agenten: ein Verteidiger plus 3–5 Angreifer, idealerweise über zwei oder mehr Anbieter verteilt. Darüber hinaus werden die Runden lang, ohne viele neue Erkenntnisse zu bringen.
Kann ich meinen eigenen Angriffswinkel hinzufügen?
Ja — auf zwei Wegen: Gib einem Agenten in seinen Anweisungen eine Persona ('greife als Steuerprüfer an'), oder füge mitten in der Debatte über das Feld für Experten-Eingriffe eine Direktive ein, auf die jeder Agent in der nächsten Runde eingehen muss.
Welchen Tarif brauche ich?
Belastungstest ist eine Pro-Funktion (20 $/Monat). Jeder Tarif enthält integrierte Modelle und monatliche Credits, sodass eine komplette Sitzung meist nur einen kleinen Teil deiner monatlichen Credits verbraucht; optional kannst du deine eigenen API-Schlüssel einbinden und direkt beim Anbieter bezahlen (0 Credits). Der PDF/DOCX-Export ist ebenfalls Pro.
Kostenloser Tarif · eigene API-Schlüssel · 15 Sprachen