Birden fazla LLM ile bir plana nasıl red-team uygulanır (adım adım rehber)

Red-teaming — gerçeklik yapmadan önce kendi planınıza saldırmak — güvenlikte standart bir uygulamadır ve ürün ile strateji çalışmalarında da giderek yaygınlaşmaktadır. Darboğaz her zaman insan olmuştur: farklı uzmanlıklara sahip saldırganları bir araya getirmek bir çalıştay gerektirir.

Birden fazla LLM ile bu iş dakikalar sürer. Bu rehber, LLM Debate Council'daki Dayanıklılık testi modunun nasıl çalıştığını ve genel geçer değil gerçekten uygulanabilir bulgular elde etmenin yolunu gösterir.

Dayanıklılık testi modu nasıl yapılandırılır

Bir ajan planınızın Savunmacısı olarak atanır; diğer tüm ajanlar sabit bir açıyla Saldırgan olur: güvenlik, ölçeklenebilirlik, maliyet, UX veya hukuki. Saldırganlar belirsiz endişeler değil, somut başarısızlık senaryoları — ne zaman ve neden bozulduğu — üretmelidir.

İkinci turdan itibaren saldırganlar, savunmacının en son yanıtını özellikle hedef almalıdır ('X dedin — bu zayıf çünkü Y'), böylece saldırı tekrar etmek yerine derinleşir. Nihai sentez, yapılandırılmış bir zafiyet listesidir: her bulgu, savunmacının önlemi ve bir risk puanıyla birlikte sunulur.

Adım adım

  • 1. Planı kısa bir brifing olarak yazın: ne yapıyorsunuz, kimin için, hangi kısıtlarla. Bunu tartışma fikri olarak yapıştırın.
  • 2. En az iki farklı sağlayıcıdan 4-6 ajan seçin — saldırgan çeşitliliği bu işin tüm amacıdır.
  • 3. Dayanıklılık testi modunu seçin. İlk ajan Savunmacı olur, bu yüzden en güçlü modelinizi oraya koyun.
  • 4. Plan sayılara veya düzenlemelere dayanıyorsa fact-check'i açın (iddialar kaynaklarla doğrulanır).
  • 5. Çalıştırın. Turları canlı izleyin; saldırganlar korktuğunuz bir açıyı kaçırırsa, uzman-müdahale alanıyla tartışmanın ortasında bunu ekleyin.
  • 6. Nihai kararı bir iş listesi gibi okuyun: her zafiyet, önlemi, risk puanı. Ekip için PDF/DOCX (Pro) olarak dışa aktarın.

Daha keskin saldırılar nasıl elde edilir

Saldırı kalitesi, brifing kalitesini takip eder. Gerçek kısıtları dahil edin (bütçe, son teslim tarihi, ekip büyüklüğü, teknoloji yığını) — saldırganlar bunları inandırıcı başarısızlık senaryoları oluşturmak için kullanır. Zaten zayıf olduğunu bildiğiniz şeyi belirtin: saldırganlar çözümünüzün gerçek bir çarpışmaya dayanıp dayanmadığını doğrular.

Alana özgü keskinlik için ajanlara talimatlarında persona verin: 'sen bir GDPR avukatısın', 'sen bu mimarinin çöktüğünü görmüş bir SRE'sin'. Personalar, her saldırganın açısını yerleşik beş açının ötesine yönlendirir.

Kendi kendine saldıran tek bir modele kıyasla çoklu sağlayıcının kattığı değer

Kendi planına saldırması istenen tek bir model, kibar ve genel riskler ortaya koyma eğilimindedir. Rakip sağlayıcılardan gelen modeller — farklı verilerle eğitilmiş ve farklı hizalamaya sahip — gerçekten farklı açıklar bulur. Pratikte GPT + Claude + Grok saldırılarının birleşimi belirgin şekilde daha fazla alanı kapsar ve savunmacı hepsini tek bir belirsiz cevapla tatmin edemez.

Sık sorulan sorular

Kaç saldırgan kullanmalıyım?

Toplamda dört ila altı ajan en iyi sonucu verir: bir savunmacı artı 3-5 saldırgan, ideal olarak iki veya daha fazla sağlayıcıya yayılmış. Bunun ötesinde turlar uzar ama çok fazla yeni bulgu eklenmez.

Kendi saldırı açımı ekleyebilir miyim?

Evet — iki şekilde: bir ajana talimatlarında bir persona verin ('bir vergi denetçisi olarak saldır') veya uzman-müdahale alanıyla tartışmanın ortasında bir direktif ekleyin; bu direktife bir sonraki turda her ajan yanıt vermek zorundadır.

Hangi plan katmanına ihtiyacım var?

Dayanıklılık testi bir Pro özelliğidir ($20/ay). Her plan yerleşik modeller ve aylık kredi içerir, bu yüzden tam bir oturum genellikle aylık kredinizin yalnızca küçük bir kısmını kullanır; isteğe bağlı olarak kendi API anahtarlarınızı bağlayıp doğrudan sağlayıcıya ödeme yapabilirsiniz (0 kredi). PDF/DOCX dışa aktarma da yalnızca Pro'da bulunur.

Gerçeklik yapmadan önce planınıza saldırın

Ücretsiz plan · kendi API anahtarların · 15 dil

Birden fazla LLM ile bir plana nasıl red-team uygulanır (adım adım rehber) · LLM Debate Council