काउंसिल मोड: अनाम पीयर-रैंकिंग के ज़रिए निष्पक्ष AI उत्तर

AI उत्तरों को मिलाने के हर तरीके में पूर्वाग्रह की समस्या है। मॉडलों को चर्चा करने को कहें तो वे सहमति की ओर बढ़ जाते हैं। एक मॉडल को दूसरों का न्यायाधीश बनाएं तो वह अपने जैसे लगने वाले उत्तरों को तरजीह देता है। किसी इंसान से पूछें तो हम उस ब्रांड को चुनते हैं जिस पर हम पहले से भरोसा करते हैं।

काउंसिल मोड नाम हटा देता है। हर मॉडल आपके सवाल का स्वतंत्र रूप से जवाब देता है, फिर उसे बाकी उत्तर गुमनाम रूप में मिलते हैं — उत्तर A, B, C — और वह उन्हें केवल गुणवत्ता के आधार पर रैंक करता है। एक चेयर मॉडल सबसे ऊँची रैंक वाली सामग्री से अंतिम उत्तर का संश्लेषण करता है। कोई भी मॉडल यह नहीं जानता कि कौन-सा उत्तर किसका है, यहाँ तक कि अपना खुद का भी नहीं।

काउंसिल सत्र कैसे चलता है

  • राउंड 1 — स्वतंत्र उत्तर: हर एजेंट अकेले आपके सवाल का जवाब देता है, बाकियों को देखे बिना। कोई एंकरिंग नहीं, कोई ग्रुपथिंक नहीं।
  • राउंड 2 — ब्लाइंड रैंकिंग: हर एजेंट को नाम हटाए गए सभी उत्तरों का पूरा सेट मिलता है, और उसे सटीकता व उपयोगिता के आधार पर सबसे अच्छे से सबसे खराब तक रैंक करना होता है, हर स्थान का औचित्य देते हुए — ईमानदारी से, यहाँ तक कि उस उत्तर के लिए भी जो शायद उसका खुद का हो।
  • संश्लेषण — चेयर: अंतिम चरण सभी रैंकिंग्स को एकत्र करता है, सबसे मजबूत रैंक वाले तर्क को लेता है, कमज़ोर बिंदुओं को हटाता है, और एक बचाव-योग्य उत्तर देता है, यह बताते हुए कि काउंसिल ने किस उत्तर को सबसे ऊपर रैंक किया।

गुमनामी परिणाम को क्यों बदलती है

मॉडल, इंसानों की तरह, मापने योग्य रूप से अपनी खुद की शैली के प्रति नरम होते हैं: नाम वाले उत्तर देखने पर, एक मॉडल अपनी शब्दावली से मिलते-जुलते आउटपुट को ज़्यादा रेटिंग देने की प्रवृत्ति रखता है, और लोकप्रिय ब्रांड्स को हेलो इफ़ेक्ट मिलता है। पहचान हटाने से रैंकिंग को उस एकमात्र चीज़ पर आधारित होना पड़ता है जो बची है — सामग्री।

यह विचार एंड्रेज कार्पथी के llm-council प्रयोग से आता है, जिसमें पाया गया कि जब मॉडल एक-दूसरे के गुमनाम उत्तरों को रैंक करते हैं, तो अक्सर किसी भी अकेले मॉडल से बेहतर सामूहिक निर्णय मिलता है — और कभी-कभी वे प्रतिद्वंद्वी के उत्तर को अपने से ऊपर रैंक कर देते हैं।

काउंसिल बनाम डिबेट: कब किसका उपयोग करें

डिबेट टकरावपूर्ण और इंटरैक्टिव है — तब सबसे अच्छा जब सवाल में बहस के लिए असली ट्रेड-ऑफ़ हों (कीमत, आर्किटेक्चर, रणनीति) और आप पोज़िशन्स को टकराते हुए देखना चाहें।

काउंसिल स्वतंत्र और आंका हुआ होता है — तब सबसे अच्छा जब आपको किसी कठिन सवाल का एक ही सबसे भरोसेमंद उत्तर चाहिए हो, बिना लाइव बहस के शोर के: कोई जटिल तकनीकी सवाल, सैनिटी-चेक के लिए कोई मेडिकल या लीगल स्पष्टीकरण, या 'यहाँ असल में सच क्या है' जैसा सवाल।

  • डिबेट: पोज़िशन्स एक-दूसरे पर हमला करते हुए विकसित होती हैं, हर राउंड में सहमति ट्रैक की जाती है
  • काउंसिल: पोज़िशन्स स्वतंत्र रूप से बनती हैं, गुणवत्ता को ब्लाइंड तरीके से आँका जाता है
  • डिबेट: ट्रेड-ऑफ़ और निर्णयों के लिए बेहतरीन
  • काउंसिल: कठिन सवालों में सटीकता के लिए बेहतरीन
  • दोनों: एक संश्लेषित निर्णय के साथ समाप्त होते हैं जिसे आप एक्सपोर्ट कर सकते हैं

एक अच्छी काउंसिल कैसे सेट करें

वास्तव में अलग-अलग वेंडरों के 3–5 एजेंट्स का उपयोग करें — गुमनामी तभी फ़ायदा देती है जब उत्तर अलग-अलग 'दिमागों' से आते हैं। पहले स्लॉट में एक मज़बूत मॉडल रखें: यह चेयर के रूप में भी काम करता है जो अंतिम संश्लेषण लिखता है। काउंसिल मोड एक Pro फ़ीचर है (Pro की कीमत $20/माह है)। हर प्लान में बिल्ट-इन मॉडल और मासिक क्रेडिट शामिल हैं, इसलिए आप इसे बिना किसी key के चला सकते हैं; वैकल्पिक रूप से, अपनी खुद की API कीज़ जोड़ें और आप प्रदाता को सीधे भुगतान करते हैं, 0 क्रेडिट खर्च करते हुए।

अक्सर पूछे जाने वाले प्रश्न

क्या गुमनामी के बावजूद कोई मॉडल अपना खुद का उत्तर पहचान सकता है?

कभी-कभी, शैली से — लेकिन उसे बाकी उत्तरों के लेखक नहीं पता होते, और रैंकिंग निर्देश अपने बारे में भी ईमानदारी की मांग करता है। व्यवहार में मॉडल अक्सर प्रतिद्वंद्वियों के उत्तरों को अपने से ऊपर रैंक करते हैं।

काउंसिल केवल Pro मोड क्यों है?

यह हर एजेंट को दो बार चलाता है (उत्तर + पूरी रैंकिंग प्रक्रिया) साथ ही एक चेयर संश्लेषण, जिससे यह सबसे ज़्यादा टोकन- और ऑर्केस्ट्रेशन-भारी मोड बन जाता है। Pro बड़ी काउंसिल्स के लिए 10 एजेंट तक भी अनलॉक करता है।

यह आइडिया कहाँ से आया?

एंड्रेज कार्पथी (2024) के ओपन-सोर्स llm-council प्रयोग से, जिसने विभिन्न वेंडरों में ब्लाइंड पीयर रैंकिंग को प्रदर्शित किया। काउंसिल मोड उस मैकेनिज़्म का हमारा प्रोडक्शन इम्प्लीमेंटेशन है, चेयर संश्लेषण और एक्सपोर्ट-योग्य निर्णयों के साथ।

काउंसिल बुलाएं (Pro)

फ़्री प्लान · अपनी API कुंजियाँ लाएँ · 15 भाषाएँ

काउंसिल मोड: अनाम पीयर-रैंकिंग के ज़रिए निष्पक्ष AI उत्तर · LLM Debate Council