Mode Council: jawaban AI tanpa bias melalui peringkat sejawat anonim
Setiap cara menggabungkan jawaban AI memiliki masalah bias. Minta model untuk berdiskusi, dan mereka akan condong menuju kesepakatan. Minta satu model untuk menilai yang lain, dan ia akan menyukai jawaban yang terdengar seperti dirinya sendiri. Tanya seorang manusia, dan kita akan memilih merek yang sudah kita percaya.
Mode Council menghilangkan nama-nama. Setiap model menjawab pertanyaan Anda secara independen, lalu menerima jawaban lain yang telah dianonimkan — Jawaban A, B, C — dan memberi peringkat semata-mata berdasarkan kualitas. Model ketua mensintesis jawaban akhir dari materi berperingkat tertinggi. Tidak ada model yang tahu jawaban mana milik siapa, termasuk miliknya sendiri.
Bagaimana sesi Council berjalan
- Ronde 1 — Jawaban independen: setiap agen menjawab pertanyaan Anda sendirian, tanpa melihat yang lain. Tidak ada anchoring, tidak ada groupthink.
- Ronde 2 — Peringkat buta: setiap agen menerima kumpulan lengkap jawaban dengan nama yang dihapus, dan harus memberi peringkat dari yang terbaik hingga terburuk berdasarkan kebenaran dan kegunaan, membenarkan setiap penempatan — dengan jujur, termasuk yang mungkin merupakan jawabannya sendiri.
- Sintesis — Sang Ketua: putaran terakhir mengagregasi peringkat, mengambil penalaran dengan peringkat terkuat, membuang poin-poin lemah, dan menghasilkan satu jawaban yang dapat dipertahankan, mencatat jawaban mana yang diberi peringkat tertinggi oleh council.
Mengapa anonimitas mengubah hasil
Model, seperti halnya manusia, secara terukur lebih lunak terhadap gaya mereka sendiri: ketika ditunjukkan jawaban berlabel, sebuah model cenderung memberi nilai berlebih pada keluaran yang menyerupai gaya bahasanya sendiri, dan merek populer mendapatkan efek halo. Menghilangkan identitas memaksa peringkat untuk hanya bergantung pada satu-satunya hal yang tersisa — kontennya.
Ide ini berasal dari eksperimen llm-council milik Andrej Karpathy, yang menemukan bahwa model yang memberi peringkat pada jawaban anonim satu sama lain sering kali menghasilkan putusan kolektif yang lebih baik daripada model mana pun secara individu — dan terkadang memberi peringkat jawaban pesaing lebih tinggi daripada jawabannya sendiri.
Council vs Debate: kapan menggunakan yang mana
Debate bersifat adversarial dan interaktif — paling cocok saat pertanyaan memiliki trade-off nyata untuk didiskusikan (harga, arsitektur, strategi) dan Anda ingin melihat posisi-posisi saling berbenturan.
Council bersifat independen dan dinilai — paling cocok saat Anda menginginkan satu jawaban paling andal untuk pertanyaan sulit tanpa kebisingan dari perdebatan langsung: pertanyaan teknis yang kompleks, penjelasan medis atau hukum untuk diperiksa kewajarannya, pertanyaan 'apa yang sebenarnya benar di sini'.
- Debate: posisi berkembang dengan saling menyerang, kesepakatan dilacak per ronde
- Council: posisi terbentuk secara independen, kualitas dinilai secara buta
- Debate: sangat baik untuk trade-off dan keputusan
- Council: sangat baik untuk kebenaran pada pertanyaan sulit
- Keduanya: berakhir dengan satu putusan tersintesis yang dapat Anda ekspor
Menyiapkan council yang baik
Gunakan 3–5 agen dari vendor yang benar-benar berbeda — anonimitas hanya memberi manfaat ketika jawaban berasal dari 'pikiran' yang berbeda. Tempatkan model yang kuat di slot pertama: model ini juga berperan sebagai ketua yang menulis sintesis akhir. Mode Council adalah fitur Pro (Pro seharga $20/bulan). Setiap paket sudah mencakup model bawaan dan kredit bulanan, jadi Anda bisa menjalankannya tanpa kunci apa pun; secara opsional, pasang kunci API Anda sendiri dan Anda membayar langsung ke penyedia, menghabiskan 0 kredit.
Pertanyaan umum
Bisakah sebuah model mengenali jawabannya sendiri meskipun telah dianonimkan?
Terkadang, melalui gaya bahasa — tetapi ia tidak mengetahui penulis jawaban lainnya, dan instruksi peringkat menuntut kejujuran bahkan terhadap jawabannya sendiri. Dalam praktiknya, model secara rutin memberi peringkat jawaban pesaing lebih tinggi daripada jawabannya sendiri.
Mengapa Council menjadi mode khusus Pro?
Mode ini menjalankan setiap agen dua kali (jawaban + putaran peringkat penuh) ditambah sintesis ketua, menjadikannya mode yang paling banyak menggunakan token dan orkestrasi. Pro juga membuka hingga 10 agen untuk council yang lebih besar.
Dari mana asal ide ini?
Dari eksperimen open-source llm-council oleh Andrej Karpathy (2024), yang mendemonstrasikan peringkat sejawat buta lintas vendor. Mode Council adalah implementasi produksi kami dari mekanisme tersebut, dengan sintesis ketua dan putusan yang dapat diekspor.
Paket gratis · pakai kunci API sendiri · 15 bahasa