议会模式:通过匿名同行排名获得无偏见的 AI 答案
任何组合 AI 答案的方式都存在偏见问题。让模型讨论,它们会趋向于达成一致。让一个模型评判其他模型,它会偏爱听起来像自己的答案。让人类来选,我们会挑选自己已经信任的品牌。
议会模式去掉了名称。每个模型独立回答你的问题,然后收到匿名化处理过的其他答案——答案 A、B、C——并纯粹根据质量进行排名。主席模型从排名最高的内容中综合出最终答案。没有任何模型知道哪个答案是谁的,包括它自己的答案。
一次议会会话如何进行
- 第一轮 — 独立作答:每个代理独自回答你的问题,看不到其他代理的答案。没有锚定效应,没有群体思维。
- 第二轮 — 盲评排名:每个代理拿到去除名称的完整答案集合,必须按正确性和实用性从最好到最差进行排名,并为每个位次给出理由——诚实地包括可能是自己的那一份。
- 综合 — 主席:最后一轮汇总所有排名,采纳排名最高的推理,剔除薄弱之处,给出一个站得住脚的答案,并说明议会将哪个答案排在最高位。
为什么匿名性会改变结果
模型和人一样,对自己的风格明显更宽容:在看到署名答案时,模型往往会给与自己措辞相似的输出更高的评分,热门品牌也会获得光环效应。剥离身份信息迫使排名只能依据唯一剩下的东西——内容本身。
这个想法源自 Andrej Karpathy 的 llm-council 实验,该实验发现,让模型对彼此的匿名答案进行排名,往往能产生比任何单一模型更好的集体判断——有时甚至会把对手的答案排在自己的之上。
议会模式 vs 辩论模式:何时使用哪种
辩论模式是对抗性和互动性的——最适合用于有真实取舍需要争论的问题(定价、架构、策略),你希望看到立场之间的碰撞。
议会模式是独立且被评判的——最适合当你希望在没有现场争论噪音的情况下,为一个难题获得单一、最可靠的答案:一个复杂的技术问题、需要理智核查的医疗或法律解释,或是一个'这里到底什么是真的'的问题。
- 辩论:立场通过相互攻击而演变,每轮都会追踪共识程度
- 议会:立场独立形成,质量以盲评方式判断
- 辩论:非常适合权衡取舍和决策
- 议会:非常适合难题的正确性判断
- 两者:都以一个可导出的综合裁决收尾
如何组建一个好的议会
使用来自真正不同厂商的 3–5 个代理——只有答案来自不同的'思维',匿名性才有意义。把一个强力模型放在第一位:它同时也会担任撰写最终综合答案的主席。议会模式是 Pro 功能(Pro 为每月 20 美元)。每种套餐都包含内置模型和每月额度,因此你无需任何密钥即可使用;你也可以选择接入自己的 API 密钥,这样直接向服务商付费,消耗 0 额度。
常见问题
尽管进行了匿名化处理,模型能否识别出自己的答案?
有时可以,凭借风格——但它不知道其他答案的作者是谁,排名指令要求即使涉及自己的答案也要诚实。实际上模型经常会把对手的答案排在自己的之上。
为什么议会模式仅限 Pro 用户使用?
它让每个代理运行两次(作答 + 完整排名流程),再加上主席的综合,这使它成为 Token 消耗和编排开销最大的模式。Pro 还解锁了最多 10 个代理,可组建更大规模的议会。
这个想法源自哪里?
源自 Andrej Karpathy(2024 年)的开源 llm-council 实验,该实验展示了跨厂商的盲评同行排名。议会模式是我们对这一机制的生产级实现,带有主席综合和可导出的裁决。
免费套餐 · 自带 API 密钥 · 15 种语言