多智能体协同学习(Cooperative Learning)的一种常见形式是“评审机制”,其流程通常是:
一个 Agent 生成答案,另一个 Agent 负责检查并提出修改建议,循环迭代
所有 Agent 同时生成答案,最后随机抽取一个
让 Agent 之间互相攻击,直到模型崩溃
Agent 不需要互相学习,只需各自完成任务