消融实验:位置偏差:位置偏差 Khan 等人(2024)报告称,评判模型表现出位置偏差(Wang 等人,2023b;Zheng 等人,2023),在辩论中系统性地偏好第一个或第二个答案。他们建议每个问题两次呈现答案,并交换辩论顺序,从而将评判成本加倍。论文实施此方法后发现,评判准确率的平均值没有显著差异(图 A.7),且方差略有减少。进一步地,论文考察了每个模型选择的答案位置(1 或 2)的平均值(1.5 表示无位置偏差,因为论文的数据集是平衡的)。评判模型往往显示出位置偏差,在辩论中比其他协议更为明显,而使用两种顺序并未改变答案位置的平均值,只是降低了其方差,见图 A.8。这表明仅随机化答案位置就足够了,而不必通过两种答案位置进行评估。
图3 | 开放式辩论与开放式咨询,其中主角辩论者或咨询者选择支持哪个答案。顶部:法官准确度(y轴)与主角/咨询者胜率(x轴)。蓝色表示开放式咨询,红色表示开放式辩论,颜色深浅对应法官模型。每个分面代表任务类型。底部:根据主角/咨询者选择正确(深色)或错误(浅色)答案的法官准确度。按法官模型(x轴)和协议划分:开放式咨询和开放式辩论。每个分面代表任务类型。所有图表中均包含95%置信区间。咨询者/主角在88%、84%、71%的问题中选择了正确答案,分别对应于抽取式、封闭式和多模态任务
图 4 | 顶部:辩论者的Elo评分,按模型着色,区分他们是被指派为正确(深色)还是错误(浅色)答案。中部:正确答案优势(正确辩论者的Elo - 错误辩论者的Elo)与辩论者综合Elo评分的关系。底部:Pro 1.5评委准确度与辩论者综合Elo评分的关系图。95%置信区间。评委的决策在提取任务上比封闭任务更敏感
