level 8
大文豪*保留
楼主
什么是EQ-Bench 4?EQ-Bench 4 通过多回合角色扮演聊天,与模拟“人格”用户评估主动的情感和社交智力能力。
核心理念是:需要强大的情商来与真实用户对话,每个用户都有自己的个性、偏好和敏感度。有用户可能喜欢接受挑战;另一个可能需要被认可和安慰;还有人可能讨厌被盘问他们的偏好。
我们抽样了竞争性人格特征的分布,使得优化某一特征会积极影响竞争性质的评估表现。其意图是,全球最优策略是直观或征求每个用户的偏好和需求,同时灵活且适应用户的反应——同时提供帮助和洞察。
该角色由Gemini 3.1 Pro Preview扮演。聊天记录由三位评委评判:Gemini 3.1 Pro Preview、GPT-5.5 和 Claude Opus 4.6,以生成排名 Elo 分数。
排名如图:

我想知道这个排名是否符合大家的体感。
Kimi K3的排名令人意外的高。我没有试过用GPT 5.5玩角色扮演,因为我用的中转站,担心会泄露隐私。
如果这张图是真的。只能说AIRP玩家确实难了。
因为这代表AIRP效果强的模型一定是大模型,一定很贵。
事实上也应该确实是这样。越大的模型见过的语料越丰富,越能应对不同场景。
2026年08月22日 15点08分
1
核心理念是:需要强大的情商来与真实用户对话,每个用户都有自己的个性、偏好和敏感度。有用户可能喜欢接受挑战;另一个可能需要被认可和安慰;还有人可能讨厌被盘问他们的偏好。
我们抽样了竞争性人格特征的分布,使得优化某一特征会积极影响竞争性质的评估表现。其意图是,全球最优策略是直观或征求每个用户的偏好和需求,同时灵活且适应用户的反应——同时提供帮助和洞察。
该角色由Gemini 3.1 Pro Preview扮演。聊天记录由三位评委评判:Gemini 3.1 Pro Preview、GPT-5.5 和 Claude Opus 4.6,以生成排名 Elo 分数。
排名如图:

我想知道这个排名是否符合大家的体感。Kimi K3的排名令人意外的高。我没有试过用GPT 5.5玩角色扮演,因为我用的中转站,担心会泄露隐私。
如果这张图是真的。只能说AIRP玩家确实难了。
因为这代表AIRP效果强的模型一定是大模型,一定很贵。
事实上也应该确实是这样。越大的模型见过的语料越丰富,越能应对不同场景。
