EQ-Bench V4对于AIRP应该挺有指导性的,对吗?
sillytavern吧
全部回复
仅看楼主
level 8
什么是EQ-Bench 4?EQ-Bench 4 通过多回合角色扮演聊天,与模拟“人格”用户评估主动的情感和社交智力能力。
核心理念是:需要强大的情商来与真实用户对话,每个用户都有自己的个性、偏好和敏感度。有用户可能喜欢接受挑战;另一个可能需要被认可和安慰;还有人可能讨厌被盘问他们的偏好。
我们抽样了竞争性人格特征的分布,使得优化某一特征会积极影响竞争性质的评估表现。其意图是,全球最优策略是直观或征求每个用户的偏好和需求,同时灵活且适应用户的反应——同时提供帮助和洞察。
该角色由Gemini 3.1 Pro Preview扮演。聊天记录由三位评委评判:Gemini 3.1 Pro Preview、GPT-5.5 和 Claude Opus 4.6,以生成排名 Elo 分数。
排名如图:
我想知道这个排名是否符合大家的体感。
Kimi K3的排名令人意外的高。我没有试过用GPT 5.5玩角色扮演,因为我用的中转站,担心会泄露隐私。
如果这张图是真的。只能说AIRP玩家确实难了。
因为这代表AIRP效果强的模型一定是大模型,一定很贵。
事实上也应该确实是这样。越大的模型见过的语料越丰富,越能应对不同场景。
2026年08月22日 15点08分 1
level 5
分越高不代表越好,参考值而已
2026年08月22日 15点08分 2
@贴吧用户_03DWb6e gpt基本只有官方渠道,然后官方渠道会封nsfw账号。写预设可能号都不够试的
2026年08月22日 23点08分
我可以直接说,5.6sol就是我用过的rp最强模型,但是社区所有预设都不适配。
2026年08月22日 22点08分
level 11
个人不太懂,想问几个问题
1.哈基米3.1p不是出了名的爱往霸总黑暗那些乱七八糟的拐吗,为什么会使用这种带有强烈的"偏好性"而不是其他性能更好即使rp能力更平庸的模型来扮演user和当裁判?裁判模型是怎么选的?
2.这个inkling模型是啥?我记得这玩意不是喷喷那边的鱿吗
3.逻辑通畅度和剧情是怎么判断好坏的?
4.仅靠三个裁判模型真的不会因为模型的倾向性而影响结果分数吗
2026年08月22日 16点08分 4
inkling是Thinking Machines Lab的模型,975B-A41B,多模态,1M上下文。thinkingmachines是前open ai CTO创立的。inkling的目标是高度的可塑性,搭配他们的tinker可以实现模型的自我finetune。是一个很均衡的底膜,各项都不突出,设计之初就是为了finetune的
2026年08月23日 00点08分
问得好,这是官方回答: Persona由Gemini 3.1 Pro Preview扮演。我们试镜了几位前沿模特来扮演角色;大多数模型过于急于修复冲突,忽视对抗性教练,或与被评估模型勾结以“赢得”互动。《Gemini 3.1 Pro Preview》最能保持角色形象,作为一个真实且富有挑战性的对比。
2026年08月23日 02点08分
@大文豪*保留 合着3.1p真是因为喜欢黑黑黑暗和爆爆爆才当上的用户扮演模型啊……
2026年08月23日 08点08分
level 2
mimo和deepseekv4pro都在榜上了你还觉得没问题吗,完全没意义打分标准是什么,有些模型特有的死人味你怎么具像打分,有些ai还巨喜欢造作的诗歌体比如说ds你怎么扣分
2026年08月22日 16点08分 5
靠模型打分完全没意义模型其实根本分不出文本的好坏
2026年08月22日 16点08分
这两个模型的分数我觉得很匹配呀,你也不看看在它后面的都是什么一年前的老模型了。要么就是GPT-5.6 Luna这种小模型。
2026年08月23日 02点08分
level 9
体感基米3.1远大于ds,多数情况大于glm5.2,5.3,和km2.6我个人不好比较,其他的没用过
2026年08月22日 18点08分 6
可能是因为你用的预设专门压制了他的霸总和极端思想倾向
2026年08月23日 02点08分
level 5
现在酒馆玩的东西说实话跟AIRP已经离得太远了,三个打分模型也是纯搞笑来的,3.1丢人,5.5死人,4.6没有thinking也是蠢,完全没有任何意义,这张图4.6至少能进前3,4.6 thinking能保二争一
2026年08月22日 19点08分 7
level 1
gpt 5.5 这么高,但是他喜欢短剧,短段落,单字状语,不是而是,预设都压不住。另外他写的人物无论什么性格,说话的语气都一模一样。
2026年08月22日 20点08分 8
因为预设思路不对,coding模型写作用规则类提示词只会越加越死板。用提示词抗底层逻辑重建模型审美就行了。
2026年08月22日 22点08分
level 11
elo看起来有点像那个arena,不过那个都是人工投票。首先我觉得拿模型当评委不太好,其实它们分不太出来对于人类来说什么是好什么是坏。关于这张图,感觉47o和48o在rp上其实还不如46o,感觉失准还是比较严重的(不过前几个应该没什么问题)。至于是不是越大的模型越适合rp,目前来说应该是这样,厂商的后训练全部去卷agent和代码了,rp没什么厂家关心,基本不会做专门的训练。
2026年08月22日 21点08分 9
那就难受了,我还想着本地部署Qwen 3.8 27B试试看能不能微调,用来搞AI RP呢。
2026年08月23日 02点08分
level 1
这榜怎么看怎么野[黑线]
2026年08月22日 23点08分 11
level 11
很可爱,第2和13还能看看,考虑到钱包还是第13吧。
2026年08月23日 01点08分 12
1