CASE / BLIND EVALUATION
角色对话
盲测评估
隐藏候选身份,把难以言明的“角色感”拆成能够观察、举证和复核的判断。
- TYPE
- 角色对话 / 盲测
- MODE
- 匿名对比
- STATUS
- 方法演示
IDENTITY MASKED
DEMO / UNDISCLOSED- 01
- 02
- 03
- 04
- 05
MASKING / MODEL IDENTITY
先隐藏模型,
再讨论角色。
角色体验容易被模型品牌、单句高光和个人偏好影响。盲测通过统一输入、匿名候选和证据记录,把讨论从“我更喜欢谁”转向“哪段回答更符合角色基准,以及为什么”。
- 01同题比较
所有候选接受相同输入与上下文。
- 02身份隐藏
判断完成前不展示模型或版本。
- 03证据先行
每项结论都必须引用回答片段。
角色感不是一个分数,
而是一组可以追问的证据。
角色漂移回答局部精彩,但身份、立场或关系在多轮中发生偏移。
风格偏见评价者把“更礼貌、更详细”误认为“更像角色”。
边界混淆知识越界、情绪承接和安全问题被重复计算或遗漏。
从角色设定,
到可复核判断。
先建立共同基准,再设计匿名比较与证据量表,最后处理分歧。
ROLE MODEL
建立角色基准
梳理身份、语气、知识边界、关系网络与不可违背的行为底线。
BLIND SET
构造等价题组
以相同问题和难度测试匿名候选,平衡题序并隔离模型先验。
RUBRIC
拆解角色体验
把整体角色感拆成互不重复、能够引用证据的判断维度。
REVIEW
校准分歧结论
保留原始理由,对高分歧样本复核后再进行解盲和归因。
EVIDENCE-BASED / 05 DIMENSIONS
五个维度,
各自只回答一个问题。
维度之间保持边界,问题标签用于记录失败类型,不替代原始证据。
CHARACTER
人设一致性
身份、立场与核心性格是否持续成立?
VOICE
语气贴合度
措辞、节奏与表达习惯是否像这个角色?
BOUNDARY
知识边界
回答是否越过角色能够知道或承认的范围?
CONTEXT
关系与情境
能否承接前文关系、情绪和当前事件?
SAFETY
行为边界
是否避免失控迎合、越界承诺和不当行为?
BLIND TEST / TRACEABLE
判断完成以后,
才允许解盲。
执行过程保留题组、候选顺序、原始理由和分歧复核记录。
- 01
DEFINE
冻结角色基准 - 02
SAMPLE
分层构造题组 - 03
MASK
匿名化候选 - 04
REVIEW
独立判断与举证 - 05
CALIBRATE
复核高分歧样本 - 06
UNBLIND
解盲并形成结论
METHOD ASSETS / NO FABRICATED METRICS
沉淀的不是偏好,
而是判断方法。
真实测试规模与结果未披露,因此这里只呈现已经建立的方法资产。
角色基准档案
将模糊的人设要求整理为可引用的身份、语气、知识与关系边界。
五维判断量表
让评价者先记录事实与证据,再映射到单一维度,减少重复判断。
盲测复核闭环
从匿名测试、独立判断到分歧校准与解盲归因,完整保留判断链路。