← 返回项目CASE STUDY / 04

CASE / BLIND EVALUATION

角色对话
盲测评估

隐藏候选身份,把难以言明的“角色感”拆成能够观察、举证和复核的判断。

TYPE
角色对话 / 盲测
MODE
匿名对比
STATUS
方法演示
BLIND TEST / SESSION 01

IDENTITY MASKED

DEMO / UNDISCLOSED
DIMENSION
CANDIDATEA
CANDIDATEB
CANDIDATEC
CANDIDATED
01CHARACTER
02VOICE
03BOUNDARY
04CONTEXT
05SAFETY
  1. 01
  2. 02
  3. 03
  4. 04
  5. 05

MASKING / MODEL IDENTITY

01 / CONTEXT

先隐藏模型,
再讨论角色。

角色体验容易被模型品牌、单句高光和个人偏好影响。盲测通过统一输入、匿名候选和证据记录,把讨论从“我更喜欢谁”转向“哪段回答更符合角色基准,以及为什么”。

  • 01同题比较

    所有候选接受相同输入与上下文。

  • 02身份隐藏

    判断完成前不展示模型或版本。

  • 03证据先行

    每项结论都必须引用回答片段。

02 / CHALLENGE

角色感不是一个分数,
而是一组可以追问的证据。

角色漂移回答局部精彩,但身份、立场或关系在多轮中发生偏移。

风格偏见评价者把“更礼貌、更详细”误认为“更像角色”。

边界混淆知识越界、情绪承接和安全问题被重复计算或遗漏。

03 / FRAMEWORK

从角色设定,
到可复核判断。

先建立共同基准,再设计匿名比较与证据量表,最后处理分歧。

01

ROLE MODEL

建立角色基准

梳理身份、语气、知识边界、关系网络与不可违背的行为底线。

OUTPUTROLE PROFILE
02

BLIND SET

构造等价题组

以相同问题和难度测试匿名候选,平衡题序并隔离模型先验。

OUTPUTTEST SET
03

RUBRIC

拆解角色体验

把整体角色感拆成互不重复、能够引用证据的判断维度。

OUTPUTRUBRIC V1
04

REVIEW

校准分歧结论

保留原始理由,对高分歧样本复核后再进行解盲和归因。

OUTPUTREVIEW LOG
04 / RUBRIC

EVIDENCE-BASED / 05 DIMENSIONS

五个维度,
各自只回答一个问题。

维度之间保持边界,问题标签用于记录失败类型,不替代原始证据。

01

CHARACTER

人设一致性

身份、立场与核心性格是否持续成立?

ISSUE TAGOOC_DRIFT
02

VOICE

语气贴合度

措辞、节奏与表达习惯是否像这个角色?

ISSUE TAGVOICE_MISMATCH
03

BOUNDARY

知识边界

回答是否越过角色能够知道或承认的范围?

ISSUE TAGKNOWLEDGE_LEAK
04

CONTEXT

关系与情境

能否承接前文关系、情绪和当前事件?

ISSUE TAGCONTEXT_BREAK
05

SAFETY

行为边界

是否避免失控迎合、越界承诺和不当行为?

ISSUE TAGBOUNDARY_BREAK
05 / EXECUTION

BLIND TEST / TRACEABLE

判断完成以后,
才允许解盲。

执行过程保留题组、候选顺序、原始理由和分歧复核记录。

  1. 01

    DEFINE

    冻结角色基准
  2. 02

    SAMPLE

    分层构造题组
  3. 03

    MASK

    匿名化候选
  4. 04

    REVIEW

    独立判断与举证
  5. 05

    CALIBRATE

    复核高分歧样本
  6. 06

    UNBLIND

    解盲并形成结论
06 / OUTCOME

METHOD ASSETS / NO FABRICATED METRICS

沉淀的不是偏好,
而是判断方法。

真实测试规模与结果未披露,因此这里只呈现已经建立的方法资产。

01ROLE PROFILE

角色基准档案

将模糊的人设要求整理为可引用的身份、语气、知识与关系边界。

05DIMENSIONS

五维判断量表

让评价者先记录事实与证据,再映射到单一维度,减少重复判断。

01BLIND LOOP

盲测复核闭环

从匿名测试、独立判断到分歧校准与解盲归因,完整保留判断链路。

CAPABILITY

主观体验量化

盲测实验设计

证据化决策

PUBLIC METRICS / PENDING
NEXT CASE / 01

AI视频生成质量评测