← 返回项目CASE STUDY / 03

CASE / STRUCTURED CAPTION

结构化图像描述

将图像中的主体、细节、空间与风格拆为稳定字段,形成可学习的描述结构。内容为可编辑模板。

TYPE
图像识别 / Caption
PERIOD
周期待填写
YEAR
年份待填写
CAPTION ENGINE / 04

AUTO SCAN

IC-01
雨后车站:雨后的站台上,撑伞男子注视着从面前经过的银色列车。
SCENE / RELATION雨后车站
SUBJECT / 01

撑伞男子 · 通勤列车

DETAIL / 02

透明雨伞 · 黑色背包

RELATION / 03

列车经过男子前方

CAPTION STRUCTURE

雨后的站台上,撑伞男子注视着从面前经过的银色列车。

蓝调时刻 · 雨后反射

01 / CONTEXT

WHY STRUCTURED CAPTION

让每条描述,
都能回到画面证据。

项目面向图像描述类 SFT 数据生产。传统自由文本容易把可见事实、主观判断与风格词混在一起, 造成主体遗漏、空间关系漂移,以及描述结果无法回查。

因此,我将单张图像拆解为主体、属性、动作、关系、场景与风格六类字段, 要求每一项描述都绑定可指认的视觉证据,最后再合成为自然、稳定、可复用的 Caption。

DATA USE
多模态 SFT / 图像理解
CORE RISK
遗漏 · 幻觉 · 关系漂移
OUTPUT
可复核的结构化描述
CAPTION PIPELINE / 01

EVIDENCE LOCKED

INPUT / RAW IMAGE画面事实
RISK / FREE CAPTION描述不稳定
01

SUBJECT

主体
02

ATTRIBUTE

属性
03

ACTION

动作
04

RELATION

关系
05

SCENE

场景
06

STYLE

风格
STRUCTURED OUTPUT

VISIBLE FACTS

CHECKABLE FIELDS

NATURAL CAPTION
02 / CHALLENGE

把模糊感受,拆成可以共同判断的问题。

挑战待替换:描述细节遗漏、幻觉、风格词滥用或空间关系表达不稳定等问题。

03 / FRAMEWORK

EVIDENCE-FIRST WORKFLOW

从看见,
到写对。

不直接生成一句话,而是让观察、拆解、合成和核验四个阶段都留下可以回查的中间结果。

01

OBSERVE

建立画面事实

先确认画面中真实可见的主体、物体与事件,只记录证据,不提前推断动机或情绪。

INPUT

RAW IMAGE

OUTPUTEVIDENCE MAP
02

DECOMPOSE

拆解描述字段

按主体、属性、动作、关系、场景和风格六类字段组织信息,避免描述无序堆叠。

INPUT

EVIDENCE MAP

OUTPUTFIELD SET
03

COMPOSE

合成自然描述

遵循主体优先、先事实后修饰的语序,把离散字段合成为简洁、自然的 Caption。

INPUT

FIELD SET

OUTPUTDRAFT CAPTION
04

VERIFY

反向证据核验

逐短语回查画面,删除无法指认的信息,并复核关系、指代、完整性与语言表达。

INPUT

DRAFT CAPTION

OUTPUTCAPTION READY
GROUNDING PRINCIPLE只描述看得见的事实

VISIBLE

TRACEABLE

REUSABLE

04 / RULE SYSTEM

CHECKABLE RULES / ISSUE TAGS

规则与
问题标签

每条规则同时定义“什么是正确”和“错误如何记录”,让审核结论可以追踪、聚类并回流到下一版规范。

RULE REGISTRY / 06

EVIDENCE REQUIRED

TAG SET / V1.0
01

SUBJECT COVERAGE

主体完整

主要人物、物体和核心事件不得遗漏,主次对象必须清楚。

ISSUE TAGMISS_SUBJECT
02

ATTRIBUTE GROUNDING

属性准确

颜色、材质、数量和外观必须与画面证据保持一致。

ISSUE TAGATTR_ERROR
03

RELATION CLARITY

关系清晰

左右、前后、遮挡、动作和人物互动需要明确且无歧义。

ISSUE TAGRELATION_DRIFT
04

STYLE CONTROL

风格克制

只使用画面能够支持的光线、氛围与风格词,避免过度修饰。

ISSUE TAGSTYLE_OVERREACH
05

NO HALLUCINATION

禁止幻觉

不补充不可见的身份、意图、原因、品牌或画面外事件。

ISSUE TAGVISUAL_HALLUCINATION
06

LANGUAGE QUALITY

语言自然

表达简洁连贯,不重复堆词,不保留生硬的字段拼接痕迹。

ISSUE TAGLANGUAGE_REDUNDANCY
REVIEW LOGIC

看得见

说得准

能回查

NO SCORE / RULE-BASED
05 / EXECUTION

PRODUCTION LOOP / VERSIONED

从一张图,
走到一套规范。

执行不是一次性交付:样本经过证据标记、描述、复核和难例回流后,继续推动规则与版本迭代。

  1. 01

    SCHEMA

    定义字段与边界

    确定六类字段、写作顺序和不可推断内容。

    DELIVERABLEGUIDELINE V1
  2. 02

    EVIDENCE

    标记视觉证据

    定位主体、属性、动作与关系对应的画面区域。

    DELIVERABLEEVIDENCE MAP
  3. 03

    CAPTION

    合成自然描述

    依据字段结果生成事实优先、语序自然的 Caption。

    DELIVERABLEDRAFT CAPTION
  4. 04

    REVIEW

    双重规则复核

    执行字段完整性检查与逐短语反向证据核验。

    DELIVERABLEREVIEW LOG
  5. 05

    HARD CASE

    难例聚类回流

    将遮挡、反射、多主体等失败样本按标签归类。

    DELIVERABLEHARD CASE SET
  6. 06

    VERSION

    规范迭代归档

    更新规则、样例与标签定义,保留版本变更记录。

    DELIVERABLEGUIDELINE VNEXT
LOOP STATUS
01–04 / PRODUCTION
05 / FEEDBACK
06 / VERSIONING
TRACEABLE PIPELINE
06 / OUTCOME

METHOD ASSETS / CAPABILITY

结果不是一个数字,
而是一套可复用资产。

本案例不虚构数据规模与通过率,重点呈现已经建立的方法资产,以及它们如何支撑后续生产、复核与版本迭代。

ASSET REGISTRY / 03

METHOD READY

PUBLIC METRICS / PENDING
01

CAPTION SCHEMA

06FIELDS

结构化描述字段

主体、属性、动作、关系、场景与风格形成统一的信息骨架。

SCHEMA / READY
02

RULE REGISTRY

06RULES

规则与问题标签

每条规则绑定唯一问题标签,让错误能够被记录、聚类与回查。

TAG SET / V1.0
03

REVIEW LOOP

01LOOP

证据复核闭环

从画面证据到自然描述,再回到逐短语核验与难例回流。

TRACE / ENABLED
CAPABILITY MAP从方法到能力
  1. 01
    视觉信息抽取

    把复杂画面拆成可指认、可复核的事实节点。

  2. 02
    描述规范设计

    将离散字段组织成稳定且自然的语言表达。

  3. 03
    质量问题治理

    用规则、标签和难例库推动规范持续迭代。

PROJECT CONCLUSION

建立“事实抽取—字段组织—自然描述—证据复核—难例回流”的完整链路,使图像描述从一次性文本产出转变为可检查、可复用、可持续迭代的数据方法。

REUSABLE / TRACEABLE / VERSIONED
IMAGE CASES / 04

图片描述案例

STRUCTURED CAPTION / VISUAL EVIDENCE

IC-01

雨后车站

空间关系 / 场景描述

IC-02

桌面静物

物体属性 / 相对位置

IC-03

街头市场

多人关系 / 动作识别

IC-04

玻璃后的阅读者

反射识别 / 遮挡判断

IC-01 / ACTIVE CAPTION

雨后车站

CAPTION READY

雨后的车站站台上,一名撑透明雨伞的男子站在铁轨旁,银色列车从他面前经过,黑色背包放在他的右侧,左侧设有红色自动售货机。

主体 / SUBJECT
撑伞男子、银色列车、黑色背包、自动售货机
属性 / ATTRIBUTE
透明雨伞、银色车身、黑色背包、红色机身
动作 / ACTION
男子站立等候,列车正从站台前方经过
关系 / RELATION
背包位于男子右侧,售货机位于画面左侧,列车经过男子前方
场景 / SCENE
雨后车站站台,傍晚蓝调光线,地面留有积水反射
NEXT CASE / 04

角色对话盲测评估