视觉评审闭环(Design Critique)
触发
每次出图后、交付前必跑;修改后再跑一轮(复评)。
评分卡(0-10)
composition / typography / color / material_quality / brand_fit / overall
门槛:中位数 overall ≥ 8 可交付;6-7 修改;<6 重做。红线项(事实错误/未授权素材/缺 AI 标识/极限词)一票否决,无论分数。
方法
- 多样本:
visualread.critique传samples: 2(重要物料 3),取median_overall;单次评分不可作为结论(实测同一张图波动 ±1 分); 1.1 模拟人工评审团(没有专职设计师时的终审替代):传personas: ["art_director","client","mobile_user"],一次得到三视角评分:art_director:构图/层级/字体/色彩/素材质感;client:3 秒看懂卖点、记住品牌、产生到店/咨询冲动;mobile_user:手机缩略图可读性与停留意愿。 通过线:三者overall均 ≥7 且client ≥8;任一 <6 直接重做。三视角冲突时(如艺术指导嫌促销、客户嫌不够醒目)以 brief 的调性为准并记录裁决理由。 1.2 锦标赛模式(省时高质量):同一 brief 并行出 3 个候选(不同素材/构图),评审团一次打分,选最高分进入修改;比"单版本串行改 6 轮"更快,且能跳出局部最优。
- 只改 top3:每轮从
fixes里选影响最大的 3 条执行,避免一版全推翻导致风格断裂; - 复评:修改后重跑;收敛判据 = 连续两轮中位数提升 < 0.5 且无红线项,即可定稿(不必强求 8 分——模型评审偏严,人工终审有最终裁定权); 3.1 轮次预算:最多 3 轮(锦标赛 1 轮 + 修改 2 轮);超过则必须换素材或换方向,而不是继续微调;
- 留证:每轮评审 JSON(分数/问题/修改)随成品入一客一档,便于复盘与训练偏好。
输出契约
- 评审记录:
{model, samples, median_overall, critiques[], round, fixes_applied[]}; - 交付必须附:成品 + recipe + 工程 + sha256 回执 + 评审记录 + 人工终审结论。
边界
- 评审模型是"第二双眼睛",不替代人工品牌/事实终审;
- 不为了刷分堆装饰元素;分数提升必须来自构图/层级/素材质量的实际改善。
工艺判据(条件 → 做法 → 判据 → 来源)
| 条件 | 做法 | 判据 | 来源 |
|---|---|---|---|
| 每次出图后、交付前 | 跑评分卡(composition/typography/color/material_quality/brand_fit/overall) | median_overall ≥8 可交付;6–7 修改;<6 重做 | KB:本套件 §评分卡 |
| 重要物料 | samples 提到 3(常规 2)取中位数 | 单次评分不得作为结论(同图波动 ±1) | KB:本套件 §方法 1 |
| 无专职设计师终审 | 模拟评审团 personas: [art_director, client, mobile_user] | 三者 ≥7 且 client ≥8;任一 <6 直接重做 | KB:本套件 §方法 1.1 |
| 想省轮次 | 锦标赛:并行 3 候选、一次评审选最高 | 比单版本串行改 6 轮更快且跳出局部最优 | KB:本套件 §方法 1.2 |
| 修改策略 | 每轮只改 fixes 里影响最大的 top3 | 一版全推翻 → 风格断裂判不合格 | KB:本套件 §方法 2 |
| 收敛判据 | 连续两轮中位数提升 <0.5 且无红线项 | 即可定稿(不必强求 8 分) | KB:本套件 §方法 3 |
| 轮次预算 | 最多 3 轮(锦标赛 1 + 修改 2) | 超过则必须换素材或换方向 | KB:本套件 §方法 3.1 |
| 红线项 | 事实错误/未授权素材/缺 AI 标识/极限词 | 一票否决,无论分数 | KB:本套件 §评分卡 |
参数边界
- 交付门槛:中位数
overall ≥8;6–7 分必须修改;<6 分重做(不允许"带病交付")。 - 评审团门槛:三视角均 ≥7 且
client ≥8;任一 <6 直接重做。 - 样本数:常规
samples=2,重要物料samples=3;单样本评分不得作为结论。 - 每轮只改 top3;轮次上限 3 轮,超限换素材/换方向。
- 红线项一票否决,且不得用高分掩盖。
失败模式(症状 → 检测器 → 处置)
| 症状 | 检测器 | 处置 |
|---|---|---|
| 拿单次评分当结论 | samples 与 median_overall 检查 | 补样本取中位数后重判 |
| 分数上去了但画面更花 | 评审 fixes 与改动对照(是否堆装饰) | 回退装饰性改动,只保留构图/层级/素材质量改善 |
| 一版全推翻导致风格断裂 | 每轮改动范围检查(是否只改 top3) | 恢复风格基线,按 top3 重做 |
| 反复微调不收敛 | 轮次计数与收敛判据(<0.5 提升) | 停止微调,换素材或换方向 |
| 红线项出现但总分高 | 红线项检查(事实/授权/AI 标识/极限词) | 一票否决:先修红线再谈分数 |
| 三视角冲突未记录 | 裁决记录检查 | 以 brief 调性为准裁决并留痕 |