议题详情

进行中

从审美评论到可验证诊断

From Aesthetic Commentary to Verifiable Diagnosis: A Visual–Engineering Diagnostic Machine for Multimodal Models

多模态模型能不能说出「页面缺乏呼吸感」不是问题,它早就会说了。问题是它能不能指出具体在哪、给出视觉证据、追到 HTML/CSS 根因,并且让这套判断经受人类感知与独立回归的检验。

  • 多模态模型
  • 网页审美评价
  • HTML/CSS
  • 人类感知对齐
  • 盲评
  • HCI

只要一个邮箱。最主要的一类角色只需要你会看网页、有基本的视觉判断力,不必先读完下面的研究说明。

类型
科研议题
当前阶段
收敛验证协议已冻结,待执行 12 条模型观察
目标产出
一篇可发表的实证研究,以及一套可复用的网页诊断评测协议

更新于 2026 年 8 月 15 日 看研究进展与变更历史 ↓

本页目录

议题定位

本议题关注多模态大模型在网页生成、网页审美评价与网页代码修复中的能力边界。它不再问「模型能不能生成好看的网页」或「模型能不能评价网页好不好看」,而是往下追问一串更难的问题:

模型到底看到了什么?它能否具体定位问题?这些问题是否真实存在?人类是否能感知并认可这些判断?模型能否继续追溯到 HTML、CSS、资源或交互根因?修复之后,页面是否真的改善,而不是只在模型自己的评价里变好了?

研究的核心对象是一台位于网页生成之后的「诊断机」,它有九个环节:

网页生成 → 模型开放观察 → 页面证据定位 → 人类感知验证
→ 严重度判断 → 代码/设计根因 → 可执行修改 → 自动回归 → 独立人类后测

整个研究可以用一句话概括:不是让模型在生成前遵守更多审美规则,而是研究如何让模型在生成后更准确地发现问题、证明问题、解释问题并支持可靠修复。

四个核心假设

假设一 · 前置评价框架可能压缩生成空间

把五维评价框架、审美指标或过度具体的提示约束直接放进生成阶段,可能导致模型优先满足显式要求,注意力集中于规定维度,框架外的探索减少,页面结构或风格趋同。这目前是机制假设,不是已被严格证明的因果结论。

假设二 · 后置诊断比前置约束更适合连接生成与评价

要验证的是:开放生成 → 后置诊断 → 人类验证 → 修复反馈,这条链能否在不压缩生成开放性的前提下提高网页任务完成度。换句话说,评价框架更适合用于生成之后的比较、编码、诊断与反馈,而不是直接当作生成阶段的强制模板。

假设三 · 诊断颗粒度与人类感知对齐是两个不同的构念

诊断颗粒度人类感知对齐类型
空泛且缺乏真实依据
判断方向正确但不可行动
高分辨率伪诊断
可验证、可复核、可行动的有效诊断

右上角那一格是本研究最关心的风险:模型说得越细,不等于它看得越对。

假设四 · 低颗粒度输出可能包含表达瓶颈

不能直接断言「模型内部已有更精确的审美表征,只是没说出来」。更谨慎的问法是:模型的粗略表述从哪来?可能是视觉感知不足、页面证据定位不足、设计归因不足、访问 HTML/CSS 的能力不足,也可能是面向人类解释时主动压缩、模型认为用户只需要结论,或者输出任务本身诱导它使用抽象概念。后续将通过不同输出诱发条件做间接比较,而不是直接宣称模型内部状态。

当前进展

研究已经从一个单案例,发展为两个相互关联但不合并统计的证据侧:生成侧的约束条件实验,与评测侧的跨模型网页诊断实验。两侧纳入同一篇论文和同一研究框架,但研究问题与估计量各自独立。

展开:已完成的工作清单 — 评测侧探索性案例、收敛验证准备、生成侧实验

已完成

评测侧探索性案例:整理了一份 2013 年的原始材料与多个模型的网页重译结果;整理了几个主流模型的视觉评价与对话记录;完成模型审美判断、问题诊断、根因推理与修复建议的初步标注;补齐 24 条试标数据的对象字段;区分了模型评审原文与派生评估报告;建立了视觉发现、代码根因与修复回归的分层分析,以及自动回归、人类独立后测、盲化解盲与字段来源审计流程。

收敛验证准备:统一 Prompt、冻结 4 个候选网页、3 个评审模型 × 4 个候选网页共 12 条运行矩阵、运行记录与元数据模板、候选源文件核验、运行前预检——全部就绪。

生成侧实验:A/B 条件下 12 个页面已生成并统一渲染,5 项硬检查共 60 项中 59 项通过;C 类作为探索性条件登记。

还没做到的(照实说明)

收敛验证协议准备好了,但模型侧的 12 条原始观察尚未执行,打分也尚未开始。生成侧同样不能宣称「五维框架已经导致约束税」或「开放 Prompt 必然优于前置框架」——A/B 盲评结果尚未完全回收,C 类同时改变了多个提示与交付条件、元数据完整性不足。当前证据主要证明的是:生成与交付的检查链已经建立。

展开:初步观察 — 模型间的宏观判断与诊断路径差异、颗粒度局限、抽象概念的风险、与人类感知的不稳定对齐

初步观察

模型之间可能有相近的宏观审美判断,但诊断路径不同。不同模型可能都说页面模板化、缺乏品牌感、视觉平衡不足、缺乏作者性,但它们指出的位置、视觉证据、严重度、原因解释和修改策略并不一致。所以模型差异不只在结论上,也在于它关注什么、如何组织观察、能否定位证据、能否连到根因。

纯视觉评价的诊断颗粒度仍然有限。模型常常停在「宏观结果 → 抽象形容词 → 直接结论」,而没有走完「视觉现象 → 页面位置 → 结构证据 → 设计影响 → 代码根因 → 可执行修改」。「页面缺乏呼吸感」这个判断本身可能有方向性,但如果不说清哪个区域、是间距还是密度还是层级、有什么视觉证据、对理解或品牌感知有什么影响、应该怎么改,它就还不算可执行诊断。

模型倾向用抽象审美概念直接下判断——作者性、模板化、呼吸感、粗粝感、视觉张力、高级感、品牌感。这些词不一定错,但需要继续验证:人类能否稳定感知这个概念?人类是否认为这个差异重要?不同评审者能否指向相近的证据?该概念能否转化为工程修改?否则,多个模型共用同一个概念,并不代表它们形成了真实的视觉共识,也可能只是共享了相近的设计评论修辞。

模型判断与人类感知之间存在不稳定对齐。模型认为重要的问题人类未必认为同样严重;模型可能发现人类不易主动描述的细节;模型的自评、自修复、自解释不能替代独立的人类后测;局部目标改善不等于整体页面净收益;自动测量正确不等于协议测量对象正确。

因此研究目前不宣称「模型已具备稳定的人类等价审美能力」,而是更谨慎地认为:模型已经能产生一定程度的网页审美判断表述,但这些判断是否有真实感知基础、足够诊断颗粒度和稳定的人类价值对齐,仍需进一步验证。

展开:方法路径 — 生成侧约束条件实验、评测侧五个阶段、数据纪律

方法路径

生成侧:约束条件实验

研究问题是:生成阶段前置五维评价框架,是否会影响模型的生成开放性、页面差异性与任务完成度?条件为 A 类自然 brief 开放生成、B 类自然 brief 加五维框架(A/B 是主要对照),C 类是探索性的自由或改写条件,不是严格的单变量条件。

分析对象不只是「好不好看」,而是分层记录任务完成度、信息完整性、视觉差异性、结构趋同性、页面硬错误、响应式表现、交互与资源稳定性、以及人类盲评偏好。

评测侧:五个阶段

阶段 A · 开放式视觉问题发现。用不带评价框架的统一开放 Prompt 让模型自行观察,输出发现的问题、所属对象、页面位置、视觉证据、可能影响、严重度、置信度,以及是否需要代码进一步验证。关键在于不提前告诉模型该从哪些审美维度观察——否则测的就是模型对框架的遵循能力,而不是它自己的关注点。

阶段 B · 建立人类参考集。由人类评审者独立判断。参考集不被视为绝对真值,而是记录多数人能感知的问题、人类认为重要的问题、人类对严重度的判断、评审者之间的分歧,以及人类暂时无法确认的模型独有发现。

阶段 C · 诊断颗粒度编码。模型的每条诊断被拆成原子主张,逐项编码:是否有明确对象、是否有明确位置、是否描述可见现象、是否区分现象与影响、是否有证据支持、是否能定位代码或设计根因、是否能形成可执行修改。颗粒度不按输出字数衡量,而按诊断链的完成程度衡量。

阶段 D · 代码辅助根因分析。只有在视觉问题被识别之后才进入代码分析。模型可以查看 HTML、CSS、DOM 结构、资源文件、响应式规则、字体配置与交互状态。这一步的任务不是重新评价页面,而是判断:视觉问题是否存在对应的设计或代码根因。

阶段 E · 修复与回归。针对已确认的问题修复,然后依次做自动回归、统一渲染、独立人类后测、副作用记录与最终交付接受度判断。分析目标问题是否改善、是否产生副作用、整体页面是否变差、修复是否可接受、局部修复是否带来净收益。

数据纪律

每条模型诊断尽量拆成结构化字段(对象、视图、位置、视觉观察、审美解释、影响、严重度、证据、根因、行动性、人类确认、人类严重度、验证状态),并且必须标明每个字段的来源:模型原文、研究者预填、人类输入、盲评、解盲后派生、研究者裁决。四条底线:

模型自评 ≠ 人类独立后测
模型发现 ≠ 人类确认
预填字段 ≠ 最终裁决
局部修复 ≠ 整体质量改善

可以怎么参与

这个议题的参与门槛比多数 AI 研究低——最主要的一类角色只需要你会看网页、有基本的视觉判断力。

展开:五种参与形式分别做什么、适合谁
形式做什么适合的人
A · 网页视觉评审看网页或截图,判断是否存在问题、问题在哪、是否影响质量、严重度如何、哪个版本更好、是否愿意接受为最终交付设计师、产品与视觉设计师、用户体验研究者、前端开发者,以及有网页审美判断经验的人
B · 模型诊断文本标注读模型的评价或对话记录,标注诊断对象、页面位置、可见证据、抽象审美概念、现象与影响是否区分、有无根因推理、是否具行动性、是否可能是高分辨率伪诊断研究助理、设计研究者、HCI 研究者、前端开发者,以及有文本标注经验的人
C · 代码根因复核同时看页面渲染结果与 HTML/CSS,复核模型指出的代码问题是否真实存在、能否解释视觉现象、修改是否可执行前端工程师、网页开发者、熟悉 HTML/CSS 的设计工程师
D · 独立盲测评审在不知道模型来源、版本名称与修复方向的情况下做 A/B 比较,判断总体优劣、目标问题是否改善、有无副作用,以及自己的判断信心有网页阅读经验的普通用户、设计师、产品经理、独立外部评审者
E · 研究协议与数据治理整理实验材料、维护文件与版本、核查元数据、管理哈希、检查盲化状态、维护运行记录、记录实验异常研究助理、实验管理员、数据标注员,以及有基础脚本能力的人

现在最缺 A 与 D。下一步要执行 3 个模型 × 4 个候选网页的 12 条开放观察,这批数据出来之后立刻需要人类参考集与盲测评审——没有独立的人类判断,模型侧的观察就没有可对照的东西。

展开:参与前提 — 网页与视觉基础、基础实验方法、数据标注能力,以及不要求什么

参与前提

网页与视觉基础

需要理解网页基本结构、HTML 与 CSS 的关系、响应式布局、Flex / Grid 与容器宽度、字体字重行高字间距、色彩对比度与层级、视觉平衡密度留白对齐,以及基本交互状态。不要求能独立开发复杂网站,但需要能回答两个问题:这个现象发生在页面哪里?它可能由什么视觉或结构因素造成?

基础实验方法

需要理解实验条件与对照关系、单变量与多变量条件、盲化与解盲、原始数据与派生数据、预填字段与最终裁决、观察与解释与因果推断的区别,以及一条底线:不能把单个案例的观察直接写成普遍结论。

基础数据标注能力

需要能按字段逐条填写、保留原始文本、不擅自改写模型输出、区分模型陈述与自己的判断、给出证据位置、把「不确定」或「无法确认」明确标出,以及记录评审分歧而不是强行消除分歧。

不要求的

不要求模型训练经验、深度学习框架经验、大规模数据工程经验或高级数学统计背景。如果只承担人类视觉盲测,具备网页阅读能力与基本视觉判断力就够了;承担代码根因复核则需要额外的 HTML/CSS 基础。有帮助但非门槛的:HCI 与用户体验评价、设计研究方法、多模态模型原理、Prompt 设计、LLM-as-a-Judge、基础统计、Krippendorff's alpha、精确率与召回率、浏览器开发者工具、Python / JSON / CSV、Git。

展开:研究纪律 — 不把抽象词当证据、不把模型共识当人类真值、不用模型验证自己等四条

研究纪律

  • 不把抽象词汇直接当作证据。「缺乏呼吸感」「不够高级」「品牌感不足」可以作为模型原始表述保留,但标注时必须继续追问:具体表现在哪里?人类是否能看到?哪个元素或区域造成了这种感受?是否影响理解、浏览或品牌表达?能否转化为修改?
  • 不把模型共识当作人类真值。多个模型都说「模板化」,只能说明模型之间出现了相近的判断或修辞,不能证明人类也一定能感知、该判断一定真实、问题一定重要。
  • 不用模型自己验证自己。「模型发现问题 → 同一模型修复 → 同一模型评价修复成功」这条链不能单独作为结论,必须尽可能加入统一渲染、独立自动测量与独立人类后测。
  • 不擅自扩展研究维度。当前优先验证诊断颗粒度与人类感知对齐这两个构念,在它们尚未验证之前,不建议继续增加大量新的评价维度或模型条件。

怎么开始

如果你选 A 或 D,几乎可以立刻开始——拿到几个候选页面,按协议独立判断并记录,不需要任何前置搭建。如果你选 B 或 C,会先给你一份已完成的标注样例和字段说明,从复核一条已有诊断入手。研究框架、协议文档与实验材料会在联系后提供。

变更历史 CHANGELOG

研究走到哪一步了

按发生顺序从左往右。除最后一次更新(2026 年 8 月 15 日)外没有逐条日期:研究记录里只有阶段先后,不编日期。尚未执行的环节照实标成「待执行」,不并入已完成。

01 · 立题

从单案例扩成两个证据侧

由一个网页重译案例,发展为生成侧的约束条件实验与评测侧的跨模型诊断实验。两侧同框架、同论文,但研究问题与估计量各自独立,不合并统计

研究框架
02 · 评测侧

探索性案例完成

整理 2013 年原始材料与多模型重译结果、主流模型的评价与对话记录,完成审美判断、问题诊断、根因推理与修复建议的初步标注,并区分模型原文与派生报告。

探索性案例
03 · 生成侧

A/B 条件实验已生成并检查

A/B 条件下 12 个页面生成并统一渲染,5 项硬检查共 60 项中 59 项通过;C 类同时改了多个条件,只作为探索性条件登记。

60 项中 59 项通过
04 · 当前 · 2026-08-15

收敛验证协议已冻结

统一 Prompt、4 个候选网页、3 个评审模型 × 4 页共 12 条运行矩阵、运行记录与元数据模板、源文件核验与运行前预检,全部就绪。

协议已冻结
05 · 下一步

12 条模型开放观察

协议就绪但模型侧的原始观察尚未执行,打分也未开始。这是当前最直接的研究任务。

待执行
06 · 下一步

人类参考集与盲测评审

12 条观察出来后立刻需要人类参考集与独立盲测——没有独立的人类判断,模型侧的观察就没有可对照的东西。这也是现在最缺的两类角色(A 与 D)。

待招募

报名参与这个议题

没有账号?留下邮箱登记,我们会通过邮件与你对接;有账号建议用上方按钮站内报名,进度可跟踪。

看看其它议题

议题是壳中客所有项目与研究的起点,每条都指向一个明确的产出。

返回议题列表