AI 是养出来的:从 Eval First 谈领域经验
前段时间我一直在折腾创意可视化。试过不同模型,也写过一些 Skill,效果总差点意思。模型不是做不出来,而是做出来的东西经常“没毛病,但也没什么意思”:页面能跑,图也完整,细节处理得挺认真,可你看完还是会觉得,这不就是换了一种画法吗?
前两天换成自己写的 Eval First 再试,结果反而明显好了不少。这只是我自己的使用感受,没做对照。
Eval First 主要做需求澄清和验收设计,里面没有直接教 AI 怎么画出惊艳的图,为什么反而改善了创作效果?正好那几天看到一句话:“AI 是养出来的。”和我做可视化 Agent、写 Skill 的感受很接近。
先把什么叫好说清楚
到了判断结果好不好的阶段,AI 的注意力经常落在图形有没有重叠、摆放是否整齐这些基础问题上。检查做了不少,最后还是没回答这张图有没有创意。
重叠和对齐当然要处理,但这些检查只能说明一部分基础质量。一个常规图表即使每处间距都调整好了,也不代表它满足了创意要求。任务推进到后面,很容易一直修细节,却没有再审视最初的设计是否值得保留。
我猜模型在创意类、不确定性比较强的任务上,更容易沿用训练里常见的表达方式。只要求它自由发挥,未必足以让它探索新的设计。这个成因还没有验证,但输出和评审偏向常规做法、偏向基础细节,是我确实遇到的问题。
Eval First 开始时要求回答一个问题:怎样才能证明用户想要的结果已经实现,或者质量已经好到可以停止?
“生成一些新颖的可视化”听起来很清楚,真做起来解释空间很大。换配色算不算新颖?换一组数据算不算?同一种图换十个名字,能不能算十个组件?这些问题不处理,AI 即使完成了生成任务,也可能离我想要的效果很远。它交出了可运行的页面,我要的是有实质区别、值得使用的设计。
Eval First 会把这种期待转成具体标准。比如同一份数据下,图形的编码、布局或者交互机制要有实质差异;只改名、换色不能计数;形式上的区别还要能解释数据含义。对于美观和新颖这类没法直接用程序证明的目标,它要求寻找参考、比较实际成品,或者保留人的判断。
这里还有一个配套要求:不要过度规定实现步骤。先明确结果和限制,再让执行者决定局部做法,体验相关的规则也明确保留了布局和表达上的自由。只说“自由发挥”,很难保证结果符合期待;把图型、布局和装饰全部指定,又会把探索范围限制得太小。要把什么叫“好”说清楚,但不要顺手把“应该怎么做”也规定死。 明确什么结果不能接受,留下足够的实现空间,才有机会做出更有意思的东西。
第一性原理和对抗式审查
这次还有一个改动,我觉得对创意效果影响更大:我让 Eval First 融合了之前另一个 Skill 的内容,其中有两点,第一性原理分析和对抗式审查。
用第一性原理分析,要先回到任务本身,把目标、事实和未经确认的假设分开。放在创意可视化里,就要重新判断读者需要理解什么关系,以及我们所说的创意具体体现在哪里。不能因为某种图型常见,就默认沿用它;也不能因为换了外观,就直接认为它有创意。要判断的是它有没有提供不同的观察角度,或者用一种有意义的编码和交互,表达出原来不容易看清的关系。这样设计和评审才会继续围绕创意,不至于全部落到排版细节上。
对抗式审查要求站到反方,主动找当前判断不成立的地方。假如把颜色和标题换回普通样式,这个方案还剩下什么新意?看起来不同的几种图,是否仍然只在重复同一种表达?评审时要允许这些问题推翻已经做出来的方案。
验收标准本身也在审查范围里。有没有一种看似合理的结果,能通过所有测试,却仍然没有达到用户目标?如果一张毫无新意、但没有重叠且排列整齐的图能通过全部检查,就说明验收没有覆盖创意要求。
这次讨论中查看的一份金融可视化组件库验收记录,就是这样的例子。任务允许把分析方法与视觉机制的实质组合计为不同组件。首轮用整个 SVG 的差异作为证据,独立 AI 审查发现,固定示意图增加了差异,但主要数据图形实际只有 840 种几何。原来的证据被撤回,后续改成真实数据驱动的对照结构,并补充了输入变化检查。最终记录仍然区分 40 种基本视觉机制与 1000 个组合组件。评估不是在任务最后盖章,它会反过来改变实现结构;至于修订后的图是不是更美、是不是原创,还需要另外判断。
执行阶段也有类似的安排:评审者尽量看原始目标和实际成品,少受作者解释的影响;指出最大的剩余差距,修订后再看。循环要有预算和停止条件,不能无限打磨。功能完成与质量达标,在这里是分开处理的。
效果变好可能来自两个地方:第一稿的方向更准,或者第一稿的问题被发现后,没有直接作为最终结果交付。哪一部分贡献更大,现在还不知道。
我的判断是,第一性原理分析帮助重新找准需要解决的问题,对抗式审查帮助发现方案和标准里的漏洞,这两项机制会让模型更持续地关注创意。但它们仍然需要具体的比较依据,不能仅凭“已经分析和批判过”,就认定作品有创意。
流程下面还有领域经验
我原本以为起作用的是流程本身,不过后来想到,我之前还构建了一层领域子 Skill,当前一共 8 个。
| 子 Skill | 主要负责什么 |
|---|---|
| eval-software | 软件行为、状态、生命周期和集成 |
| eval-data | 数据含义、转换、口径和完整性 |
| eval-runtime | 性能、资源、可靠性与恢复 |
| eval-ai | AI 输出、检索、工具行为与随机性 |
| eval-experience | 阅读理解、整体构图、交互与体验 |
| eval-media | 动画时间线、音画同步和导出 |
| eval-discovery | 研究假设、实验与决策价值 |
| eval-dataviz | 视觉编码、尺度、图例、布局和联动 |
它们按需加载。主 Skill 选择主要领域,再补充确实有不同关注点的领域,最后合并成一套验收标准。这 8 个子 Skill 不意味着每次启动 8 个独立 Agent。
通用流程负责告诉 AI 要先定义验收、要分析、要质疑;领域经验负责告诉它到底应该问什么。 如果只有流程,AI 很容易写出“美观 8 分、清晰 8 分、创新 8 分”这样的标准,看起来有评估,实际上很难指导设计。
eval-dataviz 提供的问题就具体得多:读者要理解的是比较、分布、层级还是变化,位置、长度、面积和颜色各自表示什么,缺失与零是否区分。再往下还有图例顺序改变后数据标记是否还对应,选中的对象在另一个视图不存在时联动怎么处理。
这些很像有经验的人看方案时会追问的问题。它们发生在生成之前,所以也会参与构思。
以收益可视化为例。如果只要求好看,探索就会集中在字体、配色和动画上;如果先讨论需要表达什么,就会进一步考虑相对基准、累计路径、回撤区间或者正负状态切换,然后再决定怎样画。这给结构变化提供了更具体的方向。
eval-experience 则从整页看作品:图本身画完整了,标题、图例、控件放在一起之后还能不能读懂,为了避让标签有没有改变数据点的位置含义,改局部的时候已经接受的部分有没有被破坏。
一个新颖的设计,经常还有这些细节要处理。图形表达正确、整页容易阅读、交互能正常使用,最后才会形成“这个东西做得不错”的整体感受。其中有一部分,可能是原本有潜力的想法被更完整地实现了。
领域子 Skill 对数据正确性、可读性和交互完整性的作用比较直接。它们也可能帮助产生有意义的设计变化,但单靠这些文件,还不能保证审美惊喜或者原创突破。
经验怎样进入下一次任务
被逐渐完善的是围绕模型建立的一套系统:它可以读取的领域知识、做事的方法、判断好坏的标准,都在随着使用发生变化。写入 Skill 不会直接更新模型参数,但这些内容被后续任务读取时,会影响它的方案和判断。
领域经验也不全是从当前项目里来的。看一张好的图,读一篇文章,学一种分析方法,处理一次失败,都会改变我们判断问题的方式。过去这些理解主要留在自己脑子里,现在可以进一步整理成 AI 能使用的规则和例子。
比如,起初看一张图,只会评价配色和动画;经验多起来之后,会去看图型虽然变了,表达的关系有没有变化;再进一步,就能提出一个检查方法:
固定输入,去掉颜色和文字,看看结构差异是否仍然存在,再判断这种差异有没有帮助理解数据。
把这样的判断写进 Skill,下一次任务就有机会提前处理这个问题,不用总等作品生成之后,再重新指出一遍。
我现在更看重这类沉淀。它应该说清楚什么时候使用、怎样判断、什么结果可能出错。遇到没法用规则说明的审美偏好,也可以保留正反例,帮助后续比较。
但这里有个容易走偏的地方:把看过的内容不断加进去,并不保证 Agent 越来越好。
假设看到一张装饰丰富的数据海报,就记下一条“好的可视化必须有纹理和结构装饰”。这条经验适合某类海报,放到要求快速比较数据的分析页面上,就会增加干扰。系统越来越遵守规则,结果反而离任务更远。
一次成功只提供了线索,还需要确认适用范围。新规则要看看能不能在其他任务里继续起作用,旧规则也要允许修改和删除。如果只添加、不纠错,留下来的就会包含偏见和已经失效的做法。
“养”还包含维护这些经验:哪些该进入长期规则,哪些只是暂时的猜测,哪些只适用于某种场景,都要区分。Eval First 要求领域默认经验不能自动变成用户需求,也要求用反例检查标准,这些规定同样适用于它自己的改进。
对于我正在做的可视化 Agent,专业判断和个人质量要求占了很大一部分,领域经验尤其值得积累。简单任务未必需要这么多准备,模型、工具和执行预算也仍然影响结果。
以前自己的学习和判断,大部分只能作用在“下一次我亲自做的时候”。现在它们有机会被整理出来,继续作用在下一次 AI 任务里。后面想一个个拆开试:只加领域子 Skill、只加第一性原理分析、只加对抗式审查,分别看变化出在哪一步;除了最终作品,也把验收标准和第一稿留着,看差距最早出现在哪里。