我的图片文件夹里躺着一个这样的提示词:
cinematic portrait, 85mm, (rim light:1.3), deep shadows, masterpiece, best quality, 8k, ultra detailed, trending on ArtStation --ar 2:3 --stylize 400 --no watermark
它管用。管用到如此可靠,以至于我不再读它,转而开始复制它——一个夜景版、一个特写版、一个给深色头发主体用的版本,因为那个权重和光线作用的方式不一样。然后我把同一串字符指向一个更新的模型,拿回来的却是油光水滑、过曝、隐隐透着塑料感的东西:一张我那个想法的图库照片。那个提示词早就不再描述一幅画面了。在它生命的大部分时间里,它一直在跟一组模型早已不再有的习惯较劲。
这种事我见过太多次了——图像、视频、文本都一样——所以我可以直说不中听的那个版本。互联网上所谓的提示词工程,大多数其实是方言。方言不属于你。你不拥有语法,你不决定它的汇率,而你的库究竟由什么构成,会在厂商发布新版本的那一刻揭晓。
你拥有的每一个提示词,都是两个提示词叠在一起
从你的库里随便拿一个提示词,把它劈开。你会发现一行里缠着一段描述和一种方言。
| 那串字符 | 底下的意图 |
|---|---|
(rim light:1.3) |
从背后给主体打光 |
masterpiece, best quality, 8k, ultra detailed |
别让它显得廉价 |
--stylize 400 --ar 2:3 |
允许它自由发挥;竖幅裁切 |
You are a world-class line editor |
保持高标准 |
Think step by step before answering |
把过程写出来 |
右栏是一份规格说明。你可以把它交给一位人类艺术总监、一位文字编辑、一名摄影指导,得到的东西会接近你想要的。左栏只对某个被造出来读它的实现有意义——而对接替它的那个版本,它不携带任何意义。
整个问题一行就能说清:描述是资产,方言是别人解析器里的一个仓位。资产会升值。仓位会在一夜之间被重新估值。
方言不只是会过期。它还会开始跟你作对。
一种让人舒服的假设是:过时的技巧会变得中性——是你随时可以背着、直到哪天想起来清理的死重。但通常,它们会变得积极有害,方式有四种,彼此不同。
为缺陷做补偿。 流传中的技巧有很大一部分,发明出来是为了对抗模型不擅长的事:解码器偏向平光、爱插入开场白、容易跑题。咒语之所以管用,是因为缺陷在那里。把缺陷修好,补偿就变成扭曲——这就是为什么曾经产出丰富图像的标签乱炖,如今产出塑料感;也是为什么曾经让语气变锐利的角色扮演戏服,现在只是白白吃掉上下文。
过度操控。 一墙形容词,对弱模型读起来是指令,对强模型读起来是噪音。你为让一个摇晃的生成器守规矩而加上的约束,一旦生成器自己能守规矩,就成了屋子里嗓门最大的东西。你没有改进,你只是用一串词把模型自己的品味投票压了下去。
冗余的脚手架。 把”Think step by step”贴到一个本来就会做中间步骤的模型上,或者用一段系统开场白,去要求一个从来没有别的认知姿态的东西摆出某种特定姿态。它不致命,但那是白花的 token,而且每升一次级,又多一样要重新核验的东西。
解析不了的旗标。 把同一串字符搬进另一个工具或界面,参数就不再是参数。视软件而定,它们要么被悄悄丢弃,要么被当成字面内容解析,而你的提示词含义就此改变,却没有任何报错。一个不再提供负面提示词字段的界面,会干脆忽略你提示词里住在那个字段的那一半。
损害以惯常的方式隐形:输出变差,你怪模型,然后得出结论说,一个更聪明的模型不知怎么反而更不擅长你这件事。正确的诊断是:你的提示词是对一种已被治愈的疾病的临时疗法。
能在换模型后活下来的,是规格说明——还有品味
把一个提示词里所有模型专属的东西剥掉,剩下的就是你真正拥有的部分:主体、光线、取景、媒介、情绪、你要排除的东西。对于文字工作则是:受众、目的、你坚持的标准、交付物的形态、你要求的修改、你不希望它做的事。
这些一点也不稀奇。这是手艺的词汇,而这正是要点——艺术总监谈光线用的词,剪辑师谈剪接用的词,约稿编辑谈简报用的词。它们能迁移,因为它们从来不是对着某个模型说的。它们是对着一个结果说的。
第二项可迁移的资产更冷、也更不好玩:你判断输出好不好的能力。如果你没法给返回的东西打分,一个提示词库就毫无价值;你信得过的品味能在每次升级后存活,正是它让一个新模型成为机会,而不是威胁。
合起来,这就是那个重新框定。你从来不是在学模型。你是在学把意思说清楚,以及判断返回来的东西。
审计:两种颜色,一个小时,你的整个库
你不需要重写所有东西。你需要知道什么是什么。
- 抽样。 从你的各个类别里各抽一些提示词,凑够二十五个——图像、视频、文本,你跑什么都行。如果不够,就全拿上。
- 双色标注。 逐个逐 token 过一遍,标成意图或方言。权重、旗标、触发词、后缀堆叠、角色戏服、格式脚手架:方言。一个有能力的真人能据此动手的:意图。
- 做真人测试。 一位有才华的自由职业者,只拿到这个提示词,能做出接近你想要的东西吗?如果他们需要知道那句咒语,那就是方言。
- 给脆弱度打分。 估算每个提示词里方言的占比。低于五分之一,它相当可迁移。超过三分之一,它就是与模型绑定的资产,你该把它当作会过期的东西来对待。
- 剥离出规范版本。 把只含意图的提示词写成主版。把模型专属的片段放进每个工具一个单独的适配器文件,标注日期,这样方言就是你附加的东西,而不是你存储的东西。
- 凭记忆重建一个。 挑你最常用的提示词,关掉文件,从零写出同一份简报。如果你做不到接近,那说明那个提示词携带着你从未真正拥有的知识——这是审计能产生的最有价值的发现。
然后在一个文件夹里存五到十份简短简报作为评测集,配上你上次跑它们时写下的判断。新模型来了,你重跑这个集,读自己的笔记,二十分钟而不是丢掉一个周末,就知道什么变了。
接下来的一百个小时花在哪
花在描述上:光线、构图、镜头、剪辑语法、散文节奏、写简报。花在品味上:反复跑同一份简报,写下为什么一个结果比另一个好。花在无聊的基础设施上:意图主版、标注日期的适配器、一个评测集、一份变更日志。花在教会自己把结果精确到人类合作者一眼就看得明白的程度。
不是花在还没需要就背下旗标语法,也不是花在收集模型专属的提示词包,好像它们是资产似的。它们更接近原料。读它们的时候读底下的意图,把方言留在你找到它的地方——同样的纪律也适用于公开合集,包括 awesome-prompts.com 上的那些,当你把它们当作对效果的描述、而非可以粘贴的配方时,它们才最有用。
我怎么知道一个提示词是不是模型专属的?
做真人测试。如果一个熟练的人只读这个提示词,说不清你在要什么,那么它是在靠模型的怪癖而非靠意义起作用的。第二个线索是:当你删掉那些整数、方括号和尾部的旗标后,提示词是否还管用。如果它垮了,说明那些东西是承重的。
我该删掉旧提示词吗?
别删掉意图。对每个旧提示词,抽出描述,归档为主版,删掉纯方言——那些对人没有任何意义、只为推动某一个特定解码器而存在的关键词堆。留着它们”以防万一”,就是你怎么到头来背着三百个文件,既信不过,也打不了分。
了解新模型的怪癖不还是值得的吗?
值得,但要便宜地了解。知道一个工具希望你怎么跟它说话,在头几周是实实在在的优势。只是要把那些知识放在适配器文件里,标注日期,并预期它是可丢弃的。错误不在于学方言;错误在于把它和你打算长期保留的部分存放在同一个地方。
我应该多久重新审计一次?
当你依赖的模型发生变化时,以及当你发现自己开始复制一个自己已经不理解的字符串时。每季度一次足矣。每月一次,是打扮成勤奋的拖延。
打开你的库,挑出你用最多的五个提示词,今晚就做一遍双色标注。你得到的比例,会相当诚实地回答:过去三年里有多少投进了能保值的货币,又有多少投进了注定会过期的票据。