后厨开灯。案板擦净。今晚不谈参数。日期是 2026 年 7 月 30 日,菜单上只有一道主菜:准备进入生产环境的 AI 项目。研发说它已经能跑,产品说演示很顺,老板问什么时候出餐。我把白毛巾搭在肩上,只回一句:先试菜。Demo 像摆拍,真正的上线像晚高峰。食材会缺,订单会改,客人会过敏,火会忽然太旺。七道试菜,一道也不能只尝盘边的酱。

第一道|先尝原料,不要拿调味料掩住陈旧上下文
【备料】业务规则一份,客户记录若干,权限边界四条,明确过期日期。
AI 输出发苦,团队常先换模型、改提示词、加更长上下文。可如果知识库混着旧制度,客户数据缺字段,输入文件版本不明,再好的模型也只是在替坏食材加香料。上下文工程的第一步不是喂得多,是知道每样东西从哪里来、什么时候失效。
试法很简单:抽十个真实任务,逐项追溯输入。找不到来源的,先下案板;已经过期的,直接倒掉。模型可以处理不完整信息,但必须把缺口摆在盘面,不能用流畅口感掩盖原料问题。
第二道|小火慢煨,看看任务会不会在第十步糊锅
【火候】连续执行二十步。允许两次重试。禁止无限续锅。
许多 AI 项目只试第一口:问一句,答一段,看起来鲜亮。Agent 真正上线后却要查资料、调用工具、修改状态、等待接口再继续。每一步只有很小的误差,叠到第十步也可能整锅偏味。
所以长任务测试要看轨迹,不只看终盘。在哪一步改变了计划,哪一次工具返回为空,重试是否换了策略,错误是否被带进下游,都应留下记录。火候不是平均温度,而是最容易糊锅的那一分钟。
第三道|蒙眼盲尝,别让评委先看见“AI 制作”
【试味】同一任务三份结果:人工完成、旧流程完成、AI 完成。打乱顺序。
团队一旦知道哪份是 AI 生成,评价就会被两种情绪拉走:有人愿意原谅它,因为机器已经很厉害;有人刻意挑刺,因为机器不该犯错。盲评能把注意力拉回结果:事实是否正确,格式是否可用,行动建议是否具体,复核需要多久。
更重要的是比较基线。AI 不必在所有维度赢过高手,但至少应在目标场景里,比原流程更快、更稳或更便宜。若它只多了一层新鲜感,便还不是菜,只是桌边表演。
第四道|先问过敏原,再谈个性化推荐
【标注】敏感数据、禁止动作、高风险人群、必须人工确认事项。
推荐越贴身,越可能碰到不该碰的东西。医疗、财务、人事、未成年人和客户隐私,不会因为模型语气温柔就降低风险。权限也像过敏原:少量误用,就足以让整顿晚餐停摆。
上线前应做反向点单:故意给出诱导指令、越权要求、含敏感字段的附件和伪造身份,观察系统是否拒绝、降级或转人工。安全不是菜单底部一行小字,而是后厨接单时第一眼就能看见的红标。
第五道|把账单夹在盘底,算清每一口的真实成本
【成本】模型调用、检索、工具执行、人工复核、返工、失败补偿。
单次调用很便宜,整条工作流未必。长上下文重复发送、失败自动重试、人工逐句核对、错误写回后的清理,都会把一盘看似平价的菜变成隐藏套餐。只报 token 单价,就像只算盐钱。
应按完成一个合格任务核算成本,并分出成功、需人工修正、完全失败三类。若节省的生成时间全部花在复核上,就该改变分工:让 AI 做草稿、分类或检索,把最终判断留给人,而不是继续扩大自动化比例。
第六道|出餐口必须有人喊停,不许盘子自己跑去客桌
【出餐票】责任人、验收标准、影响范围、发送对象、撤销入口。
人工复核常被设计成最后点一下“确认”,此时邮件已写好、数据已改完、客户名单也选好了。面对一盘精致成品,人很难推翻前面所有工作。真正的复核应发生在后果还没离开出餐口的时候。
复核者要同时看见依据、变化和风险:哪些事实已确认,哪些是推断,将写入哪些系统,会影响多少对象,失败后如何撤销。喊停不是拖慢效率,而是后厨唯一能在客人入口前换盘的时刻。
第七道|练习撤盘,别等客人皱眉才找垃圾桶
【演练】撤回邮件,恢复数据,吊销令牌,关闭任务,通知受影响者。
团队喜欢演示顺利出餐,很少演示如何收回一盘错菜。可生产环境里,回滚不是备用按钮,而是一条必须走通过的路线。若谁都没实际按过撤销,事故当天就会发现按钮背后没有门。
挑一个可控环境,故意让任务在中途失败:工具超时、权限失效、数据写错、预算触线。观察系统能否停下,已完成动作能否列清,外部状态能否恢复,人工接管是否知道从哪一步继续。撤盘练得越真,上菜才越有底气。
收台|好吃不等于可以无限供应
七只空盘摆回架上。没有掌声,只有洗碗机开始转。
我在出餐票背面写下今晚的结论:AI 项目是否成熟,不看它最好的一次回答,而看它用真实原料、在真实压力下,能否稳定做出可验收的结果;出错时能否停,停下后能否说清,最后能否把厨房恢复原样。
明天可以上线一小桌。限定菜单,限定客人,限定时段。先听盘子落桌的声音,再决定要不要把整间餐厅交给自动出餐。
