桌面清空。手机扣下。今天不看模型榜单,也不许展示那份排练过十七遍的 Demo。我把一张客户需求卡交给第一位玩家,再把一枚黄色机器人棋子放到他旁边。规则只有一条:消息必须经过人、AI 和系统三种角色,走完五轮,谁都不能偷看原稿。你可以把这当成一场小游戏。也可以把它当成一次比季度汇报诚实得多的 AI 验收。计时开始。

第一轮,复述:漂亮句子不加分
原卡写着:客户愿意试用,但只接受脱敏数据,周五前需要一份可撤回的测试方案。传到 AI 手里,答案变成:客户对试点表现出积极兴趣,建议尽快推进验证。听起来更像会议纪要了。可惜,脱敏、周五、可撤回,三项都没了。
我把机器人棋子退后三格。旁边有人抗议:它总结得很准确。准确吗?它保存了情绪,丢掉了约束;保住了“愿意”,弄丢了“怎样才愿意”。真实工作里,最贵的信息往往不是主旨,而是那些让事情不能随便做的边角。
第一轮的计分规则因此很简单:别数它保留了多少词,数它丢了多少个会改变行动的条件。
第二轮,追问:不知道时,谁先举手
新卡只有一句:按上次的方式发。人类玩家皱眉。AI 玩家立刻写出一封完整邮件,主题、称呼、落款一应俱全。观众差点鼓掌。
我按住发送键,问:上次是哪次?发给谁?附件含不含报价?沉默。我们终于看见一个常被流畅遮住的事实:生成速度越快,缺少信息越不容易被注意。
这一轮,最先说“信息不够”的玩家得分。不是因为他更保守,而是因为追问本身就是生产力。好的 AI 不该只擅长补句子,还要能识别哪一块空白不能靠猜。
第三轮,交接:请把下一步说成人能接住的样子
现在,AI 完成资料比对,把任务交给同事。它写:已处理,请复核。只有六个字,像一只封得严严实实的盒子。复核什么?改了哪里?哪个判断最不确定?盒子不开口。
我们重来一次。新的交接卡必须填四格:我做了什么、我没做什么、差异在哪里、你下一步只需要判断什么。卡片一填,原本二十分钟的翻找变成两分钟的选择。
很多团队以为 AI 的价值发生在生成时。其实更稳定的价值,常常发生在交棒时。答案未必惊艳,但下一位不用重新勘探整片上下文。棋子因此前进的,不是一格,是一整段等待。
第四轮,打断:恢复比赛也要计时
我故意拔掉一张工具卡。接口报错,流程停住。演示人员条件反射般伸手,准备从头再跑。等等。真实的一天里,网络会抖,权限会过期,客户会在最后一分钟改口。为什么我们的评测只奖励顺滑通关?
计时器换了方向:不再计算完成用了多久,而是计算失败后多久能说清三件事——停在哪里,已经留下什么,换成人以后从哪一步继续。
能失败得清楚,是一种被低估的能力。一个每次都必须重开全局的 Agent,就像摔倒后会忘记赛道的选手。它偶尔跑得再快,也不适合接力。
第五轮,责任归位:最后一张卡不能写 AI
终点前摆着责任卡。上面的问题是:如果这条消息发错,谁决定撤回?有人顺手写下“AI 系统”。我把卡推回去。系统可以执行撤回,不能承担决定撤回的后果。
最后一轮不评模型,评队伍。是否有一个具体角色看得见全程,是否有权叫停,是否知道找谁确认,是否能在出错后把客户、记录和流程一起修回来。若答案含糊,再强的棋子也不能越过终点。
责任不是把每一步都交给人点击。责任是让决定、证据和后果始终能回到一个真实位置。
终局计分:别再只给完美答案发奖牌
五轮结束,最聪明的玩家没有赢。它在第一轮丢约束,第二轮抢答,第四轮又忘了如何从半途恢复。真正领先的是那支会保留条件、主动追问、认真交棒、允许接管的队伍。
明天你也可以拿一条真实任务来玩,不需要实验室。把原始约束写在卡上,让消息经过三个角色,中途拿走一个工具,再请最后的人复述下一步。你会很快看见流程里哪些地方靠记忆,哪些地方靠猜,哪些所谓智能只是把断点藏得更漂亮。
AI 进入工作,不是一位天才独自答题,而是一场漫长接力。我们真正该优化的,不只是它冲刺的速度,还有每一次把事情交到别人手里时,信息是否仍然完整,队友是否接得住。
