Agent 评测就是新的单元测试
你不会在没有测试的情况下合并代码,那也别在没有评测的情况下发布 Agent 改动。
发生了什么
Agent 的行为是非确定性的,一次提示词微调可能修好一个 case、同时悄悄弄坏另外三个。没有评测集的团队,往往要等几周后从一张客服工单里才知道。
对交付团队意味着什么
评测集把提示词工程从「凭感觉」变成「工程」。用 30 到 50 个代表性场景给每次改动打分,你才真的能判断某次修改是不是改进。
可以立刻做的事
从你已经见过的失败开始。把每一个写成一个带明确通过条件的场景,接进 CI,然后拒绝合入任何让分数下降且没有书面理由的 Agent 改动。
可以立刻做的事
- 收集 30-50 个真实场景,别用理想化的合成数据
- 每次提示词改动都在 CI 里打分
- 分数下降就当成构建失败