先定义任务

写清输入、期望输出、不能违反的规则和人工验收方式。

任务不清楚时,模型比较没有意义。

准备测试集

至少准备正常、边界和容易失败的真实样本,并去掉无权使用的隐私数据。

所有模型使用同一批材料。

统一测试条件

固定提示、工具、输出格式与重试次数。

否则比较的是设置差异,不是模型差异。

记录五个指标

记录正确率、人工修改时间、响应时间、总费用和失败恢复能力。

每项都应留下可复查结果。

判断旗舰是否值得

复杂任务提升明显时可以选旗舰;简单提取差距很小时,便宜模型可能更合适。

总成本包含人工检查。

做安全测试

测试提示注入、错误资料、越权工具调用和不可逆操作。

付款、删除和发布前必须人工确认。

上线与回归

先小流量上线并固定版本。

模型升级时重跑同一测试集,确认没有倒退。