先定义任务
写清输入、期望输出、不能违反的规则和人工验收方式。
任务不清楚时,模型比较没有意义。
准备测试集
至少准备正常、边界和容易失败的真实样本,并去掉无权使用的隐私数据。
所有模型使用同一批材料。
统一测试条件
固定提示、工具、输出格式与重试次数。
否则比较的是设置差异,不是模型差异。
记录五个指标
记录正确率、人工修改时间、响应时间、总费用和失败恢复能力。
每项都应留下可复查结果。
判断旗舰是否值得
复杂任务提升明显时可以选旗舰;简单提取差距很小时,便宜模型可能更合适。
总成本包含人工检查。
做安全测试
测试提示注入、错误资料、越权工具调用和不可逆操作。
付款、删除和发布前必须人工确认。
上线与回归
先小流量上线并固定版本。
模型升级时重跑同一测试集,确认没有倒退。