一次演示通常样本少、提示词经过调整,不能代表模型在真实业务中的长期表现。先把目标、资料和责任拆清楚,往往比立刻调整提示词更能改善结果。 与其凭感觉调整,不如先完成四项基础工作: 1. 建立覆盖常见、边界和高风险场景的测试集。 2. 统一输入参数,对候选模型重复测试。 3. 同时记录质量、延迟、失败率和实际费用。 4. 让真实业务人员盲评并说明扣分原因。 本题最需要警惕的是:只凭主观印象选择模型,容易忽略偶发波动、上下文限制和接口稳定性。一旦涉及真实客户或外部发布,影响就不再局限于内部试验。 测试不能只覆盖最常见问题,还应专门挑战系统边界。保留模型版本、测试日期、完整输出与评分规则,使后续升级能够在同一基准上比较。除了顺利完成的常规样本,还应加入资料不全、输入矛盾、权限不足或服务异常等边界情形。关键结果可由业务与技术分别签字确认,减少单一视角遗漏。 最终负责人要对业务结果负责,不能把模型输出当作免责理由。合适的模型不是所有榜单上最强的模型,而是在目标任务、风险和预算内表现最稳定的模型。 本文在提纲整理和初稿撰写中使用了AI辅助,发布前已人工复核事实与表达。