所有文章
阅读时长 1 分钟
别再问“哪个模型最好”,先把你的任务说清楚
写作、抽取、长推理和高频客服,要的不是同一种模型。成本、延迟、隐私和稳定性摆在一起,答案通常不是一个名字。
选模型不是找一个永久冠军,而是为具体任务选择能满足质量底线、延迟和预算的版本。公开榜单只能缩小范围,最终决定应来自自己的流量。
先定义任务和失败代价
把分类、抽取、生成、检索问答和代理操作分开评估。明确严重错误,例如漏掉禁忌项、编造引用或执行错误工具;高风险任务的准入线应高于营销文案。
用真实样本做约束比较
固定提示词、工具、超时和输出格式,在同一批样本上重复运行候选模型。报告任务成功率、严重错误、P50/P95 延迟和每个成功任务成本,不能只比平均分。
上线后保留版本控制
固定生产模型版本,先用影子流量测试升级,再逐步放量。准备回滚和备用模型;模型更新后重新跑回归集,因为同一产品名不保证行为不变。
上线前检查
- 核心任务有明确质量底线
- 延迟和成本来自真实分布
- 升级可灰度且可回滚