所有文章
阅读时长 1 分钟
有些活儿,真没必要每次都请最贵的模型
分类、抽取和格式化这类重复工作,小模型往往更快也更省。把它和前沿模型搭配起来,比选一边站队更实在。
小模型与前沿模型不是阵营选择。稳定、可验证的高频任务常适合小模型;歧义大、步骤多或失败代价高的任务可能需要更强模型或人工介入。
先按任务复杂度分流
分类、字段抽取、模板改写可先测小模型;跨文档推理、复杂代码修改和开放式规划应单独评估。路由依据是任务特征和置信规则,不是让小模型自己宣称“我能做”。
设置升级而非无限重试
当校验失败、输入超出分布或置信不足时升级到强模型;强模型仍失败则转人工。副作用操作应在升级时保留幂等键,避免两次执行。
按系统结果比较
比较端到端成功率、P95 延迟、成本、升级率和人工修正,而不是只比模型单次准确率。小模型节省只有在升级与返工后仍成立才是真的。
上线前检查
- 路由规则能由日志解释
- 升级不会重复副作用
- 成本包含强模型和人工兜底