所有文章
阅读时长 1 分钟
开源模型不收 API 费,不等于它真的便宜
GPU、运维、推理优化和宕机都会算进账里。自托管该不该做,不看口号,得先把自己的调用量和人力成本算出来。
开源权重免去按 token 支付给模型厂商,不会免去算力、工程、监控和风险成本。商业 API 也不只是单价,还包括限流、数据条款和供应商依赖。
按一年工作量算总成本
自托管要计入 GPU 购买或租赁、低利用率、存储、带宽、推理服务、升级、值班和安全响应。API 要计入 token、缓存、重试、出口流量和集成维护。
先确认约束是否真的需要自托管
数据驻留、离线运行、定制权重或稳定高吞吐可能支持自托管;低而波动的流量、快速试验和缺少推理团队通常更适合 API。不要用“数据不出门”掩盖内部权限管理不足。
用小规模压测找盈亏点
在目标硬件和真实上下文长度上测吞吐、P95 延迟、质量和故障恢复,再计算不同利用率下的单位成功任务成本。没有利用率假设的成本比较不可信。
上线前检查
- 人力和闲置算力已计价
- 质量与 API 候选用同一集合评测
- 合规要求有书面依据