所有文章
阅读时长 1 分钟

开源模型不收 API 费,不等于它真的便宜

GPU、运维、推理优化和宕机都会算进账里。自托管该不该做,不看口号,得先把自己的调用量和人力成本算出来。

开源 vs 商业 LLM TCO 2026 封面

开源权重免去按 token 支付给模型厂商,不会免去算力、工程、监控和风险成本。商业 API 也不只是单价,还包括限流、数据条款和供应商依赖。

按一年工作量算总成本

自托管要计入 GPU 购买或租赁、低利用率、存储、带宽、推理服务、升级、值班和安全响应。API 要计入 token、缓存、重试、出口流量和集成维护。

先确认约束是否真的需要自托管

数据驻留、离线运行、定制权重或稳定高吞吐可能支持自托管;低而波动的流量、快速试验和缺少推理团队通常更适合 API。不要用“数据不出门”掩盖内部权限管理不足。

用小规模压测找盈亏点

在目标硬件和真实上下文长度上测吞吐、P95 延迟、质量和故障恢复,再计算不同利用率下的单位成功任务成本。没有利用率假设的成本比较不可信。

上线前检查

  • 人力和闲置算力已计价
  • 质量与 API 候选用同一集合评测
  • 合规要求有书面依据

资料来源

相关阅读