01客户背景
一家日活超 30 万的 SaaS 平台,内置 AI 助手为注册用户生成回复、摘要与推荐。
02原始问题
业务量每月增长 20%,Token 成本却涨得更快;多个业务各自直连不同模型,没有一个统一的成本视图,也说不清钱花哪了。
03诊断过程
接入用量采集后发现:60% 的调用是相似甚至重复的高频问题,却每次都按全价生成;不同业务用了成本差异很大的模型,却没有按场景区分。
04解决方案
构建统一 API 网关:高频同类请求命中缓存;按任务复杂度做模型路由,简单任务走便宜模型、复杂任务才走高配模型;并建立月度成本治理复盘。
05实施过程
两周完成网关与路由上线,四周完成缓存策略调优与团队成本看板。
06最终结果
业务量不变的前提下,月度 Token 支出从 58 万降至 34 万,单次调用成本下降 42%,3 个月收回了改造投入。
