AI 变慢通常不是单点问题,而是四条链路之一被卡住。排查前先别急着加钱买卡,先分辨慢在哪一层。
一、模型本身慢:上下文与推理
上下文越长,首字延迟越高。先把输入压缩,去掉无关历史与指令,再考虑换更快的推理引擎或更小的模型。同样是问答,长文档题和短问题延迟可能差出好几倍。
二、推理硬件不匹配
负载不大却慢,往往是指纹级算力不匹配:显存不足导致换页、批次过小导致利用率低。某企业一台卡推理 30 并发时 P95 秒级回落,把并发、批量和显存规格调优后,同样机器承载量几乎翻倍——先优化配置,再考虑扩容。
三、并发与排队
流量上来后慢,多半是排队等待,而不是计算本身慢。关注 P95/P99 而不是平均延迟;必要时做请求分级,把高优先级任务优先调度。
四、缓存与重复计算
高频、固定的请求完全可以命中缓存,省下一次完整推理。加上语义缓存与结果复用,重复问题基本不再重复算。
一句话:先分层定位,再决定是调模型、调硬件、调并发还是加缓存,不要一慢就买卡。想要一张针对你负载的排查清单,用诊断工具按场景生成。
