创建时间: 2026-03-24最后更新: 2026-08-20作者: yangbo(838844bbd)
1. 延迟预算
这篇文章我们要讨论部署方案的选择
用户发出一条消息后,系统通常需要完成下面这些工作:
| 环节 | 耗时范围 |
|---|---|
| 网络往返(用户 ↔ 服务器) | 50 - 500ms |
| 安全检查 | 10 - 30ms |
| 记忆检索(向量搜索 + 关键词匹配) | 30 - 100ms |
| 情绪状态读取 | 5 - 15ms |
| Prompt 组装 | 5 - 10ms |
| LLM 推理(首 Token) | 500 - 2000ms |
| 记忆写回 | 20 - 50ms |
在流式输出场景中,用户最直接感受到的是首字节时间(TTFB),也就是从发送消息到看到第一个字出现的间隔。比较理想的等待时间是 1-2 秒;超过 3 秒,等待感会变得明显;超过 5 秒,用户很可能直接离开页面。
LLM 生成首个 Token 通常需要 500-2000ms,这部分时间很难由应用层直接压缩,因此留给安全检查、记忆检索、状态读取和 Prompt 组装的预算并不宽裕。如果一次网络往返就占用 300ms,整条链路几乎没有调整空间。
所以,部署架构要解决的问题很明确:既然 LLM 推理时间不可控,就要尽可能缩短其余环节,尤其是网络传输时间。最直接的办法,就是把计算放到离用户更近的位置
订阅后可阅读剩余内容
AI 电子伴侣企业级项目实战
已发布239节计划发布120节目标已完成199%