创建时间: 2026-03-24最后更新: 2026-08-20

1. 延迟预算

这篇文章我们要讨论部署方案的选择

用户发出一条消息后,系统通常需要完成下面这些工作:

环节耗时范围
网络往返(用户 ↔ 服务器)50 - 500ms
安全检查10 - 30ms
记忆检索(向量搜索 + 关键词匹配)30 - 100ms
情绪状态读取5 - 15ms
Prompt 组装5 - 10ms
LLM 推理(首 Token)500 - 2000ms
记忆写回20 - 50ms

在流式输出场景中,用户最直接感受到的是首字节时间(TTFB),也就是从发送消息到看到第一个字出现的间隔。比较理想的等待时间是 1-2 秒;超过 3 秒,等待感会变得明显;超过 5 秒,用户很可能直接离开页面。

LLM 生成首个 Token 通常需要 500-2000ms,这部分时间很难由应用层直接压缩,因此留给安全检查、记忆检索、状态读取和 Prompt 组装的预算并不宽裕。如果一次网络往返就占用 300ms,整条链路几乎没有调整空间。

所以,部署架构要解决的问题很明确:既然 LLM 推理时间不可控,就要尽可能缩短其余环节,尤其是网络传输时间。最直接的办法,就是把计算放到离用户更近的位置

订阅后可阅读剩余内容
AI 电子伴侣企业级项目实战
已发布239计划发布120目标已完成199%