创建时间: 2026-03-24最后更新: 2026-08-21

1. 为什么需要流式输出

在具体的测量中,我们会发现 LLM 生成占到了总耗时的 70-80%,这个比例会随着模型、网络和上下文长度变化,不能当作固定指标。一段中等长度的完整回复可能需要等待 500-2000ms,如果 AI 伴侣要生成约 200 字的安慰内容,等待时间还可能超过 3 秒

LLM 并不是先生成完整答案,再一次性返回。模型会逐步生成 token,但接口传回来的一个 chunk 可能包含一个或多个 token。首个文本片段可能在 200ms 内就已经可用;如果服务端仍然等待全部内容生成完毕,用户就会额外等待 1-2 秒。实际首字节时间仍取决于模型、上下文长度、网络和服务端实现。

流式输出会在文本片段可用后立即传给客户端,让用户从等待完整回复,变成直接看到文字逐步出现。

从首字节时间来看,两种模式通常存在明显差异。下面的数字只是测量示例,实际结果需要结合模型、网络和部署环境验证:

模式首字节时间用户感知
非流式(等完整回复)1500-3000ms它在想什么?卡了吗?
流式(收到首个片段后开始推送)200-500ms它在说话了

对于实时对话产品,流式输出不是额外的视觉效果,而是控制用户感知延迟的基础能力。

人的阅读速度大约是每秒 5-8 个汉字,而模型的输出速度会因模型和语言而变化。对于中文对话,生成速度有时会高于阅读速度;在这种情况下,持续追加文字可以明显减轻等待感,也更接近自然的打字过程。

订阅后可阅读剩余内容
AI 电子伴侣企业级项目实战
已发布239计划发布120目标已完成199%