AI圈报
模型发布 / 更新普通

LLM 速度体验:TTFT 与 ITL 解析

信息来源:X:马东锡 NLP (@dongxi_nlp)·
原始标题:LLM 的速度,有两种体验:等多久开始回答,回答时是否流畅。 两种体验,与 Prefill 和 Decode 密切相关。 从发出请求到收到第一个 token,这段等待叫 TTFT,首 token 反…

内容摘要

LLM 的速度体验分为等待首 token 和回答流畅度两方面,分别与 Prefill 和 Decode 密切相关。从发出请求到收到第一个 token 的等待叫 TTFT,模型在此期间进行 prefill 处理输入;开始回答后通过 decode 逐步生成后续 token,相邻 token 到达间隔叫 ITL。TTFT 越短反应越快,ITL 越短且越稳定回答越流畅。
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:马东锡 NLP (@dongxi_nlp)
站内情报编号intel-7c6f7b47d41a66ddf8e50f37