Token 输出速度模拟器
对比不同 token 生成速度下,文本流式返回的观感。速度可在每个面板上单独配置,运行中修改即时生效。
大模型的流式输出速度直接决定了用户感知的响应体验。在 10 tokens/s 时,文字像逐字敲出来一样,等待感明显;提升到 40 tokens/s 后,整段回复几乎是一口气出现的,阅读节奏更接近自然浏览。 Streaming speed matters: at low throughput the interface feels sluggish, while higher throughput keeps the reader engaged. 关键是把首 token 延迟和持续输出速度分开看待。
开始
暂停
重置