FlashAttention Transformer 什么是 FlashAttention?为什么注意力计算能更快更省显存 FlashAttention 是什么?它没有改变 Transformer 的结果,为什么却能加速长上下文训练与推理?讲清显存读写瓶颈、分块计算与实际意义。 2026年8月31日
束搜索 大模型 什么是束搜索?AI 如何同时保留多个生成方向 束搜索 Beam Search 是什么?它如何在文本生成中同时尝试多个候选、和贪心解码及采样有何区别,以及为什么聊天模型不总用它。 2026年8月28日
KV Cache 大模型 什么是 KV Cache?大模型为什么聊天越长越占显存 KV Cache 是什么?它如何让大模型避免重复计算、为何长上下文会占显存、和上下文窗口及提示词缓存有什么区别,一文讲清。 2026年8月20日