LLM inference · 大模型推理
高效扩展 Transformer 推理
Efficiently Scaling Transformer Inference
分析大规模 Transformer 生成式推理的延迟、吞吐量、内存和通信权衡,并为 TPU v4 上的多维模型划分、多查询注意力和量化给出工程方案。
包含两篇论文的英文内容整理与中文译文。每个英文内容块后紧跟对应中文内容块;正文沿用论文的章节结构,并保留主要公式、图表、数值与附录。英文内容为便于阅读作了清理和轻度重整,不是逐字校勘版。网页及随附原始 PDF 均可离线使用。
Efficiently Scaling Transformer Inference
分析大规模 Transformer 生成式推理的延迟、吞吐量、内存和通信权衡,并为 TPU v4 上的多维模型划分、多查询注意力和量化给出工程方案。
Pathways: Asynchronous Distributed Dataflow for ML
介绍 Google PATHWAYS 的单控制器、分片异步数据流与成组调度架构,以及它在数千 TPU、流水并行、多租户和跨加速器岛训练中的性能。