avatar
Articles
21
Tags
6
Categories
0
Home
Archives
Tags
Categories
List
  • Music
  • Movie
Link
About
scmmm's blog流水线并行Pipeline Parallelism Back to Home
Home
Archives
Tags
Categories
List
  • Music
  • Movie
Link
About

流水线并行Pipeline Parallelism

Created2026-07-25|Updated2026-07-25
|Post Views:
Author: scmmm
Link: http://example.com/2026/07/25/%E6%B5%81%E6%B0%B4%E7%BA%BF%E5%B9%B6%E8%A1%8CPipeline-Parallelism/
Copyright Notice: All articles on this blog are licensed under CC BY-NC-SA 4.0 unless otherwise stated.
cover of next post
Next
张量并行Tensor Parallelism
张量并行(Tensor Parallelism,TP)就是把同一层神经网络中的张量(权重或计算)拆分到多张 GPU 上,并行完成一次层计算。 张量并行并不是 LLM 时代才提出的概念,在深度学习中很早就存在。不过早期模型通常只有几百万到几千万参数,单层参数规模远小于单卡显存容量,因此几乎没有使用张量并行的需求。 训练瓶颈随着模型大小越来越大,一个 70B 的稠密模型单层就有 1B 左右,在 FP16+Adam 下面训练,则会存储这些东西 项目 字节 FP16 模型权重 2 FP16 梯度 2 FP32 master weight 4 FP32 Adam 一阶矩 $m$ 4 FP32 Adam 二阶矩 $v$ 4 有些实现会额外保留 FP32 梯度副本,1B 左右的参数需要 16-20G显存。 如果为了防止爆显存而让每个流水线 stage 只放一层 Transformer Block,那么虽然单卡能够容纳这一层,但会导致流水线 stage 数量过多,流水线 bubble 增大,吞吐下降,同时通信次数也会明显增加。 此外,这 20G 只是必...
avatar
scmmm
B.S. in Biology & Computer Science, Shandong University,2022-2026
M.S. in Computer Science, ShanghaiTech University(Research conducted at ICT,CAS),2026-
Research Focus: AI for EDA
Articles
21
Tags
6
Categories
0
Follow Me
Recent Posts
流水线并行Pipeline Parallelism
流水线并行Pipeline Parallelism2026-07-25
张量并行Tensor Parallelism
张量并行Tensor Parallelism2026-07-25
PagedAttention原理
PagedAttention原理2026-07-24
FlashAttention -1 原理
FlashAttention -1 原理2026-07-20
面试积累 - FFN 层激活函数
面试积累 - FFN 层激活函数2026-07-20
© 2020 - 2026 By scmmm