Articles
22
Tags
7
Categories
0
Home
Archives
Tags
Categories
List
Music
Movie
Link
About
scmmm's blog
流水线并行Pipeline Parallelism
Back to Home
Home
Archives
Tags
Categories
List
Music
Movie
Link
About
流水线并行Pipeline Parallelism
Created
2026-07-25
|
Updated
2026-07-25
|
Post Views:
Author:
scmmm
Link:
http://example.com/2026/07/25/%E6%B5%81%E6%B0%B4%E7%BA%BF%E5%B9%B6%E8%A1%8CPipeline-Parallelism/
Copyright Notice:
All articles on this blog are licensed under
CC BY-NC-SA 4.0
unless otherwise stated.
Previous
CUDA:从null到0
本篇为 CUDA 入门的扫盲篇,以下 GPU 均默认为支持 CUDA 的 GPU,在正式写算子之前,我们先简单梳理下 CUDA 是个什么东西。 在机器学习中,存在大量简单且相似的运算,这天生适合有大量流处理器 GPU 来完成,随着 CUDA ,Tensor Core 和其他模块的完善,大量主流机器学习训练和推理任务都可以利用 GPU 加速。且常比 CPU 更快。而把他们搬到 GPU 去计算,其底层由 CUDA 算子实现。 CUDA 执行的周期 CUDA 编程模型包含 host 和 device 两个执行端。host 是 CPU 端,负责程序控制;device 是 GPU 端,负责并行计算。kernel 是运行在 device 上、由大量线程并行执行的函数。 一个典型的生命周期如下 12345CPU 准备数据 -> 数据进入 GPU 可访问的内存 -> CPU 发射 kernel -> GPU 线程执行 -> CPU 或下一个 kernel 等待结果 kernel launch 相对于 CPU 默认是异步的。发射调用返回时,GPU 可...
Next
张量并行Tensor Parallelism
张量并行(Tensor Parallelism,TP)就是把同一层神经网络中的张量(权重或计算)拆分到多张 GPU 上,并行完成一次层计算。 张量并行并不是 LLM 时代才提出的概念,在深度学习中很早就存在。不过早期模型通常只有几百万到几千万参数,单层参数规模远小于单卡显存容量,因此几乎没有使用张量并行的需求。 训练瓶颈 随着模型大小越来越大,一个 70B 的稠密模型单层就有 1B 左右,在 FP16+Adam 下面训练,则会存储这些东西 项目 字节 FP16 模型权重 2 FP16 梯度 2 FP32 master weight 4 FP32 Adam 一阶矩 #mjx-0c39dd2{ display:contents; mjx-assistive-mml { user-select: text !important; clip: auto !important; color: rgba(0,0,0,0); ...
scmmm
B.S. in Biology & Computer Science, Shandong University,2022-2026
M.S. in Computer Science, ShanghaiTech University,2026-
Research Focus: AI for EDA
Articles
22
Tags
7
Categories
0
Follow Me
Recent Posts
CUDA:从null到0
2026-07-26
流水线并行Pipeline Parallelism
2026-07-25
张量并行Tensor Parallelism
2026-07-25
PagedAttention原理
2026-07-24
FlashAttention -1 原理
2026-07-20
繁