星渊炼火 · 以代码求真
PyTorch 从零到大模型工程
十二章、74 节课程,覆盖 Python 基础、Tensor、训练循环、Transformer、性能优化、分布式训练和迷你语言模型项目。每节附有代码、运行条件、常见错误和相关资料。
- 12
- 学习章节
- 74
- 核心课程
- 3
- 贯穿项目
阅读记录
本机课程进度
尚无已完成的课程。
课程结构
四个学习阶段
- 01运行基础
Python、NumPy、安装、Tensor、设备与梯度。
- 02模型实现
训练循环、数据管线、注意力与 Transformer。
- 03性能工程
AMP、Profiler、编译、显存与分布式训练。
- 04完整项目
分类器、Decoder Block 与迷你语言模型。
课程索引
搜索知识点
支持按课程标题、阶段和主题搜索。
12 章课程
从 Python 基础到大模型训练
课程依次覆盖基础语法、张量与训练、Transformer、性能优化、分布式和大模型生态。
零基础准备:Python、NumPy 与正确安装
只补后续课程真正会用到的 Python 与 NumPy,并学会按自己的机器选择 PyTorch、判断 CUDA 是否可用。
Python / NumPy / 安装进入本章 →02入门 · 6 节起步:环境、设备与第一枚 Tensor
从可复现的环境和第一枚张量开始,建立“形状、类型、设备”这三个贯穿 PyTorch 与大模型工程的基本坐标。
环境配置 / Tensor / shape进入本章 →03基础 · 7 节张量基本功:索引、广播与线性代数
把形状变换、广播、索引与批量矩阵乘法练成肌肉记忆,为注意力、掩码和损失计算打稳地基。
broadcasting / view / einsum进入本章 →04基础 · 6 节自动求导:从计算图到反向传播
拆开 autograd 的黑盒:看懂动态计算图、叶子节点、梯度累积、钩子和自定义求导,真正掌握训练为何有效。
autograd / backpropagation / gradient进入本章 →05基础 · 7 节神经网络工程:Module、损失与训练循环
从 `nn.Module` 的参数注册机制出发,亲手搭建可训练、可验证、可保存和可恢复的完整训练器。
nn.Module / loss / optimizer进入本章 →06进阶 · 6 节数据管线:Dataset、DataLoader 与批处理
让数据从磁盘稳定、高效地流向加速器,掌握 Dataset、采样、动态 padding、多进程加载与数据泄漏排查。
Dataset / DataLoader / collate_fn进入本章 →07进阶 · 8 节亲手搭 Transformer:从 Embedding 到注意力
不依赖高级封装,沿着形状流亲手实现词嵌入、因果注意力、前馈网络、残差与 Decoder Block。
Embedding / Attention / Transformer进入本章 →08进阶 · 6 节稳定训练:初始化、AMP、裁剪与排错
让模型不仅能跑,还能稳定地学:掌握初始化、混合精度、梯度累积、裁剪、监控和 NaN 定位。
AMP / gradient clipping / debugging进入本章 →09高级 · 6 节性能与显存:Profiler、compile 与检查点
用测量代替猜测,读懂 CPU/GPU 时间线、显存组成、激活检查点与 `torch.compile` 的适用边界。
Profiler / torch.compile / checkpointing进入本章 →10高级 · 6 节分布式训练:从 DDP 到 FSDP 与 TP
理解进程、rank 和集合通信,掌握 DDP、FSDP2、张量并行的选择逻辑,以及分布式训练最常见的挂起问题。
DDP / FSDP2 / Tensor Parallel进入本章 →11高级 · 6 节大模型生态:Transformers、PEFT、torchao 与 TorchTitan
把 PyTorch 基础接到真实大模型工具链,理解 Hugging Face 生态、参数高效微调、量化优化与官方大规模训练框架的职责边界。
Transformers / Datasets / Accelerate进入本章 →12实战 · 7 节方向实战:训练并优化一个迷你语言模型
把前十一章串成一个可运行项目:构造自回归样本、训练 Decoder-only 模型、生成文本、做参数高效微调并形成项目复盘。
Decoder-only / language modeling / LoRA进入本章 →贯穿项目
每走一段,就留下可运行的成果
验证记录
代码运行范围
- 74
- Python 代码语法校验
- 39
- CPU 独立执行通过
- 35
- 组合或硬件路径明示
- 3/3
- 完整项目 CPU 通过
CUDA、FSDP2、Tensor Parallel 与 TorchTitan 路径明确标记所需硬件;页面同时提供运行命令和验收指标,但不会声称在本站 CPU 环境完成了 GPU 验证。
资料来源
资料来源与版本边界
课程以 PyTorch 官方文档和可复现实验为主要参考,版本敏感内容会单独标注。
基础教程 · torch.compile · 分布式训练 · 高性能注意力