云镜收藏

稍后阅读

清单保存在当前浏览器,方便下次回来继续阅读。

清单还是空的

在笔记卡片或正文页点击“加入稍后阅读”即可收藏。

星渊炼火 · 以代码求真

PyTorch 从零到大模型工程

十二章、74 节课程,覆盖 Python 基础、Tensor、训练循环、Transformer、性能优化、分布式训练和迷你语言模型项目。每节附有代码、运行条件、常见错误和相关资料。

12
学习章节
74
核心课程
3
贯穿项目

阅读记录

本机课程进度

尚无已完成的课程。

开始第一章
预计总学习时间约 28 小时 · 进度只保存在当前设备

课程结构

四个学习阶段

  1. 01运行基础

    Python、NumPy、安装、Tensor、设备与梯度。

  2. 02模型实现

    训练循环、数据管线、注意力与 Transformer。

  3. 03性能工程

    AMP、Profiler、编译、显存与分布式训练。

  4. 04完整项目

    分类器、Decoder Block 与迷你语言模型。

课程索引

搜索知识点

支持按课程标题、阶段和主题搜索。

12 章课程

从 Python 基础到大模型训练

课程依次覆盖基础语法、张量与训练、Transformer、性能优化、分布式和大模型生态。

01入门 · 3 节

零基础准备:Python、NumPy 与正确安装

只补后续课程真正会用到的 Python 与 NumPy,并学会按自己的机器选择 PyTorch、判断 CUDA 是否可用。

Python / NumPy / 安装进入本章 →
02入门 · 6 节

起步:环境、设备与第一枚 Tensor

从可复现的环境和第一枚张量开始,建立“形状、类型、设备”这三个贯穿 PyTorch 与大模型工程的基本坐标。

环境配置 / Tensor / shape进入本章 →
03基础 · 7 节

张量基本功:索引、广播与线性代数

把形状变换、广播、索引与批量矩阵乘法练成肌肉记忆,为注意力、掩码和损失计算打稳地基。

broadcasting / view / einsum进入本章 →
04基础 · 6 节

自动求导:从计算图到反向传播

拆开 autograd 的黑盒:看懂动态计算图、叶子节点、梯度累积、钩子和自定义求导,真正掌握训练为何有效。

autograd / backpropagation / gradient进入本章 →
05基础 · 7 节

神经网络工程:Module、损失与训练循环

从 `nn.Module` 的参数注册机制出发,亲手搭建可训练、可验证、可保存和可恢复的完整训练器。

nn.Module / loss / optimizer进入本章 →
06进阶 · 6 节

数据管线:Dataset、DataLoader 与批处理

让数据从磁盘稳定、高效地流向加速器,掌握 Dataset、采样、动态 padding、多进程加载与数据泄漏排查。

Dataset / DataLoader / collate_fn进入本章 →
07进阶 · 8 节

亲手搭 Transformer:从 Embedding 到注意力

不依赖高级封装,沿着形状流亲手实现词嵌入、因果注意力、前馈网络、残差与 Decoder Block。

Embedding / Attention / Transformer进入本章 →
08进阶 · 6 节

稳定训练:初始化、AMP、裁剪与排错

让模型不仅能跑,还能稳定地学:掌握初始化、混合精度、梯度累积、裁剪、监控和 NaN 定位。

AMP / gradient clipping / debugging进入本章 →
09高级 · 6 节

性能与显存:Profiler、compile 与检查点

用测量代替猜测,读懂 CPU/GPU 时间线、显存组成、激活检查点与 `torch.compile` 的适用边界。

Profiler / torch.compile / checkpointing进入本章 →
10高级 · 6 节

分布式训练:从 DDP 到 FSDP 与 TP

理解进程、rank 和集合通信,掌握 DDP、FSDP2、张量并行的选择逻辑,以及分布式训练最常见的挂起问题。

DDP / FSDP2 / Tensor Parallel进入本章 →
11高级 · 6 节

大模型生态:Transformers、PEFT、torchao 与 TorchTitan

把 PyTorch 基础接到真实大模型工具链,理解 Hugging Face 生态、参数高效微调、量化优化与官方大规模训练框架的职责边界。

Transformers / Datasets / Accelerate进入本章 →
12实战 · 7 节

方向实战:训练并优化一个迷你语言模型

把前十一章串成一个可运行项目:构造自回归样本、训练 Decoder-only 模型、生成文本、做参数高效微调并形成项目复盘。

Decoder-only / language modeling / LoRA进入本章 →

贯穿项目

每走一段,就留下可运行的成果

  1. 基础里程碑完整分类训练器数据、训练、验证与 checkpoint 闭环。下载项目
  2. 进阶里程碑可运行 Decoder Block含 SDPA、反向梯度与因果泄漏测试。下载项目
  3. 方向项目迷你中文语言模型内置语料,完成训练、生成与 checkpoint。下载项目

验证记录

代码运行范围

74
Python 代码语法校验
39
CPU 独立执行通过
35
组合或硬件路径明示
3/3
完整项目 CPU 通过

CUDA、FSDP2、Tensor Parallel 与 TorchTitan 路径明确标记所需硬件;页面同时提供运行命令和验收指标,但不会声称在本站 CPU 环境完成了 GPU 验证。

资料来源

资料来源与版本边界

课程以 PyTorch 官方文档和可复现实验为主要参考,版本敏感内容会单独标注。

基础教程 · torch.compile · 分布式训练 · 高性能注意力