S01 · 31 / 31 集

芯片层

从一颗 CPU 到 AI 工厂,算力是怎么造出来的

3:51

S01EP01AI 时代,CPU 到底还有没有用

3:49

S01EP02只看算力,会被 GPU 骗

3:36

S01EP03CUDA:GPU 怎么把一个任务拆成上万个线程

3:11

S01EP04为什么 AI 喜欢矩阵乘法

3:37

S01EP05张量核心:AI 的矩阵速算班

3:37

S01EP06训练:模型是怎么学会的

3:47

S01EP07推理:训练好之后,跑起来有什么不同

3:35

S01EP08精度不是越高越好:FP32、FP16、BF16、FP8 到底在说什么(上)

4:10

S01EP09精度不是越高越好:FP32、FP16、BF16、FP8 到底在说什么(下)

4:01

S01EP10大模型为什么这么吃显存:参数、激活值和 KV Cache(上)

3:41

S01EP11大模型为什么这么吃显存:参数、激活值和 KV Cache(下)

3:53

S01EP12为什么同一张 GPU,跑一个人和跑一万人不是一回事(上)

4:04

S01EP13为什么同一张 GPU,跑一个人和跑一万人不是一回事(下)

4:22

S01EP14单卡不够怎么办:多卡互联和加速网络(上)

4:17

S01EP15单卡不够怎么办:多卡互联和加速网络(下)

6:00

S01EP16AI 工厂:GPU、网络、功耗和软件栈怎么组成系统

6:01

S01EP17数据喂不进去,GPU 也会饿:存储和数据管道

6:10

S01EP18模型怎么真正上线:推理引擎、调度和服务化

6:17

S01EP19RAG 是什么:为什么大模型还要查资料

6:35

S01EP20微调、RAG、提示词,到底该选哪个(上)

6:26

S01EP21微调、RAG、提示词,到底该选哪个(下)

5:54

S01EP22Agent 到底比聊天机器人多了什么(上)

6:26

S01EP23Agent 到底比聊天机器人多了什么(下)

5:42

S01EP24云上跑还是本地跑:AI 算力怎么选(上)

5:26

S01EP25云上跑还是本地跑:AI 算力怎么选(下)

5:27

S01EP26AI 系统为什么要监控(上)

6:04

S01EP27AI 系统为什么要监控(下)

5:24

S01EP28普通人怎么判断一个 AI 系统靠不靠谱(上)

5:34

S01EP29普通人怎么判断一个 AI 系统靠不靠谱(下)

5:24

S01EP30第一季总结:从一张 GPU 到 AI 工厂(上)

3:51

S01EP31第一季总结:从一张 GPU 到 AI 工厂(下)

← 全部系列