S01 · 31 / 31 集
芯片层
从一颗 CPU 到 AI 工厂,算力是怎么造出来的
3:51S01EP01AI 时代,CPU 到底还有没有用
3:49S01EP02只看算力,会被 GPU 骗
3:36S01EP03CUDA:GPU 怎么把一个任务拆成上万个线程
3:11S01EP04为什么 AI 喜欢矩阵乘法
3:37S01EP05张量核心:AI 的矩阵速算班
3:37S01EP06训练:模型是怎么学会的
3:47S01EP07推理:训练好之后,跑起来有什么不同
3:35S01EP08精度不是越高越好:FP32、FP16、BF16、FP8 到底在说什么(上)
4:10S01EP09精度不是越高越好:FP32、FP16、BF16、FP8 到底在说什么(下)
4:01S01EP10大模型为什么这么吃显存:参数、激活值和 KV Cache(上)
3:41S01EP11大模型为什么这么吃显存:参数、激活值和 KV Cache(下)
3:53S01EP12为什么同一张 GPU,跑一个人和跑一万人不是一回事(上)
4:04S01EP13为什么同一张 GPU,跑一个人和跑一万人不是一回事(下)
4:22S01EP14单卡不够怎么办:多卡互联和加速网络(上)
4:17S01EP15单卡不够怎么办:多卡互联和加速网络(下)
6:00S01EP16AI 工厂:GPU、网络、功耗和软件栈怎么组成系统
6:01S01EP17数据喂不进去,GPU 也会饿:存储和数据管道
6:10S01EP18模型怎么真正上线:推理引擎、调度和服务化
6:17S01EP19RAG 是什么:为什么大模型还要查资料
6:35S01EP20微调、RAG、提示词,到底该选哪个(上)
6:26S01EP21微调、RAG、提示词,到底该选哪个(下)
5:54S01EP22Agent 到底比聊天机器人多了什么(上)
6:26S01EP23Agent 到底比聊天机器人多了什么(下)
5:42S01EP24云上跑还是本地跑:AI 算力怎么选(上)
5:26S01EP25云上跑还是本地跑:AI 算力怎么选(下)
5:27S01EP26AI 系统为什么要监控(上)
6:04S01EP27AI 系统为什么要监控(下)
5:24S01EP28普通人怎么判断一个 AI 系统靠不靠谱(上)
5:34S01EP29普通人怎么判断一个 AI 系统靠不靠谱(下)
5:24S01EP30第一季总结:从一张 GPU 到 AI 工厂(上)
3:51