目录

Transformer-on-Metax

课程背景

Transformer是现代人工智能的基石,从GPT系列到DeepSeek,所有大语言模型的核心架构均建立在Transformer与注意力机制之上。

作为进入AI领域的必修课,Transformer已是国内绝大多数高校计算机、人工智能、电子信息等专业的核心教学内容。但当前高校AI人才培养与产业实际需求之间存在三个断层:

  1. 理论与实践的断层:学生能背出Attention公式,却没亲手写过一行核心代码,没跑通过一次完整训练
  2. 教学与工业界的断层:课程还在讲5年前的老内容,KV Cache、推理优化、vLLM这些工业界常识,课堂上几乎没有
  3. 国产硬件的断层:几乎所有GPU教学都围绕单一海外架构,学生毕业时对国产GPU开发一无所知,而国产算力生态正在爆发式增长,人才缺口巨大

课程介绍:

本实战营采用循序渐进的设计:先在CPU上用220行代码跑通最小Transformer,理解核心原理;再迁移到沐曦C500国产GPU,完成大规模数据集训练;随后扩展到Decoder-Only架构与KV Cache;再深入推理性能测试与工业级推理框架;最后体验MACA C++、Triton、TileLang三种方式的算子开发与性能对比。真实的国产GPU实验环境,加上系统的适配实践课程,让学员通过21天打卡学习,实现在国产GPU上,手搓大模型的项目成果。

课程亮点:

零基础友好: 从CPU上220行Python代码的最小实现开始,不搞跳跃式学习,每一步都跑通再进入下一步,零基础也能跟上。我们提供完整可运行的代码框架与数据集,从20个词的最小样例到1GB级公开训练集,每一步都有明确可交付的成果。AI概念随用随讲,只要会写Python/C++、具备高中数学基础即可跟上学习节奏,从CPU原理到GPU训练,带你完整走通Transformer开发全流程。

填补教学空白: 直击AI教学”重理论轻实践”痛点,我们想做一门真正”有用”的实战课:不搞玄学、不堆名词,每一行代码都能跑,每一个实验都有数据,每一个知识点都能落地。是原理到国产GPU落地全链路打通的实战营,解决”会公式不会写代码”的核心问题,为高校师生与开发者提供理论结合实践的高质量学习路径。

真实算力支持: 为解决学员实战算力不足的痛点,所有学员均可领取沐曦官方提供的GPU算力券,在课程中全程免费使用沐曦C系列的云GPU环境,无需自行购置硬件即可完成所有实验。【算力领取:https://developer.metax-tech.com/activities/27

国产生态先发: 系统掌握沐曦MACA编程与大模型部署能力,抢占国产算力时代人才先机,优秀学员可获得沐曦官方实习内推机会。

适合人群:

高校计算机/AI相关专业师生: 想动手实践课堂上学的Transformer理论,补全工程实践经验,积累国产GPU开发与大模型优化经历,为科研、竞赛、求职增加硬核项目经历的同学;

AI入门学习者: 想入门大模型开发,不满足只调用现成API,希望搞懂模型训练、推理、优化完整流程,建立扎实技术基础的学习者;

AI算法工程师&开发者: 想系统了解Transformer底层实现与推理优化,掌握国产GPU适配方法,拓展技术栈的一线开发者;

国产算力生态从业者&技术爱好者: 想切入国产GPU赛道,系统掌握沐曦MXMACA软件栈开发与大模型适配优化技术,参与国产算力生态建设的技术爱好者。

学习顺序及章节名称

学习顺序及章节名称 任务打卡地址-Issue序号 任务描述 预计用时 任务开始日期 任务截止日期
第一课:从 0 到 1 跑通你的第一个 Transformer https://gitlink.org.cn/ccf-ai-infra/Transformer-on-Metax/issues/1 通过 20 组中英词汇组成的极小数据集,观察训练损失下降,完成从代码运行、数据修改到 Attention 数值验证的最小闭环。 0.5天 08月17日 08月20日
第二课:使用MetaX GPU,训练 Encoder-Decoder 翻译模型 https://gitlink.org.cn/ccf-ai-infra/Transformer-on-Metax/issues/2 1. 在 MetaX GPU 上使用 MC-PyTorch 跑通训练闭环;
2. 同时使用 mx-smi 观察显存占用与 GPU 利用率,直观理解 GPU 对深度学习训练的价值。
1天 08月20日 08月27日
第三课:MetaX GPU 上的 Encoder-Decoder 翻译验证与优化 https://gitlink.org.cn/ccf-ai-infra/Transformer-on-Metax/issues/3 加载第二课训练得到的 Encoder-Decoder 权重,完成从训练指标到实际翻译结果的验证。 1天 08月24日 08月27日
第四课: 从 Encoder-Decoder 到 Decoder-Only,吃透大模型通用架构 https://gitlink.org.cn/ccf-ai-infra/Transformer-on-Metax/issues/4 亲手训练一个能够根据 prompt 续写文本的小型 Decoder-Only 模型。 1天 08月27日 09月03日
第五课:模型推理与 GPU 性能测试 https://gitlink.org.cn/ccf-ai-infra/Transformer-on-Metax/issues/5 在同一模型、同一 prompt 下,对比开启和关闭 KV Cache 的输出一致性与耗时差异; 1天 08月31日 09月03日
第六课:从模型到算子:基于MACA C++、Triton、TileLang 的算子优化 https://gitlink.org.cn/ccf-ai-infra/Transformer-on-Metax/issues/6 结合这 21 天的动手实践,从硬件层面、算子层面、算法/架构层面、推理引擎层面聊聊你对 “大模型性能优化” 的理解和思考。 1天 09月03日 09月07日

项目治理

本项目以小而透明的方式运转,欢迎所有人参与课程建设与迭代:

关于

21 天,在国产 GPU 上写一个能跑的 Transformer

27.0 MB
邀请码
    Gitlink(确实开源)
  • 加入我们
  • 官网邮箱:gitlink@ccf.org.cn
  • QQ群
  • QQ群
  • 公众号
  • 公众号

版权所有:中国计算机学会技术支持:开源发展技术委员会
京ICP备13000930号-9 京公网安备 11010802047560号