Merge pull request ‘新增第四课文档,整理文档格式’ (#6) from vvyr/Transformer-on-Metax:master into master
Transformer是现代人工智能的基石,从GPT系列到DeepSeek,所有大语言模型的核心架构均建立在Transformer与注意力机制之上。
作为进入AI领域的必修课,Transformer已是国内绝大多数高校计算机、人工智能、电子信息等专业的核心教学内容。但当前高校AI人才培养与产业实际需求之间存在三个断层:
本实战营采用循序渐进的设计:先在CPU上用220行代码跑通最小Transformer,理解核心原理;再迁移到沐曦C500国产GPU,完成大规模数据集训练;随后扩展到Decoder-Only架构与KV Cache;再深入推理性能测试与工业级推理框架;最后体验MACA C++、Triton、TileLang三种方式的算子开发与性能对比。真实的国产GPU实验环境,加上系统的适配实践课程,让学员通过21天打卡学习,实现在国产GPU上,手搓大模型的项目成果。
零基础友好: 从CPU上220行Python代码的最小实现开始,不搞跳跃式学习,每一步都跑通再进入下一步,零基础也能跟上。我们提供完整可运行的代码框架与数据集,从20个词的最小样例到1GB级公开训练集,每一步都有明确可交付的成果。AI概念随用随讲,只要会写Python/C++、具备高中数学基础即可跟上学习节奏,从CPU原理到GPU训练,带你完整走通Transformer开发全流程。
填补教学空白: 直击AI教学”重理论轻实践”痛点,我们想做一门真正”有用”的实战课:不搞玄学、不堆名词,每一行代码都能跑,每一个实验都有数据,每一个知识点都能落地。是原理到国产GPU落地全链路打通的实战营,解决”会公式不会写代码”的核心问题,为高校师生与开发者提供理论结合实践的高质量学习路径。
真实算力支持: 为解决学员实战算力不足的痛点,所有学员均可领取沐曦官方提供的GPU算力券,在课程中全程免费使用沐曦C系列的云GPU环境,无需自行购置硬件即可完成所有实验。【算力领取:https://developer.metax-tech.com/activities/27 】
国产生态先发: 系统掌握沐曦MACA编程与大模型部署能力,抢占国产算力时代人才先机,优秀学员可获得沐曦官方实习内推机会。
高校计算机/AI相关专业师生: 想动手实践课堂上学的Transformer理论,补全工程实践经验,积累国产GPU开发与大模型优化经历,为科研、竞赛、求职增加硬核项目经历的同学;
AI入门学习者: 想入门大模型开发,不满足只调用现成API,希望搞懂模型训练、推理、优化完整流程,建立扎实技术基础的学习者;
AI算法工程师&开发者: 想系统了解Transformer底层实现与推理优化,掌握国产GPU适配方法,拓展技术栈的一线开发者;
国产算力生态从业者&技术爱好者: 想切入国产GPU赛道,系统掌握沐曦MXMACA软件栈开发与大模型适配优化技术,参与国产算力生态建设的技术爱好者。
本项目以小而透明的方式运转,欢迎所有人参与课程建设与迭代:
21 天,在国产 GPU 上写一个能跑的 Transformer
版权所有:中国计算机学会技术支持:开源发展技术委员会 京ICP备13000930号-9 京公网安备 11010802047560号
Transformer-on-Metax
课程背景
Transformer是现代人工智能的基石,从GPT系列到DeepSeek,所有大语言模型的核心架构均建立在Transformer与注意力机制之上。
作为进入AI领域的必修课,Transformer已是国内绝大多数高校计算机、人工智能、电子信息等专业的核心教学内容。但当前高校AI人才培养与产业实际需求之间存在三个断层:
课程介绍:
本实战营采用循序渐进的设计:先在CPU上用220行代码跑通最小Transformer,理解核心原理;再迁移到沐曦C500国产GPU,完成大规模数据集训练;随后扩展到Decoder-Only架构与KV Cache;再深入推理性能测试与工业级推理框架;最后体验MACA C++、Triton、TileLang三种方式的算子开发与性能对比。真实的国产GPU实验环境,加上系统的适配实践课程,让学员通过21天打卡学习,实现在国产GPU上,手搓大模型的项目成果。
课程亮点:
零基础友好: 从CPU上220行Python代码的最小实现开始,不搞跳跃式学习,每一步都跑通再进入下一步,零基础也能跟上。我们提供完整可运行的代码框架与数据集,从20个词的最小样例到1GB级公开训练集,每一步都有明确可交付的成果。AI概念随用随讲,只要会写Python/C++、具备高中数学基础即可跟上学习节奏,从CPU原理到GPU训练,带你完整走通Transformer开发全流程。
填补教学空白: 直击AI教学”重理论轻实践”痛点,我们想做一门真正”有用”的实战课:不搞玄学、不堆名词,每一行代码都能跑,每一个实验都有数据,每一个知识点都能落地。是原理到国产GPU落地全链路打通的实战营,解决”会公式不会写代码”的核心问题,为高校师生与开发者提供理论结合实践的高质量学习路径。
真实算力支持: 为解决学员实战算力不足的痛点,所有学员均可领取沐曦官方提供的GPU算力券,在课程中全程免费使用沐曦C系列的云GPU环境,无需自行购置硬件即可完成所有实验。【算力领取:https://developer.metax-tech.com/activities/27 】
国产生态先发: 系统掌握沐曦MACA编程与大模型部署能力,抢占国产算力时代人才先机,优秀学员可获得沐曦官方实习内推机会。
适合人群:
高校计算机/AI相关专业师生: 想动手实践课堂上学的Transformer理论,补全工程实践经验,积累国产GPU开发与大模型优化经历,为科研、竞赛、求职增加硬核项目经历的同学;
AI入门学习者: 想入门大模型开发,不满足只调用现成API,希望搞懂模型训练、推理、优化完整流程,建立扎实技术基础的学习者;
AI算法工程师&开发者: 想系统了解Transformer底层实现与推理优化,掌握国产GPU适配方法,拓展技术栈的一线开发者;
国产算力生态从业者&技术爱好者: 想切入国产GPU赛道,系统掌握沐曦MXMACA软件栈开发与大模型适配优化技术,参与国产算力生态建设的技术爱好者。
学习顺序及章节名称
2. 同时使用 mx-smi 观察显存占用与 GPU 利用率,直观理解 GPU 对深度学习训练的价值。
项目治理
本项目以小而透明的方式运转,欢迎所有人参与课程建设与迭代: