目录

生成式 AI 高效部署实践——基于超大模型的推理和部署实践

1. 课程概述

本课程基于腾讯混元大模型平台的一线实践经验,系统介绍生成式 AI 大模型从训练到推理部署的全链路技术方案。内容涵盖混元大模型与太极一站式平台的整体架构、Angle HCF 推理加速框架的核心技术、Angle SNIP 模型压缩框架的多种压缩算法,以及业务落地场景与前景展望。

课程源自 CNCC 2023 技术分享,由腾讯混元大模型团队出品,聚焦大模型在生产环境中的工程化部署挑战与实践经验。

2. 学习目标

通过本课程的学习,您将:

  1. 了解腾讯混元大模型及太极一站式平台的架构与能力
  2. 掌握大模型推理加速的核心技术(Attention 优化、显存优化、服务化调度等)
  3. 理解模型压缩的关键方法(量化压缩、稀疏压缩、蒸馏、小型化)
  4. 了解生成式 AI 技术在腾讯内部标杆业务中的落地场景

3. 适合的学习者

  • 对大规模语言模型(LLM)推理部署感兴趣的技术人员
  • 希望了解大模型工程化落地的算法工程师与系统工程师
  • 高校计算机相关专业的研究生与高年级本科生
  • AI 平台架构师与云服务开发者

4. 课程结构

章节 章节名称 主要内容 学习目标
1 混元大模型 & 太极一站式平台 混元大模型概述、太极平台架构、加速组件 了解混元大模型与太极一站式平台的整体架构
2 太极 Angle HCF 推理加速框架 Attention 加速、显存优化、量化与稀疏压缩适配、服务化调度 掌握大模型推理加速的核心技术原理
3 太极 Angle SNIP 模型压缩框架 量化压缩、稀疏压缩、小型化蒸馏、步数蒸馏 理解模型压缩的主流方法与效果评估
4 业务落地及前景展望 腾讯文档/会议/广告等落地场景、技术展望 了解生成式 AI 落地实践与未来方向

5. 实操演练

本课程秉持”做中学 (Learning by Doing)”原则,建议学习者在学习过程中:

  • 结合章节内容,尝试在云环境中部署大模型推理服务
  • 使用开源工具(如 TensorRT-LLM、vLLM、Triton Inference Server)复现推理加速实验
  • 对比不同量化精度(FP16/INT8/INT4)对模型性能和推理速度的影响
  • 探索稀疏压缩和蒸馏技术在大模型上的应用效果

6. 课程打卡指引

本项目采用 Issue 评论打卡 的方式。完成每项任务后,在对应 Issue 下提交您的学习成果。

打卡任务列表

任务 名称 说明
任务1 📖 第1章学习打卡 掌握混元大模型与太极平台架构
任务2 📖 第2章学习打卡 理解 Angle HCF 推理加速原理
任务3 📖 第3章学习打卡 掌握 Angle SNIP 模型压缩方法
任务4 📖 第4章学习打卡 了解生成式 AI 业务落地场景

7. 共创与贡献

欢迎所有学习者参与贡献!

贡献方式

  • 提交 Issue 反馈问题或建议
  • 提交 Pull Request 完善内容
  • 分享您的学习经验

8. 许可说明

本课程暂无指定许可证。课程创建者可后续添加 LICENSE 文件。

推荐许可证选项:MIT / Apache 2.0 / CC BY-SA 4.0 / MulanPSL-2.0

关于

基于腾讯混元大模型平台的生成式AI高效部署实践课程,涵盖混元一站式平台、Angle HCF推理加速、Angle SNIP模型压缩与业务落地

33.0 KB
邀请码
    Gitlink(确实开源)
  • 加入我们
  • 官网邮箱:gitlink@ccf.org.cn
  • QQ群
  • QQ群
  • 公众号
  • 公众号

版权所有:中国计算机学会技术支持:开源发展技术委员会
京ICP备13000930号-9 京公网安备 11010802047560号