Merge pull request #138 from flagos-ai/feat/mthreads-fp64-l2-remaining Add remaining MUSA FP64 L2 kernels
Merge pull request #138 from flagos-ai/feat/mthreads-fp64-l2-remaining
Add remaining MUSA FP64 L2 kernels
[中文版|English]
FlagBLAS 是 FlagOS 的一部分。 FlagBLAS是一个遵循BLAS标准的接口的面向多种芯片后端的计算库,它定义了向量、矩阵等数值计算的核心操作,支持科学计算、工程仿真、机器学习和人工智能等领域高性能计算。
FlagBLAS 是一个使用 OpenAI 推出的Triton 编程语言实现的高性能通用算子库,
pip install -U scikit-build-core>=0.11 pybind11 ninja cmake
git clone https://github.com/flagos-ai/FlagBLAS.git cd FlagBLAS pip install .
在摩尔线程 GPU 上,请先准备厂商提供的 PyTorch/Triton(TorchMUSA)运行时, 再执行以下命令,避免安装过程替换厂商版 PyTorch:
source tools/set-env.sh mthreads pip install -e . --no-deps --no-build-isolation
摩尔线程 Level 2 正确性测试默认使用同一张 MUSA GPU 上的官方 muBLAS 作为参考后端,也可显式选择 CPU/SciPy 高精度参考:
pytest -q --ref musa tests/test_gemv.py pytest -q --ref cpu tests/test_gemv.py
本项目采用 Apache (Version 2.0) License 授权许可。
版权所有:中国计算机学会技术支持:开源发展技术委员会 京ICP备13000930号-9 京公网安备 11010802047560号
[中文版|English]
介绍
FlagBLAS 是 FlagOS 的一部分。 FlagBLAS是一个遵循BLAS标准的接口的面向多种芯片后端的计算库,它定义了向量、矩阵等数值计算的核心操作,支持科学计算、工程仿真、机器学习和人工智能等领域高性能计算。
FlagBLAS 是一个使用 OpenAI 推出的Triton 编程语言实现的高性能通用算子库,
特性
快速安装
安装依赖
安装FlagBLAS
在摩尔线程 GPU 上,请先准备厂商提供的 PyTorch/Triton(TorchMUSA)运行时, 再执行以下命令,避免安装过程替换厂商版 PyTorch:
摩尔线程 Level 2 正确性测试默认使用同一张 MUSA GPU 上的官方 muBLAS 作为参考后端,也可显式选择 CPU/SciPy 高精度参考:
本项目采用 Apache (Version 2.0) License 授权许可。