确认最终总分为 1345.51
CCF 开源创新大赛参赛项目 · 上海海洋大学 0 队 底层依赖:MindSpore AKG · 目标平台:昇腾 910B 系列
OpForge 面向 akg_kernels_bench_lite 算子任务,以官方 AKG Agent 的 akg-op -> kernelgen -> verifier 流程为生成底座,在其外层补充硬件能力审计、Operator Playbook、Adaptive Pass@N、真实 NPU 反馈、失败记忆、候选晋升、来源证明和可复现打包,将一次性代码生成扩展为可观察、可控制、可复核的算子优化闭环。
akg_kernels_bench_lite
akg-op -> kernelgen -> verifier
最终交付覆盖算子、Agent、知识、模型与配套工具,成绩和证据分别记录、分别归因:
latest/
skills/
SKILL.md
OpForge-AKG-Agent/
JupyterCTL/
MoarkCTL/
latest/ 收录 OpForge Agent 在多轮闭环中生成、验证并晋升的最终算子集。Agent 负责语义分析、路线规划、代码生成、真机反馈和候选迭代,Harness 负责组织评测证据与晋升条件;最终提交通过 13/13 strict correctness。按 13 题 official runner 结果与官方计分公式汇总,总分为 1345.51 分,最大加速为 5.88x。
题目快照与语义抽取 -> 运行栈与硬件能力审计 -> Operator Playbook / Candidate Plan -> 任务匹配的 Agent Skill 与受控机制知识 -> 官方 akg-op / kernelgen 生成 -> 官方 Verifier 与严格正确性门 -> Sidecar build / import / NPU forward / .so attestation -> 官方 runner 与 Profile Digest -> Candidate DAG / failure memory / targeted repair -> keep-best promotion / submission audit / package
控制器按算子结构选择实现路线:原生库算子优先评估精确 vendor floor;归一化、量化和 reduction 任务探索 AscendC/Triton 组合;矩阵任务比较 layout/cache 方案;mutable state 任务重点校验状态更新与多 seed 语义。
对需要 Sidecar 的候选,构建工作由控制器统一管理,ModelNew.forward() 保持纯运行路径。生成文件可以同时提供 AscendC primary、Triton-Ascend fallback 和 Torch correctness floor;正确性与晋升结果由官方 Verifier 和 runner 确认。
ModelNew.forward()
项目研发过程中形成了 27 + 8 + 3 = 38 项 Skill 工程资产:
项目研发阶段累计形成 38 项 Skill 工程资产。最终工作树在外层 skills/ 发布 35 个可直接审阅的 SKILL.md,当前 governed Agent 注册其中 8 个原生 Skill。3 个适配 Skill 的设计与实现保留在 Git 历史中,正式运行时使用机制级知识和当前 episode 的评测反馈。
项目 Skill 用于知识审阅、模型训练和机制研究。正式 Agent 运行接收机制级知识与当前 episode 的脱敏反馈,候选晋升依据当轮完整性检查和 official runner 结果。
. ├── latest/ # Agent 生成的 13 个最终提交候选 │ ├── t1/ # 6 个基础算子 │ ├── t2/ # 4 个复合算子及 Sidecar │ └── t3/ # 3 个高难算子及 Sidecar ├── skills/ # 35 个外层 SKILL.md │ ├── ascend-bench-strategy/ # 8 个团队通用策略 Skill │ ├── ascend-npu-profiling/ # 1 个团队 Profiling Skill │ ├── specific-implementation/ # 18 个团队模式/case Skill │ └── opforge-agent/ # 8 个 Agent 原生 Skill ├── OpForge-AKG-Agent/ # 自包含 Agent 工程 │ ├── opforge/ # 规划、控制、验证、反馈、打包 │ ├── akg_op_overlay/ # 当前受控运行时的 8 个 Agent Skill │ ├── scripts/ # setup/self-check/run_case/run_suite │ ├── tests/ # 控制器回归测试 │ └── third_party/akg-br-agents/ # 固定的官方 AKG Agent 快照 ├── JupyterCTL/ # Agent 远程终端、文件与可恢复任务 ├── MoarkCTL/ # 算力容器生命周期与计费边界控制 └── README.md
微调模型体积较大,不重复提交到 Git 仓库;完整四模型 LoRA 套件发布在 ModelScope 和 Hugging Face。
MANIFEST.sha256
本地回归用于校验控制逻辑;算子正确性和性能由 Ascend 环境中的 run_case.sh、run_agent_suite.sh 与 official runner 验证。
run_case.sh
run_agent_suite.sh
latest/ 是 OpForge Agent 经多轮生成、真机验证和候选晋升得到的最终提交。下表记录 13 个算子的参考延迟、最终加速比与加权分;加权分采用 official runner 的 T1/T2/T3 权重 1/1.5/2 计算。
13 题加权分合计 1345.51;其中 decode_mla 超过 5x,按官方规则计满 200.00 分。
decode_mla
cd OpForge-AKG-Agent bash scripts/setup.sh --ascend cp .env.example .env bash scripts/self_check.sh --runtime bash scripts/run_case.sh t1/sigmoid_scale_sum
完整题集:
cd OpForge-AKG-Agent bash scripts/run_agent_suite.sh
每次运行默认写入 OpForge-AKG-Agent/artifacts/runs/<run-id>/,包含 runtime audit、Pass@N 候选、progress events、Verifier/runner 证据、Candidate Memory、promotion decision 和 submission audit。
OpForge-AKG-Agent/artifacts/runs/<run-id>/
pipx install ./JupyterCTL pipx install ./MoarkCTL jc --help mc --help
JupyterCTL 负责机器内部的终端、文件与可恢复任务;MoarkCTL 负责算力容器的发现、启停、重启与状态等待。两者都只从本地私有配置读取凭据,示例文件不包含真实 Token。
import torch from latest.t1.gelu import Model, ModelNew, get_inputs, get_init_inputs args = get_inputs() init_args = get_init_inputs() reference = Model(*init_args)(*args) candidate = ModelNew(*init_args)(*args) assert torch.allclose(reference, candidate, atol=1e-2, rtol=1e-2)
该片段只用于快速语义检查,正式结论必须使用赛事官方 runner 的输入、预热、计时和评分流程。
aarch64
torch
torch_npu
OpForge-AKG-Agent/scripts/run_case.sh
OpForge-AKG-Agent/scripts/run_agent_suite.sh
OpForge-AKG-Agent/scripts/self_check.sh --with-tests
akg_kernels_bench_lite/tools/run_bench.py
OpForge-AKG-Agent/scripts/analyze_akg_agent_suite.py
项目设计与算子优化参考:
akg-op
版权所有:中国计算机学会技术支持:开源发展技术委员会 京ICP备13000930号-9 京公网安备 11010802047560号
OpForge:基于 Eval Harness 剖分驱动的双算子自动生成 Agent
项目简介
OpForge 面向
akg_kernels_bench_lite算子任务,以官方 AKG Agent 的akg-op -> kernelgen -> verifier流程为生成底座,在其外层补充硬件能力审计、Operator Playbook、Adaptive Pass@N、真实 NPU 反馈、失败记忆、候选晋升、来源证明和可复现打包,将一次性代码生成扩展为可观察、可控制、可复核的算子优化闭环。最终交付覆盖算子、Agent、知识、模型与配套工具,成绩和证据分别记录、分别归因:
latest/skills/SKILL.mdOpForge-AKG-Agent/JupyterCTL/MoarkCTL/latest/收录 OpForge Agent 在多轮闭环中生成、验证并晋升的最终算子集。Agent 负责语义分析、路线规划、代码生成、真机反馈和候选迭代,Harness 负责组织评测证据与晋升条件;最终提交通过 13/13 strict correctness。按 13 题 official runner 结果与官方计分公式汇总,总分为 1345.51 分,最大加速为 5.88x。核心创新
Agent 自主闭环
控制器按算子结构选择实现路线:原生库算子优先评估精确 vendor floor;归一化、量化和 reduction 任务探索 AscendC/Triton 组合;矩阵任务比较 layout/cache 方案;mutable state 任务重点校验状态更新与多 seed 语义。
对需要 Sidecar 的候选,构建工作由控制器统一管理,
ModelNew.forward()保持纯运行路径。生成文件可以同时提供 AscendC primary、Triton-Ascend fallback 和 Torch correctness floor;正确性与晋升结果由官方 Verifier 和 runner 确认。Skill 资产与当前运行边界
项目研发过程中形成了 27 + 8 + 3 = 38 项 Skill 工程资产:
项目研发阶段累计形成 38 项 Skill 工程资产。最终工作树在外层
skills/发布 35 个可直接审阅的SKILL.md,当前 governed Agent 注册其中 8 个原生 Skill。3 个适配 Skill 的设计与实现保留在 Git 历史中,正式运行时使用机制级知识和当前 episode 的评测反馈。项目 Skill 用于知识审阅、模型训练和机制研究。正式 Agent 运行接收机制级知识与当前 episode 的脱敏反馈,候选晋升依据当轮完整性检查和 official runner 结果。
仓库结构
微调模型体积较大,不重复提交到 Git 仓库;完整四模型 LoRA 套件发布在 ModelScope 和 Hugging Face。
Agent 工程验证
MANIFEST.sha256全量校验通过。SKILL.md;当前 Agent overlay 注册 8 个原生 Skill,模型可见面与历史实现隔离。latest/最终算子集由 Agent 生成并通过 official runner:13/13 strict;总分 1345.51,最大加速 5.88x。本地回归用于校验控制逻辑;算子正确性和性能由 Ascend 环境中的
run_case.sh、run_agent_suite.sh与 official runner 验证。最终算子成绩
latest/是 OpForge Agent 经多轮生成、真机验证和候选晋升得到的最终提交。下表记录 13 个算子的参考延迟、最终加速比与加权分;加权分采用 official runner 的 T1/T2/T3 权重 1/1.5/2 计算。13 题加权分合计 1345.51;其中
decode_mla超过 5x,按官方规则计满 200.00 分。快速开始
运行 Agent
完整题集:
每次运行默认写入
OpForge-AKG-Agent/artifacts/runs/<run-id>/,包含 runtime audit、Pass@N 候选、progress events、Verifier/runner 证据、Candidate Memory、promotion decision 和 submission audit。使用配套工具
JupyterCTL 负责机器内部的终端、文件与可恢复任务;MoarkCTL 负责算力容器的发现、启停、重启与状态等待。两者都只从本地私有配置读取凭据,示例文件不包含真实 Token。
检查团队候选
该片段只用于快速语义检查,正式结论必须使用赛事官方 runner 的输入、预热、计时和评分流程。
环境与评测入口
aarch64、Python 3.10+、Ascend 910B 系列、CANN、torch、torch_npu。OpForge-AKG-Agent/scripts/run_case.sh。OpForge-AKG-Agent/scripts/run_agent_suite.sh。OpForge-AKG-Agent/scripts/self_check.sh --with-tests。akg_kernels_bench_lite/tools/run_bench.py。OpForge-AKG-Agent/scripts/analyze_akg_agent_suite.py。JupyterCTL/;算力生命周期:MoarkCTL/。评测与交付规范
文档与参考文献
项目设计与算子优化参考:
akg-op、Kernel Designer/Coder/Verifier 与多 DSL 生成流程提供方法与系统基座;实现细节参见 AKG Agents 使用手册。