chore: harden archived c500 smoke reproduction Signed-off-by: chatPPT chatPPT@users.noreply.gitlink.org.cn
chore: harden archived c500 smoke reproduction
Signed-off-by: chatPPT chatPPT@users.noreply.gitlink.org.cn
# vLLM-metax 开源贡献参赛项目
本项目围绕 vLLM-metax 进行开源贡献实践,目标是在沐曦 GPU 适配方向完成真实 issue 调研、代码贡献、PR 提交、运行验证和比赛材料归档。
目标上游项目:
参赛账号:
最后核验时间:2026-07-25 UTC
2026-07-25 UTC
本项目曾根据维护者建议,从旧 v0.19.0 issue #220 转向当时的 latest master / vLLM 0.23 对齐方向。两个真实上游 PR 和对应验证材料仍然有效,但上游 master 已继续演进,因此这里把“历史贡献结果”和“当前版本状态”明确分开。
当前上游状态:
mergeable=true
425a769
ed9cf8a
b3e0aee
mergeable=false
bf71867
setup.py
0.24.0
pyproject.toml
torch==2.10.0+metax3.8.0.7
PR #292 是主技术贡献:同步 v1 KV cache 相关 CPU 测试到 vLLM 0.23 API,并修复 MetaX 环境中的测试收集与 cleanup 兼容问题。Gemini Code Assist 指出的 ModelConfig(max_model_len=...) 问题已通过 follow-up commit 425a769 修复。2026-07-25 进一步发现 helper 直接把 HMA 开关设为 False,使一个本应验证真实 VllmConfig 解析的用例恒通过;待推送 commit ed9cf8a 已恢复 None → False 的真实测试语义,并完成 1 passed semantic guard 和 63 passed / 3 deselected 目标集合复验。
ModelConfig(max_model_len=...)
False
VllmConfig
None → False
1 passed
63 passed / 3 deselected
PR #293 是独立文档贡献:将 MACA source build 文档中的 vLLM 分支从 releases/v0.22.0 对齐到当时 master 使用的 releases/v0.23.0。Gemini Code Assist 没有提出修改意见;截至最后核验时间,这一修改已被上游版本推进自然覆盖,不应再描述为当前 master 的待合并修复。v0.23.0-dev 分支仍保留旧文档,因此 retarget 后仍有维护价值。待推送 commit bf71867 已把 “current master” 改为不随 master 演进而失真的 “vLLM-metax v0.23 line”。
releases/v0.22.0
releases/v0.23.0
v0.23.0-dev
两条新 commit 已在远端独立 clean worktree 中使用 signoff 提交,并制作 complete-history bundle 回传;本机缺少发布流程要求的 gh 前置工具,因此 尚未推送到 GitHub。这里不把“已验证、待推送”写成“PR 当前 head”。
gh
device_ids
CUDA_VISIBLE_DEVICES
_C
docs/01_project_research.md
docs/13_20260725_c500_revalidation_and_pr_hardening.md
EVIDENCE_INDEX.md
logs/remote_validation/044_final_verify_vllm023_kv_cache_tests.txt
logs/remote_validation/058_verify_pr292_modelconfig_followup_scheduler_tokens.txt
logs/remote_validation/061_verify_pr292_local_core_tests_clean_worktree.txt
logs/remote_validation/050_pr2_source_probe.txt
logs/remote_validation/079_current_c500_base_environment.txt
logs/remote_validation/085_pr292_hma_semantics_fix_validation.txt
logs/remote_validation/086_pr293_branch_specific_wording_fix.txt
logs/remote_validation/087_current_master_static_compatibility_gate.txt
logs/remote_validation/088_updated_pr292_tiny_real_weight_inference_c500.txt
logs/remote_validation/089_openai_server_tiny_random_c500.txt
090_openai_client_tiny_random_c500.txt
091_openai_server_client_summary_c500.txt
logs/remote_validation/093_new_validation_logs_sha256.txt
094_pending_push_commit_bundles.txt
logs/remote_validation/064_c500_torch_compute_and_metax_imports.txt
logs/remote_validation/075_tiny_dummy_inference_with_complete_accelerator_shim.txt
logs/remote_validation/078_real_weight_tiny_llama_inference_c500_generate_api.txt
records/gpuapps_issue_submission.md
screenshots/01_pr_and_validation_snapshot.svg
screenshots/02_c500_runtime_snapshot.svg
2026-06 与 2026-07-25 的运行使用同一历史版本线:MACA 3.5.3.20、 torch 2.8.0+metax3.5.3.9、vLLM 0.23.0 和旧版本 MetaX op bundle。 2026-07-25 新实例有两张 C500,并重新完成设备计算、测试、LLM.generate 和 OpenAI-compatible /v1/completions。这些结果是功能 smoke、问题定位 和实验性 workaround 证据,不构成 current master 的 MACA 3.5 支持声明, 也不代表 0.24/0.25、生产模型、语言质量或性能目标已经验证。
3.5.3.20
2.8.0+metax3.5.3.9
0.23.0
LLM.generate
/v1/completions
PR #292 clean-worktree 目标测试摘要:
Commit: 425a76942c6ee48ccb78a1460d22fdb54d366f17 GPU: MetaX C500 64GB torch: 2.8.0+metax3.5.3.9 vLLM: 0.23.0 collect: 63/66 tests collected, 3 deselected pytest: 63 passed, 3 deselected, 5 warnings
这组测试在 C500 主机上运行,但本身属于 CPU-safe tests,不应表述为 GPU kernel 回归。3 个 deselected 用例均为真实 ModelConfig("Qwen/Qwen1.5-7B", ...) 外部模型配置解析路径;未过滤运行已收集 66 tests,并在外部 HuggingFace 配置请求处等待后人工中断,停止前为 33 passed,记录见 logs/remote_validation/059_verify_pr292_full_core_tests_clean_worktree.txt。
ModelConfig("Qwen/Qwen1.5-7B", ...)
66 tests
33 passed
logs/remote_validation/059_verify_pr292_full_core_tests_clean_worktree.txt
2026-07-25 在待推送 commit ed9cf8a 上重新执行:
HMA semantic guard: 1 passed collect: 63/66 tests collected, 3 deselected pytest: 63 passed, 3 deselected, 6 warnings
这次测试恢复了真实 VllmConfig 的 HMA 配置解析,而不是由 stub 预先写入 期望值;证据见 logs/remote_validation/085_pr292_hma_semantics_fix_validation.txt。
C500 运行补充验证:
vLLM-metax key imports: OK torch.cuda device: MetaX C500 float16 matmul: 1024 x 1024, cuda:0, checksum recorded
最小 vLLM dummy inference 已完成,日志为 logs/remote_validation/075_tiny_dummy_inference_with_complete_accelerator_shim.txt。当时环境没有现成模型缓存,因此使用本地 tiny Llama config + load_format="dummy",并在 vLLM 0.23 隔离环境中补齐运行依赖和进程级 runtime shim。最终结果:
load_format="dummy"
LLM engine initialized on MetaX C500 generated_token_ids [8] finish_reason length
随后进一步生成本地 HF safetensors 随机权重模型,不依赖外网下载,在同一 C500 环境中完成权重文件加载和 token generation,日志为 logs/remote_validation/078_real_weight_tiny_llama_inference_c500_generate_api.txt。这里的“真实权重加载”指实际读取 safetensors,而不是有语言质量的预训练权重;最终结果:
safetensors
Loading safetensors checkpoint shards: 100% Model loading took 0.0 GiB memory and 0.191696 seconds GPU KV cache size: 32,519,616 tokens prompt_token_ids [1, 10, 11, 12] generated_token_ids [7, 75, 31, 89] finish_reason length
2026-07-25 在新实例、PR #292 待推送验证 commit ed9cf8a 上复验得到相同 token 结果,见 logs/remote_validation/088_updated_pr292_tiny_real_weight_inference_c500.txt。 随后生成确定性 WordLevel tokenizer,将 "Hello MetaX GPU" 编码为 [4, 5, 6],并在仅绑定 loopback 的 server 上成功调用:
"Hello MetaX GPU"
[4, 5, 6]
POST /v1/completions: PASS prompt_tokens: 3 completion_tokens: 4 response_text: " token_97 token_97 token_97 token_83" finish_reason: length single_request_elapsed_ms: 643
这是随机权重、单请求、eager mode 的 API compatibility smoke。输出没有语言 质量意义,643 ms 没有预热和重复样本,不能作为 benchmark。server/client、 SHA256 和清理证据分别见日志 089–093。
本项目基于 vLLM-metax 开源项目进行贡献,不直接复制为参赛作品;参赛产出是针对上游项目的真实 issue 分析、代码 PR、测试验证、文档和性能记录。
vLLM-metax 开源贡献参赛材料归档
版权所有:中国计算机学会技术支持:开源发展技术委员会 京ICP备13000930号-9 京公网安备 11010802047560号
# vLLM-metax 开源贡献参赛项目
项目简介
本项目围绕 vLLM-metax 进行开源贡献实践,目标是在沐曦 GPU 适配方向完成真实 issue 调研、代码贡献、PR 提交、运行验证和比赛材料归档。
目标上游项目:
参赛账号:
当前贡献状态
最后核验时间:
2026-07-25 UTC本项目曾根据维护者建议,从旧 v0.19.0 issue #220 转向当时的 latest master / vLLM 0.23 对齐方向。两个真实上游 PR 和对应验证材料仍然有效,但上游 master 已继续演进,因此这里把“历史贡献结果”和“当前版本状态”明确分开。
当前上游状态:
mergeable=true;GitHub head425a769;相对当前 master ahead 2 / behind 27ed9cf8a,修复 HMA 测试假阳性b3e0aee;ahead 1 / behind 27;mergeable=falsebf71867,将说明限定为 v0.23 版本线setup.py为0.24.0;pyproject.toml固定torch==2.10.0+metax3.8.0.7PR #292 是主技术贡献:同步 v1 KV cache 相关 CPU 测试到 vLLM 0.23 API,并修复 MetaX 环境中的测试收集与 cleanup 兼容问题。Gemini Code Assist 指出的
ModelConfig(max_model_len=...)问题已通过 follow-up commit425a769修复。2026-07-25 进一步发现 helper 直接把 HMA 开关设为False,使一个本应验证真实VllmConfig解析的用例恒通过;待推送 commited9cf8a已恢复None → False的真实测试语义,并完成1 passedsemantic guard 和63 passed / 3 deselected目标集合复验。PR #293 是独立文档贡献:将 MACA source build 文档中的 vLLM 分支从
releases/v0.22.0对齐到当时 master 使用的releases/v0.23.0。Gemini Code Assist 没有提出修改意见;截至最后核验时间,这一修改已被上游版本推进自然覆盖,不应再描述为当前 master 的待合并修复。v0.23.0-dev分支仍保留旧文档,因此 retarget 后仍有维护价值。待推送 commitbf71867已把 “current master” 改为不随 master 演进而失真的 “vLLM-metax v0.23 line”。两条新 commit 已在远端独立 clean worktree 中使用 signoff 提交,并制作 complete-history bundle 回传;本机缺少发布流程要求的
gh前置工具,因此 尚未推送到 GitHub。这里不把“已验证、待推送”写成“PR 当前 head”。上游版本演进与生态位
device_ids、不再由框架内部设置CUDA_VISIBLE_DEVICES,以及_C扩展向 libtorch stable ABI 的迁移。docs/01_project_research.md;本轮完整执行结果见docs/13_20260725_c500_revalidation_and_pr_hardening.md。关键证据
EVIDENCE_INDEX.mdlogs/remote_validation/044_final_verify_vllm023_kv_cache_tests.txtlogs/remote_validation/058_verify_pr292_modelconfig_followup_scheduler_tokens.txtlogs/remote_validation/061_verify_pr292_local_core_tests_clean_worktree.txtlogs/remote_validation/050_pr2_source_probe.txtlogs/remote_validation/079_current_c500_base_environment.txtlogs/remote_validation/085_pr292_hma_semantics_fix_validation.txtlogs/remote_validation/086_pr293_branch_specific_wording_fix.txtlogs/remote_validation/087_current_master_static_compatibility_gate.txtlogs/remote_validation/088_updated_pr292_tiny_real_weight_inference_c500.txtlogs/remote_validation/089_openai_server_tiny_random_c500.txt、090_openai_client_tiny_random_c500.txt、091_openai_server_client_summary_c500.txtlogs/remote_validation/093_new_validation_logs_sha256.txt、094_pending_push_commit_bundles.txtlogs/remote_validation/064_c500_torch_compute_and_metax_imports.txtlogs/remote_validation/075_tiny_dummy_inference_with_complete_accelerator_shim.txtlogs/remote_validation/078_real_weight_tiny_llama_inference_c500_generate_api.txtrecords/gpuapps_issue_submission.mdscreenshots/01_pr_and_validation_snapshot.svg、screenshots/02_c500_runtime_snapshot.svgC500 验证结果与边界
2026-06 与 2026-07-25 的运行使用同一历史版本线:MACA
3.5.3.20、 torch2.8.0+metax3.5.3.9、vLLM0.23.0和旧版本 MetaX op bundle。 2026-07-25 新实例有两张 C500,并重新完成设备计算、测试、LLM.generate和 OpenAI-compatible/v1/completions。这些结果是功能 smoke、问题定位 和实验性 workaround 证据,不构成 current master 的 MACA 3.5 支持声明, 也不代表 0.24/0.25、生产模型、语言质量或性能目标已经验证。PR #292 clean-worktree 目标测试摘要:
这组测试在 C500 主机上运行,但本身属于 CPU-safe tests,不应表述为 GPU kernel 回归。3 个 deselected 用例均为真实
ModelConfig("Qwen/Qwen1.5-7B", ...)外部模型配置解析路径;未过滤运行已收集66 tests,并在外部 HuggingFace 配置请求处等待后人工中断,停止前为33 passed,记录见logs/remote_validation/059_verify_pr292_full_core_tests_clean_worktree.txt。2026-07-25 在待推送 commit
ed9cf8a上重新执行:这次测试恢复了真实
VllmConfig的 HMA 配置解析,而不是由 stub 预先写入 期望值;证据见logs/remote_validation/085_pr292_hma_semantics_fix_validation.txt。C500 运行补充验证:
最小 vLLM dummy inference 已完成,日志为
logs/remote_validation/075_tiny_dummy_inference_with_complete_accelerator_shim.txt。当时环境没有现成模型缓存,因此使用本地 tiny Llama config +load_format="dummy",并在 vLLM 0.23 隔离环境中补齐运行依赖和进程级 runtime shim。最终结果:随后进一步生成本地 HF
safetensors随机权重模型,不依赖外网下载,在同一 C500 环境中完成权重文件加载和 token generation,日志为logs/remote_validation/078_real_weight_tiny_llama_inference_c500_generate_api.txt。这里的“真实权重加载”指实际读取 safetensors,而不是有语言质量的预训练权重;最终结果:2026-07-25 在新实例、PR #292 待推送验证 commit
ed9cf8a上复验得到相同 token 结果,见logs/remote_validation/088_updated_pr292_tiny_real_weight_inference_c500.txt。 随后生成确定性 WordLevel tokenizer,将"Hello MetaX GPU"编码为[4, 5, 6],并在仅绑定 loopback 的 server 上成功调用:这是随机权重、单请求、eager mode 的 API compatibility smoke。输出没有语言 质量意义,643 ms 没有预热和重复样本,不能作为 benchmark。server/client、 SHA256 和清理证据分别见日志 089–093。
仓库内容
后续待完成
gh发布流程可用后推送ed9cf8a、bf71867;当前推荐并计划把两条 PR retarget 到v0.23.0-dev,若维护者不再维护该线则关闭为 superseded。参考来源说明
本项目基于 vLLM-metax 开源项目进行贡献,不直接复制为参赛作品;参赛产出是针对上游项目的真实 issue 分析、代码 PR、测试验证、文档和性能记录。