GET /api/dashboard 控制台聚合数据
GET /api/cluster 集群概览
GET /api/jobs 任务列表
GET /api/metrics GPU 指标
GET /api/alerts 告警列表
GET /api/model-calls 模型调用日志
GET /api/runs Agent 运行日志
POST /api/chat 执行 Agent 分析
GET /api/connections 查询脱敏后的节点连接状态
POST /api/connections/parse 解析 SSH 命令
POST /api/connections/fingerprints 检测 SSH Host Key 指纹
POST /api/connections/connect 异步连接并部署探针
GET /api/connection-tasks/{id} 查询连接任务进度
POST /api/connections/{id}/disconnect 停止采集并保留配置与凭据
POST /api/connections/{id}/reconnect 使用现有凭据重新连接节点
DELETE /api/connections/{id} 删除网页托管节点
算力集群智能运维 Agent
项目简介
算力集群智能运维 Agent 是一个面向国产 AI 算力平台的智能体应用原型,主要用于辅助开发者和运维人员排查大模型训练、推理服务和 GPU 资源调度过程中的常见问题。
项目以 CCF AIGC 与智能体开发任务为背景,采用“Mock/Real 双集群数据源 + 可切换大模型适配层”的方式实现。当前版本既可使用内置多节点 Mock 数据稳定演示,也可通过 SSH 探针实时采集租用的沐曦 C500 节点,并调用魔力方舟 / GiteeAI 资源包大模型完成真实推理验证。
本项目希望解决的问题是:当算力平台出现训练任务失败、显存不足、推理接口超时、容器异常退出、GPU 利用率异常等情况时,用户不需要手动翻查大量日志和指标,而是可以通过自然语言向 Agent 提问,由 Agent 自动调用工具、检索日志、整理证据并生成结构化运维报告。
整体流程如下:
当前项目已经提供 CLI 和 Web 两种演示入口。Web 控制台更适合比赛展示和后续部署,包含算力快速接入、集群总览、GPU 指标、任务队列、告警中心、Agent 分析流程、模型调用日志和故障报告展示。
演示材料
ppt/stage1_creative_plan/index.htmldocs/technical_spec.mddocs/deployment.mddocs/deployment_package.mddocs/real_cluster_integration.mddocs/multi_node_cluster.mddocs/real_call_evidence.mddocs/real_workload_validation.mddocs/real_failure_validation.mddocs/real_multi_node_validation.mddocs/real_four_node_validation.mddocs/development_plan.mddocs/final_submission.mddocs/final_merged_pr_list.md功能说明
已完成功能
项目内置一套 Mock 集群数据,位于:
包括:
项目同时提供真实沐曦节点采集链路:
当前已适配 MetaX C500 的 sGPU 输出,可分别记录租户切片利用率、显存配额、计算配额,以及共享物理板卡利用率、温度和功耗,避免混淆两类指标。
真实采集支持 2 至 32 个清单节点并发连接、稳定节点 ID、节点级独立缓存和部分故障降级。一个节点 SSH 失败时,其余节点仍可继续提供实时指标,故障节点生成
NODE_COLLECTOR_UNAVAILABLE告警。项目还提供真实 MACA Runtime 任务验证链路:
四节点实测资源池由三个 16 GB/25% sGPU 实例和一个 32 GB/50% sGPU 实例组成。健康并发场景的峰值利用率为
93%、93%、94%、94%,四个任务均正常完成;隔离故障场景中,32 GB 节点在94%负载后触发真实mcMalloc out of memory,其余三个节点均正常完成且没有收到 OOM 告警。Agent 通过真实 Qwen/Qwen3-32B 准确定位故障节点,随后原节点以94%峰值通过恢复任务。详细证据见docs/real_four_node_validation.md。核心流程位于:
支持:
工具模块位于:
主要包括:
知识库位于:
当前包含:
模型调用代码位于:
支持两种模式:
前端文件位于:
后端服务位于:
页面功能包括:
CLI 入口位于:
可用于快速验证 Agent 分析流程。
运行日志默认写入:
日志记录内容包括:
注意:
logs/默认不建议上传到公开仓库。项目同时提供脱敏后的真实联合调用样例
docs/real_call_evidence.md,用于 GitLink 公开验收;原始 JSONL 日志仅用于私密提交或现场演示。当前支持的典型问题
使用的模型与算力环境
模型接入方式
项目当前适配魔力方舟 / GiteeAI 资源包的 OpenAI-compatible Chat Completions 接口:
默认模型配置:
项目测试中接口实际返回的模型名可能显示为:
算力环境说明
本项目面向沐曦 GPU 算力环境设计。当前 Demo 采用两条可独立切换的真实链路:
这种设计既保留比赛现场不依赖外部网络的稳定演示能力,也能够提供真实沐曦算力、真实指标和真实模型调用日志作为验收证据。详细接入说明见
docs/real_cluster_integration.md。模型与集群配置项
配置模板位于:
主要配置:
说明:
MODEL_MODE=mock:只使用本地模拟模型;MODEL_MODE=real:调用真实魔力方舟 / GiteeAI 模型;MODEL_MODE=auto:检测到 API Key 时调用真实模型,否则退回 mock;MUXI_NO_THINK=true:针对 Qwen3 模型,自动在用户消息前添加/no_think,减少content为空的问题。CLUSTER_MODE=mock:读取内置多节点演示数据;CLUSTER_MODE=real:通过 SSH 读取真实沐曦节点,断连时使用最后一次成功快照并明确标记stale;CLUSTER_MODE=auto:优先读取真实节点,无缓存且连接失败时回退 Mock。CCF_CREDENTIAL_MASTER_KEY:加密网页录入的 SSH 凭据;本地可留空自动生成,生产环境应固定配置并安全备份。详细模型配置说明见:
运行与部署方法
环境要求
推荐环境:
安装 SSH 客户端依赖:
本地运行 Web 控制台
浏览器访问:
使用网页快速接入算力
ssh user@host -p 32222。多个节点会并发接入;其中一个节点失败不会阻止其他节点加入资源池。成功后系统自动使用网页托管的真实集群清单,无需手工编辑
.env或 JSON。远端仅写入~/.ccf-agent/muxi_node_probe.py,用于读取 Python、MX-SMI、MACA 和 GPU 指标。在“已连接节点”中可以逐节点断开和重新连接。断开只会将节点移出实时采集资源池,保留节点配置、Host Key 和加密凭据,也不会终止远端正在运行的任务;重新连接会使用现有凭据验证 SSH 和 GPU 探针,无需再次输入密码。配置文件节点首次断开时,系统会自动生成运行时启停清单,不修改原配置文件。
本地连接状态保存在被 Git 忽略的
runtime/目录:密码和私钥不会写入清单或 API 响应,提交连接任务后也会立即从页面输入框清除。
runtime/仍属于敏感运行数据,不得上传 GitLink、打包进镜像或公开分发。本地运行 CLI
强制调用真实模型:
强制读取真实沐曦节点:
执行真实 GPU 任务并调用真实模型验收:
执行真实受控 OOM 故障并验证 Agent 诊断:
OOM 模式下,远端任务按预期以非零码失败;只有状态文件、critical 告警、真实模型调用和 Agent 诊断全部通过时,本地验证脚本才返回
0。公开验证结果见docs/real_failure_validation.md。一次完成清单内全部节点的并发健康任务、单节点受控 OOM、故障隔离和聚合 Agent 诊断:
脚本先并发部署探针,再依次执行
healthy和isolated-oom场景。默认使用清单中的全部节点,也可以重复传入--node选择子集。节点任务只负责产生并采集证据,每个场景最后由聚合集群快照触发一次 Agent / Qwen 调用;完整证据写入logs/cluster_validation/<run-id>/combined_evidence.json。配置真实模型与集群
复制配置文件:
填写
.env:请勿将
.env、APIKEY.txt或任何真实 API Key 上传到 GitLink。多节点集群使用不含密码的 JSON 清单和独立密码文件:
配置格式和状态说明见
docs/multi_node_cluster.md。Web API
当前后端提供以下接口:
POST /api/chat示例:测试
当前测试覆盖:
云服务器部署
第一版后端没有内置登录系统。由于算力接入接口会接收 SSH 密码或私钥,禁止把
7860端口直接暴露到公网;云部署必须在服务前增加 HTTPS 反向代理和身份认证,只允许受信用户访问。完整配置原则见docs/deployment.md。Docker 部署
更多部署说明见:
上传 GitLink 前检查
请确认以下文件或目录没有被提交:
这些内容已配置在
.gitignore或.dockerignore中,但上传前仍建议执行:示例输入输出
示例一:训练任务 OOM
输入:
系统执行流程:
输出摘要:
示例二:推理服务变慢
输入:
输出摘要:
示例三:容器异常退出
输入:
输出摘要:
示例四:GPU 利用率偏低
输入:
输出摘要:
参考来源说明
本项目的设计和实现参考了以下材料与来源:
项目围绕比赛中“基于国产算力平台的 AIGC 与智能体开发与应用”任务要求设计,重点覆盖:
模型调用接口参考魔力方舟 / GiteeAI OpenAPI 文档中的 Chat Completions 接口:
当前项目使用的接口形式:
当前
data/mock_cluster/中的节点、任务、告警、日志和 GPU 指标均为项目演示构造数据,用于还原算力集群运维场景,不包含真实用户数据或真实生产日志。当前
data/knowledge_base/中的知识库内容由项目根据常见 AI 训练、推理服务和 GPU 调度故障场景整理,主要用于演示 RAG 检索流程和 Agent 证据链生成。项目开发中遇到的主要问题包括:
reasoning_content,导致message.content为空;当前版本的处理方式是先保证“可运行、可演示、可部署”,再逐步替换 Mock 数据源、增强真实模型调用和 Agent 编排能力。