Add standalone GPU monitor with day/hour charts for temp, fan, and power. Co-authored-by: Cursor cursoragent@cursor.com
Add standalone GPU monitor with day/hour charts for temp, fan, and power.
Co-authored-by: Cursor cursoragent@cursor.com
使用 OpenCompass 0.5.4,通过 OpenAI 兼容 API 评估本地 HyperQwen Qwen-27B。
面向环境:Linux + Python >= 3.10 + pip。
cmmlu_gen
ceval_gen
mmlu_gen
gsm8k_gen
humaneval_gen
longbench
Qwen-27B -> HyperQwen API (OpenAI-compatible) -> OpenCompass 0.5.4 -> Report
bash scripts/install.sh source .venv/bin/activate
脚本会:
.venv
opencompass[api]==0.5.4
.env
.env.example
也可手动安装:
python3 -m venv .venv source .venv/bin/activate pip install -U pip -i https://pypi.tuna.tsinghua.edu.cn/simple pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple cp .env.example .env
编辑 .env:
HYPERQWEN_API_BASE=http://172.20.32.235:18021/v1 HYPERQWEN_API_KEY=your-api-key HYPERQWEN_MODEL=qwen3.8-27b
模型配置:configs/models/hyperqwen_qwen27b.py(从环境变量读取上述项)。
configs/models/hyperqwen_qwen27b.py
source .venv/bin/activate python scripts/check_api.py
覆盖:数学 GSM8K(50 题) + 代码 HumanEval(全量) + 中文 CMMLU(5 科×20 题)。
bash scripts/run_quick.sh
bash scripts/run_eval.sh
单数据集:
bash scripts/run_single.sh gsm8k_gen
自定义数据集列表:
DATASETS="cmmlu_gen ceval_gen" bash scripts/run_eval.sh
调试(传给 opencompass 的额外参数):
bash scripts/run_single.sh gsm8k_gen -- --debug
等价于手动命令:
opencompass --config-dir configs --models hyperqwen_qwen27b --datasets gsm8k_gen --work-dir results/gsm8k_gen
注意:OpenCompass 0.5.4 若把配置文件作为第一个参数传入,会忽略 --datasets,必须改用 --models + --datasets。
--datasets
--models
常用环境变量:
MAX_NUM_WORKERS
4
MODE
all
infer
eval
viz
WORK_ROOT
results
MODEL_CFG
hyperqwen_qwen27b
configs/models/
CONFIG_DIR
configs
每个数据集结果在:
results/<dataset>/
汇总表一般在对应 work-dir 下的 summary / csv 文件中。
在 scripts/run_eval.sh 的 DEFAULT_DATASETS 中增加 dataset 名,或:
scripts/run_eval.sh
DEFAULT_DATASETS
DATASETS="bbh_gen mbpp_gen" bash scripts/run_eval.sh
可用配置可用:
python -c "from opencompass.utils.run import list_configs; list_configs()" # 或安装后使用 opencompass 自带 list 工具(若版本提供)
human_eval
pip install -U "setuptools<81" wheel pip install --no-build-isolation results/human-eval-master.zip # 若评分时报 os.fork / filelock 错误: pip install "filelock>=3.12,<3.16" bash scripts/run_humaneval_eval.sh
max_seq_len=32768
版权所有:中国计算机学会技术支持:开源发展技术委员会 京ICP备13000930号-9 京公网安备 11010802047560号
HyperQwen Qwen-27B OpenCompass Evaluation
使用 OpenCompass 0.5.4,通过 OpenAI 兼容 API 评估本地 HyperQwen Qwen-27B。
面向环境:Linux + Python >= 3.10 + pip。
覆盖 Benchmark
cmmlu_genceval_genmmlu_gengsm8k_genhumaneval_genlongbench架构
1. 安装
脚本会:
.venvopencompass[api]==0.5.4等依赖.env,从.env.example复制一份也可手动安装:
2. 配置 API
编辑
.env:模型配置:
configs/models/hyperqwen_qwen27b.py(从环境变量读取上述项)。3. 检查 API
4. 运行评测
快速摸底(约 30–60 分钟,推荐先跑)
覆盖:数学 GSM8K(50 题) + 代码 HumanEval(全量) + 中文 CMMLU(5 科×20 题)。
全量评测
单数据集:
自定义数据集列表:
调试(传给 opencompass 的额外参数):
等价于手动命令:
常用环境变量:
MAX_NUM_WORKERS4MODEallall/infer/eval/vizWORK_ROOTresultsMODEL_CFGhyperqwen_qwen27bconfigs/models/下的模型配置名CONFIG_DIRconfigs5. 查看结果
每个数据集结果在:
汇总表一般在对应 work-dir 下的 summary / csv 文件中。
6. 扩展
在
scripts/run_eval.sh的DEFAULT_DATASETS中增加 dataset 名,或:可用配置可用:
注意
humaneval_gen需要human_eval(不需要 git):longbench依赖长上下文;当前配置max_seq_len=32768,请确认服务端上下文长度足够。.env,不要提交到仓库。