目录

HyperQwen Qwen-27B OpenCompass Evaluation

使用 OpenCompass 0.5.4,通过 OpenAI 兼容 API 评估本地 HyperQwen Qwen-27B。

面向环境:Linux + Python >= 3.10 + pip。

覆盖 Benchmark

类别 Dataset 参数
中文知识 cmmlu_gen
中文考试 ceval_gen
综合知识 mmlu_gen
数学推理 gsm8k_gen
代码能力 humaneval_gen
长上下文 longbench

架构

Qwen-27B -> HyperQwen API (OpenAI-compatible) -> OpenCompass 0.5.4 -> Report

1. 安装

bash scripts/install.sh
source .venv/bin/activate

脚本会:

  • 创建 .venv
  • 使用清华 PyPI 源安装 opencompass[api]==0.5.4 等依赖
  • 若无 .env,从 .env.example 复制一份

也可手动安装:

python3 -m venv .venv
source .venv/bin/activate
pip install -U pip -i https://pypi.tuna.tsinghua.edu.cn/simple
pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple
cp .env.example .env

2. 配置 API

编辑 .env:

HYPERQWEN_API_BASE=http://172.20.32.235:18021/v1
HYPERQWEN_API_KEY=your-api-key
HYPERQWEN_MODEL=qwen3.8-27b

模型配置:configs/models/hyperqwen_qwen27b.py(从环境变量读取上述项)。

3. 检查 API

source .venv/bin/activate
python scripts/check_api.py

4. 运行评测

快速摸底(约 30–60 分钟,推荐先跑)

覆盖:数学 GSM8K(50 题) + 代码 HumanEval(全量) + 中文 CMMLU(5 科×20 题)。

bash scripts/run_quick.sh

全量评测

bash scripts/run_eval.sh

单数据集:

bash scripts/run_single.sh gsm8k_gen

自定义数据集列表:

DATASETS="cmmlu_gen ceval_gen" bash scripts/run_eval.sh

调试(传给 opencompass 的额外参数):

bash scripts/run_single.sh gsm8k_gen -- --debug

等价于手动命令:

opencompass --config-dir configs --models hyperqwen_qwen27b --datasets gsm8k_gen --work-dir results/gsm8k_gen

注意:OpenCompass 0.5.4 若把配置文件作为第一个参数传入,会忽略 --datasets,必须改用 --models + --datasets。

常用环境变量:

变量 默认 说明
MAX_NUM_WORKERS 4 OpenCompass 并行 worker
MODE all all / infer / eval / viz
WORK_ROOT results 结果目录
MODEL_CFG hyperqwen_qwen27b configs/models/ 下的模型配置名
CONFIG_DIR configs 本地配置目录

5. 查看结果

每个数据集结果在:

results/<dataset>/

汇总表一般在对应 work-dir 下的 summary / csv 文件中。

6. 扩展

在 scripts/run_eval.sh 的 DEFAULT_DATASETS 中增加 dataset 名,或:

DATASETS="bbh_gen mbpp_gen" bash scripts/run_eval.sh

可用配置可用:

python -c "from opencompass.utils.run import list_configs; list_configs()"
# 或安装后使用 opencompass 自带 list 工具(若版本提供)

注意

  • humaneval_gen 需要 human_eval(不需要 git):
    pip install -U "setuptools<81" wheel
    pip install --no-build-isolation results/human-eval-master.zip
    # 若评分时报 os.fork / filelock 错误:
    pip install "filelock>=3.12,<3.16"
    bash scripts/run_humaneval_eval.sh
  • longbench 依赖长上下文;当前配置 max_seq_len=32768,请确认服务端上下文长度足够。
  • API key 请放在 .env,不要提交到仓库。
关于
95.0 KB
邀请码
    Gitlink(确实开源)
  • 加入我们
  • 官网邮箱:gitlink@ccf.org.cn
  • QQ群
  • QQ群
  • 公众号
  • 公众号

版权所有:中国计算机学会技术支持:开源发展技术委员会
京ICP备13000930号-9 京公网安备 11010802047560号