目录

Harbor Agent 评测仓库

本仓库集中存放 Harbor 框架下各 Agent 的测评产物:测评结果报告、部署过程记录、Agent 说明,以及支撑这些产物的任务/判分/附件。

仓库的三个用途:

  1. 分类管理:把智能体按核心定位归入 NN-<分类>/ 下的 11 个主目录(学科·行业·应用大类,01-理科 ~ 11-跨领域通用),跨分类只在 agent.md 里标注次级行业;
  2. 分类说明介绍:每个分类的定义、典型场景、代表智能体、适合的 Harbor 评估方向,见 分类说明.md
  3. Harbor 各方向评估:如何用 Harbor 为每个方向的智能体构造可自动判分的最小闭环,见 Harbor评估方法.md;并最终落实到 1001 个智能体(= 11 分类 × 7 业务环节 × 13 原型),见 1001智能体规划.md

仓库原则:测一个,完整交付一个,再挂一个进目录。 这里存放 242 个候选池清单(那些继续留在调研 Excel 里),也存放 Agent 的源码(源码用上游 GitHub 链接指向)。仓库里出现的每一个 Agent,都必须已经按 Definition of Done 交付。


一、文档导航

文档 说明
分类说明.md 11 个智能体方向(学科·行业·应用)的详细说明:定义、典型场景、代表智能体、适合的 Harbor 评估方向
Harbor评估方法.md 如何用 Harbor 评估各方向智能体的方法论:最小闭环、评测规模、五类指标、9 大方向闭环构造
1001智能体规划.md 1001 个智能体落地规划:11×7×13 组织地图、Agent/Eval 双卡、阶段路线、候选池
快速使用SOP.md Harbor 安装→跑通 Task→查看结果的快速上手 + 本仓库使用流程
FAQ.md 常见问题(仓库用法 / 如何评测 / 如何提交 Agent)
CONTRIBUTING.md 提交规范 + 赛道/资产类型受控词表 + 分类目录词表 + Definition of Done
_registry/candidates.md 候选池台账(11 分类 · 50 项目,通向 1001 的种子)

二、分类规则

  1. 分类做目录:每个 Agent 按”核心定位分类”归入 NN-<分类>/ 下的一个主目录;跨分类/跨行业的,在 agent.md 里标注次级行业,不复制目录。
  2. 赛道做标签:测评维度(deep_research / 数据分析 / text_to_sql / 浏览器操作……)作为 agent.md 和注册表里的标签,用 _registry/by-track.md 反查,不设目录层级。

仓库的 11 个分类按学科·行业·应用界定(详细说明见 分类说明.md;文中”行业/行业包/行业知识”等词指各分类所对应的领域场景):

目录 分类 一句话说明
01-理科 理科 数学/物理/化学/生物/地球与环境科学等基础研究与科学发现
02-工科 工科 机械/电子/材料/土木/机器人等工程设计·仿真·实现
03-文科 文科 语言/写作/翻译/法律/社科等文字与咨询类
04-金融 金融 投研/交易/风控/财报分析
05-教育 教育 教学/出题/答疑/教务
06-医疗 医疗 临床/药物/生物信息/医学影像
07-交通(智驾) 交通(智驾) 自动驾驶/车/出行/物流调度
08-文娱 文娱 内容创作/音视频/游戏/营销创意
09-能源 能源 电力/油气/新能源
10-智能制造 智能制造 工业研发/制造执行/质检/设备运维
11-跨领域通用 跨领域通用 通用编码/编排/框架/助手 + 跨学科自动科研

说明:11 个分类与《1001 智能体规划》的”11×7×13 网格”一一对应(11 分类 × 7 业务环节 × 13 智能体原型 = 1001)——11-跨领域通用 也是网格的一行(第 11 行,主码 GEN),不再是网格外。


三、目录结构

harbor-agent-eval/             # = Harbor Agent 评测仓库
├── README.md                  # 本文件(入口)
├── 分类说明.md                 # 11 个智能体方向(学科·行业·应用)详细说明
├── Harbor评估方法.md           # 如何用 Harbor 评估各方向智能体
├── 1001智能体规划.md           # 1001 落地规划
├── 快速使用SOP.md              # Harbor 快速上手 + 仓库使用流程
├── FAQ.md                     # 常见问题
├── LICENSE                    # 木兰宽松许可证第2版
├── CONTRIBUTING.md            # 提交规范 + 赛道/资产类型/分类目录词表 + DoD
├── _template/                 # 每个新 Agent 的模板(从这里复制)
│   ├── agent.md
│   ├── deploy.md
│   └── report.md
├── _registry/
│   ├── tested.md              # 已测 Agent 台账(唯一权威清单)
│   ├── by-track.md            # 按赛道反查
│   ├── status.md              # 候选池 → 部署中 → 测评中 → 已完成 进度看板
│   └── candidates.md          # 候选池台账(通向 1001 的种子)
├── scripts/
│   └── add_agent.py           # 从调研 Excel 读一行,自动生成目录 + 三件套初稿
├── _infra/                    # 评测基础设施(Benchmark / 工具 / 技能库,不是被测对象)
│   ├── benchmarks/
│   └── tools-skills/
├── 工作进展总结/               # 团队工作进展(赵一耕/于露/李丹/刘雨琨/彭子恒 各一子夹)
└── NN-<分类>/                 # 11 个分类目录(01-理科 ~ 11-跨领域通用)
    └── owner__repo/           # 一个已测 Agent 一个目录
        ├── agent.md           # 这个 Agent 是干什么的
        ├── deploy.md          # 部署/安装过程
        ├── report.md          # 测评结果报告
        └── artifacts/         # 分数、日志、截图、评分脚本等附件

Harbor Agent 评测仓库目录结构


四、快速开始(新测一个 Agent)

  1. _registry/status.md 把该 Agent 标为 测评中
  2. 运行脚本生成目录和三件套初稿:
    .\.venv\Scripts\python.exe scripts\add_agent.py "owner/repo" --survey "D:\harbor-project\报告表格及文档\可测评Agent调研总表(2026).xlsx"
    (调研表里没有的项目,用 --industry 10-智能制造 --track <slug> 手工指定所属分类目录)
  3. 填完 agent.md / deploy.md / report.md,附件放进 artifacts/
  4. _registry/tested.mdby-track.md 各登记一行,status.md已完成
  5. 走 Fork + PR 合入(见 CONTRIBUTING)。

评测怎么跑? 每个方向的评测环境(任务、Verifier、评分脚本)按 Harbor评估方法.md 构造,具体安装运行步骤见 快速使用SOP.md


五、1001 智能体规划速览

本仓库最终落实 1001 个智能体的适配与评测。核心思路:

  • 1001 = 11 分类 × 7 业务环节 × 13 智能体原型,每个格子 = 一个候选 Agent(如 ENG-P2-A4 = 工科 × 设计仿真 × 仿真建模 = 结构/电路仿真建模智能体);
  • 智能体 = 通用 Agent 运行时 + 领域知识 + 岗位 Skill + 工具权限 + 安全规则,是”1001 张 Agent Card”,不是 1001 套烟囱系统;
  • 每个 Agent 必须配套 Agent Card(定义)+ Eval Card(如何评价) 两张卡;
  • 落地分 5 个阶段:建地图 → 最小闭环 → 跨领域验证 → 50 标杆 → 1001 张卡,从”1 个分类 × 5 任务 × 3 次 = 15 trials”开始。

详见 1001智能体规划.md


六、核心约定速记

  • 目录命名owner__repo(双下划线),全小写,空格转 -
  • 分类目录NN-<分类>01-理科 ~ 11-跨领域通用),一个 Agent 只放一个主目录,跨分类只在 agent.md 标注,不复制、不建软链。
  • 赛道/资产类型必须用受控词表(见 CONTRIBUTING.md),否则注册表没法汇总对比。
  • _registry/tested.md 是唯一权威清单:目录里出现的东西必须先登记;登记过的必须指向真实目录。
  • **Benchmark / 工具 / 技能库进 _infra/**,不进分类目录——它们是被测 Agent 的”裁判和任务环境”。
关于

实现1001个agent在魔力方舟api上的适配与测评

18.5 MB
邀请码
    Gitlink(确实开源)
  • 加入我们
  • 官网邮箱:gitlink@ccf.org.cn
  • QQ群
  • QQ群
  • 公众号
  • 公众号

版权所有:中国计算机学会技术支持:开源发展技术委员会
京ICP备13000930号-9 京公网安备 11010802047560号