Initial commit: Harbor Agent 评测仓库
本仓库集中存放 Harbor 框架下各 Agent 的测评产物:测评结果报告、部署过程记录、Agent 说明,以及支撑这些产物的任务/判分/附件。
仓库的三个用途:
NN-<分类>/
01-理科
11-跨领域通用
agent.md
仓库原则:测一个,完整交付一个,再挂一个进目录。 这里不存放 242 个候选池清单(那些继续留在调研 Excel 里),也不存放 Agent 的源码(源码用上游 GitHub 链接指向)。仓库里出现的每一个 Agent,都必须已经按 Definition of Done 交付。
_registry/by-track.md
仓库的 11 个分类按学科·行业·应用界定(详细说明见 分类说明.md;文中”行业/行业包/行业知识”等词指各分类所对应的领域场景):
02-工科
03-文科
04-金融
05-教育
06-医疗
07-交通(智驾)
08-文娱
09-能源
10-智能制造
说明:11 个分类与《1001 智能体规划》的”11×7×13 网格”一一对应(11 分类 × 7 业务环节 × 13 智能体原型 = 1001)——11-跨领域通用 也是网格的一行(第 11 行,主码 GEN),不再是网格外。
GEN
harbor-agent-eval/ # = Harbor Agent 评测仓库 ├── README.md # 本文件(入口) ├── 分类说明.md # 11 个智能体方向(学科·行业·应用)详细说明 ├── Harbor评估方法.md # 如何用 Harbor 评估各方向智能体 ├── 1001智能体规划.md # 1001 落地规划 ├── 快速使用SOP.md # Harbor 快速上手 + 仓库使用流程 ├── FAQ.md # 常见问题 ├── LICENSE # 木兰宽松许可证第2版 ├── CONTRIBUTING.md # 提交规范 + 赛道/资产类型/分类目录词表 + DoD ├── _template/ # 每个新 Agent 的模板(从这里复制) │ ├── agent.md │ ├── deploy.md │ └── report.md ├── _registry/ │ ├── tested.md # 已测 Agent 台账(唯一权威清单) │ ├── by-track.md # 按赛道反查 │ ├── status.md # 候选池 → 部署中 → 测评中 → 已完成 进度看板 │ └── candidates.md # 候选池台账(通向 1001 的种子) ├── scripts/ │ └── add_agent.py # 从调研 Excel 读一行,自动生成目录 + 三件套初稿 ├── _infra/ # 评测基础设施(Benchmark / 工具 / 技能库,不是被测对象) │ ├── benchmarks/ │ └── tools-skills/ ├── 工作进展总结/ # 团队工作进展(赵一耕/于露/李丹/刘雨琨/彭子恒 各一子夹) └── NN-<分类>/ # 11 个分类目录(01-理科 ~ 11-跨领域通用) └── owner__repo/ # 一个已测 Agent 一个目录 ├── agent.md # 这个 Agent 是干什么的 ├── deploy.md # 部署/安装过程 ├── report.md # 测评结果报告 └── artifacts/ # 分数、日志、截图、评分脚本等附件
_registry/status.md
.\.venv\Scripts\python.exe scripts\add_agent.py "owner/repo" --survey "D:\harbor-project\报告表格及文档\可测评Agent调研总表(2026).xlsx"
--industry 10-智能制造 --track <slug>
deploy.md
report.md
artifacts/
_registry/tested.md
by-track.md
status.md
评测怎么跑? 每个方向的评测环境(任务、Verifier、评分脚本)按 Harbor评估方法.md 构造,具体安装运行步骤见 快速使用SOP.md。
本仓库最终落实 1001 个智能体的适配与评测。核心思路:
ENG-P2-A4
详见 1001智能体规划.md。
owner__repo
-
NN-<分类>
CONTRIBUTING.md
_infra/
实现1001个agent在魔力方舟api上的适配与测评
版权所有:中国计算机学会技术支持:开源发展技术委员会 京ICP备13000930号-9 京公网安备 11010802047560号
Harbor Agent 评测仓库
本仓库集中存放 Harbor 框架下各 Agent 的测评产物:测评结果报告、部署过程记录、Agent 说明,以及支撑这些产物的任务/判分/附件。
仓库的三个用途:
NN-<分类>/下的 11 个主目录(学科·行业·应用大类,01-理科~11-跨领域通用),跨分类只在agent.md里标注次级行业;一、文档导航
二、分类规则
NN-<分类>/下的一个主目录;跨分类/跨行业的,在agent.md里标注次级行业,不复制目录。agent.md和注册表里的标签,用_registry/by-track.md反查,不设目录层级。仓库的 11 个分类按学科·行业·应用界定(详细说明见 分类说明.md;文中”行业/行业包/行业知识”等词指各分类所对应的领域场景):
01-理科02-工科03-文科04-金融05-教育06-医疗07-交通(智驾)08-文娱09-能源10-智能制造11-跨领域通用三、目录结构
四、快速开始(新测一个 Agent)
_registry/status.md把该 Agent 标为 测评中;--industry 10-智能制造 --track <slug>手工指定所属分类目录)agent.md/deploy.md/report.md,附件放进artifacts/;_registry/tested.md、by-track.md各登记一行,status.md标 已完成;评测怎么跑? 每个方向的评测环境(任务、Verifier、评分脚本)按 Harbor评估方法.md 构造,具体安装运行步骤见 快速使用SOP.md。
五、1001 智能体规划速览
本仓库最终落实 1001 个智能体的适配与评测。核心思路:
ENG-P2-A4= 工科 × 设计仿真 × 仿真建模 = 结构/电路仿真建模智能体);详见 1001智能体规划.md。
六、核心约定速记
owner__repo(双下划线),全小写,空格转-。NN-<分类>(01-理科~11-跨领域通用),一个 Agent 只放一个主目录,跨分类只在agent.md标注,不复制、不建软链。CONTRIBUTING.md),否则注册表没法汇总对比。_registry/tested.md是唯一权威清单:目录里出现的东西必须先登记;登记过的必须指向真实目录。_infra/**,不进分类目录——它们是被测 Agent 的”裁判和任务环境”。