目录

赛题题目:一种面向多智能体协作的低开销通信、状态传递与共享记忆机制(社区赛题)

赛题说明

随着大模型应用从单 Agent 问答逐步扩展到多 Agent 协同执行,智能系统正在从“单点生成”向“分工协作”演进。在检索增强生成、复杂任务规划、代码协作、办公自动化、知识分析等场景中,往往需要多个 Agent 分别承担规划、检索、执行、总结、生成等不同角色,并通过相互协作完成复杂任务。当前主流多 Agent 系统大多以自然语言或 JSON 作为通信媒介,即一个 Agent 将其中间结果组织成文本,再传递给其他 Agent 进行解析和继续处理。这种方式虽然通用性较好,但在多轮、多 Agent、复杂任务场景下存在明显不足:一是通信内容冗长、重复上下文多,token 消耗高;二是中间结果需要在“内部状态—文本—内部状态”之间反复转换,导致时延增加并可能带来语义损耗;三是任务执行过程中形成的中间知识和经验难以沉淀,系统在处理相似任务时往往仍需从头开始,缺乏持续积累和复用能力。

本赛题面向多智能体协作系统中的基础设施问题,要求选手围绕低开销通信、非文本状态传递、共享记忆复用三个方面,设计并实现一套可运行的原型系统。系统一方面需要通过结构化通信协议替代冗长自然语言交互,将 Agent 间传递的内容收敛为动作、参数、结果、能力等高密度语义单元,以降低通信成本和解析开销;另一方面需要探索 embedding、语义向量、隐藏状态特征或其他中间表示在 Agent 之间的直接传递机制,减少不必要的文本编解码过程,提高协作效率。在此基础上,还需将任务执行过程中形成的摘要、证据、策略、经验等内容沉淀为可标识、可检索、可复用的共享记忆单元,使系统具备跨任务的知识积累和协同增强能力。

本课题区别于一般的工作流编排类题目,重点不在于简单调用大模型接口和外部工具,而在于研究多智能体协作中的“系统层机制”:包括 Agent 间统一通信协议设计、中间状态表示与交换方式、共享记忆组织模型、跨任务复用机制以及整体运行效率验证。选手需面向开源操作系统或通用 Linux 环境完成原型实现,通过可复现实验验证该机制相较传统纯文本协作方式在通信开销、任务时延和记忆复用方面的改进效果。

具体要求

  • 系统需支持不少于 3 个 Agent 协同运行,至少覆盖任务规划、信息检索、总结生成、工具执行等角色中的 3 类,并能够完成一个包含多步骤处理过程的复杂任务;
  • 系统需设计并实现一套面向 Agent 间协作的结构化通信机制,通信内容至少包括动作类型、输入参数、返回结果和能力描述,并支持基本的握手、能力发现或协议映射机制,不得仅通过自然语言长文本直接透传全部协作信息;
  • 系统需同时支持“纯文本协作模式”和“结构化协议协作模式”,并在相同任务条件下完成可复现实验对比;
  • 系统需实现一种非文本中间状态传递机制,支持 embedding、语义向量、隐藏状态特征或其他中间表示在 Agent 间直接交换,并说明其生成方式、传递方式、接收方式及后续使用方式;
  • 系统需实现共享记忆模块,能够将任务执行过程中的中间结果、摘要、经验片段、证据链、结论或策略保存为统一的记忆单元,并为每条记忆记录至少包含记忆 ID、来源 Agent、创建时间、任务主题和摘要描述等基本元数据;
  • 系统需支持按关键词、标签或语义相似度检索历史记忆,并允许不同 Agent 在后续任务中直接复用已有记忆;
  • 系统需至少设计 2 组具有关联性的连续任务,验证结构化通信、非文本状态传递和共享记忆复用在减少重复计算、降低协作开销和提升任务效率方面的实际效果;
  • 系统需统计并展示 Agent 间消息次数、文本通信 token 或字符开销、非文本状态传递次数及数据规模、单任务总耗时、共享记忆命中率及整体性能提升情况;
  • 系统架构中至少应包含多 Agent 运行时、协议解析与调度模块、状态交换模块、共享记忆存储与检索模块和评测模块,并能够稳定执行不少于 10 轮连续任务;
  • 需提交完整源码、系统设计文档、部署文档、实验报告和演示视频,能够支持评审复现,鼓励结合 IPC、共享内存、Socket、向量数据库、WASM/容器沙箱、eBPF 等系统技术提升实现质量。
  • 鼓励系统能够支持基于 CodeAct 模式的 Agent 执行机制,允许 LLM 生成 Python 可执行代码,并在轻量沙箱中安全运行,实现低延迟、可隔离的代码执行与结果回传能力。

CoAgent — Multi-Agent StateBus(本仓库实现)

面向多智能体协作系统层机制的可运行原型:结构化通信、shm:// 非文本向量传递、共享记忆复用;含 CodeAct 沙箱与浏览器可视化实验台。

文档 路径
参赛主报告(Word) docs/CoAgent_instruction_book.docx
演示视频 docs/5minCoAgent_demo.mp4
原创承诺书 docs/Commitment.docx
作品介绍PPT docs/CoAgent_PPT.pptx
系统设计 docs/other_docs/design.md
部署说明 docs/other_docs/deploy.md
实验报告 docs/other_docs/experiment.md
CodeAct / 协作看板 docs/other_docs/codeact_ui.md
DeepSeek 真 API docs/other_docs/llm_deepseek.md
彩色结构图 docs/figures/

流水线

Planner → Retriever → Executor(CodeAct) → Compressor → Writer → Memory

启动时 CapabilityRegistry 握手与能力发现;Runtime 按能力调度,支持 text / protocol 双模式。

核心能力

模块 说明
AgentMessage action / params / result / capabilities + state:// / vec:// / shm://
StateStore 大 payload 外置,消息只传引用
VectorStore + ShmVectorBus hashing embedding + 共享内存传递(失败自动回退)
MemoryStore 元数据完整;keyword / tag / semantic / hybrid;命中节省
CodeAct 模板或 LLM 生成 Python + AST 白名单 + 隔离子进程
可视化实验台 CodeAct 五步链路 + 协作效能看板(全文 vs StateBus 现场对照)
Metrics / Benchmark 双模式、四组消融、稳定性 10 轮、SVG / PDF 报告

实测摘要(一次本机运行,细节见报告)

实验 关键结果
本地 run_benchmark 消息体积约 **↓70%**,估算 token 约 **↓90%+**,shm_attach > 0
DeepSeek run_benchmark_llm 真实 API token 3597 → 1277(↓64.5%)
协作看板(高/局部/低复用三组) 字节 **↓61.1%~82.1%**,token **↓80.3%~95.6%**,命中率 75% / 50% / 0%
CodeAct UI(古诗问答) Guard PASS,exit=0,61.76 ms
稳定性 10/10,记忆命中率约 80%

快速运行

仅依赖 Python 3.10+ 标准库(可视化台同样不需 Web 框架)。目标平台:openEuler 24.03-LTS-SP3。

# 机制复现(零密钥)
python3 run_demo.py
python3 run_benchmark.py
python3 run_ablation.py
python3 run_stability.py
python3 run_report.py
# 或一键:
bash scripts/smoke_openeuler.sh

# 可视化实验台(推荐演示主画面)
python3 run_codeact_ui.py
# 浏览器打开终端提示地址,默认 http://127.0.0.1:8765

# 可选:真实 DeepSeek(需配置 .env,见 docs/llm_deepseek.md)
python3 run_demo_llm.py
python3 run_benchmark_llm.py

Windows 将 python3 换成 python 即可。

可视化实验台要点

  1. CodeAct:Prompt → LLM/模板生成 → AST Guard → 隔离子进程 → 结构化回传。
  2. 协作效能:默认 Task1/Task2,可通过 + Add Task 增加 Task3/Task4;同序列跑 StateBus vs 传统全文,展示字节/token 降幅、shm/向量计数、记忆命中与 CodeAct 摘要。
  3. 趋势看板:展示随任务推进的传统模式/StateBus 累计 token,以及累计记忆命中率双轴曲线。
  4. 看板数值为本机现场实测;页面 token 为本地估算(非厂商账单)。账单级见 DeepSeek 实验。

界面采用白底、高对比度和放大字号,并提供打印样式,适合直接截图或打印为论文插图。

API Key 仅后端读 .env,勿提交仓库。沙箱为竞赛原型级隔离,生产需再加强。详见 docs/codeact_ui.md

环境变量(可选 LLM)

DEEPSEEK_API_KEY=sk-...
DEEPSEEK_BASE_URL=https://api.deepseek.com
DEEPSEEK_MODEL=deepseek-chat
# 或通用名:LLM_API_KEY / LLM_BASE_URL / LLM_MODEL

任务设计

run_demo/run_benchmark本地测试任务:

  • 组 A:Python import 错误系列(cv2 / numpy / …)— 命令行 demo/benchmark
  • 组 B:Nginx / config / log 排错系列
  • 可视化台:支持 2~4 条自定义任务及高复用、局部复用、低复用三组预设

Stability 连续跑 ≥10 轮关联任务。

项目结构

statebus/
  agents.py           # 六角色 Agent
  registry.py         # 握手与能力发现
  messages.py         # 结构化协议
  runtime.py          # 双模式运行时
  state_store.py      # state://
  vector_store.py     # vec://
  shm_vector_bus.py   # shm://
  codeact_sandbox.py  # CodeAct 沙箱
  codeact_web.py      # 可视化 HTTP 服务
  llm_client.py       # DeepSeek / OpenAI-compatible 客户端
  memory_store.py     # 共享记忆
  metrics.py / benchmark.py / report_svg.py / tasks.py
web/                  # 实验台前端
run_demo.py / run_benchmark.py / run_ablation.py
run_stability.py / run_report.py
run_demo_llm.py / run_benchmark_llm.py
run_codeact_ui.py

设计约束

  • Agent 间不传大文本;大 payload → StateStore,向量 → VectorStore / SHM
  • 消息字段超过 300 字符报错;state:// / vec:// / shm:// 强制校验
  • 默认单进程、内存态、标准库-only,便于评审复现
  • 可选 LLM 与可视化台不改变协议层抽象
关于
229.3 MB
邀请码
    Gitlink(确实开源)
  • 加入我们
  • 官网邮箱:gitlink@ccf.org.cn
  • QQ群
  • QQ群
  • 公众号
  • 公众号

版权所有:中国计算机学会技术支持:开源发展技术委员会
京ICP备13000930号-9 京公网安备 11010802047560号