目录

EvidenceBus:可审计的多智能体低开销协作系统

本项目面向“多智能体协作中的低开销通信、非文本状态传递与共享记忆复用”赛题, 实现了一条可运行、可复现、可审计的多 Agent 协作链路。

系统注册 9 个具体 Agent。正式评测固定执行:

planner → researcher → executor → summarizer → verifier

结构化模式不只是把自然语言换成 JSON:planner 生成真实查询 embedding 并写入 multiprocessing.shared_memoryresearcher 通过 state_id 读取并用于记忆检索; executor 在受限 CodeAct 子进程中生成工具证据,summarizer 解引用该证据后生成答案。 每次状态读取都记录生产者、消费者、用途、字节数及 SHA-256 完整性结果。

作品特点

  • 证据寻址通信:协议只传动作、紧凑参数及 state_id/memory_id,大对象保留在状态层。
  • 真实状态消费:报告同时记录状态发布和读取,不以“写入数据库行数”冒充机制生效。
  • 完整性保护:embedding 二进制和 CodeAct artifact 均校验 SHA-256;篡改状态会被拒绝。
  • 持久共享记忆:SQLite 记忆支持关键词、标签、embedding 和动态 links 混合检索。
  • 公平配对 A/B:相同模型、seed、Agent 链路、工具计划和重试策略;两种模式使用隔离数据库并交替执行顺序。
  • 质量硬门槛:缺关键事实、编造本地路径或未读取状态的结果不会被算作质量通过。
  • 不隐藏协议成本:应用 token、握手 token、二者合计和用户输出分别统计。

正式 A/B 结果

正式实验包含 2 组关联任务、每轮 4 个案例、10 轮,共 40 对、80 次完整运行。

指标 文本模式 结构化模式 结构化相对变化
质量通过 11/40(27.5%) 30/40(75.0%) +47.5 个百分点
Agent 应用 token/运行 4303.05 1062.08 -73.64%
协议 token/运行 0 31.33 一次握手摊入 40 次运行
合计 token/运行 4303.05 1093.40 -72.44%
合计字符/运行 13133.15 3413.43 -72.02%
应用消息/运行 5.00 5.00 0
消息与协议事件/运行 5.00 5.25 +5.00%
平均耗时/运行 45169 ms 44163 ms 无显著结论

合计 token 的配对 bootstrap 95% CI 为 [-75.59%, -68.30%]。时延相对差异的 95% CI 为 [-6.41%, 9.31%],跨越 0,因此本项目不声称已证明显著时延改善。

在两种模式都通过质量门槛的 7 对样本中,合计 token 下降 70.35%,95% CI 为 [-80.56%, -50.91%]。低质量样本仍保留在全部样本统计中。

原始数据和完整性审计:

审计绑定的正式结果 SHA-256:

f71bab7a516353d2316911aabfb36dffe529f26870ea1204b6c63ca8529e7595

正式五变体消融

正式消融使用相同 4 个案例、10 轮、完整 5 消息 Agent 链和工具计划;5 个变体各运行 40 次,共 200 次。失败样本全部保留。

变体 质量通过率 平均合计 token 相对文本配对 token 变化 状态/记忆证据
文本基线 25.0% 4715.05 无状态传递
仅结构化协议 0.0% 1392.23 -68.17% 无状态传递
协议 + 状态 52.5% 1503.70 -65.51% 80 次已校验读取
协议 + 状态 + 记忆 55.0% 1533.55 -64.82% 1.925 次记忆命中/运行
完整系统 + 记忆图 57.5% 1559.75 -64.23% 1.925 次图命中/运行

完整系统相对文本基线的配对合计 token 变化为 -64.23%,95% CI [-68.33%, -58.87%];质量通过率提高 32.5 个百分点,95% CI [17.5, 47.5]。时延变化为 +16.36%,95% CI [-4.66%, 38.05%], 区间跨越 0,因此不声称时延有显著改善。

消融揭示了关键机制差异:协议压缩本身会损伤质量;加入真实 embedding 和 CodeAct 状态消费后, 质量从 0% 恢复到 52.5%。记忆和记忆图继续提高质量,但分别增加少量 token 开销。

消融原始结果 SHA-256:

7c2fb3d4d8eea961c8dc3167b7e2b3943718737f561eccdd54f4fdfc98ec5282

快速验证

目标操作系统为 openEuler 24.03-LTS-SP3。项目使用 Python 3;本地整理验证环境的 Python 版本为 3.13.13。进入源码目录:

cd source_code
python3 -m pip install -r requirements.txt

运行核心测试:

python3 -m experiments.test_protocol
python3 -m experiments.test_mode_features
python3 -m experiments.test_state_bus
python3 -m experiments.test_quality_gate
python3 -m experiments.test_tools

配置本地 Ollama:

export LLM_BACKEND=ollama
export OLLAMA_BASE_URL=http://127.0.0.1:11434
export LLM_MODEL=qwen3:8b
export OLLAMA_THINK=false
export OLLAMA_NUM_PREDICT=768
export LLM_SEED=2026

export EMBEDDING_BACKEND=ollama
export OLLAMA_EMBED_MODEL=bge-m3
export EMBEDDING_TIMEOUT=60
export TOKEN_COUNT_METHOD=tiktoken
export TIKTOKEN_ENCODING=cl100k_base

正式运行与审计:

export STATE_BACKEND=shared_memory
export CODEACT_SANDBOX=subprocess
export CODEACT_PLAN_MODE=protocol
export RIGOROUS_ROUNDS=10
python3 -m experiments.rigorous_benchmark
python3 -m experiments.audit_rigorous_results

启动演示面板:

python3 -m experiments.dashboard

浏览器访问 http://127.0.0.1:8765

答辩与提交材料

文档

目录

.
├── README.md
├── SUBMISSION_CHECKLIST.md
├── 设计文档.md
├── 技术报告.md
├── 操作系统开源创新大赛-作品原创承诺书.docx
├── 哆啦A梦队-EvidenceBus-答辩PPT.pptx
├── 哆啦A梦队-EvidenceBus-演示视频.mp4
├── docs/
│   ├── contest_requirements.md
│   ├── demo_video.md
│   └── submission_status.md
└── source_code/
    ├── multi_agent/
    ├── experiments/
    ├── docs/
    ├── reports/
    ├── README.md
    ├── requirements.txt
    └── requirements-optional.txt

当前边界

  • 上述 10 轮 A/B 在 openEuler 24.03 LTS-SP1 开发环境完成;提交前仍须在比赛指定的 LTS-SP3 环境重跑并保留日志,不能把 SP1 结果冒充 SP3 证据。
  • 已完成 LTS-SP1 上 10 轮、5 变体、200 次正式消融和独立审计;LTS-SP3 仍待复现。
  • 已实现 embedding 与工具 artifact 状态交换,未实现 KV-cache 或 hidden-state 跨模型复用。
  • CodeAct 使用 Linux 资源限制下的独立 Python 子进程,不等同于容器或虚拟机级强隔离。
  • 仓库根目录已包含设计文档、技术报告、作品原创承诺书、答辩 PPT 和演示视频。
关于
548.8 MB
邀请码
    Gitlink(确实开源)
  • 加入我们
  • 官网邮箱:gitlink@ccf.org.cn
  • QQ群
  • QQ群
  • 公众号
  • 公众号

版权所有:中国计算机学会技术支持:开源发展技术委员会
京ICP备13000930号-9 京公网安备 11010802047560号