Finalize master submission checklist
本项目面向“多智能体协作中的低开销通信、非文本状态传递与共享记忆复用”赛题, 实现了一条可运行、可复现、可审计的多 Agent 协作链路。
系统注册 9 个具体 Agent。正式评测固定执行:
planner → researcher → executor → summarizer → verifier
结构化模式不只是把自然语言换成 JSON:planner 生成真实查询 embedding 并写入 multiprocessing.shared_memory,researcher 通过 state_id 读取并用于记忆检索; executor 在受限 CodeAct 子进程中生成工具证据,summarizer 解引用该证据后生成答案。 每次状态读取都记录生产者、消费者、用途、字节数及 SHA-256 完整性结果。
planner
multiprocessing.shared_memory
researcher
state_id
executor
summarizer
memory_id
正式实验包含 2 组关联任务、每轮 4 个案例、10 轮,共 40 对、80 次完整运行。
合计 token 的配对 bootstrap 95% CI 为 [-75.59%, -68.30%]。时延相对差异的 95% CI 为 [-6.41%, 9.31%],跨越 0,因此本项目不声称已证明显著时延改善。
[-75.59%, -68.30%]
[-6.41%, 9.31%]
在两种模式都通过质量门槛的 7 对样本中,合计 token 下降 70.35%,95% CI 为 [-80.56%, -50.91%]。低质量样本仍保留在全部样本统计中。
[-80.56%, -50.91%]
原始数据和完整性审计:
审计绑定的正式结果 SHA-256:
f71bab7a516353d2316911aabfb36dffe529f26870ea1204b6c63ca8529e7595
正式消融使用相同 4 个案例、10 轮、完整 5 消息 Agent 链和工具计划;5 个变体各运行 40 次,共 200 次。失败样本全部保留。
完整系统相对文本基线的配对合计 token 变化为 -64.23%,95% CI [-68.33%, -58.87%];质量通过率提高 32.5 个百分点,95% CI [17.5, 47.5]。时延变化为 +16.36%,95% CI [-4.66%, 38.05%], 区间跨越 0,因此不声称时延有显著改善。
-64.23%
[-68.33%, -58.87%]
[17.5, 47.5]
+16.36%
[-4.66%, 38.05%]
消融揭示了关键机制差异:协议压缩本身会损伤质量;加入真实 embedding 和 CodeAct 状态消费后, 质量从 0% 恢复到 52.5%。记忆和记忆图继续提高质量,但分别增加少量 token 开销。
消融原始结果 SHA-256:
7c2fb3d4d8eea961c8dc3167b7e2b3943718737f561eccdd54f4fdfc98ec5282
目标操作系统为 openEuler 24.03-LTS-SP3。项目使用 Python 3;本地整理验证环境的 Python 版本为 3.13.13。进入源码目录:
cd source_code python3 -m pip install -r requirements.txt
运行核心测试:
python3 -m experiments.test_protocol python3 -m experiments.test_mode_features python3 -m experiments.test_state_bus python3 -m experiments.test_quality_gate python3 -m experiments.test_tools
配置本地 Ollama:
export LLM_BACKEND=ollama export OLLAMA_BASE_URL=http://127.0.0.1:11434 export LLM_MODEL=qwen3:8b export OLLAMA_THINK=false export OLLAMA_NUM_PREDICT=768 export LLM_SEED=2026 export EMBEDDING_BACKEND=ollama export OLLAMA_EMBED_MODEL=bge-m3 export EMBEDDING_TIMEOUT=60 export TOKEN_COUNT_METHOD=tiktoken export TIKTOKEN_ENCODING=cl100k_base
正式运行与审计:
export STATE_BACKEND=shared_memory export CODEACT_SANDBOX=subprocess export CODEACT_PLAN_MODE=protocol export RIGOROUS_ROUNDS=10 python3 -m experiments.rigorous_benchmark python3 -m experiments.audit_rigorous_results
启动演示面板:
python3 -m experiments.dashboard
浏览器访问 http://127.0.0.1:8765。
http://127.0.0.1:8765
. ├── README.md ├── SUBMISSION_CHECKLIST.md ├── 设计文档.md ├── 技术报告.md ├── 操作系统开源创新大赛-作品原创承诺书.docx ├── 哆啦A梦队-EvidenceBus-答辩PPT.pptx ├── 哆啦A梦队-EvidenceBus-演示视频.mp4 ├── docs/ │ ├── contest_requirements.md │ ├── demo_video.md │ └── submission_status.md └── source_code/ ├── multi_agent/ ├── experiments/ ├── docs/ ├── reports/ ├── README.md ├── requirements.txt └── requirements-optional.txt
版权所有:中国计算机学会技术支持:开源发展技术委员会 京ICP备13000930号-9 京公网安备 11010802047560号
EvidenceBus:可审计的多智能体低开销协作系统
本项目面向“多智能体协作中的低开销通信、非文本状态传递与共享记忆复用”赛题, 实现了一条可运行、可复现、可审计的多 Agent 协作链路。
系统注册 9 个具体 Agent。正式评测固定执行:
结构化模式不只是把自然语言换成 JSON:
planner生成真实查询 embedding 并写入multiprocessing.shared_memory,researcher通过state_id读取并用于记忆检索;executor在受限 CodeAct 子进程中生成工具证据,summarizer解引用该证据后生成答案。 每次状态读取都记录生产者、消费者、用途、字节数及 SHA-256 完整性结果。作品特点
state_id/memory_id,大对象保留在状态层。正式 A/B 结果
正式实验包含 2 组关联任务、每轮 4 个案例、10 轮,共 40 对、80 次完整运行。
合计 token 的配对 bootstrap 95% CI 为
[-75.59%, -68.30%]。时延相对差异的 95% CI 为[-6.41%, 9.31%],跨越 0,因此本项目不声称已证明显著时延改善。在两种模式都通过质量门槛的 7 对样本中,合计 token 下降 70.35%,95% CI 为
[-80.56%, -50.91%]。低质量样本仍保留在全部样本统计中。原始数据和完整性审计:
审计绑定的正式结果 SHA-256:
正式五变体消融
正式消融使用相同 4 个案例、10 轮、完整 5 消息 Agent 链和工具计划;5 个变体各运行 40 次,共 200 次。失败样本全部保留。
完整系统相对文本基线的配对合计 token 变化为
-64.23%,95% CI[-68.33%, -58.87%];质量通过率提高 32.5 个百分点,95% CI[17.5, 47.5]。时延变化为+16.36%,95% CI[-4.66%, 38.05%], 区间跨越 0,因此不声称时延有显著改善。消融揭示了关键机制差异:协议压缩本身会损伤质量;加入真实 embedding 和 CodeAct 状态消费后, 质量从 0% 恢复到 52.5%。记忆和记忆图继续提高质量,但分别增加少量 token 开销。
消融原始结果 SHA-256:
快速验证
目标操作系统为 openEuler 24.03-LTS-SP3。项目使用 Python 3;本地整理验证环境的 Python 版本为 3.13.13。进入源码目录:
运行核心测试:
配置本地 Ollama:
正式运行与审计:
启动演示面板:
浏览器访问
http://127.0.0.1:8765。答辩与提交材料
文档
目录
当前边界