add final submission package
CodeState-Agent 面向软件维护场景,通过结构化协议、非文本状态交换、共享记忆复用和 CodeAct-style 受控检查,完成代码风险识别、质量评估、测试建议与修复建议生成。
AgentMessage
semantic_state_id
MMapStateExchangeStore
RequirementAgent → CodeSemanticAgent → QualityAgent → ToolAgent → TestAgent → ReportAgent
最终结果来自 results/final_official_metrics/,主 benchmark 为相同顺序的 60 条任务、两种模式各 360 条 Agent 消息。
results/final_official_metrics/
Structured mode 通过紧凑协议显著降低了进入消息通道的 Token 和字节载荷。系统同时完成 360 次非文本状态传递,状态规模为 823,511 bytes;计入状态后总交换量较 Text mode 增加 6.76%,平均单任务时延增加 10.73%。当前结果说明协议压缩效果明显,但完整状态写入仍存在进一步增量化和去重优化空间。
python3 -m pip install -r requirements.txt python3 scripts/run_demo.py --mode structured --task_path data/code_tasks_real.jsonl python3 scripts/export_dashboard.py python3 scripts/web_demo_server.py
访问 http://localhost:8000。指标复核脚本为:
http://localhost:8000
python3 scripts/calculate_official_metrics.py
该脚本拒绝覆盖已有 results/final_official_metrics/;复跑前应另行归档现有权威结果。
src/ 六 Agent、Runtime、协议、状态、记忆与评测 data/ 主 benchmark、演示案例和连续任务 scripts/ 实验、官方指标、Dashboard 与 Web 服务脚本 results/final_official_metrics/ 唯一正式指标与可复核明细 docs/ 设计、接口、数据和实验说明 web/ Web Studio
data/code_tasks_real.jsonl
data/openeuler_cases.jsonl
data/continuous_tasks_group_a.jsonl
group_b.jsonl
tiktoken 0.13.0 / cl100k_base
项目已在 openEuler 24.03-LTS-SP3、Python 3.11.6 环境验证。openEuler 是部署和测试环境,不是 60 条主 benchmark 的代码来源。本项目是研究原型,不替代人工代码审查或工业级静态分析器。
版权所有:中国计算机学会技术支持:开源发展技术委员会 京ICP备13000930号-9 京公网安备 11010802047560号
CodeState-Agent:面向软件维护场景的低开销多智能体代码质量分析与修复建议系统
CodeState-Agent 面向软件维护场景,通过结构化协议、非文本状态交换、共享记忆复用和 CodeAct-style 受控检查,完成代码风险识别、质量评估、测试建议与修复建议生成。
核心能力
AgentMessage、semantic_state_id和MMapStateExchangeStore。六 Agent 流程
核心实验结果
最终结果来自
results/final_official_metrics/,主 benchmark 为相同顺序的 60 条任务、两种模式各 360 条 Agent 消息。Structured mode 通过紧凑协议显著降低了进入消息通道的 Token 和字节载荷。系统同时完成 360 次非文本状态传递,状态规模为 823,511 bytes;计入状态后总交换量较 Text mode 增加 6.76%,平均单任务时延增加 10.73%。当前结果说明协议压缩效果明显,但完整状态写入仍存在进一步增量化和去重优化空间。
快速运行
访问
http://localhost:8000。指标复核脚本为:该脚本拒绝覆盖已有
results/final_official_metrics/;复跑前应另行归档现有权威结果。项目结构
数据与实验说明
data/code_tasks_real.jsonl:60 条公开真实缺陷任务,Python/Java 各 30 条。data/openeuler_cases.jsonl:8 条构造演示案例,不代表真实 openEuler 漏洞或新 CVE。data/continuous_tasks_group_a.jsonl、group_b.jsonl:两组关联连续任务。tiktoken 0.13.0 / cl100k_base,不使用字符除以固定系数的估算方法。openEuler 运行环境
项目已在 openEuler 24.03-LTS-SP3、Python 3.11.6 环境验证。openEuler 是部署和测试环境,不是 60 条主 benchmark 的代码来源。本项目是研究原型,不替代人工代码审查或工业级静态分析器。