Initial commit: three papers (P1/P2/P3) experiment code, results, and infrastructure P1 (Hitchhiking by Design): credit-chain attack on self-evolving agent memory Sandbox: Lemma 1 saturation 1.4e-12, Lemma 2 dead-zone 0 violations Real MemRL: payload swap 100% delivery, dose-response monotone PASS P2 (Learning the Wrong Lesson): write-back poisoning + fidelity-recall frontier End-to-end: 24/24 survival, boundary arm 0/16, judge independence 100% P3 (The Sharing Tax): shared memory linearly dissolves review independence 8 judges 5 orgs: n_eff 4.48->1.60, 9-point grid R2=0.995, TOST pass Non-oracle arm: law robust to retrieval degradation Infrastructure: audit.py, ref_stats.py, check_bib_strict.py, night_watchdog.sh
Initial commit: three papers (P1/P2/P3) experiment code, results, and infrastructure
博士论文主线:度量 → 诊断 → 可证明的缓解 环境:Windows + WSL2 (Ubuntu 20.04) 项目路径(WSL 内):~/research/agent-reliability Windows 访问:\\wsl$\Ubuntu-20.04\home\ljh\research\agent-reliability(或双击 D:\research\open-project.bat)
~/research/agent-reliability
\\wsl$\Ubuntu-20.04\home\ljh\research\agent-reliability
D:\research\open-project.bat
论文里出现的每一个数字,都必须能在 results/ 里找到对应文件,且该文件由 scripts/ 中已提交的脚本生成。
results/
scripts/
这条纪律存在的原因很具体:本项目由 AI 承担绝大部分劳动,最大的失败模式不是”做不出来”,而是产出一篇看起来很完整、但数字是编的论文——初稿越流畅越不容易被察觉。所以可靠性必须由机制保证,而不是由人眼检查。
具体做法:
results/<实验名>/<run_id>.json
run_id
timestamp
model
model_version
config_hash
prompt_tokens
completion_tokens
cost_estimate
raw_outputs
`幸运通过率 37.2%` <!--src:results/p1_main/20260921T1030.json#lpr-->
python3 audit.py papers/draft.md
nature-ref-verifier
所有实验必须能在任意时刻被杀掉并恢复,不丢失已完成的工作。
原因:会话会关闭、笔记本会休眠、API 会限流、余额会用完。这不是可选项。
具体做法:逐样本落盘(每完成一个样本写一次),启动时扫描 results/ 跳过已完成的 run_id;同一 (prompt, model, 参数) 的调用结果永久缓存,重跑不重复付费。
(prompt, model, 参数)
agent-reliability/ ├─ check_env.py 环境自检(零依赖):验证 API 密钥是否真能跑通 ├─ audit.py 数字可追溯性审计(投稿前必跑) ├─ .env 密钥(已 gitignore,需自行创建) ├─ .env.example 密钥模板 │ ├─ src/ │ ├─ harness/ 实验框架:可续跑执行器、API 客户端、缓存、计费 │ ├─ perturbations/ 论文 1:语义等价扰动生成器 │ ├─ memory/ 论文 2:记忆系统接入 + 四维诊断指标 │ └─ mas/ 论文 4:一致性协议与冲突注入 │ ├─ scripts/ 每个实验一个可重跑入口脚本 ├─ results/ 所有数字的唯一来源(JSON/CSV) ├─ figures/ 出版级图 ├─ papers/ 论文草稿 ├─ refs/ 文献库(bib + 核实报告) └─ notes/ 实验日志、决策记录
决策:在 WSL2 下构建和运行,不要用 Windows 原生 Python。
理由(均为本机实测):
/mnt/d
这一条是实测出来的,不是经验之谈。在 Windows 盘(/mnt/d,9p 挂载)与 Linux 文件系统上各创建 2000 个 4KB 小文件:
/mnt/d 的挂载参数为 type 9p (rw,noatime,...,msize=65536),这是 WSL2 访问 Windows 磁盘的经典慢路径。另外在该挂载点上 chmod 失效——chmod +x 后权限仍是 -rwxrwxrwx,所有文件都是 777。
type 9p (rw,noatime,...,msize=65536)
chmod
chmod +x
-rwxrwxrwx
对本项目的实际影响:
结论:代码、虚拟环境、实验结果一律放 Linux 文件系统;只把需要人工查看的最终交付物(论文稿、图)导出到 Windows 侧。
cd ~/research/agent-reliability python3 check_env.py
wsl -e bash -lc "cd ~/research/agent-reliability && python3 check_env.py"
wsl -e bash -lc "cd ~/research/agent-reliability && code ."
VS Code 会自动以 WSL 远程模式打开,编辑体验和本地文件完全一样,且不受 9p 性能影响。
check_env.py
audit.py
src/harness/
wsl -e bash -lc "cd ~/research/agent-reliability && cp .env.example .env"
编辑密钥文件。两种方式任选:
.env
\\wsl$\Ubuntu-20.04\home\ljh\research\agent-reliability\.env
验证:
看到 ✅ 可用 就说明环境就绪。
✅ 可用
注意:不要把密钥粘贴到聊天窗口里 —— 它会留在对话记录中。写进 .env 文件即可,我能直接读取该文件。
nature-downloader
版权所有:中国计算机学会技术支持:开源发展技术委员会 京ICP备13000930号-9 京公网安备 11010802047560号
智能体可靠性工程 · 研究项目
0. 两条不可违反的纪律
纪律一:证据链
论文里出现的每一个数字,都必须能在
results/里找到对应文件,且该文件由scripts/中已提交的脚本生成。这条纪律存在的原因很具体:本项目由 AI 承担绝大部分劳动,最大的失败模式不是”做不出来”,而是产出一篇看起来很完整、但数字是编的论文——初稿越流畅越不容易被察觉。所以可靠性必须由机制保证,而不是由人眼检查。
具体做法:
results/<实验名>/<run_id>.json,字段至少包含:run_id/timestamp/model/model_version/config_hash/prompt_tokens/completion_tokens/cost_estimate/raw_outputs`幸运通过率 37.2%` <!--src:results/p1_main/20260921T1030.json#lpr-->python3 audit.py papers/draft.md,检查每个标记的数字是否与来源文件一致。审计不通过不许投稿。nature-ref-verifier),不允许出现”看起来很真”的引用。纪律二:可中断、可续跑
所有实验必须能在任意时刻被杀掉并恢复,不丢失已完成的工作。
原因:会话会关闭、笔记本会休眠、API 会限流、余额会用完。这不是可选项。
具体做法:逐样本落盘(每完成一个样本写一次),启动时扫描
results/跳过已完成的run_id;同一(prompt, model, 参数)的调用结果永久缓存,重跑不重复付费。1. 目录结构
2. 环境与运行方式
决策:在 WSL2 下构建和运行,不要用 Windows 原生 Python。
理由(均为本机实测):
项目必须放在 Linux 文件系统里,不能放在
/mnt/d这一条是实测出来的,不是经验之谈。在 Windows 盘(
/mnt/d,9p 挂载)与 Linux 文件系统上各创建 2000 个 4KB 小文件:/mnt/d/mnt/d的挂载参数为type 9p (rw,noatime,...,msize=65536),这是 WSL2 访问 Windows 磁盘的经典慢路径。另外在该挂载点上chmod失效——chmod +x后权限仍是-rwxrwxrwx,所有文件都是 777。对本项目的实际影响:
/mnt/d上要几分钟结论:代码、虚拟环境、实验结果一律放 Linux 文件系统;只把需要人工查看的最终交付物(论文稿、图)导出到 Windows 侧。
从 WSL 内部运行(常规方式)
从 Windows 运行 WSL 命令
在 Windows 里打开项目
D:\research\open-project.bat\\wsl$\Ubuntu-20.04\home\ljh\research\agent-reliability用 VS Code 编辑(推荐)
VS Code 会自动以 WSL 远程模式打开,编辑体验和本地文件完全一样,且不受 9p 性能影响。
3. 当前进度
check_env.py环境自检脚本,已在 WSL 内实测通过audit.py数字审计脚本src/harness/可续跑执行器 + API 客户端 + 缓存4. 你需要做的事
配置密钥(约 5 分钟)
编辑密钥文件。两种方式任选:
D:\research\open-project.bat,在打开的窗口里双击.env(用记事本编辑)\\wsl$\Ubuntu-20.04\home\ljh\research\agent-reliability\.env验证:
看到
✅ 可用就说明环境就绪。注意:不要把密钥粘贴到聊天窗口里 —— 它会留在对话记录中。写进
.env文件即可,我能直接读取该文件。其余两件小事
nature-downloader取 PDF。