update README.md
osCom 是一个面向校内办事政策的 DocQA RAG 应用,并提供本地 llama-server 的提示词缓存性能测试页面。
聊天页面中的 doc_qa Agent 会根据问题自行决定直接回答、追问,或调用 知识库工具检索政策内容;检索到的证据会交给模型组织最终回复。性能测试页面 提供三种提示词布局,用于观察本地服务在不同前缀稳定性下的表现。
doc_qa
项目只连接 OpenAI 兼容的本地 llama-server,不构建、启动或识别其内部的 Prompt Cache 实现。缓存后端和模型运行参数由使用者启动的 llama-server 决定。
/v1/chat/completions
在项目目录中安装运行依赖:
cd /path/to/os-com python -m pip install -r requirements.txt
需要运行测试时,再安装开发依赖:
python -m pip install -r requirements-dev.txt
从示例配置创建本机配置:
cp .env.example .env
对于已在默认地址启动的 llama-server,只需确认以下配置:
LLM_BASE_URL=http://127.0.0.1:8080/v1 LLM_API_KEY=none LLM_MODEL=local
配置项说明:
LLM_BASE_URL
/v1
LLM_API_KEY
none
LLM_MODEL
LLAMA_TOOL_URL
DOC_QA_KNOWLEDGE_PATH
data/doc_qa/knowledge.json
.env 和可选的 .local/env.sh 都位于项目根目录。启动脚本会先加载 .local/env.sh,再加载 .env,因此可将 Conda、NPU 驱动等机器相关环境放在 .local/env.sh,而将服务地址和项目配置放在 .env。
.env
.local/env.sh
先按照自己的模型和硬件环境启动 llama-server,并保证其模型别名、端口与 .env 一致。例如:
llama-server \ --model /path/to/model.gguf \ --alias local \ --port 8080
项目也提供 scripts/start_llama_server.sh 作为本机开发辅助脚本。使用该脚本前, 需要在 .env 中补充 LLAMA_SERVER_BIN、LLAMA_MODEL_PATH 及所需的模型运行参数。 这不是运行 osCom Web UI 的必要条件。
scripts/start_llama_server.sh
LLAMA_SERVER_BIN
LLAMA_MODEL_PATH
可以在启动 osCom 前检查服务连接:
bash scripts/check_llama_server.sh
在 llama-server 已就绪后启动 Web UI:
bash scripts/start_api.sh
默认访问地址为 http://127.0.0.1:8000/。
聊天页可查询知识库中的研究生院、财务处和实验室管理处政策。回答中的 Markdown 会在页面中渲染,检索和读取证据过程默认收起显示。
性能测试页只需选择一种提示词模式后运行测试:
页面展示 Cache Hit、Host Cache 占用、TTFT P50/P95 与 E2E Avg/P50/P95。测试始终连接 当前本地 llama-server,osCom 不提供缓存后端选择开关。
PYTHONPATH=src python -m unittest discover -s tests -v
src/oscom/ Web API、DocQA Agent 和性能测试代码 data/doc_qa/knowledge.json 内置政策知识库 scripts/ 服务检查与本机启动辅助脚本 tests/ 单元、API 与集成测试 docs/architecture.md 架构说明 docs/benchmarking.md 性能测试协议与指标定义
版权所有:中国计算机学会技术支持:开源发展技术委员会 京ICP备13000930号-9 京公网安备 11010802047560号
osCom
osCom 是一个面向校内办事政策的 DocQA RAG 应用,并提供本地 llama-server 的提示词缓存性能测试页面。
聊天页面中的
doc_qaAgent 会根据问题自行决定直接回答、追问,或调用 知识库工具检索政策内容;检索到的证据会交给模型组织最终回复。性能测试页面 提供三种提示词布局,用于观察本地服务在不同前缀稳定性下的表现。项目只连接 OpenAI 兼容的本地 llama-server,不构建、启动或识别其内部的 Prompt Cache 实现。缓存后端和模型运行参数由使用者启动的 llama-server 决定。
前置条件
/v1/chat/completions和工具调用的本地 llama-server安装
在项目目录中安装运行依赖:
需要运行测试时,再安装开发依赖:
配置
从示例配置创建本机配置:
对于已在默认地址启动的 llama-server,只需确认以下配置:
配置项说明:
LLM_BASE_URL/v1。LLM_API_KEYnone。LLM_MODELLLAMA_TOOL_URLLLM_BASE_URL。DOC_QA_KNOWLEDGE_PATHdata/doc_qa/knowledge.json。.env和可选的.local/env.sh都位于项目根目录。启动脚本会先加载.local/env.sh,再加载.env,因此可将 Conda、NPU 驱动等机器相关环境放在.local/env.sh,而将服务地址和项目配置放在.env。启动本地 llama-server
先按照自己的模型和硬件环境启动 llama-server,并保证其模型别名、端口与
.env一致。例如:项目也提供
scripts/start_llama_server.sh作为本机开发辅助脚本。使用该脚本前, 需要在.env中补充LLAMA_SERVER_BIN、LLAMA_MODEL_PATH及所需的模型运行参数。 这不是运行 osCom Web UI 的必要条件。可以在启动 osCom 前检查服务连接:
启动 osCom
在 llama-server 已就绪后启动 Web UI:
默认访问地址为 http://127.0.0.1:8000/。
聊天页可查询知识库中的研究生院、财务处和实验室管理处政策。回答中的 Markdown 会在页面中渲染,检索和读取证据过程默认收起显示。
性能测试页只需选择一种提示词模式后运行测试:
页面展示 Cache Hit、Host Cache 占用、TTFT P50/P95 与 E2E Avg/P50/P95。测试始终连接 当前本地 llama-server,osCom 不提供缓存后端选择开关。
测试
目录说明
进一步阅读