feat: initialize reliable inference microservices
面向可靠推理任务的限流、熔断、降级与流量隔离实践
本项目是“分布式计算环境”课程大作业,课题方向为基于微服务架构的服务治理。
项目选择大模型智能体推理作为应用场景,构建一个可真实运行的微服务系统。系统接收用户提交的推理任务,通过推理编排、模型调用和结果验证完成任务,并记录完整的服务调用与治理事件。在此基础上,项目重点实现和验证限流、熔断、降级及流量隔离等服务治理机制。
本项目的核心是微服务架构与服务治理。可靠推理是业务场景和长期研究方向,而不是对课程目标的替代。
初步业务调用链如下:
用户 / Web 控制台 | v API 网关 | v 推理任务服务 | v 推理编排服务 / \ v v 模型网关 验证器服务 | | v v 大模型服务 规则 / 工具 / 测试 \ v 调用轨迹与评测结果
计划包含以下服务:
最终服务边界将根据实现和实验需要调整,但各服务必须能够独立启动和发生真实的网络调用。
项目将提供可重复执行的正常流量、突发流量和故障注入场景,重点展示:
计划采集的指标包括:
在满足课程服务治理要求的基础上,项目将为以下研究方向预留扩展能力:
服务可靠性和推理可靠性是两个不同概念。前者关注系统在故障和负载下能否持续提供服务,后者关注推理结果是否正确、稳定和可验证。本项目将分别度量二者,并分析它们之间的关系。
当前基础工程已验证的版本与后续选型如下:
RestClient
模型网关计划兼容 OpenAI API 风格的接口。模型地址和密钥仅通过环境变量或本地配置注入,不写入源码、示例配置或 Git 历史。系统也将提供可控的故障模拟服务,保证服务治理实验能够稳定复现。
项目工作区本身位于云服务器分配的作业容器中。当前容器的有效资源配额约为 8 vCPU 和 60 GiB 内存,足以运行本项目的多个微服务及监控组件。容器内没有 Docker Socket,且当前用户不是 root,因此项目不依赖 Docker-in-Docker。
开发和课程演示将采用以下方式:
如需在其他机器复现,项目可额外提供 Docker Compose 配置,但它不是当前作业容器中的主要运行方式。
完整环境核验见 docs/environment.md,服务边界、架构决策和逐阶段验收标准见 docs/architecture.md,分支与合并要求见 docs/collaboration.md。
docs/environment.md
docs/architecture.md
docs/collaboration.md
首次运行会把便携式 JDK 和 Maven 安装到已忽略的 .tools/ 目录:
.tools/
./scripts/bootstrap-tools.sh ./mvnw clean package ./scripts/start.sh ./scripts/e2e-test.sh
API 网关监听 http://127.0.0.1:8080。可直接提交一次在线推理任务:
http://127.0.0.1:8080
curl -sS -H 'Content-Type: application/json' \ -d '{"prompt":"Explain circuit breaking","taskType":"ONLINE"}' \ http://127.0.0.1:8080/api/v1/inference/tasks | jq .
查看所有服务健康状态或停止服务:
./scripts/health.sh ./scripts/stop.sh
五个服务分别监听 8080 至 8084,日志和 PID 位于 .runtime/。模型网关当前使用确定性本地适配器作为可重复实验基线,返回结果会如实标注模型名;它不是对真实大模型调用的伪装。OpenAI-compatible 适配器将在熔断和降级阶段加入。
.runtime/
阶段 0 和阶段 1 已完成。当前仓库包含五个可独立启动的 Spring Boot 服务、共享 HTTP 契约、便携工具链、进程管理脚本、健康检查、单元测试和端到端测试。
2026-08-09 基线验证结果:Maven Reactor 七个模块构建成功;模型网关和验证器单元测试共 2 个通过;8080-8084 五个健康端点均为 UP;端到端创建、编排、模型生成、规则验证和任务回查断言通过。下一阶段进入网关限流和模型并发预算实现。
UP
.env.example
.env
.gitignore
本项目用于课程学习与研究。开源许可证将在首次发布前确定。
distributed-computing-project
版权所有:中国计算机学会技术支持:开源发展技术委员会 京ICP备13000930号-9 京公网安备 11010802047560号
基于微服务架构的大模型智能体推理服务治理平台
项目简介
本项目是“分布式计算环境”课程大作业,课题方向为基于微服务架构的服务治理。
项目选择大模型智能体推理作为应用场景,构建一个可真实运行的微服务系统。系统接收用户提交的推理任务,通过推理编排、模型调用和结果验证完成任务,并记录完整的服务调用与治理事件。在此基础上,项目重点实现和验证限流、熔断、降级及流量隔离等服务治理机制。
本项目的核心是微服务架构与服务治理。可靠推理是业务场景和长期研究方向,而不是对课程目标的替代。
项目目标
系统架构
初步业务调用链如下:
计划包含以下服务:
最终服务边界将根据实现和实验需要调整,但各服务必须能够独立启动和发生真实的网络调用。
服务治理设计
1. 限流
2. 熔断
3. 降级
4. 流量隔离
演示与评测
项目将提供可重复执行的正常流量、突发流量和故障注入场景,重点展示:
计划采集的指标包括:
可靠推理扩展
在满足课程服务治理要求的基础上,项目将为以下研究方向预留扩展能力:
服务可靠性和推理可靠性是两个不同概念。前者关注系统在故障和负载下能否持续提供服务,后者关注推理结果是否正确、稳定和可验证。本项目将分别度量二者,并分析它们之间的关系。
技术选型
当前基础工程已验证的版本与后续选型如下:
RestClient:当前内部 HTTP 调用;接口稳定后再评估是否引入 OpenFeign模型网关计划兼容 OpenAI API 风格的接口。模型地址和密钥仅通过环境变量或本地配置注入,不写入源码、示例配置或 Git 历史。系统也将提供可控的故障模拟服务,保证服务治理实验能够稳定复现。
当前运行环境
项目工作区本身位于云服务器分配的作业容器中。当前容器的有效资源配额约为 8 vCPU 和 60 GiB 内存,足以运行本项目的多个微服务及监控组件。容器内没有 Docker Socket,且当前用户不是 root,因此项目不依赖 Docker-in-Docker。
开发和课程演示将采用以下方式:
如需在其他机器复现,项目可额外提供 Docker Compose 配置,但它不是当前作业容器中的主要运行方式。
完整环境核验见
docs/environment.md,服务边界、架构决策和逐阶段验收标准见docs/architecture.md,分支与合并要求见docs/collaboration.md。快速开始
首次运行会把便携式 JDK 和 Maven 安装到已忽略的
.tools/目录:API 网关监听
http://127.0.0.1:8080。可直接提交一次在线推理任务:查看所有服务健康状态或停止服务:
五个服务分别监听 8080 至 8084,日志和 PID 位于
.runtime/。模型网关当前使用确定性本地适配器作为可重复实验基线,返回结果会如实标注模型名;它不是对真实大模型调用的伪装。OpenAI-compatible 适配器将在熔断和降级阶段加入。课程要求对应关系
计划交付物
实施阶段
项目状态
阶段 0 和阶段 1 已完成。当前仓库包含五个可独立启动的 Spring Boot 服务、共享 HTTP 契约、便携工具链、进程管理脚本、健康检查、单元测试和端到端测试。
2026-08-09 基线验证结果:Maven Reactor 七个模块构建成功;模型网关和验证器单元测试共 2 个通过;8080-8084 五个健康端点均为
UP;端到端创建、编排、模型生成、规则验证和任务回查断言通过。下一阶段进入网关限流和模型并发预算实现。团队成员
安全说明
.env.example说明配置项,真实.env文件由.gitignore排除。License
本项目用于课程学习与研究。开源许可证将在首次发布前确定。