ONLINE INFERENCE GATEWAY · PORTFOLIO

NexusMind
Inference

知枢推理

将项目一的 SFT+DPO 客服模型与项目二的 Dense FAISS 金融 RAG 接入同一个 FastAPI 网关,统一缓存、限流、降级、指标与错误契约。

  • FastAPI
  • Transformers
  • FAISS
  • vLLM
  • Redis
EVIDENCE CONSOLE
PUBLIC SNAPSHOT
POST /api/deploy/ask route = auto
8-token 模型执行 P95
382.759 ms
32 并发完整 P95
10.742 s
热点缓存 32 并发 P95customer_cache · unique run
27.318 ms
轻量回归
123 / 123 PASS

! 三组延迟来自不同实验口径,不作生产 SLA 合并。

真实工程链路 可复核证据 明确外推边界

01 / SYSTEM

一套网关,两条推理路径

公共页面是纯静态作品集;完整交互演示由本地 FastAPI 服务提供。这里展示的是系统结构与冻结证据,不向 GitHub Pages 发起后端请求。

01
REQUEST售后问题
02
ROUTER意图分流
03
GENERATIONQwen3-0.6B + LoRA
04
CONTROLSOP guardrail

CUSTOMER SERVICE

微调模型负责生成,服务层负责守边界

加载项目一 SFT+DPO 后的 Qwen3-0.6B 合并模型;在统一响应契约外增加可信 SOP 检查、超时降级与 OOM fallback。

模型资产
rank-16 LoRA / merged HF
缓存键
prompt + generation config + version
返回证据
source / latency / fallback 状态
01分层缓存Redis 可选,内存 TTL 降级
02流量控制TokenBucket 限流
03故障降级timeout / OOM 合同
04可观测性指标、错误码、来源

02 / MEASURED

把性能数字放回实验上下文

下列数据均来自已提交报告。切换视图可查看模型并发、Linux serving 与量化测试;每个数字都同时标注它能证明什么。

WINDOWS · TRANSFORMERS/CUDA · NO CACHE

预热后固定 8-token,61 / 61 请求成功

模型执行约 0.4 秒,但单模型锁让完整响应随并发排队增长。滑动并发档位查看两个延迟口径。

32 并发 10,741.975 ms · 客户端完整 P95
模型执行 P95
382.759 ms
模型排队 P95
6,784.789 ms
吞吐
2.774 QPS
执行
383 ms
完整
10.74 s

HOT CACHE · 32 CONCURRENCY

27.318 ms P95

GATEWAY THROUGHPUT

1,012.745 QPS

缓存命中绕过模型,只证明热点网关路径;不能替代真实生成延迟。

RUN 20260711_180145_16692 · PROFILE customer_cache · UNIQUE RUN · 与 canonical concurrency CSV 分开

03 / CLAIM BOUNDARY

会做工程,也会约束结论

面试与简历只使用当前证据直接支持的表述。性能优化方向可以提出,但不能伪装成已完成结果。

证据支持

  • FastAPI 双路由网关接入客服模型与金融 RAG
  • 真实 8-token 模型并发与热点缓存分别压测
  • WSL2 vLLM Base 5 请求与 LoRA adapter 单请求跑通
  • 动态 INT8 延迟冒烟与 123 项轻量回归

证据不支持

  • 生产 SLA、高并发生产就绪或稳定性结论
  • 把 27.318 ms 缓存延迟写成模型生成延迟
  • LoRA adapter 的业务质量提升或人工偏好提升
  • AWQ/GPTQ 已实测、INT8 精度无损或内存下降

RESUME-READY SUMMARY

算法与服务工程的交叉项目

基于 Qwen3-0.6B SFT+DPO 客服模型与 Dense FAISS 金融 RAG,构建 FastAPI 双路由推理网关,完成缓存、限流、超时/OOM 降级和指标契约;在固定 8-token 无缓存口径下定位 32 并发 P95 10.74 秒的单模型锁排队瓶颈,并以 WSL2 vLLM Base 与 rank-16 LoRA 单请求验证后续迁移路径。

REPOSITORY

代码、报告与运行手册
保持同一证据口径。

打开 GitHub 仓库