Qwen3-0.6B Base
- Mean
- 473.400 ms
- P95
- 790.871 ms
- GPU
- 3,834 / 4,096 MiB
证明 OpenAI-compatible Base 单序列链路在 WSL2 / vLLM 0.8.5 可运行。
ONLINE INFERENCE GATEWAY · PORTFOLIO
知枢推理
将项目一的 SFT+DPO 客服模型与项目二的 Dense FAISS 金融 RAG 接入同一个 FastAPI 网关,统一缓存、限流、降级、指标与错误契约。
! 三组延迟来自不同实验口径,不作生产 SLA 合并。
01 / SYSTEM
公共页面是纯静态作品集;完整交互演示由本地 FastAPI 服务提供。这里展示的是系统结构与冻结证据,不向 GitHub Pages 发起后端请求。
CUSTOMER SERVICE
加载项目一 SFT+DPO 后的 Qwen3-0.6B 合并模型;在统一响应契约外增加可信 SOP 检查、超时降级与 OOM fallback。
02 / MEASURED
下列数据均来自已提交报告。切换视图可查看模型并发、Linux serving 与量化测试;每个数字都同时标注它能证明什么。
WINDOWS · TRANSFORMERS/CUDA · NO CACHE
模型执行约 0.4 秒,但单模型锁让完整响应随并发排队增长。滑动并发档位查看两个延迟口径。
HOT CACHE · 32 CONCURRENCY
27.318 ms P95GATEWAY THROUGHPUT
1,012.745 QPS缓存命中绕过模型,只证明热点网关路径;不能替代真实生成延迟。
RUN 20260711_180145_16692 · PROFILE customer_cache · UNIQUE RUN · 与 canonical concurrency CSV 分开WSL2 · LINUX CUDA · 4 GB GPU ENVELOPE
两次实验的 artifact、请求数和目标不同,因此不合并成“最终模型 vLLM 性能”。
证明 OpenAI-compatible Base 单序列链路在 WSL2 / vLLM 0.8.5 可运行。
证明 rank-16 LoRA alias 被真实加载并完成一条请求,不证明吞吐或业务质量。
CPU RUNTIME SMOKE · CONTRACT TESTS
动态 INT8 是 Windows CPU 短输出冒烟,不等价于 AWQ/GPTQ;测试基线使用 mock / 合成候选,不加载真实模型。
197 / 197 个 Linear 完成量化;输出不完全一致,且该进程口径下 RSS 未下降。
冻结核心契约基线;公共副本另有 10/10 发布审计,当前合并运行 133/133 PASS。
03 / CLAIM BOUNDARY
面试与简历只使用当前证据直接支持的表述。性能优化方向可以提出,但不能伪装成已完成结果。
RESUME-READY SUMMARY
基于 Qwen3-0.6B SFT+DPO 客服模型与 Dense FAISS 金融 RAG,构建 FastAPI 双路由推理网关,完成缓存、限流、超时/OOM 降级和指标契约;在固定 8-token 无缓存口径下定位 32 并发 P95 10.74 秒的单模型锁排队瓶颈,并以 WSL2 vLLM Base 与 rank-16 LoRA 单请求验证后续迁移路径。