REPRODUCIBLE FINANCE RETRIEVAL

金融 RAG 的可复现检索与评测泄漏治理

从 240 份公开研报的解析、切块和索引工程,到标题捷径审计、严格诊断集和分组置信区间。这里展示的是可核验证据,而不是一个被高分修饰的问答 Demo。

240 份公开研报 3 行业 × 80
8,504 索引 chunks 512 / overlap 100
1,024 向量维度 BGE-large-zh-v1.5
0 表格切分违规 960 table chunks

INTERACTIVE RETRIEVAL CONTRACT

合成检索沙盒

在浏览器中演示 Dense 候选、文档多样化和 RRF 的排序行为。演示数据与分数完全合成,不代表真实 BGE 输出。

SYNTHETIC ONLY 企业、数值、文档和摘要均为虚构;页面不包含研报原文、分析师联系方式、原始 Query 或向量索引。

本地启发式排序,仅用于展示接口契约与后处理差异。

检索策略
快速查询

检索链路

local / 0.0 ms
  1. 01
    Query normalize合成分词与语义标签
  2. 02
    Candidate ranking8 个合成候选
  3. 03
    PolicyDense 原始排名
  4. 04
    Citation payloaddoc / page / synthetic flag
TOP 5

检索结果

文档覆盖 0 / 5

    LEAKAGE AUDIT

    高分先经过泄漏审计

    原始自动集中 90/120 条 Query 含完整 gold 标题。移除这个捷径后,Dense Recall@5 从泄漏回归值 81.67% 降至严格诊断值 18.33%;两者不能混报。

    含标题
    90
    未含标题
    30
    总样本
    120
    01

    去掉最直接的捷径

    标题隐藏集完整标题残留为 0,疑似答案残留为 0。

    02

    评测集仍不“干净”

    120 条中只有 51 个规范化唯一 Query,69 条重复冗余,且全部为模板生成。

    03

    不替代人工独立集

    119/120 条模糊或结构缺失,30 条对比题缺少被比实体。

    DENSE RECALL@5

    同一检索器,两种评测口径

    泄漏回归集 81.67% 仅 pipeline regression
    标题隐藏诊断集 18.33% 仍非人工独立集

    RETRIEVAL EVIDENCE

    算法对照与不确定性

    文档多样化在全量事后诊断中表现最好,但固定 Dev/Test 后的区间下界触及 0。因此只声明“方向一致”,不声明稳定显著提升。

    STRICT TITLE-MASKED / N=120

    全量事后敏感性诊断

    dense_docdiv_m1 每份文档最多保留 1 个 chunk,将文档覆盖优先级显式写入排序。

    +5.84 pp 18.33% → 24.17% 事后诊断,不是 pristine holdout
    PIPELINE 从 PDF 到带引用答案
    1. 01ParsePyMuPDF + pdfplumber
    2. 02Chunk表格保护 / 9 组消融
    3. 03IndexBGE + FAISS / BM25
    4. 04RetrieveDense + doc diversity
    5. 05RerankTop20 → Top5
    6. 06Ground证据绑定 / 引用检查

    ANN MICROBENCHMARK

    索引近似质量与单机性能

    8,504 × 1,024 维真实向量,固定种子抽取 1,000 个库内 query,逐条移除自身 ID。FlatIP leave-self-out Top10 作为精确真值。

    HNSW / THIS MACHINE 99.95% ANN Recall@10 vs Flat neighbors
    Batch QPS41,627.57
    P95 / query0.256 ms
    Serialized35.42 MB
    IndexRecall@10QPSP95 msMemory MB
    Flat100.00%16,412.523.98233.22
    IVF99.81%14,271.090.76333.79
    HNSW99.95%41,627.570.25635.42
    不要误读这组数字

    它测量 ANN 对 Flat 邻居集合的逼近质量,不是语义检索 Recall;它是 Windows 单机 CPU 微基准,不是在线并发吞吐或生产 SLA。

    CLAIM BOUNDARY

    结论可以到哪里

    同一组证据,只有在不越过评测边界时才具有简历价值。下列口径是项目的公开声明契约。

    证据支持

    • 实现 240 份研报、8,504 chunks 的 BGE + FAISS/BM25 检索流水线。
    • 审计发现原自动集 75% Query 含完整 gold 标题。
    • 文档多样化在事后诊断和 Dev/Test 敏感性中方向一致。
    • 等权 RRF 在当前严格集上低于 Dense,是明确负结果。
    • IVF/HNSW 在已记录单机微基准中达到 99.81%/99.95% ANN Recall@10。

    证据不支持

    • 真实用户流量 Recall、答案正确率或 faithfulness。
    • 文档多样化带来稳定显著提升。
    • 人工盲测、线上收益、生产可用性或 SLA。
    • 将 81.67% 泄漏回归值当作泛化性能。
    • 将 ANN Recall/QPS 当作语义检索效果或服务端到端性能。
    NEXT REQUIRED EVIDENCE

    冻结协议后采集人工独立 Query

    当前 pristine 提交 0/60。下一轮需先完成作者隔离、盲化系统评审和质量门禁,再谈问答质量结论。

    Pristine queries0 / 60
    status: INCOMPLETE

    REPRODUCIBILITY MAP

    数字从哪里来

    页面仅展示聚合指标。公开仓库保留冻结配置、评测脚本与净化报告,不包含第三方研报正文、PDF、权重、embeddings 或索引。