2026/10/5 15:14:30
网站建设
项目流程
数据库 B实验结果报告 第一章 实验概述 1.1 实验背景与目标 本实验面向论文检索场景,评估不同检索策略在给定语料库(共171 篇 学术文献)上的检索质量。语料按主题分为三类:漏洞修复(20 篇)、漏洞检测(93 篇)、LLM 安全(58 篇),三类论文数之和恰为 171 篇,构成完整的测试语料。
1.2 测试查询 测试集包含 3 条英文查询,分别与上述三个主题类别一一对应:
序号 测试查询(英文) 对应主题类别 相关文献数 1 State-of-the-art source code automatic repair methods 漏洞修复(20篇) 20 2 Summarize automated vulnerability mining frameworks 漏洞检测(93篇) 93 3 Future trends of LLM security research LLM安全(58篇) 58
1.3 评估指标定义 检索正例 :在返回结果(TOP-K)中被判定为与查询相关的文献数。Recall@K(召回率) = 检索正例数 ÷ 该类别相关文献总数。衡量“该找的找到了多少”。Precision@K(准确率) = 检索正例数 ÷ TOP-K(实际返回数)。衡量“返回的结果有多少是对的”。F1@K = 2 × Recall × Precision ÷ (Recall + Precision)。综合权衡召回与准确,作为核心择优指标。第二章 实验设计与配置 实验覆盖 4 种检索方式,并在每种方式下扫描多组超参数(重排序模型 / 融合权重、TOP-K、Score 阈值):
检索方式 重排序 / 融合策略 配置组数 TOP-K 取值 Score 阈值取值 全文检索 重排序模型 bge-reranker-v2-m3 12 3 / 5 / 8 / 10 0 / 0.5 / 0.8 向量检索 bge-reranker-v2-m3 12 3 / 5 / 8 / 10 0 / 0.5 / 0.8 混合检索-Rerank 重排序模型 bge-reranker-v2-m3 12 3 / 5 / 8 / 10 0 / 0.5 / 0.8 混合检索-权重设置 语义:关键词 权重 0:100% ~ 100%:0 共12档 44 3 / 5 / 8 / 10 0 / 0.5 / 0.8
第三章 核心指标汇总 下表给出各检索方式在全部超参数组合中的最优配置 及其核心指标(F1@K 最高者):
检索方式 最优配置 召回率 准确率 F1@K 均值F1 全文检索 变体=bge-reranker,TOP-K=10,Score阈值=0.0 6.43% 36.67% 10.95% 3.34% 向量检索 变体=bge-reranker,TOP-K=10,Score阈值=0.0 16.96% 96.67% 28.86% 8.68% 混合检索-Rerank 变体=bge-reranker,TOP-K=10,Score阈值=0.0 12.87% 73.33% 21.89% 7.47% 混合检索-权重设置 变体=0.4:0.6,TOP-K=10,Score阈值=0.0 17.54% 100.00% 29.85% 18.08%
第四章 各检索方式性能表现 4.1 全文检索 配置组数:12;最优配置:变体=bge-reranker,TOP-K=10,Score阈值=0.0。 整体指标(最优配置):Recall@K = 6.43%,Precision@K = 36.67%,F1@K =10.95% 。 分主题类别表现: 主题类别 相关文献 检索正例 Recall@K Precision@K F1@K 漏洞修复 20 7 35.00% 70.00% 46.67% 漏洞检测 93 4 4.30% 40.00% 7.77% LLM安全 58 0 0.00% 0.00% —
整体平均(全配置):Recall = 1.90%,Precision = 15.79%,F1 = 3.34%。 4.2 向量检索 配置组数:12;最优配置:变体=bge-reranker,TOP-K=10,Score阈值=0.0。 整体指标(最优配置):Recall@K = 16.96%,Precision@K = 96.67%,F1@K =28.86% 。 分主题类别表现: 主题类别 相关文献 检索正例 Recall@K Precision@K F1@K 漏洞修复 20 10 50.00% 100.00% 66.67% 漏洞检测 93 9 9.68% 90.00% 17.48% LLM安全 58 10 17.24% 100.00% 29.41%
整体平均(全配置):Recall = 4.09%,Precision = 36.06%,F1 = 8.68%。 4.3 混合检索-Rerank 配置组数:12;最优配置:变体=bge-reranker,TOP-K=10,Score阈值=0.0。 整体指标(最优配置):Recall@K = 12.87%,Precision@K = 73.33%,F1@K =21.89% 。 分主题类别表现: 主题类别 相关文献 检索正例 Recall@K Precision@K F1@K 漏洞修复 20 10 50.00% 100.00% 66.67% 漏洞检测 93 6 6.45% 60.00% 11.65% LLM安全 58 6 10.34% 60.00% 17.65%
整体平均(全配置):Recall = 4.24%,Precision = 36.04%,F1 = 7.47%。 4.4 混合检索-权重设置 配置组数:44;最优配置:变体=0.4:0.6,TOP-K=10,Score阈值=0.0。 整体指标(最优配置):Recall@K = 17.54%,Precision@K = 100.00%,F1@K =29.85% 。 分主题类别表现: 主题类别 相关文献 检索正例 Recall@K Precision@K F1@K 漏洞修复 20 10 50.00% 100.00% 66.67% 漏洞检测 93 10 10.75% 100.00% 19.42% LLM安全 58 10 17.24% 100.00% 29.41%
整体平均(全配置):Recall = 10.23%,Precision = 89.89%,F1 = 18.08%。 4.5 混合检索-权重设置的权重敏感度(B库) 在 TOP-K=10、Score阈值=0 条件下,不同语义:关键词权重下的 F1@K 峰值配置:
权重(语义:关键词) 召回率 准确率 F1@K 0.4:0.6 17.54% 100.00% 29.85% 0.3:0.7 16.96% 96.67% 28.86% 0.2:0.8 16.37% 93.33% 27.86% 0.5:0.5 16.37% 93.33% 27.86% 0.6:0.4 16.37% 93.33% 27.86%
第五章 关键发现 Score 阈值对召回存在显著负向影响 。所有检索方式下,Score 阈值取 0.5 或 0.8 的配置其召回率与 F1 普遍大幅低于阈值=0 的配置;全部最优指标均出现在 Score 阈值=0 处。建议在保证准确率可接受的前提下将阈值设为 0。TOP-K 与检索质量正相关 。以最优配置集中的 TOP-K=10 为例,其召回率与 F1 明显高于 TOP-K=3/5/8;增大返回窗口能提升相关文献被覆盖的概率,但需权衡下游重排序/阅读成本。“混合检索-权重设置”在本库中综合表现最佳 。其峰值 F1@K 达 29.85%,整体均值 F1(18.08%)显著高于其余三种方式(全文/向量/混合-Rerank 均值均低于 10%),44 组细粒度权重扫描提供了最大寻优空间;在 A 库中其峰值 F1 与“向量检索”持平,在 B 库中则明显优于“向量检索”。主题类别间表现严重不均衡 。漏洞检测类(93 篇)相关文献基数大、语义分散,各方式召回普遍偏低;LLM 安全类在部分配置下召回为 0(如 B 库全文检索最优配置未检索到任何 LLM 安全文献),是检索质量的短板。稳定性方面 ,“混合检索-权重设置”方式的 F1@K 变异系数最小,对超参数扰动最不敏感,工程落地风险最低。第六章 结论与建议 首选方案 :综合 F1 与寻优空间,推荐以“混合检索-权重设置”(最优权重,TOP-K=10,Score 阈值=0)作为本库默认检索策略。参数基线 :默认 TOP-K=10、Score 阈值=0;在准确率要求极高时可适度引入阈值,但需以召回损失为代价进行评估。短板治理 :针对 LLM 安全类与漏洞检测类召回不足,建议扩充该类语料、优化嵌入模型或引入查询改写;对类别不均衡问题,可采用分主题独立检索与加权融合。