1. 项目背景与核心发现
安全研究员Kasra Rahjerdi近期进行了一项引人注目的实验:通过故意构建一个存在漏洞的图书评论APK应用,测试当前主流大语言模型在安全漏洞挖掘方面的实际表现。这项研究总共花费1500美元预算,对十余款大模型进行了系统性测试,其中GPT-5.5以70%的成功率领先,而DeepSeek V4 Pro则以单次成功成本仅0.62美元的表现成为成本效益最优的模型。
实验设计的精妙之处在于模拟了真实场景中的漏洞挖掘过程。研究员在APK文件中植入了暴露的Firebase凭据(谷歌移动端后端服务),这些凭据如果被正确识别,攻击者就能绕过应用加固的API直接访问数据库。每个模型测试时都设置了10美元预算和2小时的时间限制,完全模拟安全团队在实际工作中的资源约束条件。
2. 测试方法与评估指标
2.1 漏洞应用构建细节
研究员专门开发了一个图书评论应用作为测试平台,其中故意设置了多个典型漏洞:
- 未保护的Firebase数据库凭据
- 不安全的API端点
- 潜在的注入漏洞点
- 不恰当的权限控制
应用经过了一定程度的混淆和加固,增加了漏洞发现的难度,但保留了真实应用的基本特征。这种设计既保证了测试的有效性,又避免了过于简单导致的结果失真。
2.2 评估指标体系
测试主要关注三个核心指标:
- 成功率:模型在10次尝试中成功识别并利用漏洞的次数
- 成本效率:每次成功利用漏洞所消耗的平均费用
- 响应质量:模型在漏洞挖掘过程中的分析深度和逻辑严谨性
特别值得注意的是,测试不仅记录最终结果,还详细追踪了每个模型的推理过程,包括:
- 对APK文件的解包和分析方法
- 对潜在漏洞点的识别逻辑
- 对Firebase凭据的提取和处理方式
- 遇到障碍时的应对策略
3. 主要模型表现分析
3.1 GPT-5.5的突出表现
在10次测试中,GPT-5.5成功7次,成功率高达70%,是所有测试模型中最高的。其显著特点包括:
- 快速准确地解包APK文件
- 能有效过滤无关信息,直接定位关键凭据
- 对Firebase配置有深入理解
- 平均每次成功成本为9.46美元
技术细节显示,GPT-5.5在解包后平均只需2-3步推理就能锁定Firebase凭据,很少被应用界面或其他API分散注意力。这种高度专注的问题解决能力使其在漏洞挖掘任务中表现优异。
3.2 DeepSeek V4 Pro的成本优势
虽然DeepSeek V4 Pro的成功率只有30%(10次尝试成功3次),但其成本效益极为突出:
- 单次成功成本仅0.62美元
- 总运行成本远低于其他模型
- 在5次失败尝试中仍能接触到关键漏洞点
深入分析发现,DeepSeek的"失败"案例中,有多次是因为误将Firebase Auth用于后端接口,而非完全未能发现漏洞。这表明其漏洞识别能力实际上比成功率显示的要强,只是在利用环节存在优化空间。
3.3 其他模型的表现
- Claude系列:Sonnet 4.6和Opus 4.8各成功2次,但成本较高(单次成功45.75美元和16.15美元)
- Gemini 3.1 Pro:几乎每次都在任务早期就拒绝继续,token消耗极低(中位数仅9000)
- 其他国产模型:如GLM 5.1、Qwen 3.7 Max等,在本测试中未能取得突破
4. 技术实现细节解析
4.1 测试环境搭建
研究员建立了完整的自动化测试管道:
- 环境隔离:每个模型在独立的Docker容器中运行
- 输入标准化:统一提供APK文件和简明的任务说明
- 输出解析:自动提取关键操作和结果
- 成本监控:实时跟踪token消耗和API费用
4.2 漏洞利用的关键步骤
成功的模型通常遵循以下流程:
- APK解包:使用apktool等工具解压应用文件
- 资源分析:检查AndroidManifest.xml和资源文件
- 代码审查:搜索硬编码的凭据和敏感配置
- Firebase定位:识别google-services.json等配置文件
- 权限验证:测试获取的凭据是否有效
4.3 成本控制策略
研究发现,模型的成本差异主要来自:
- 上下文长度使用:过度保留历史对话会增加token消耗
- 推理步骤数量:不必要的中间步骤会显著提高成本
- 错误处理方式:过早放弃或过度坚持都会影响效率
5. 实际应用建议
5.1 模型选择策略
根据测试结果,不同场景下的最佳选择:
- 高价值目标:优先选用GPT-5.5,追求最高成功率
- 批量扫描:推荐DeepSeek V4 Pro,优化成本效益
- 深度分析:可考虑Claude Opus,获取更详尽的推理过程
5.2 成本优化技巧
- 设置合理的超时和预算限制
- 预处理输入数据,减少模型冗余工作
- 对输出进行后处理,避免重复分析
- 根据任务复杂度动态调整模型
5.3 安全防护启示
这项研究也揭示了当前移动应用的安全隐患:
- 硬编码凭据仍然是普遍问题
- 传统的加固手段对AI分析效果有限
- 需要建立针对AI的新型防御机制
6. 未来研究方向
基于本次实验结果,值得深入探索的方向包括:
- 多模型协作的漏洞挖掘框架
- 针对AI分析的混淆和防护技术
- 成本预测和优化算法
- 特定领域漏洞的专项测试方案
这项研究不仅展示了当前大语言模型在安全领域的实际能力,也为后续的AI辅助安全测试提供了宝贵的基准数据和方法参考。随着模型能力的持续进化,AI在漏洞挖掘领域的应用前景将更加广阔。