Cryfish: On deep audio analysis with Large Language Models
2026/9/19 10:29:44 网站建设 项目流程

论文《Cryfish: On deep audio analysis with Large Language Models》总结与翻译

一、论文主要内容总结

(一)研究背景与问题

近年来,基于文本的大型语言模型(LLMs)发展迅猛,但将听觉能力整合到LLMs中仍面临挑战,现有具备听觉能力的LLMs(AudioLLMs)在不同音频相关任务间的泛化能力有限,在非训练分布的任务上性能大幅下降。为解决这一问题,研究团队提出了Cryfish模型,旨在提升AudioLLM在各类音频任务中的泛化能力。

(二)模型架构

Cryfish以SALMONN为灵感,采用“WavLM音频编码器+基于Transformer的连接器+Qwen2 LLM”的架构。其中,WavLM作为自监督训练的通用音频编码器,能提供丰富的音频表征,适配多种任务;Transformer连接器可提取句子级和帧级嵌入(帧级嵌入提取速率为2.5Hz),有效衔接音频特征与语言模型;Qwen2.5-7B-Instruct作为语言模型,负责处理文本指令与生成响应。整体架构中,连接器和WavLM共含345M参数,语言模型适配器含21M参数。

(三)训练数据与流程

  1. 训练数据准备:采用“模板指令+LLM生成指令”的双阶段数据构建方式。模板指令数据量达13k小时音频,涵盖语音转录、性别识别等任务,还通

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询