MOSS-TTS OpenClaw 技能实战:飞书语音消息一键发送
2026/9/17 12:03:27 网站建设 项目流程

MOSS-TTS OpenClaw 技能实战:飞书语音消息一键发送

【免费下载链接】MOSS-TTSAn open-source model family for long-form speech, dialogue synthesis, voice design, sound effects, and real-time streaming TTS项目地址: https://gitcode.com/GitHub_Trending/mo/MOSS-TTS

MOSS-TTS 是 MOSI.AI 与 OpenMOSS 团队开源的语音与声音生成模型家族,覆盖长文本朗读、多说话人对话、音色设计、音效生成与实时流式 TTS。借助上架在 🦞 龙虾 ClawHub 平台的 OpenClaw 技能,你可以在飞书上让 AI一键发送语音消息——不用写代码、不用本地部署,三步即可上手。

为什么是 MOSS-TTS?

日常工作中,"把一段文字变成自然语音"是高频需求:给飞书群发条语音通知、生成播客旁白、做语音助理回复……自己搭一套 TTS 服务通常要装环境、下模型、写接口,门槛不低。

MOSS-TTS 家族把这条链路拆成了 5 个可独立使用、也可组合的量产级模型:

模型定位
MOSS-TTS旗舰 TTS,高保真 + 零样本语音克隆、长文本生成
MOSS-TTSD多说话人超长对话生成
MOSS-VoiceGenerator文本指令直接设计音色,无需参考音频
MOSS-TTS-Realtime实时流式 TTS,TTFB 低至 180ms
MOSS-SoundEffect文本生成自然/城市场景等音效

其中 MOSS-TTS-Realtime 的整体响应(LLM 首句 + TTS 首包)约为377ms,非常适合搭建低时延语音智能体。更多细节可查阅 docs/moss_tts_model_card.md 与 docs/moss_tts_realtime_model_card.md。

什么是 OpenClaw 技能?

OpenClaw 技能可以理解为给 AI 助手装的"插件":安装一条命令装好,就能直接调用某个服务能力。MOSS-TTS 官方在 ClawHub 上架了两个技能:

技能说明安装命令
feishu-voice-tts在飞书直接发送语音消息clawhub install feishu-voice-tts
moss-tts-voice调用 MOSS-TTS API 生成语音文件clawhub install moss-tts-voice

两个技能共用同一套服务:语音合成由 MOSS-TTS 云端 API 完成,API Key 在MOSI AI Studio平台获取。技能官方说明见 README_zh.md 的 "OpenClaw API Skills" 小节。

飞书语音消息一键发送:三步上手

第 1 步:获取 MOSS-TTS API Key

注册 MOSI AI Studio 平台,在控制台创建 API Key。这是唯一的前置准备,无需购买 GPU、无需下载模型。

第 2 步:安装 feishu-voice-tts 技能

在已安装 OpenClaw(ClawHub CLI)的终端中执行:

clawhub install feishu-voice-tts

按照技能引导配置 MOSI AI Studio 的 API Key 与飞书机器人凭据即可。整个过程是交互式问答,全程不超过 1 分钟。

第 3 步:让 OpenClaw 在飞书里说人话

安装完成后,直接用自然语言下指令,例如:

  • "给某某群发一条语音:今天下午三点开会,请准时参加"
  • "把这段周报读出来,发到飞书"
  • "用参考音频里的音色克隆一条欢迎语音"

OpenClaw 会自动完成"文本 → 语音合成 → 飞书语音消息"整条链路,最终你会在飞书里收到一条可以长按拖动、带小喇叭图标的标准语音消息,而不是一个冷冰冰的 mp3 文件。

💡小技巧:MOSS-TTS-v1.5 支持[pause X.Ys]内联停顿标记和拼音/IPA 发音控制。发正式通知时,可以在文本中插入停顿(如各位同事[pause 1.5s]下午好),语音会更自然。

moss-tts-voice 技能:更底层的语音生成

如果不想发飞书,只想把文本变成可下载的音频文件,可以装moss-tts-voice

clawhub install moss-tts-voice

典型用法:

  • "把这篇 5000 字的文章合成一段播客音频"
  • "用 reference_zh.wav 的音色克隆一段英文旁白"
  • "生成 30 秒的'雨声+城市环境'音效"

它直接暴露了 MOSS-TTS API 的能力:多语种合成、零样本语音克隆、时长控制等。仓库内 assets/audio/ 目录下的reference_zh.wavreference_en.m4a等参考音频,都可以直接拿来体验音色克隆效果。

语音背后:模型是怎么工作的?

好奇的同学可以花 30 秒看懂核心架构:旗舰模型基于MossTTSDelay架构——一个 Decoder-Only LLM,用"延迟模式"并行预测多层 RVQ 音频 Token,再经音频解码器还原波形。这正是它能在 8B 参数量下取得 Seed-TTS-eval 开源最佳成绩、且长文本依然稳定的原因。源码位于 moss_tts_delay/modeling_moss_tts.py。

如果你还想更进一步——自己部署、做语音智能体:

  • 本地部署:configs/llama_cpp/cpu-only.yaml 提供纯 CPU运行配置,完全无 GPU 需求;8GB 显存显卡也有对应的trt-8gb.yaml低显存方案,详见 moss_tts_delay/llama_cpp/README_zh.md
  • 网页体验:直接运行 clis/moss_tts_app.py 启动 Gradio 界面,拖拽即听
  • 实时语音智能体:moss_tts_realtime/fast_api.py 提供服务化接口,可搭配 LLM 流式输出做语音对话
  • 微调自己的音色:三种架构的微调教程分别在 moss_tts_delay/finetuning/README_zh.md、moss_tts_local/finetuning/README_zh.md

常见问题速答

Q:安装技能需要本地 GPU 吗?不需要。OpenClaw 技能走云端 API 合成,任何能运行 OpenClaw 的设备都行。

Q:语音消息的音色可以自定义吗?可以。moss-tts-voice技能支持传入参考音频做零样本克隆;feishu-voice-tts也可在技能配置中指定参考音色。

Q:支持哪些语言?MOSS-TTS-v1.5 支持31 种语言,包括中英混合、粤语、日语、韩语、法语等,多语种合成时记得带上语言标签效果最佳。

Q:想完全离线运行怎么办?克隆仓库后按 moss_tts_delay/llama_cpp/README_zh.md 配置 llama.cpp 后端,可无 PyTorch、纯 CPU 运行;配合 moss_tts_local_v1.5/streaming.py 还能做 48kHz 立体声实时流式解码。

写在最后

从"文字"到"飞书语音消息",过去需要一个后端团队,现在只需要一条安装命令。MOSS-TTS 把业界领先的开源 TTS 能力封装成 OpenClaw 技能,让普通用户也能零门槛用上高保真语音克隆与多语种合成。先装上feishu-voice-tts试试,下一条群通知,就让它用声音说话吧 🎙️

【免费下载链接】MOSS-TTSAn open-source model family for long-form speech, dialogue synthesis, voice design, sound effects, and real-time streaming TTS项目地址: https://gitcode.com/GitHub_Trending/mo/MOSS-TTS

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询