☰
OpenClaw 语音与转写技能分类全解:Speech Transcription 精选技能的发现、安装与选型
2026/10/1 10:08:42 网站建设 项目流程
  • 文档
  • AI 技能

【免费下载链接】awesome-openclaw-skills

The awesome collection of OpenClaw skills. 5,400+ skills filtered and categorized from the official OpenClaw Skills Registry.🦞

项目地址:https://gitcode.com/gh_mirrors/aw/awesome-openclaw-skills
点击查看免费下载

Speech & Transcription 是 Awesome OpenClaw Skills 精选清单中按功能域划分的一个分类,集中收录了 OpenClaw 生态中与语音转文字(STT)、文字转语音(TTS)、语音克隆、转写摘要、语音人设与家庭播报相关的社区技能。本文将带你从零读懂这份分类文件的结构与筛选标准,掌握三种官方安装方式,并逐条盘点该分类下的全部技能条目,最后给出本地与云端方案的选型建议与安全使用须知。

分类文件是什么:一张按功能域组织的技能清单

本分类的完整内容保存在 categories/speech-and-transcription.md 中,并通过 README.md 的目录表(Table of Contents)以及正文中的Speech & Transcription区块(README.md)对外暴露。README 内嵌区块只展示其中 10 条代表性技能(如addis-assistant-stt、assemblyai-transcribe、auto-whisper-safe等)作为预览,区块末尾通过 "View all 47 skills in Speech & Transcription →" 链接指向完整的分类文件。

条目格式

分类文件中的每条记录遵循统一的单行格式,与 CONTRIBUTING.md 定义的贡献格式一致:

- skill-name - 一句话功能描述。
  • 技能名(slug):用于openclaw skills install等命令的唯一标识;
  • 链接:指向技能在 ClawHub(OpenClaw 公共技能注册表)上的发布页,原文中的链接为clawskills.sh或clawhub.ai域名下的页面,可直接在分类文件中查看原文;
  • 一句话描述:约定不超过 10 个词,用于快速判断技能用途。

数量与版本快照

文件头部标注47 skills,README 目录表与内嵌区块同样标注 47;不过截至当前仓库快照,分类文件中实际列出44 条条目。这类计数差异在持续更新的精选清单中属正常现象,具体以 ClawHub 注册表的实时状态为准。

这份清单是怎么筛出来的

README 明确说明(README.md):该清单从 OpenClaw 官方注册表 ClawHub 的数千个社区技能中过滤而来,共剔除 7,215 个不符合要求的条目,包括:

过滤维度剔除数量
疑似垃圾(批量注册账号、机器人账号、测试/垃圾内容)4,065
重名 / 相似名1,040
低质量或非英文描述851
Crypto / 区块链 / 金融 / 交易类886
安全审计标记为恶意的条目373
未取自 OpenClaw 官方技能注册表的合计7,215

也就是说,本分类下的条目均来自官方注册表,且通过了上述粗筛;但 README 同时强调这些技能是curated(经筛选)而非 audited(经审计),维护者可能在收录后被原作者更新、修改或替换(README.md)。此外,CONTRIBUTING.md 规定收录门槛包括:技能须已发布在 ClawHub、测试通过、安全状态未被标记为可疑、具备 SKILL.md 文档、描述不超过 10 词、且需有真实的社区使用量。

安装与启用:三种官方途径

无论选择本分类中的哪个技能,安装方式都是统一的。README 给出了三种途径(README.md)。

方式一:OpenClaw CLI

openclaw skills install <skill-slug>

<skill-slug>即分类文件中的技能名,例如openclaw skills install faster-whisper。

方式二:ClawHub CLI

适合在完整 OpenClaw 工作区之外、由注册表托管技能目录的场景:

npx clawhub install <skill-slug>

方式三:手动安装

将技能文件夹复制到以下任一位置:

位置路径
全局~/.openclaw/skills/
工作区<project>/skills/

技能查找优先级为:Workspace > Local > Bundled(工作区优先于本地,本地优先于内置)。

备选:粘贴仓库链接

也可以直接把技能的仓库链接粘贴到助手的对话中,让 OpenClaw 在后台自动完成安装与配置,无需手动执行命令。

语音转文字(STT)与转写类技能

这一类覆盖了"把音频/视频/语音消息变成文本"的全部能力,是本分类中数量最大的子集。按部署形态可进一步分为本地离线方案与云端 API 方案。

技能 slug一句话描述(原文)形态推断
addis-assistant-sttProvides Speech-to-Text (STT) and text.从描述看为 STT 通用能力
assemblyai-transcribeTranscribe audio/video with AssemblyAI.云端 API(AssemblyAI)
auto-whisper-safeRAM-safe voice transcription with auto-chunking — works on 16GB machines without crashes.本地 Whisper 方案,自动分块以控制内存,适配 16GB 内存机器
faster-whisperLocal speech-to-text using faster-whisper.明确标注 Local,本地转写
deepgram— command-line interface for Deepgram speech-to-text.云端 API(Deepgram)的 CLI 封装
elevenlabs-transcribeTranscribe audio to text using ElevenLabs.云端 API(ElevenLabs)
kesha-voice-kitOffline speech-to-text in 25 languages, TTS in 9, speaker diarization.离线 STT(25 种语言)+ 说话人分离,同时含 TTS(9 种语言)
eachlabs-voice-audioTTS, STT, voice conversion using ElevenLabs, Whisper, RVC.聚合型:TTS/STT/变声,底层混用 ElevenLabs、Whisper、RVC
feishu-minutesFetch info, stats, transcript, and media from Feishu.飞书妙记类:拉取会议信息、统计、转写稿与媒体
gettr-transcribe-summarizeDownload audio from a GETTR post.下载 GETTR 帖子音频用于转写/摘要
youtube-transcript-speaker-diarizationSpeaker-labeled YouTube transcripts via the diarize.io API.通过 diarize.io API 获取带说话人标注的 YouTube 转写
documents-aiReal-time OCR and data extraction API by Veryfi.偏文档 OCR/数据抽取,与语音转写同属"非文本内容转文本"方向

选型要点:如果关注隐私与离线可用性,优先看faster-whisper、auto-whisper-safe、kesha-voice-kit这类本地方案——它们不依赖网络与第三方 API Key;其中auto-whisper-safe描述中明确强调通过自动分块(auto-chunking)避免大音频文件导致内存溢出,适合 16GB 内存的常规机器。如果追求转写质量与多语言支持,assemblyai-transcribe、deepgram、elevenlabs-transcribe等云端 API 通常提供更丰富的后处理能力(如说话人分离、时间戳、摘要),代价是需要申请对应平台的 API Key 并产生调用费用。若需要会议场景的完整闭环(转写 + 信息统计 + 媒体文件),feishu-minutes是面向飞书的专用选择。

文字转语音(TTS)与语音合成类技能

这一类覆盖"把文本变成声音"的全部能力,包括通用 TTS、多音色合成、语音克隆与音频内容生产。

技能 slug一句话描述(原文)底层引擎/平台
chichi-speechA RESTful service for high-quality text-to-speech using Qwen3.Qwen3 驱动的 RESTful TTS 服务
doubao-api-open-ttsText-to-Speech service using Doubao (Volcano Engine).火山引擎豆包 TTS
siliconflow-tts-genText-to-Speech using SiliconFlow API (CosyVoice2).SiliconFlow API + CosyVoice2
elevenlabs-ttsElevenLabs TTS - the best ElevenLabs integration for OpenClaw.ElevenLabs(描述为作者自述,非本仓库结论)
elevenlabs-voicesHigh-quality voice synthesis with 18 personas, 32.ElevenLabs 多音色合成(原条目描述在 "32" 处被截断)
elevenlabs-agentsCreate, manage, and deploy ElevenLabs.ElevenLabs 代理/平台全生命周期管理
inworld-ttsText-to-speech via Inworld.ai API.Inworld.ai API
kokoro-ttsGenerate spoken audio from text using the local Kokoro TTS engine.本地 Kokoro TTS 引擎
deepdub-ttsGenerate speech audio using Deepdub and attach it as a MEDIA.Deepdub 合成,并可作为 MEDIA 附件输出
audio-replyGenerate audio replies using TTS.TTS 生成语音回复
audio-genGenerate audiobooks, podcasts, or educational audio content.有声书/播客/教育音频内容生产
ressembleText-to-Speech and Speech-to-Text integration using Resemble AI HTTP API.Resemble AI HTTP API(TTS + STT 双能力)
miranda-sagElevenLabs text-to-speech with mac-style say UX.ElevenLabs TTS + macOSsay风格交互
clonevClone any voice and generate speech using Coqui XTTS v2.Coqui XTTS v2 语音克隆

选型要点:

  • 本地优先:kokoro-tts使用本地 Kokoro 引擎,无需云端 API,适合离线环境与隐私敏感场景;clonev依赖 Coqui XTTS v2,实现"克隆任意声音再合成语音",通常需要在本地运行推理。
  • 云端 API:chichi-speech(Qwen3)、doubao-api-open-tts(豆包)、siliconflow-tts-gen(CosyVoice2)、elevenlabs-tts、inworld-tts均为典型云端方案,各自对应不同的供应商账户体系与计费模式。
  • 内容生产导向:audio-gen面向有声书/播客/教学音频的长文本批量合成;audio-reply面向对话场景的短音频回复;deepdub-tts强调把生成结果作为 MEDIA 附件输出,适合与消息类工作流衔接。

让 Agent "拥有声音":语音人设、交互与家庭播报

这一组技能的价值不只是"转写/合成",而是赋予 OpenClaw 语音身份与听觉能力,甚至把声音接入物理世界。

技能 slug一句话描述(原文)能力定位
jarvis-voiceMetallic AI voice persona with TTS and visual transcript styling.金属质感 AI 语音人设 + TTS + 可视化转写样式
her-voiceGive your agent a voice.为 Agent 赋予声音(TTS 人设类)
cult-of-carcinizationGive your agent a voice — and ears.同时赋予 Agent 发声与"听觉"(TTS + 语音输入)
alexa-cliControl Amazon Alexa devices and smart home via thealexacliCLI.通过alexacliCLI 控制 Alexa 设备与智能家居
announcerAnnounce text throughout the house via AirPlay speakers using Airfoil +.通过 Airfoil 将文本播报到全屋 AirPlay 音箱

从描述可以推断:jarvis-voice、her-voice、cult-of-carcinization属于"人格化语音"路线,让 Agent 以特定嗓音开口说话,其中cult-of-carcinization还包含接收语音输入的能力;alexa-cli与announcer则是"语音出口"的物理延伸——前者把控制权接到 Amazon Alexa 生态,后者利用 AirPlay 音箱实现全屋播报,适合智能家居语音提醒场景。

文本加工与内容生产类周边技能

分类中还混入少量与"语音/转写"只有间接关系的文本处理技能,它们同样以一句话描述收录:

技能 slug一句话描述(原文)用途
brw-de-ai-ifyRemove AI-generated jargon and restore human voice to text.去除 AI 腔、让文字回归自然语气(转写稿润色可用)
hebrew-nikudHebrew nikud (vowel points) reference for AI agents.希伯来语元音点(nikud)参考,供 Agent 处理希伯来语文本
critical-article-writerGenerate draft articles, outlines.生成文章草稿与大纲
agent-voiceCommand-line blogging platform for AI agents.面向 AI Agent 的命令行博客平台("voice"取"发声渠道"之意)

其中brw-de-ai-ify与转写工作流有直接协同价值:转写稿或 AI 生成的摘要往往带有机械腔,可用它做二次润色,让最终文本更接近真人写作。

分类中的非语音条目:记账、财务与杂项

需要特别说明的是,该分类文件中还保留着若干与语音/转写主题关联较弱的条目,它们在归档时被归入此文件,选型时可以直接跳过:

技能 slug一句话描述(原文)实际领域
akauntingInteract with Akaunting open-source accounting software via REST API.开源记账软件 Akaunting 对接
easyverein-apiWork with the easyVerein v2.0 REST API.德国协会管理平台 easyVerein API
freshbooks-cliFreshBooks CLI for managing invoices, clients, and billing.FreshBooks 发票/账单 CLI
norman-categorize-transactionsReview and categorize uncategorized bank transactions, match them with invoices, and verify bookkeeping entries.银行流水分类与记账核对
norman-monthly-reconciliationPerform a complete monthly financial reconciliation...月度财务对账
lnbitsManage LNbits Lightning Wallet (Balance, Pay, Invoice).闪电网络钱包管理
lnbits-with-qrcodeManage LNbits Lightning Wallet (Balance, Pay, Invoice).闪电网络钱包管理(含二维码)
dellight-cro-revenue-opsDELLIGHT.AI is an AI startup in DIFC, Dubai.某 AI 初创公司的营收运营
eternal-haven-lore-packEternal Haven Chronicles lore + mythic persona pack.世界观设定/神话人设包

从 CONTRIBUTING.md 可以看到,当前贡献规范明确"暂不收 crypto、区块链、DeFi 或金融类技能",但这些历史条目仍保留在清单中,属于分类归档遗留。使用前请自行评估其必要性与安全性,且它们与本分类的语音/转写主题无关。

选型建议与安全须知

本地 vs 云端决策

综合本分类的条目描述,可从三条标准快速决策:

  1. 隐私与离线:音频不出本机 → 选本地方案,如faster-whisper(STT)、kokoro-tts(TTS)、kesha-voice-kit(离线 STT + TTS + 说话人分离)、auto-whisper-safe(内存受限机器);
  2. 质量与功能:需要多语言、说话人分离、摘要、时间戳等高级能力 → 选云端 API,如assemblyai-transcribe、deepgram、elevenlabs-transcribe、youtube-transcript-speaker-diarization;
  3. 场景闭环:会议转写 →feishu-minutes;语音回复 →audio-reply;有声内容 →audio-gen;全屋播报 →announcer+alexa-cli。

安全须知

  • 本清单中的技能经过筛选但未经审计(curated, not audited),安装前应阅读技能自带的 SKILL.md 文档,核对脚本行为;
  • README 建议在安装或使用前自行验证来源,OpenClaw 与 VirusTotal 有合作,可在 ClawHub 技能页查看 VirusTotal 报告确认是否被标记为风险(README.md);
  • 技能可能被原作者在任何时间更新、修改或替换,长期使用需关注版本变动;
  • 对于分类中的非语音杂项条目(尤其金融/钱包类),建议直接跳过或严格审查。

进一步探索

  • 完整分类清单(含全部 44 条技能及其原始 ClawHub 链接):categories/speech-and-transcription.md
  • 分类入口与内嵌预览(10 条代表性技能):README.md
  • 安装方式原文:README.md
  • 筛选与去重统计:README.md
  • 安全须知:README.md
  • 贡献与收录规范(条目格式、门槛、安全政策):CONTRIBUTING.md

需要说明的是,本仓库是一个"精选链接清单"性质的仓库(README 原文:a curated list of links),不含技能本体代码;所有技能的实际实现、配置与测试均托管在 ClawHub 上、由各自作者维护,分类文件中的原始链接是进一步查看 SKILL.md 与源码的唯一入口。

  • 文档
  • AI 技能

【免费下载链接】awesome-openclaw-skills

The awesome collection of OpenClaw skills. 5,400+ skills filtered and categorized from the official OpenClaw Skills Registry.🦞

项目地址:https://gitcode.com/gh_mirrors/aw/awesome-openclaw-skills
点击查看免费下载

相关推荐

上一篇:Gutenberg 编辑小工具(Widgets)数据仓库 core/edit-widgets 完全指南:Selectors 与 Actions 深度解析
下一篇:Conda Post-Commands 插件钩子:在 `conda install`、`create` 等命令执行后运行自定义代码的完整指南

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询