- 文档
- AI 技能
【免费下载链接】awesome-openclaw-skills
The awesome collection of OpenClaw skills. 5,400+ skills filtered and categorized from the official OpenClaw Skills Registry.🦞
Speech & Transcription 是 Awesome OpenClaw Skills 精选清单中按功能域划分的一个分类,集中收录了 OpenClaw 生态中与语音转文字(STT)、文字转语音(TTS)、语音克隆、转写摘要、语音人设与家庭播报相关的社区技能。本文将带你从零读懂这份分类文件的结构与筛选标准,掌握三种官方安装方式,并逐条盘点该分类下的全部技能条目,最后给出本地与云端方案的选型建议与安全使用须知。
分类文件是什么:一张按功能域组织的技能清单
本分类的完整内容保存在 categories/speech-and-transcription.md 中,并通过 README.md 的目录表(Table of Contents)以及正文中的Speech & Transcription区块(README.md)对外暴露。README 内嵌区块只展示其中 10 条代表性技能(如addis-assistant-stt、assemblyai-transcribe、auto-whisper-safe等)作为预览,区块末尾通过 "View all 47 skills in Speech & Transcription →" 链接指向完整的分类文件。
条目格式
分类文件中的每条记录遵循统一的单行格式,与 CONTRIBUTING.md 定义的贡献格式一致:
- skill-name - 一句话功能描述。- 技能名(slug):用于
openclaw skills install等命令的唯一标识; - 链接:指向技能在 ClawHub(OpenClaw 公共技能注册表)上的发布页,原文中的链接为
clawskills.sh或clawhub.ai域名下的页面,可直接在分类文件中查看原文; - 一句话描述:约定不超过 10 个词,用于快速判断技能用途。
数量与版本快照
文件头部标注47 skills,README 目录表与内嵌区块同样标注 47;不过截至当前仓库快照,分类文件中实际列出44 条条目。这类计数差异在持续更新的精选清单中属正常现象,具体以 ClawHub 注册表的实时状态为准。
这份清单是怎么筛出来的
README 明确说明(README.md):该清单从 OpenClaw 官方注册表 ClawHub 的数千个社区技能中过滤而来,共剔除 7,215 个不符合要求的条目,包括:
| 过滤维度 | 剔除数量 |
|---|---|
| 疑似垃圾(批量注册账号、机器人账号、测试/垃圾内容) | 4,065 |
| 重名 / 相似名 | 1,040 |
| 低质量或非英文描述 | 851 |
| Crypto / 区块链 / 金融 / 交易类 | 886 |
| 安全审计标记为恶意的条目 | 373 |
| 未取自 OpenClaw 官方技能注册表的合计 | 7,215 |
也就是说,本分类下的条目均来自官方注册表,且通过了上述粗筛;但 README 同时强调这些技能是curated(经筛选)而非 audited(经审计),维护者可能在收录后被原作者更新、修改或替换(README.md)。此外,CONTRIBUTING.md 规定收录门槛包括:技能须已发布在 ClawHub、测试通过、安全状态未被标记为可疑、具备 SKILL.md 文档、描述不超过 10 词、且需有真实的社区使用量。
安装与启用:三种官方途径
无论选择本分类中的哪个技能,安装方式都是统一的。README 给出了三种途径(README.md)。
方式一:OpenClaw CLI
openclaw skills install <skill-slug><skill-slug>即分类文件中的技能名,例如openclaw skills install faster-whisper。
方式二:ClawHub CLI
适合在完整 OpenClaw 工作区之外、由注册表托管技能目录的场景:
npx clawhub install <skill-slug>方式三:手动安装
将技能文件夹复制到以下任一位置:
| 位置 | 路径 |
|---|---|
| 全局 | ~/.openclaw/skills/ |
| 工作区 | <project>/skills/ |
技能查找优先级为:Workspace > Local > Bundled(工作区优先于本地,本地优先于内置)。
备选:粘贴仓库链接
也可以直接把技能的仓库链接粘贴到助手的对话中,让 OpenClaw 在后台自动完成安装与配置,无需手动执行命令。
语音转文字(STT)与转写类技能
这一类覆盖了"把音频/视频/语音消息变成文本"的全部能力,是本分类中数量最大的子集。按部署形态可进一步分为本地离线方案与云端 API 方案。
| 技能 slug | 一句话描述(原文) | 形态推断 |
|---|---|---|
addis-assistant-stt | Provides Speech-to-Text (STT) and text. | 从描述看为 STT 通用能力 |
assemblyai-transcribe | Transcribe audio/video with AssemblyAI. | 云端 API(AssemblyAI) |
auto-whisper-safe | RAM-safe voice transcription with auto-chunking — works on 16GB machines without crashes. | 本地 Whisper 方案,自动分块以控制内存,适配 16GB 内存机器 |
faster-whisper | Local speech-to-text using faster-whisper. | 明确标注 Local,本地转写 |
deepgram | — command-line interface for Deepgram speech-to-text. | 云端 API(Deepgram)的 CLI 封装 |
elevenlabs-transcribe | Transcribe audio to text using ElevenLabs. | 云端 API(ElevenLabs) |
kesha-voice-kit | Offline speech-to-text in 25 languages, TTS in 9, speaker diarization. | 离线 STT(25 种语言)+ 说话人分离,同时含 TTS(9 种语言) |
eachlabs-voice-audio | TTS, STT, voice conversion using ElevenLabs, Whisper, RVC. | 聚合型:TTS/STT/变声,底层混用 ElevenLabs、Whisper、RVC |
feishu-minutes | Fetch info, stats, transcript, and media from Feishu. | 飞书妙记类:拉取会议信息、统计、转写稿与媒体 |
gettr-transcribe-summarize | Download audio from a GETTR post. | 下载 GETTR 帖子音频用于转写/摘要 |
youtube-transcript-speaker-diarization | Speaker-labeled YouTube transcripts via the diarize.io API. | 通过 diarize.io API 获取带说话人标注的 YouTube 转写 |
documents-ai | Real-time OCR and data extraction API by Veryfi. | 偏文档 OCR/数据抽取,与语音转写同属"非文本内容转文本"方向 |
选型要点:如果关注隐私与离线可用性,优先看faster-whisper、auto-whisper-safe、kesha-voice-kit这类本地方案——它们不依赖网络与第三方 API Key;其中auto-whisper-safe描述中明确强调通过自动分块(auto-chunking)避免大音频文件导致内存溢出,适合 16GB 内存的常规机器。如果追求转写质量与多语言支持,assemblyai-transcribe、deepgram、elevenlabs-transcribe等云端 API 通常提供更丰富的后处理能力(如说话人分离、时间戳、摘要),代价是需要申请对应平台的 API Key 并产生调用费用。若需要会议场景的完整闭环(转写 + 信息统计 + 媒体文件),feishu-minutes是面向飞书的专用选择。
文字转语音(TTS)与语音合成类技能
这一类覆盖"把文本变成声音"的全部能力,包括通用 TTS、多音色合成、语音克隆与音频内容生产。
| 技能 slug | 一句话描述(原文) | 底层引擎/平台 |
|---|---|---|
chichi-speech | A RESTful service for high-quality text-to-speech using Qwen3. | Qwen3 驱动的 RESTful TTS 服务 |
doubao-api-open-tts | Text-to-Speech service using Doubao (Volcano Engine). | 火山引擎豆包 TTS |
siliconflow-tts-gen | Text-to-Speech using SiliconFlow API (CosyVoice2). | SiliconFlow API + CosyVoice2 |
elevenlabs-tts | ElevenLabs TTS - the best ElevenLabs integration for OpenClaw. | ElevenLabs(描述为作者自述,非本仓库结论) |
elevenlabs-voices | High-quality voice synthesis with 18 personas, 32. | ElevenLabs 多音色合成(原条目描述在 "32" 处被截断) |
elevenlabs-agents | Create, manage, and deploy ElevenLabs. | ElevenLabs 代理/平台全生命周期管理 |
inworld-tts | Text-to-speech via Inworld.ai API. | Inworld.ai API |
kokoro-tts | Generate spoken audio from text using the local Kokoro TTS engine. | 本地 Kokoro TTS 引擎 |
deepdub-tts | Generate speech audio using Deepdub and attach it as a MEDIA. | Deepdub 合成,并可作为 MEDIA 附件输出 |
audio-reply | Generate audio replies using TTS. | TTS 生成语音回复 |
audio-gen | Generate audiobooks, podcasts, or educational audio content. | 有声书/播客/教育音频内容生产 |
ressemble | Text-to-Speech and Speech-to-Text integration using Resemble AI HTTP API. | Resemble AI HTTP API(TTS + STT 双能力) |
miranda-sag | ElevenLabs text-to-speech with mac-style say UX. | ElevenLabs TTS + macOSsay风格交互 |
clonev | Clone any voice and generate speech using Coqui XTTS v2. | Coqui XTTS v2 语音克隆 |
选型要点:
- 本地优先:
kokoro-tts使用本地 Kokoro 引擎,无需云端 API,适合离线环境与隐私敏感场景;clonev依赖 Coqui XTTS v2,实现"克隆任意声音再合成语音",通常需要在本地运行推理。 - 云端 API:
chichi-speech(Qwen3)、doubao-api-open-tts(豆包)、siliconflow-tts-gen(CosyVoice2)、elevenlabs-tts、inworld-tts均为典型云端方案,各自对应不同的供应商账户体系与计费模式。 - 内容生产导向:
audio-gen面向有声书/播客/教学音频的长文本批量合成;audio-reply面向对话场景的短音频回复;deepdub-tts强调把生成结果作为 MEDIA 附件输出,适合与消息类工作流衔接。
让 Agent "拥有声音":语音人设、交互与家庭播报
这一组技能的价值不只是"转写/合成",而是赋予 OpenClaw 语音身份与听觉能力,甚至把声音接入物理世界。
| 技能 slug | 一句话描述(原文) | 能力定位 |
|---|---|---|
jarvis-voice | Metallic AI voice persona with TTS and visual transcript styling. | 金属质感 AI 语音人设 + TTS + 可视化转写样式 |
her-voice | Give your agent a voice. | 为 Agent 赋予声音(TTS 人设类) |
cult-of-carcinization | Give your agent a voice — and ears. | 同时赋予 Agent 发声与"听觉"(TTS + 语音输入) |
alexa-cli | Control Amazon Alexa devices and smart home via thealexacliCLI. | 通过alexacliCLI 控制 Alexa 设备与智能家居 |
announcer | Announce text throughout the house via AirPlay speakers using Airfoil +. | 通过 Airfoil 将文本播报到全屋 AirPlay 音箱 |
从描述可以推断:jarvis-voice、her-voice、cult-of-carcinization属于"人格化语音"路线,让 Agent 以特定嗓音开口说话,其中cult-of-carcinization还包含接收语音输入的能力;alexa-cli与announcer则是"语音出口"的物理延伸——前者把控制权接到 Amazon Alexa 生态,后者利用 AirPlay 音箱实现全屋播报,适合智能家居语音提醒场景。
文本加工与内容生产类周边技能
分类中还混入少量与"语音/转写"只有间接关系的文本处理技能,它们同样以一句话描述收录:
| 技能 slug | 一句话描述(原文) | 用途 |
|---|---|---|
brw-de-ai-ify | Remove AI-generated jargon and restore human voice to text. | 去除 AI 腔、让文字回归自然语气(转写稿润色可用) |
hebrew-nikud | Hebrew nikud (vowel points) reference for AI agents. | 希伯来语元音点(nikud)参考,供 Agent 处理希伯来语文本 |
critical-article-writer | Generate draft articles, outlines. | 生成文章草稿与大纲 |
agent-voice | Command-line blogging platform for AI agents. | 面向 AI Agent 的命令行博客平台("voice"取"发声渠道"之意) |
其中brw-de-ai-ify与转写工作流有直接协同价值:转写稿或 AI 生成的摘要往往带有机械腔,可用它做二次润色,让最终文本更接近真人写作。
分类中的非语音条目:记账、财务与杂项
需要特别说明的是,该分类文件中还保留着若干与语音/转写主题关联较弱的条目,它们在归档时被归入此文件,选型时可以直接跳过:
| 技能 slug | 一句话描述(原文) | 实际领域 |
|---|---|---|
akaunting | Interact with Akaunting open-source accounting software via REST API. | 开源记账软件 Akaunting 对接 |
easyverein-api | Work with the easyVerein v2.0 REST API. | 德国协会管理平台 easyVerein API |
freshbooks-cli | FreshBooks CLI for managing invoices, clients, and billing. | FreshBooks 发票/账单 CLI |
norman-categorize-transactions | Review and categorize uncategorized bank transactions, match them with invoices, and verify bookkeeping entries. | 银行流水分类与记账核对 |
norman-monthly-reconciliation | Perform a complete monthly financial reconciliation... | 月度财务对账 |
lnbits | Manage LNbits Lightning Wallet (Balance, Pay, Invoice). | 闪电网络钱包管理 |
lnbits-with-qrcode | Manage LNbits Lightning Wallet (Balance, Pay, Invoice). | 闪电网络钱包管理(含二维码) |
dellight-cro-revenue-ops | DELLIGHT.AI is an AI startup in DIFC, Dubai. | 某 AI 初创公司的营收运营 |
eternal-haven-lore-pack | Eternal Haven Chronicles lore + mythic persona pack. | 世界观设定/神话人设包 |
从 CONTRIBUTING.md 可以看到,当前贡献规范明确"暂不收 crypto、区块链、DeFi 或金融类技能",但这些历史条目仍保留在清单中,属于分类归档遗留。使用前请自行评估其必要性与安全性,且它们与本分类的语音/转写主题无关。
选型建议与安全须知
本地 vs 云端决策
综合本分类的条目描述,可从三条标准快速决策:
- 隐私与离线:音频不出本机 → 选本地方案,如
faster-whisper(STT)、kokoro-tts(TTS)、kesha-voice-kit(离线 STT + TTS + 说话人分离)、auto-whisper-safe(内存受限机器); - 质量与功能:需要多语言、说话人分离、摘要、时间戳等高级能力 → 选云端 API,如
assemblyai-transcribe、deepgram、elevenlabs-transcribe、youtube-transcript-speaker-diarization; - 场景闭环:会议转写 →
feishu-minutes;语音回复 →audio-reply;有声内容 →audio-gen;全屋播报 →announcer+alexa-cli。
安全须知
- 本清单中的技能经过筛选但未经审计(curated, not audited),安装前应阅读技能自带的 SKILL.md 文档,核对脚本行为;
- README 建议在安装或使用前自行验证来源,OpenClaw 与 VirusTotal 有合作,可在 ClawHub 技能页查看 VirusTotal 报告确认是否被标记为风险(README.md);
- 技能可能被原作者在任何时间更新、修改或替换,长期使用需关注版本变动;
- 对于分类中的非语音杂项条目(尤其金融/钱包类),建议直接跳过或严格审查。
进一步探索
- 完整分类清单(含全部 44 条技能及其原始 ClawHub 链接):categories/speech-and-transcription.md
- 分类入口与内嵌预览(10 条代表性技能):README.md
- 安装方式原文:README.md
- 筛选与去重统计:README.md
- 安全须知:README.md
- 贡献与收录规范(条目格式、门槛、安全政策):CONTRIBUTING.md
需要说明的是,本仓库是一个"精选链接清单"性质的仓库(README 原文:a curated list of links),不含技能本体代码;所有技能的实际实现、配置与测试均托管在 ClawHub 上、由各自作者维护,分类文件中的原始链接是进一步查看 SKILL.md 与源码的唯一入口。
- 文档
- AI 技能
【免费下载链接】awesome-openclaw-skills
The awesome collection of OpenClaw skills. 5,400+ skills filtered and categorized from the official OpenClaw Skills Registry.🦞
相关推荐
cenkalti/backoff v5 重试库解析:构建面向上下文取消与泛型的指数退避 API
cenkalti/backoff v5 重试库解析:构建面向上下文取消与泛型的指数退避 API 导读 本文以构建工具链 BuildKit 中内嵌(vendore
文档AI 技能Awesome OpenClaw Skills 安全与密码技能全景:54 个精选技能的分类导读与安全实践
Awesome OpenClaw Skills 安全与密码技能全景:54 个精选技能的分类导读与安全实践 本文以当前仓库的 categories/securit
文档AI 技能OpenClaw 图像与视频生成技能清单全解析:171 个社区技能的安装、分类与选型指南
OpenClaw 图像与视频生成技能清单全解析:171 个社区技能的安装、分类与选型指南 本文以 awesome openclaw skills https:/
文档AI 技能
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考