@thcjp

Openai Whisper

|- 功能涵盖:。Use when 需要API集成、接口对接、Webhook配置、系统连接时使用。不适用于逆向工程闭源API。适用于独立开发者、企业团队和自动化工作流场景。支持中文交互,无需复杂配置即开即用。输出结果可直接使用,减少二次加工成本。提供结构化输出和错误处理机制。支持多场景应用和灵活配置。 功能涵盖: openai。

Current version
v1.0.0
0 0All installs 0

slug: openai-whisper name: openai-whisper version: 1.0.1 displayName: llm-provider Whisper summary: '用Whisper CLI本地语音转文字,免API Key。Local speech-to-text with the Whisper CLI (no API key)。核心能力: - 创意设' summary_zh: '用Whisper CLI本地语音转文字,免API Key。Local speech-to-text with the Whisper CLI (no API key)。核心能力: - 创意设' license: MIT description: |- 功能涵盖:。Use when 需要API集成、接口对接、Webhook配置、系统连接时使用。不适用于逆向工程闭源API。适用于独立开发者、企业团队和自动化工作流场景。支持中文交互,无需复杂配置即开即用。输出结果可直接使用,减少二次加工成本。提供结构化输出和错误处理机制。支持多场景应用和灵活配置。 功能涵盖: openai。 \nLocal speech-to-text with the Whisper CLI (no API key)。核心能力:\n\n- 创意设计领域的专业化AI辅助工具\n
\n- \n\n- \n\n适用场景:\n\n- 内容创作、设计生成、多媒体制作\n\n- 独立开发者与一人公司效率提升\n\n- 自动化工..." tags:

  • Creative
  • 工具
  • 效率
  • api
  • whisper
  • key tools:
  • read
  • exec
  • write homepage: '' category: Automation

核心功能: 本技能提供中文交互、化工作流场景等能力。

核心功能: 本技能提供、多媒体制作等能力。

llm-provider Whisper

专业版增强能力

能力免费版付费版
基础功能支持支持
大数据集流式处理不支持支持
多数据源关联查询不支持支持
可视化图表自动生成不支持支持
定时数据同步与增量更新不支持支持
数据质量检测与清洗规则不支持支持

主要能力

  • Local speech-to-text with the Whisper CLI (no API key)

启动指引

  1. 确认运行环境满足依赖说明中的要求
  2. 在AI Agent对话中调用本技能,提供必要的输入参数
  3. 检查输出结果,根据需要进行后续处理

详细的输入输出格式请参考下方章节说明。

应用场景

场景输入输出
用Whisper C目标数据与配置参数处理结果与执行状态
免API Key目标数据与配置参数处理结果与执行状态

不适用于:需要人工判断的复杂决策场景

操作步骤

  1. 确认运行环境满足依赖说明中的要求
  2. 根据适用场景选择合适的使用方式
  3. 执行操作并检查输出结果
  4. 如遇错误,参考错误处理章节

请求格式

参数名类型必填说明
contentstring处理的内容输入
modestring处理模式, 可选值: json/text/markdown
stylestring输出风格, 参考 references/style.md

响应格式

{
  "success": true,
  "data": {
    "result": "处理结果",
    "status": "success",
    "metadata": {
    "metadata": {
      "template_used": "reviewer",
      "word_count": 0,
      "style": "专业"
    }
  },
  "error": null
}

输出模板参考: assets/output.json

异常管理

错误场景原因处理方式
配置错误参数缺失或格式错误检查依赖说明中的配置要求
运行时错误运行环境不满足确认运行环境符合依赖说明
网络错误连接超时或不可达

安装与配置

运行环境

  • Agent平台: 支持SKILL.md的任意AI Agent(ai-assistant Code / Cursor / Codex / Gemini CLI等)
  • 操作系统: Windows / macOS / Linux

依赖说明(补充)

依赖项类型是否必需获取方式
LLM APIAPI必需由Agent内置LLM提供

API Key 配置

可用性分类

  • 分类: MD+execute()
  • 说明: 基于Markdown的AI Skill,

API Key配置方式:

export API_KEY="${API_KEY:?请设置环境变量}"

配置后需重启会话或开启新终端生效。API Key应妥善保管,避免泄露到版本控制系统.

错误恢复方案

错误场景(续)原因处理方式
LLM响应超时或无响应网络延迟或模型负载过高请求重试;确认Agent平台LLM服务正常
输入内容格式不正确用户输入不符合skill预期格式检查输入是否符合skill使用说明中的格式要求,参考示例章节
执行结果与预期不符指令描述不够明确或上下文不足提供更详细的指令描述,补充必要的上下文信息
命令执行失败运行环境不满足要求或权限不足确认运行环境符合依赖说明中的要求;检查命令权限设置

限制条件

  • 需要API Key,无Key环境无法使用
  • 本地运行,不支持多设备同步

常见问题FAQ

Q1: llm-provider Whisper支持哪些语音格式?

A: llm-provider Whisper支持多种音频格式,包括MP3、WAV、M4A等,确保音频质量良好,以便获得更准确的转录结果。

Q2: 如何处理转录结果中的错误?

A: 可以通过Whisper CLI的参数调整来提高转录准确性,例如使用--model tiny来选择更小的模型以加快处理速度,或者使用--language参数指定更精确的语言模型。

Q3: llm-provider Whisper是否支持多语言转录?

A: 是的,llm-provider Whisper支持多种语言的转录,你可以在启动转录时指定所需的--language参数。

Q4: 如何在命令行中启动Whisper转录?

A: 使用以下命令启动Whisper转录:

whisper input_audio_file --output output_text_file

其中input_audio_file是音频文件的路径,output_text_file是输出文本文件的路径。

Q5: llm-provider Whisper的转录速度如何?

A: 转录速度取决于音频文件的大小和所选模型的大小。一般来说,使用较大的模型(如baselarge)可以获得更快的转录速度,但处理时间会更长。

安全说明

风险项等级防护措施验证方法
音频数据泄露使用加密文件传输,限制访问权限定期审计访问日志
API Key泄露保护API Key,避免在公共代码库中存储使用安全的存储和访问控制
转录错误导致隐私泄露限制转录内容的敏感度审查转录内容,确保不包含敏感信息
系统资源耗尽监控系统资源使用,合理分配定期检查系统资源使用情况
恶意软件攻击使用防病毒软件,定期更新系统定期扫描恶意软件,更新系统补丁

创新亮点

场景效率提升差异化对比
内容创作节省时间,提高创作效率自动化语音转文字,减少手动转录时间
设计生成提高设计流程效率快速转录设计讨论,方便记录和回顾
多媒体制作加快制作流程自动化语音转文字,减少后期编辑工作
独立开发者提升个人工作效率自动化转录,节省人力成本
自动化工作流提高工作流自动化程度集成到自动化工作流中,实现语音数据自动处理
智能决策辅助提供数据支持,辅助决策快速获取语音数据,辅助制定决策
对比项llm-provider Whisper传统语音转文字工具
转录准确性一般
支持语言数量
速度
易用性一般
成本
灵活性

功能介绍

  • 自动化执行: 用Whisper CLI本地语音转文字,免API Key。Local speech-to-text with the W
  • 文件处理: 支持多种文件格式的读取、解析和写入操作
  • API集成: 通过标准化接口调用外部服务并处理响应
  • 命令执行: 在安全沙箱中执行系统命令并收集结果
  • 信息检索: 快速搜索和过滤目标数据

量化评估

操作场景手动耗时自动化耗时效率提升
文件解析与提取5-10分钟/个<5秒/个60-120x
批量文件处理(100个)8-16小时<5分钟96-192x
API调用与响应解析2-3分钟/次<1秒/次120-180x
多接口数据聚合15-30分钟<10秒90-180x
命令执行与结果收集3-5分钟/次<2秒/次90-150x
重复任务批量执行因任务而异线性缩减5-50x
错误排查与修复10-30分钟<30秒20-60x

优势分析

对比维度llm-provider Whisper传统手动方式通用脚本工具
自动化程度全流程自动完全手动部分自动
错误处理内置错误恢复依赖人工经验基本try-catch
可复用性参数化配置一次性脚本模板化
安全合规内置安全检查无安全保障无安全保障
适用场景用Whisper CLI本地语音转文字,免API Key。Local speec通用场景通用场景

异常处理体系

针对llm-provider Whisper使用中可能遇到的常见问题,提供以下排查方案:

错误类型原因分析解决方案
API认证失败(401)API密钥错误或过期检查密钥配置,重新生成token
接口限流(429)请求频率超出限制降低调用频率,启用重试退避策略
响应超时(504)网络延迟或服务端负载过高增加超时阈值,检查网络连接
文件不存在路径错误或文件未创建检查路径拼写,确认文件已生成
文件格式不支持扩展名不在支持列表中转换为支持的格式后重试
权限不足当前用户无读写权限检查文件权限,以管理员身份运行
命令执行失败参数错误或环境依赖缺失检查命令语法,确认依赖已安装
进程超时命令执行时间过长增加超时设置,优化命令参数
网络连接失败DNS解析失败或防火墙拦截检查网络配置,确认代理设置

llm-provider Whisper通用排查步骤

  1. 检查输入参数: 确认所有必填参数已提供且格式正确
  2. 查看日志输出: 定位具体错误行和异常类型
  3. 验证环境配置: 确认依赖库版本和运行环境满足要求
  4. 逐步调试: 缩小问题范围,隔离故障模块

安装向导

  1. 配置API密钥: 在环境变量中设置对应的API Key
  2. 初始化连接: 使用提供的凭证建立API连接
  3. 调用接口: 传入必要参数执行API调用
  4. 准备文件: 确认文件路径正确且格式受支持
  5. 执行处理: 调用对应的处理函数
  6. 查看结果: 检查输出文件或返回数据
  7. 检查环境: 确认运行时和依赖已安装
  8. 执行命令: 使用正确的参数格式执行
  9. 查看输出: 检查命令输出和退出码

前置条件

  • 已安装所需运行环境(参考依赖说明)
  • 已获取必要的API密钥或访问凭证(如适用)
  • 输入数据已准备就绪

适用边界

  • 极端边界输入可能影响输出质量,建议对异常输入做预校验
  • 外部API服务可用性影响功能稳定性,建议实现重试和降级机制
  • 模型推理耗时与输入长度正相关,超长输入需考虑分段处理
  • 文件路径需使用合法字符,避免特殊字符导致路径解析异常
  • 不同操作系统的命令行参数可能存在差异,需做平台适配

Security Scan

No security scan results are available right now.

Metadata

  • Owner: @thcjp
  • Created: 2026/08/02
  • Updated: 2026/08/02
  • Versions: 1
  • Comments: 0

Runtime

No runtime requirements are exposed in the official public payload.