slug: openai-whisper
name: openai-whisper
version: 1.0.1
displayName: llm-provider Whisper
summary: '用Whisper CLI本地语音转文字,免API Key。Local speech-to-text with the Whisper CLI (no
API key)。核心能力: - 创意设'
summary_zh: '用Whisper CLI本地语音转文字,免API Key。Local speech-to-text with the Whisper CLI
(no API key)。核心能力: - 创意设'
license: MIT
description: |- 功能涵盖:。Use when 需要API集成、接口对接、Webhook配置、系统连接时使用。不适用于逆向工程闭源API。适用于独立开发者、企业团队和自动化工作流场景。支持中文交互,无需复杂配置即开即用。输出结果可直接使用,减少二次加工成本。提供结构化输出和错误处理机制。支持多场景应用和灵活配置。 功能涵盖: openai。
\nLocal speech-to-text with the Whisper CLI (no API key)。核心能力:\n\n- 创意设计领域的专业化AI辅助工具\n
\n- \n\n- \n\n适用场景:\n\n- 内容创作、设计生成、多媒体制作\n\n- 独立开发者与一人公司效率提升\n\n- 自动化工..."
tags:
- Creative
- 工具
- 效率
- api
- whisper
- key tools:
- read
- exec
- write homepage: '' category: Automation
核心功能: 本技能提供中文交互、化工作流场景等能力。
核心功能: 本技能提供、多媒体制作等能力。
llm-provider Whisper
专业版增强能力
| 能力 | 免费版 | 付费版 |
|---|---|---|
| 基础功能 | 支持 | 支持 |
| 大数据集流式处理 | 不支持 | 支持 |
| 多数据源关联查询 | 不支持 | 支持 |
| 可视化图表自动生成 | 不支持 | 支持 |
| 定时数据同步与增量更新 | 不支持 | 支持 |
| 数据质量检测与清洗规则 | 不支持 | 支持 |
主要能力
- Local speech-to-text with the Whisper CLI (no API key)
启动指引
- 确认运行环境满足依赖说明中的要求
- 在AI Agent对话中调用本技能,提供必要的输入参数
- 检查输出结果,根据需要进行后续处理
详细的输入输出格式请参考下方章节说明。
应用场景
| 场景 | 输入 | 输出 |
|---|---|---|
| 用Whisper C | 目标数据与配置参数 | 处理结果与执行状态 |
| 免API Key | 目标数据与配置参数 | 处理结果与执行状态 |
不适用于:需要人工判断的复杂决策场景
操作步骤
- 确认运行环境满足依赖说明中的要求
- 根据适用场景选择合适的使用方式
- 执行操作并检查输出结果
- 如遇错误,参考错误处理章节
请求格式
| 参数名 | 类型 | 必填 | 说明 |
|---|---|---|---|
| content | string | 否 | 处理的内容输入 |
| mode | string | 否 | 处理模式, 可选值: json/text/markdown |
| style | string | 否 | 输出风格, 参考 references/style.md |
响应格式
{
"success": true,
"data": {
"result": "处理结果",
"status": "success",
"metadata": {
"metadata": {
"template_used": "reviewer",
"word_count": 0,
"style": "专业"
}
},
"error": null
}
输出模板参考: assets/output.json
异常管理
| 错误场景 | 原因 | 处理方式 |
|---|---|---|
| 配置错误 | 参数缺失或格式错误 | 检查依赖说明中的配置要求 |
| 运行时错误 | 运行环境不满足 | 确认运行环境符合依赖说明 |
| 网络错误 | 连接超时或不可达 |
安装与配置
运行环境
- Agent平台: 支持SKILL.md的任意AI Agent(ai-assistant Code / Cursor / Codex / Gemini CLI等)
- 操作系统: Windows / macOS / Linux
依赖说明(补充)
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| LLM API | API | 必需 | 由Agent内置LLM提供 |
API Key 配置
可用性分类
- 分类: MD+execute()
- 说明: 基于Markdown的AI Skill,
API Key配置方式:
export API_KEY="${API_KEY:?请设置环境变量}"
配置后需重启会话或开启新终端生效。API Key应妥善保管,避免泄露到版本控制系统.
错误恢复方案
| 错误场景(续) | 原因 | 处理方式 |
|---|---|---|
| LLM响应超时或无响应 | 网络延迟或模型负载过高 | 请求重试;确认Agent平台LLM服务正常 |
| 输入内容格式不正确 | 用户输入不符合skill预期格式 | 检查输入是否符合skill使用说明中的格式要求,参考示例章节 |
| 执行结果与预期不符 | 指令描述不够明确或上下文不足 | 提供更详细的指令描述,补充必要的上下文信息 |
| 命令执行失败 | 运行环境不满足要求或权限不足 | 确认运行环境符合依赖说明中的要求;检查命令权限设置 |
限制条件
- 需要API Key,无Key环境无法使用
- 本地运行,不支持多设备同步
常见问题FAQ
Q1: llm-provider Whisper支持哪些语音格式?
A: llm-provider Whisper支持多种音频格式,包括MP3、WAV、M4A等,确保音频质量良好,以便获得更准确的转录结果。
Q2: 如何处理转录结果中的错误?
A: 可以通过Whisper CLI的参数调整来提高转录准确性,例如使用--model tiny来选择更小的模型以加快处理速度,或者使用--language参数指定更精确的语言模型。
Q3: llm-provider Whisper是否支持多语言转录?
A: 是的,llm-provider Whisper支持多种语言的转录,你可以在启动转录时指定所需的--language参数。
Q4: 如何在命令行中启动Whisper转录?
A: 使用以下命令启动Whisper转录:
whisper input_audio_file --output output_text_file
其中input_audio_file是音频文件的路径,output_text_file是输出文本文件的路径。
Q5: llm-provider Whisper的转录速度如何?
A: 转录速度取决于音频文件的大小和所选模型的大小。一般来说,使用较大的模型(如base或large)可以获得更快的转录速度,但处理时间会更长。
安全说明
| 风险项 | 等级 | 防护措施 | 验证方法 |
|---|---|---|---|
| 音频数据泄露 | 高 | 使用加密文件传输,限制访问权限 | 定期审计访问日志 |
| API Key泄露 | 高 | 保护API Key,避免在公共代码库中存储 | 使用安全的存储和访问控制 |
| 转录错误导致隐私泄露 | 中 | 限制转录内容的敏感度 | 审查转录内容,确保不包含敏感信息 |
| 系统资源耗尽 | 中 | 监控系统资源使用,合理分配 | 定期检查系统资源使用情况 |
| 恶意软件攻击 | 高 | 使用防病毒软件,定期更新系统 | 定期扫描恶意软件,更新系统补丁 |
创新亮点
| 场景 | 效率提升 | 差异化对比 |
|---|---|---|
| 内容创作 | 节省时间,提高创作效率 | 自动化语音转文字,减少手动转录时间 |
| 设计生成 | 提高设计流程效率 | 快速转录设计讨论,方便记录和回顾 |
| 多媒体制作 | 加快制作流程 | 自动化语音转文字,减少后期编辑工作 |
| 独立开发者 | 提升个人工作效率 | 自动化转录,节省人力成本 |
| 自动化工作流 | 提高工作流自动化程度 | 集成到自动化工作流中,实现语音数据自动处理 |
| 智能决策辅助 | 提供数据支持,辅助决策 | 快速获取语音数据,辅助制定决策 |
| 对比项 | llm-provider Whisper | 传统语音转文字工具 |
|---|---|---|
| 转录准确性 | 高 | 一般 |
| 支持语言数量 | 多 | 少 |
| 速度 | 快 | 慢 |
| 易用性 | 高 | 一般 |
| 成本 | 低 | 高 |
| 灵活性 | 高 | 低 |
功能介绍
- 自动化执行: 用Whisper CLI本地语音转文字,免API Key。Local speech-to-text with the W
- 文件处理: 支持多种文件格式的读取、解析和写入操作
- API集成: 通过标准化接口调用外部服务并处理响应
- 命令执行: 在安全沙箱中执行系统命令并收集结果
- 信息检索: 快速搜索和过滤目标数据
量化评估
| 操作场景 | 手动耗时 | 自动化耗时 | 效率提升 |
|---|---|---|---|
| 文件解析与提取 | 5-10分钟/个 | <5秒/个 | 60-120x |
| 批量文件处理(100个) | 8-16小时 | <5分钟 | 96-192x |
| API调用与响应解析 | 2-3分钟/次 | <1秒/次 | 120-180x |
| 多接口数据聚合 | 15-30分钟 | <10秒 | 90-180x |
| 命令执行与结果收集 | 3-5分钟/次 | <2秒/次 | 90-150x |
| 重复任务批量执行 | 因任务而异 | 线性缩减 | 5-50x |
| 错误排查与修复 | 10-30分钟 | <30秒 | 20-60x |
优势分析
| 对比维度 | llm-provider Whisper | 传统手动方式 | 通用脚本工具 |
|---|---|---|---|
| 自动化程度 | 全流程自动 | 完全手动 | 部分自动 |
| 错误处理 | 内置错误恢复 | 依赖人工经验 | 基本try-catch |
| 可复用性 | 参数化配置 | 一次性脚本 | 模板化 |
| 安全合规 | 内置安全检查 | 无安全保障 | 无安全保障 |
| 适用场景 | 用Whisper CLI本地语音转文字,免API Key。Local speec | 通用场景 | 通用场景 |
异常处理体系
针对llm-provider Whisper使用中可能遇到的常见问题,提供以下排查方案:
| 错误类型 | 原因分析 | 解决方案 |
|---|---|---|
| API认证失败(401) | API密钥错误或过期 | 检查密钥配置,重新生成token |
| 接口限流(429) | 请求频率超出限制 | 降低调用频率,启用重试退避策略 |
| 响应超时(504) | 网络延迟或服务端负载过高 | 增加超时阈值,检查网络连接 |
| 文件不存在 | 路径错误或文件未创建 | 检查路径拼写,确认文件已生成 |
| 文件格式不支持 | 扩展名不在支持列表中 | 转换为支持的格式后重试 |
| 权限不足 | 当前用户无读写权限 | 检查文件权限,以管理员身份运行 |
| 命令执行失败 | 参数错误或环境依赖缺失 | 检查命令语法,确认依赖已安装 |
| 进程超时 | 命令执行时间过长 | 增加超时设置,优化命令参数 |
| 网络连接失败 | DNS解析失败或防火墙拦截 | 检查网络配置,确认代理设置 |
llm-provider Whisper通用排查步骤
- 检查输入参数: 确认所有必填参数已提供且格式正确
- 查看日志输出: 定位具体错误行和异常类型
- 验证环境配置: 确认依赖库版本和运行环境满足要求
- 逐步调试: 缩小问题范围,隔离故障模块
安装向导
- 配置API密钥: 在环境变量中设置对应的API Key
- 初始化连接: 使用提供的凭证建立API连接
- 调用接口: 传入必要参数执行API调用
- 准备文件: 确认文件路径正确且格式受支持
- 执行处理: 调用对应的处理函数
- 查看结果: 检查输出文件或返回数据
- 检查环境: 确认运行时和依赖已安装
- 执行命令: 使用正确的参数格式执行
- 查看输出: 检查命令输出和退出码
前置条件
- 已安装所需运行环境(参考依赖说明)
- 已获取必要的API密钥或访问凭证(如适用)
- 输入数据已准备就绪
适用边界
- 极端边界输入可能影响输出质量,建议对异常输入做预校验
- 外部API服务可用性影响功能稳定性,建议实现重试和降级机制
- 模型推理耗时与输入长度正相关,超长输入需考虑分段处理
- 文件路径需使用合法字符,避免特殊字符导致路径解析异常
- 不同操作系统的命令行参数可能存在差异,需做平台适配