- 社区热度
- 107.8k Stars
- GitHub 收藏
- 最近活跃
- 2026/7/28
- 近 30 天还在更新
- 授权协议
- MIT
- 宽松协议
为什么值得关注
不是看 Star 排名,而是看它解决了什么问题、实际有没有用,以及方法为什么值得关注。
解决的问题
语音识别管线过去通常需要分段组合多个独立模型,本项目用单一序列到序列模型解决了多任务处理问题。
实际价值
提供了从命令行到 Python 接口的多种调用方式,支持多语言识别、翻译和语种检测,具备完整的开源实现。
创新 / 差异化
通过大规模弱监督数据训练,采用统一的 Transformer 架构和特殊标记来联合表示不同语音处理任务。
扩展潜力
提供了不同参数规模的模型尺寸选择,方便开发者根据显存与速度权衡进行本地部署或集成。
为什么是现在
发布于大模型与语音技术快速结合的阶段,满足了开发者对高精度开源语音转写工具的需求。
社区活跃度
近 90 天新增 0 个 Issue、32 个 PR;窗口内抽取的 Issue/PR 样本中有 0 位 Issue 发起者、21 位 PR 贡献者,并发布 0 个版本。
维护者响应
窗口内 0 个 Issue 样本关闭率 —,32 个 PR 样本合并率 3%。维护者评论样本仅覆盖该 Issue 样本的 —,不足以可靠判断首次响应率与响应速度。
核心亮点
- 支持多语言语音转录与翻译
- 自动识别音频中的口语语言
- 提供从 tiny 到 large 等多种模型尺寸
快速开始
安装方式、上手难度、开始步骤。
装在哪
本地运行
难不难
中等,需要一点配置
- 01确保系统已安装 Python 3.8-3.11 及 FFmpeg。
- 02使用 pip 安装 Whisper 软件包。
- 03在命令行运行 whisper 命令并指定音频文件进行转录。
- 04或在 Python 脚本中调用 whisper.load_model 加载模型并执行 transcribe 方法。
更适合谁
- 希望数据放在自己服务器上的团队
- 想在本机直接跑起来试用的开发者
更多介绍
Whisper 是 OpenAI 推出的通用语音识别系统,通过大规模弱监督学习训练而成。它将语音识别、翻译和语言检测等任务统一为序列到序列的预测问题,能够直接处理音频流并输出文本。
该模型提供多种规格,用户可根据硬件资源(如 VRAM)和精度需求选择合适的版本。它既可作为 Python 库集成到现有应用中,也支持通过命令行直接处理音频文件。
信息来源
每条信息都标注了状态与出处,可展开查看。
15 条 · 展开
信息来源
每条信息都标注了状态与出处,可展开查看。
capability tags
已核验ai_coding、automation
来源: admin_cms · cms editor · 2026/8/22
editor note
已核验{"en":"This project unifies various speech tasks using a Transformer architecture, suitable for developers needing local speech recognition capabilities. Note that running the model typically requires FFmpeg and sufficient VRAM.","zh":"该项目通过 Transformer 架构统一了多种语音任务,适合需要本地部署语音识别能力的开发者。注意运行该模型通常需要安装 FFmpeg 并具备一定的显存资源。"}
来源: admin_cms · cms editor · 2026/8/22
how to use
已核验{"steps":[{"en":"Ensure Python 3.8-3.11 and FFmpeg are installed on your system.","zh":"确保系统已安装 Python 3.8-3.11 及 FFmpeg。"},{"en":"Install the Whisper package using pip.","zh":"使用 pip 安装 Whisper 软件包。"},{"en":"Run the whisper command in your terminal, specifying the audio file for transcription.","zh":"在命令行运行 whisper 命令并指定音频文件进行转录。"},{"en":"Alternatively, call whisper.load_model in your Python script to load the model and execute the transcribe method.","zh":"或在 Python 脚本中调用 whisper.load_model 加载模型并执行 transcribe 方法。"}],"installAt":"local","difficulty":"medium"}
来源: admin_cms · cms editor · 2026/8/22
intro
已核验{"en":"Whisper is a general-purpose speech recognition system by OpenAI, trained on large-scale weak supervision. It unifies tasks like speech recognition, translation, and language detection into a sequence-to-sequence prediction problem, processing audio directly into text.\n\nThe model is available in various sizes, allowing users to choose based on hardware resources (e.g., VRAM) and accuracy requirements. It can be integrated as a Python library or used via a command-line interface to process audio files.","zh":"Whisper 是 OpenAI 推出的通用语音识别系统,通过大规模弱监督学习训练而成。它将语音识别、翻译和语言检测等任务统一为序列到序列的预测问题,能够直接处理音频流并输出文本。\n\n该模型提供多种规格,用户可根据硬件资源(如 VRAM)和精度需求选择合适的版本。它既可作为 Python 库集成到现有应用中,也支持通过命令行直接处理音频文件。"}
来源: admin_cms · cms editor · 2026/8/22
最新版本
已核验v20250625
来源: GitHub 官方接口 · latest_release=v20250625 · 2026/8/22
许可证
已核验MIT
来源: GitHub 官方接口 · license.spdx_id=MIT · 2026/8/22
needs api key
已核验否
来源: admin_cms · cms editor · 2026/8/22
一句话用途
已核验{"en":"A general-purpose speech recognition model by OpenAI that supports multilingual transcription, translation, and language identification.","zh":"OpenAI 开发的通用语音识别模型,支持多语言语音转文字、翻译及语言识别。"}
来源: admin_cms · cms editor · 2026/8/22
平台
已核验windows、macos、linux
来源: admin_cms · cms editor · 2026/8/22
分类线索
根据材料推断developer-tools
来源: 项目说明文档 · hint=developer-tools · 2026/8/22
product forms
已核验cli、library_framework
来源: admin_cms · cms editor · 2026/8/22
role tags
已核验backend、data
来源: admin_cms · cms editor · 2026/8/22
supports docker
已核验否
来源: admin_cms · cms editor · 2026/8/22
supports local
已核验是
来源: admin_cms · cms editor · 2026/8/22
supports self host
已核验是
来源: admin_cms · cms editor · 2026/8/22
相关项目
根据分类、能力和适用角色匹配的其他已核验项目。
ollama
在 Windows、macOS 和 Linux 本地运行与管理开放模型,并提供 REST API 与 Python/JavaScript 客户端的模型运行工具。
unsloth
在 Windows、macOS 和 Linux 本地运行、微调与部署大语言模型及扩散模型的桌面与开发工具。
hermes-agent
可在本机、VPS 或云环境运行的个人 AI Agent,支持终端、消息平台、记忆、技能和定时自动化。
omnigent
统一运行、切换和协作多个 AI Agent 的开源编排层,覆盖终端、Web、桌面与云沙箱会话。
OpenBiliClaw
一个本地运行的跨平台 AI 内容发现 Agent,通过深度心理画像主动为你从各大主流平台寻找感兴趣的内容。
transformers
Hugging Face 推出的用于文本、视觉、音频和多模态机器学习模型的定义与训练框架。

