Python如何实现实时语音转文字？SpeechRecognition库详细教程-Python教程-PHP中文网

Python如何实现实时语音转文字？SpeechRecognition库详细教程

蓮花仙者

发布： 2025-07-14 15:15:02

原创

970人浏览过

要实现实时语音转文字，可使用python的speechrecognition库配合pyaudio进行音频捕获和识别。首先安装speechrecognition和pyaudio（可通过下载wheel文件解决安装问题），然后使用google语音识别api或其他api如recognize_sphinx进行识别。为实现持续实时识别，需在循环中分段录音并处理，通过pause_threshold和phrase_time_limit控制录音结束条件，并使用adjust_for_ambient_noise减少背景噪音。选择api时需考虑准确率、延迟、价格及是否支持离线使用；提高识别准确率的方法包括降噪、优化音频质量、选择合适语言模型、分段处理及后处理；常见错误如网络连接、api限制、无法识别语音等，可通过更换api、调整麦克风设置、增加超时时间等方式处理。

Python如何实现实时语音转文字？SpeechRecognition库详细教程

Python实现实时语音转文字，核心在于利用语音识别库捕获音频流并将其转换为文本。SpeechRecognition库是一个不错的选择，它简化了与各种语音识别API的交互。

解决方案

安装SpeechRecognition库和pyaudio:

立即学习“Python免费学习笔记（深入）”；
```
pip install SpeechRecognition
pip install pyaudio
```
登录后复制
pyaudio 是一个跨平台音频 I/O 库，用于录制和播放音频。安装 pyaudio 可能会遇到问题，尤其是在 Windows 上。如果 pip install pyaudio 失败，可以尝试下载预编译的 wheel 文件。搜索 "pyaudio wheel" 找到与你的 Python 版本和操作系统相匹配的版本，然后使用 pip install 文件名.whl 安装。

简单语音识别示例:

import speech_recognition as sr

r = sr.Recognizer()
with sr.Microphone() as source:
    print("请说话...")
    audio = r.listen(source)

try:
    text = r.recognize_google(audio, language='zh-CN') # 指定中文
    print("你说的是: {}".format(text))
except sr.UnknownValueError:
    print("无法识别您的语音")
except sr.RequestError as e:
    print("无法连接到 Google 语音识别服务; {0}".format(e))

登录后复制

这段代码使用默认麦克风录制音频，然后使用 Google 语音识别 API 将其转换为文本。language='zh-CN' 指定了中文识别。如果不想使用Google，可以使用其他的API，比如recognize_sphinx，recognize_wit等等，但是这些API可能需要额外的配置。

实时语音转文字:

要实现实时语音转文字，需要持续录制音频并将其分段识别。这可以通过循环实现。

GPTKit

一个AI文本生成检测工具

108

查看详情

import speech_recognition as sr
import time

r = sr.Recognizer()
mic = sr.Microphone()

with mic as source:
    r.adjust_for_ambient_noise(source)  # 可选: 消除环境噪音

def recognize_worker():
    while True:
        try:
            with mic as source:
                r.pause_threshold = 0.8 # 停顿0.8秒后结束录音
                audio = r.listen(source, phrase_time_limit=5) # 每次录制5秒
            try:
                text = r.recognize_google(audio, language='zh-CN')
                print("你说的是: {}".format(text))
            except sr.UnknownValueError:
                print("无法识别")
            except sr.RequestError as e:
                print("请求错误; {0}".format(e))
        except Exception as e:
            print(f"发生错误: {e}")
        time.sleep(0.1)

recognize_worker()

登录后复制

这个例子中，pause_threshold 控制静音多久后结束录音，phrase_time_limit 限制每次录音的最大时长。 adjust_for_ambient_noise 可以消除一些背景噪音，提高识别准确率。注意，实时性受网络延迟和语音识别 API 处理速度的影响。

如何选择合适的语音识别API？

选择语音识别 API 取决于你的需求。Google Speech Recognition API 易于使用，但依赖网络连接。CMU Sphinx 是一个开源的离线语音识别引擎，但准确率可能不如在线 API。其他选择包括 Wit.ai、Microsoft Bing Voice Recognition API 等。考虑因素包括：