Skip to content Skip to footer

使用语音识别服务时的常见问题

功能类

实时转写说话有停顿,但是语音识别不断句怎么办?

如果是vad断句情况下,实时转写的vad断句依赖对音频中静音数据的判断,如果上游不发送静音音频,服务端则无法识别用户说话是否有停顿。如果确认是上游没有发送静音音频,则系统通过对实时转写服务的时间戳和实际音频的时间戳对比。如果发现服务端的判断音频时长比实际音频时长短,说明静音时服务端没有收到用户发的静音数据。

在开启语义断句情况下,有可能是后处理模型的效果问题。

解决方案:在用户停顿时持续地向服务端发送静音数据。

语音识别能自动断开多句话吗?

实时语音识别服务可以断开多句话。一句话识别服务的每个请求只对应一句话,无法断开。

语音识别服务支持离线功能吗?

目前不支持本地离线的语音识别,必须把音频数据发送到服务端做识别。

语音识别服务是否支持离线SDK或本地离线识别?

语音转文字(ASR)目前不支持离线SDK及本地离线识别功能。所有音频数据必须发送至云端服务端进行处理。具体说明如下:

离线SDK:目前不提供可在本地运行的离线SDK,无法脱离网络环境独立完成语音识别。

离线人机对话:无法实现完全离线的人机对话语音转文字。所有识别请求均需通过网络连接到阿里云语音识别服务端进行处理。

语音识别支持哪些模型?

可以在智能语音交互控制台中项目功能配置里查看具体的模型种类,目前有8k和16k两种采样率的模型,每个采样率下面又有多个领域模型,可以按需选择。

语音识别是否可以混合识别极少量英文单词和字母?

可以的,中文普通话模型支持对中英文混杂的音频进行识别。

开启ITN(逆文本规整)后,中文数字混合时为什么并不是全部转为阿拉伯数字?

是否要转成阿拉伯数字,系统是用模型来判断的,并不是所有数字都需要转成阿拉伯数字,模型的判断主要准则是一般书面文本中常用的形态。

录音文件识别的enable_sample_rate_adaptive和极速版本里的sample_rate,这两个接口是一样的吗?

不是。极速版的sample_rate就是采样率,enable_sample_rate_adaptive是个开关,极速版默认采样率16k,不需要这个开关。

录音转文本能区分坐席和客户吗?

语音识别引擎只能区分出说话的不同角色,角色对应的身份引擎是无法识别的,需要用户从业务的角度自行判断。建议您在存储录音时按照角色分类存储。

智能语音交互的一句话识别,标点符号是根据什么来判断逗号和句号的?

结合音频的声学特征和对识别结果文本做语音分析后做标点处理。

离线文件转写如何区分左右声道?

语音识别引擎无法区分左右声道,当多声道音频送入语音识别服务进行识别时,返回结果会用channel_id字段来标记多个音轨。如果采集顺序固定,可以根据channel_id区分对应声道。具体可参见接口说明。

语音识别可以支持多个词表吗?

一次可使用一个词表,每次只能传一个vocabulary_id,如果觉得不够可以使用定制模型。具体可参见使用POP API创建业务专属热词。

设置录音文件识别服务的版本,"4.0"和"2.0"两个版本有什么区别?

由于历史原因,早期发布的录音文件识别服务(默认为2.0版本)的回调方式和轮询方式的识别结果在JSON字符串的风格和字段上均有不同。录音文件识别服务在4.0版本对回调方式做了优化,使得回调方式的识别结果与轮询方式的识别结果保持一致,均为驼峰风格的JSON格式字符串。具体可参见接口说明。

在电话端支持哪些国家的语音识别?

电话8k语音目前支持的外语语种为英语,非电话16k语音支持更多外语语种。语种模型支持列表详见功能特性。

在语音识别的服务中,有没有请求参数是音频文件地址,返回参数是转写文本?

可使用录音文件识别功能,具体请参见接口说明。

实时语音转写能和录音文件识别一样加入音轨ID吗?

不能,音轨ID是录音文件专用的。实时转写只有单通道语音,不需要channel区分。

录音文件识别可以生成SRT字幕文件吗?

录音文件识别不直接输出SRT格式文件,需根据返回结果中的时间信息自行拼接。以下参数可辅助完成字幕生成与优化:

获取词级时间戳:开启enable_words参数,识别结果中将包含每个词的时间戳信息,用于精确对齐字幕时间轴。

控制单行字幕字数:设置sentence_max_length参数(取值范围[4,50],默认值0表示不启用),控制每行字幕的最大字符数,避免单行过长。

字幕索引映射:开启enable_subtitle=True后,返回结果中的字幕索引(begin_index/end_index)对应纯文本位置,已剔除SSML标签,可直接映射回原始讲稿。

语音识别服务支持哪些编码格式的音频?

每种服务支持的格式不尽相同,请参见各服务中的说明。您可以使用常见音频编辑软件如Audacity,查看音频文件的编码格式。

语音识别服务支持哪些采样率?

一般支持8000 Hz、16000 Hz的采样率。 电话客服场景通常是8000采样率,如果是手机App、PC端工具、网页H5类场景,通常是16000 Hz采样率(可能会有32、44k采样率,但开发时需要调用方将采样率调整为16k)。其他采样率的录音数据需要预先自行转码。

录音文件转写可以支持其他采样率,例如32k、44k等等。

怎么查看音频文件的采样率?

可以使用常见音频编辑软件如Audacity查看音频文件的采样率,也可以使用开源命令行工具FFmpeg查看。

语音识别服务支持的方言模型和语种都有哪些?

语音识别目前支持的语种和方言模型如下:

语种

语言

模型名称

采样率

标点

ITN

顺滑

语义断句

声音和文本对齐

英语

通用-英文,教育直播-英文,教育内容分析-英文

16k

支持

支持

支持

不支持

支持

电话客服(通用)

8k

支持

支持

支持

不支持

不支持

东南亚多语言

16k

支持

不支持

不支持

不支持

不支持

日语

通用-日语

16k

支持

支持

不支持

不支持

支持

西班牙语

通用-西班牙语

16k

支持

支持

不支持

不支持

不支持

通用-西班牙客服通用

8k

支持

支持

不支持

不支持

不支持

阿拉伯语

通用-阿拉伯语

16k

支持

不支持

不支持

不支持

不支持

哈萨克语

通用-哈萨克语

16k

支持

不支持

不支持

不支持

不支持

韩语

通用-韩语

16k

支持

支持

不支持

不支持

不支持

泰语

通用-泰语

16k

不支持

不支持

不支持

不支持

不支持

通用-泰语客服通用

8k

不支持

不支持

不支持

不支持

不支持

东南亚多语言

16k

支持

不支持

不支持

不支持

不支持

印尼语

通用-印尼语

16k

支持

支持

不支持

不支持

不支持

电话客服(通用)

8k

支持

支持

不支持

不支持

不支持

东南亚多语言

16k

支持

不支持

不支持

不支持

不支持

俄语

通用-俄语

16k

支持

支持

不支持

不支持

不支持

越南语

通用-越南语

16k

支持

支持

不支持

不支持

不支持

通用-越南语客服通用

8k

支持

支持

不支持

不支持

不支持

东南亚多语言

16k

支持

不支持

不支持

不支持

不支持

法语

通用-法语

16k

支持

支持

不支持

不支持

不支持

德语

通用-德语

16k

支持

支持

不支持

不支持

不支持

意大利语

通用-意大利语

16k

支持

不支持

不支持

不支持

不支持

印地语

通用-印地语

16k

支持

不支持

不支持

不支持

不支持

马来语

通用-马来语

16k

支持

不支持

不支持

不支持

不支持

通用-马来语客服通用

8k

支持

不支持

不支持

不支持

不支持

东南亚多语言

16k

支持

不支持

不支持

不支持

不支持

菲律宾语

通用-菲律宾语

16k

支持

支持

不支持

不支持

不支持

电话客服(通用)

8k

支持

支持

不支持

不支持

不支持

东南亚多语言

16k

支持

不支持

不支持

不支持

不支持

泰米尔语

通用-泰米尔语

16k

支持

不支持

不支持

不支持

不支持

葡萄牙语

通用-葡萄牙语

16k

支持

支持

不支持

不支持

不支持

土耳其语

通用-土耳其语

16k

支持

不支持

不支持

不支持

不支持

波兰语

通用-波兰语

16k

支持

不支持

不支持

不支持

不支持

乌克兰语

通用-乌克兰语

16k

支持

不支持

不支持

不支持

不支持

罗马尼亚语

通用-罗马尼亚语

16k

支持

不支持

不支持

不支持

不支持

荷兰语

通用-荷兰语

16k

支持

不支持

不支持

不支持

不支持

希腊语

通用-希腊语

16k

支持

不支持

不支持

不支持

不支持

匈牙利语

通用-匈牙利语

16k

支持

不支持

不支持

不支持

不支持

爪哇语

通用-爪哇语

16k

支持

不支持

不支持

不支持

不支持

孟加拉语

通用-孟加拉语

16k

支持

不支持

不支持

不支持

不支持

缅甸语

通用-缅甸语

16k

支持

不支持

不支持

不支持

不支持

老挝语

通用-老挝语

16k

支持

不支持

不支持

不支持

不支持

斯瓦希里语

通用-斯瓦希里语

16k

支持

不支持

不支持

不支持

不支持

阿塞拜疆语

通用-阿塞拜疆语

16k

支持

不支持

不支持

不支持

不支持

波斯语

通用-波斯语

16k

支持

不支持

不支持

不支持

不支持

僧伽罗语

通用-僧伽罗语

16k

支持

不支持

不支持

不支持

不支持

加泰罗尼亚语

通用-加泰罗尼亚语

16k

支持

不支持

不支持

不支持

不支持

高棉语

通用-高棉语

16k

支持

不支持

不支持

不支持

不支持

希伯来语

通用-希伯来语

16k

支持

不支持

不支持

不支持

不支持

克罗地亚语

通用-克罗地亚语

16k

支持

不支持

不支持

不支持

不支持

豪萨语

通用-豪萨语

16k

支持

不支持

不支持

不支持

不支持

马拉地语

通用-马拉地语

16k

支持

不支持

不支持

不支持

不支持

泰卢固语

通用-泰卢固语

16k

支持

不支持

不支持

不支持

不支持

旁遮普语

通用-旁遮普语

16k

支持

不支持

不支持

不支持

不支持

瑞典语

通用-瑞典语

16k

支持

不支持

不支持

不支持

不支持

保加利亚语

通用-保加利亚语

16k

支持

不支持

不支持

不支持

不支持

丹麦语

通用-丹麦语

16k

支持

不支持

不支持

不支持

不支持

挪威语

通用-挪威语

16k

支持

不支持

不支持

不支持

不支持

坎纳达语

通用-坎纳达语

16k

支持

不支持

不支持

不支持

不支持

马拉雅拉姆语

通用-马拉雅拉姆语

16k

支持

不支持

不支持

不支持

不支持

捷克语

通用-捷克语

16k

支持

不支持

不支持

不支持

不支持

乌尔都语

通用-乌尔都语

16k

支持

不支持

不支持

不支持

不支持

尼泊尔语

通用-尼泊尔语

16k

支持

不支持

不支持

不支持

不支持

蒙古语(外蒙)

通用-蒙古语(外蒙)

16k

支持

不支持

不支持

不支持

不支持

乌兹别克语

通用-乌兹别克语

16k

支持

不支持

不支持

不支持

不支持

方言

语言

模型名称

采样率

标点

ITN

顺滑

语义断句

声音和文本对齐

粤语

通用-粤语

16k

支持

支持

支持

不支持

支持

电话客服(通用)

8k

支持

支持

支持

不支持

支持

粤中自由说

8k

支持

支持

支持

不支持

不支持

东南亚多语言

16k

支持

不支持

不支持

不支持

不支持

粤语(繁体)

通用-粤语(繁体)

8k

支持

不支持

不支持

不支持

不支持

通用-粤语(繁体)

16k

支持

不支持

不支持

不支持

不支持

四川话

通用-四川话

16k

支持

支持

支持

支持

支持

电话客服(通用)

8k

支持

支持

支持

支持

支持

湖北话

通用-湖北话

16k

支持

支持

支持

支持

支持

通用-湖北话

8k

支持

支持

支持

支持

支持

上海话

通用-上海话

16k

支持

支持

支持

支持

不支持

湖南话

通用-湖南话

16k

支持

支持

支持

支持

支持

河南话

通用-河南话

16k

支持

支持

支持

支持

支持

通用-河南话

8k

支持

支持

支持

支持

支持

浙江话

通用-浙江话

16k

支持

支持

支持

支持

不支持

东北话

通用-东北话

16k

支持

支持

支持

支持

支持

山东话

通用-山东话

16k

支持

支持

支持

支持

支持

天津话

通用-天津话

16k

支持

支持

支持

支持

支持

陕西话

通用-陕西话

16k

支持

支持

支持

支持

支持

山西话

通用-山西话

16k

支持

支持

支持

支持

支持

贵州话

通用-贵州话

16k

支持

支持

支持

支持

支持

云南话

通用-云南话

16k

支持

支持

支持

支持

支持

甘肃话

通用-甘肃话

16k

支持

支持

支持

支持

支持

维吾尔语

通用-维吾尔语

16k

不支持

不支持

不支持

不支持

不支持

通用-维吾尔语

8k

不支持

不支持

不支持

不支持

不支持

苏州话

通用-苏州话

16k

支持

支持

支持

支持

不支持

闽南语

通用-闽南语

16k

支持

支持

支持

支持

不支持

江西话

通用-江西话

16k

支持

支持

支持

支持

支持

宁夏话

通用-宁夏话

16k

支持

支持

支持

支持

支持

广西话

通用-广西话

16k

支持

支持

支持

支持

支持

通用-广西话

8k

支持

支持

支持

支持

支持

中文普通话

识音石 V1 - 端到端模型,教育内容分析,医疗内容分析,新闻媒体内容分析,娱乐视频内容分析,音视频离线转写(升级版),新零售领域识别模型,出行领域识别模型,汽车领域

16k

支持

支持

支持

支持

支持

中英自由说

16k

支持

支持

支持

支持

不支持

识音石 V1 - 端到端模型

8k

支持

支持

支持

支持

支持

东南亚多语言

16k

支持

不支持

不支持

不支持

不支持

最新的模型支持情况可以登录智能语音交互控制台,在项目配置中查看。在智能语音交互控制台的我的所有项目页面,找到目标项目,单击其操作列中的项目功能配置进入配置页面。在项目功能配置页面的语音识别 ASR面板中,单击修改配置按钮,即可修改当前语音识别模型配置。

模型能力边界说明

使用模型时,请注意以下限制:

识音石V1端到端模型:仅支持中文普通话,不支持粤语识别。

跨语言识别限制:中文普通话模型识别英文属非标准行为,识别效果无法保证;英文模型无法识别中文。

方言覆盖范围:目前暂不支持南通市区方言,如有需要可尝试苏州话、上海话等相近吴语方言模型进行测试。

远场识别推荐:fun-asr-far-field是当前效果最好的远场识别模型,适合远场采集场景。

听悟与商用模型一致:在听悟产品中测试时使用的模型体系与商用接口相同(默认模型或fun-asr系列),测试结果可作为商用效果参考。

语音识别能否自动断开多句话?

实时语音识别服务可以断开多句话;一句话识别服务的每个请求只对应一句话,无法断开。

实时识别和录音文件转写分别支持哪些语音格式?

录音文件识别支持所有采样率与位深组合(8k 8bit、8k 16bit、16k 8bit、16k 16bit),支持单声道和双声道,支持格式为 PCM(无压缩的 PCM 或 WAV 文件)。实时语音识别仅支持 8k 16bit 和 16k 16bit(不支持 8k 8bit 和 16k 8bit),仅支持单声道(不支持双声道),支持格式为 WAV 格式和 MP3 格式。

实时语音识别WebSocket连接断开后如何重连及保活?

WebSocket连接断开是实时语音识别的常见问题,主要涉及以下三个方面:

1. 重连机制

任务断开后,推流地址在24小时内有效。若因无数据发送导致连接断开或进入PAUSED状态,可在24小时内使用原地址重连继续推流,无需新建任务。

2. 保活方法

连接空闲超过10秒,服务端会自动关闭连接。建议在无有效语音时,持续发送静音数据(全0 buffer数组)以维持长连接,避免超时断开。

3. 实例复用

一个SpeechTranscriber实例支持多轮识别。执行stop后,只要WebSocket连接未断开,无需重建实例,也无需重新调用start,直接发送新音频流即可开启新一轮识别。

录音文件识别提交成功但获取不到结果或报错怎么办?

录音文件识别提交成功后若无法获取结果,请按以下场景逐一排查:

1. 服务端无法下载音频

请确保音频URL满足以下条件:

支持公网访问

无302重定向(建议使用OSS URL)

若业务必须使用带重定向的URL,可在请求参数中添加download_method: curl,服务端将使用curl方式下载,支持跟随重定向。

2. URL刚生成即调用导致失败

URL生成后立即调用可能因服务器尚未就绪而失败。建议等待约1分钟后再发起识别请求。

3. 返回结果为空,状态码40270002(punctagger silent)

此状态码通常表示音频为纯杂音或无效语音(如静音留言),模型无法识别有效内容,属正常返回空结果。请检查音频内容是否包含有效语音。

4. 排队等待时间过长

控制台不支持查看当前排队任务数。付费用户的识别任务通常在3小时内完成并返回结果。

语音识别服务支持哪些音频采集方式及说话人分离限制?

音频采集方式

Web端采集限制:Web端仅支持麦克风采集,不支持直接采集系统音频(如扬声器输出)。在线会议场景若需同时采集麦克风和系统音频,需在应用层自行混合两路音频流后再推送至识别服务。

性别识别

一句话识别不支持性别识别功能。

说话人分离限制

单声道录音的说话人分离(Speaker Diarization)无法保证100%准确,在抢话、短句等场景下准确率会明显下降。

提升准确率的建议:

条件允许时,优先采用物理分轨(多麦克风分轨录音)方式采集。

或使用百炼Fun-ASR产品,其说话人分离效果更好。

实时角色分离效果不佳时,建议会议结束后采用离线角色分离方式重新处理,以获得更高准确率。

语音识别服务的数据隐私、日志及音频存储策略是什么?

日志与数据访问策略

语音识别服务的日志中包含识别文本。阿里云仅在客户遇到问题并主动提供taskid时,才会查看相关日志协助排查,不会主动访问用户数据。

音频存储策略

实时语音转写服务不保存音频文件。若需要保留音频录音,请在应用前端自行录制并存储。

指令识别限制

语音识别服务不支持仅识别特定词汇(如数字人名称指令)并过滤其他内容。识别结果为全量转写,需在业务逻辑层自行判断和过滤特定指令词汇。

录音文件识别支持情感识别、分段模型切换及版本区别吗?

情感识别

录音文件识别支持语气语调及情感识别。开启后,识别结果中会返回EmotionValue参数,反映该句语音的情感倾向。

分段模型切换

不支持在valid_times参数中为不同时间段指定不同的appkey进行分段识别。如需对同一音频使用不同模型处理不同段落,需在业务层自行将音频切片,分别提交至对应模型识别后合并结果。

标准版与极速版区别

录音文件识别标准版与极速版的功能基本一致,主要区别在于识别速度:极速版处理速度更快,适合对时效性要求较高的场景。

实时识别与录音文件识别的模型关系

实时语音识别与录音文件识别使用相同的模型体系,两种接口方式共享底层识别模型。

Copyright © 2088 初试游戏活动中心-热门网游最新资讯发布平台 All Rights Reserved.
友情链接