帮助与文档 > 产品文档 > 语音识别ASR > IOS_SDK文档 > 短语音识别服务
短语音识别服务

短语音识别 SDK简介

有道智云语音识别 SDK 是有道智云开放平台提供的云服务之一,是有道在线语音识别接口的一种实现,支持在线语音识别。

通过SDK接入优势:

  1. 接入简单,不用实现整个语音识别协议
  2. 方便进行数据统计,了解用户语音识别使用情况

集成前提

开始集成SDK之前开发者需要登录有道开放平台(http://ai.youdao.com),创建应用获取应用ID(或者通过运营人员获取应用ID),以便使用识别服务。

语音识别 SDK 由如下几个 SDK 组成,用户可根据需要组合使用:

  1. FanYiSDK.h:头文件(必选)
  2. libbase.a:语音识别相关sdk基础库(必选)
  3. libspeechrecognition.a:在线语音识别 SDK(必选,使用在线语音识别时使用)

SDK 集成步骤

头文件及SDK库引入(所有功能都需要这一步)

  1. 添加头文件和库文件:将语音识别 SDK 添加到工程中,包括 FanYiSDK.h头文件、libbase.a和libspeechrecognition.a文件。
  2. 设置工程Other Linker Flags为-ObjC
  3. 在工程build Phases – Link Binary With Libraries中添加libbase.a, AdSupport.framework, CoreTelephony.framework, SystemConfiguration, libz.tbd和libsqlite3.tbd。

功能集成说明

1. 初始化key

说明:所有的查询都需要初始化key,只执行初始化一次即可。

//初始化key
YDTranslateInstance *yd = [YDTranslateInstance sharedInstance];
yd.appKey = @"your appkey";

2 . 在线语音识别功能

说明:支持最长15秒的短语音在线识别功能,请参考 demo 中 SpeechRecognitionViewController 的使用;

  1. 使用的库文件:头文件、libbase.a、libspeechrecognition.a;
  2. 构造查询器
YDSpeechRecognitionRequest *request = [YDSpeechRecognitionRequest request];
YDSpeechRecognitionParam *param = [YDSpeechRecognitionParam param];
param.langType = @"zh-CHS";//源语言
param.rate = @"8000";//采样率
param.channel = @"1";//声道数,目前只支持单声道,请写固定值1
request.param = param;
  1. 将语音数据转化为base64编码
NSData *speechData = [NSData dataWithContentsOfURL:self.recordFileUrl];
NSString *base64Str = [speechData base64EncodedStringWithOptions:0];
  1. 执行过程

识别返回两种情况,一种是成功,相关结果存储在 result 参数中,另外一种是失败,失败信息放在 error,是一个枚举类。

[request lookup:base64Str WithCompletionHandler:^(YDSpeechRecognitionRequest *request, YDSpeechRecognitionResult *result, NSError *error) {
    if (error) {
        //失败
        NSLog(@"error:%@", error);
    }else {
        //成功
        [self handleReuslt:result];
    }
}];

语音识别结果说明

对于在线语音识别,服务器查询结果返回数据如下:

{
"result": [
"今天天气不错"
],  //识别结果
"errorCode": "0",   //错误码。一定存在
}
字段含义
result识别结果发音地址,识别成功一定存在
errorCode识别结果错误码,一定存在

SDK demo对上述json数据解析封装为YDSpeechRecognitionResult对象,如下:


@interface YDSpeechRecognitionResult : NSObject
/* 识别结果 */
@property (nonatomic, copy) NSArray *result;
/* 翻译结果错误码,一定存在 */
@property (nonatomic, copy) NSString *errorCode;

+ (instancetype)initWithDict:(NSDictionary *)info;
@end

支持语言

英文名中文名代码
Arabic阿拉伯语ar
Bahasa (Indonesia)巴哈萨语(印度尼西亚)in
Basque巴斯克语eu
Cantonese粤语yue
Catalan加泰隆语ca
Czech捷克语cs
Danish丹麦语da
Dutch荷兰语nl
Dutch (Belgium)荷兰语(比利时)nl-BEL
English (Australia)英语(澳大利亚)en-AUS
English (GB)英语(英国)en-GBR
English (India)英语(印度)en-IND
English (Ireland)英语(爱尔兰)en-IRL
English (Scotland)英语(苏格兰)en-SCT
English (South Africa)英语(南非)en-ZAF
English (US)英语(美国)en
Finnish芬兰语fi
French法语fr
French (Canada)法语(加拿大)fr-CAN
Galician加利西亚语gl
German德语de
Greek希腊语el
Hebrew希伯来语he
Hindi印地语hi
Hungarian匈牙利语hu
Italian意大利语it
Japanese日语ja
Korean韩语ko
Mandarin (China)普通话(中国)zh-CHS
Mandarin (Taiwan)普通话(中国台湾)zh-TWN
Norwegian挪威语no
Polish波兰语pl
Portuguese (Brazil)葡萄牙语(巴西)pt-BRA
Portuguese (Portugal)葡萄牙语(葡萄牙)pt
Romanian罗马尼亚语ro
Russian俄语ru
Slovak斯洛伐克语sk
Spanish (Castilian)西班牙语(卡斯蒂利亚)es-ESP
Spanish (Columbia)西班牙语(哥伦比亚)es-COL
Spanish (Mexico)西班牙语(墨西哥)es-MEX
Swedish瑞典语sv
Thai泰语th
Turkish土耳其语tr
Valencian巴伦西亚语spa-ESP
  • 格式支持:只支持wav格式。
  • 采样率:8k或者16k。推荐16k。
  • 编码:16bit位深的单声道

常见问题及注意事项

  1. 参数错误 108

appKey无效,注册账号, 登录后台创建应用和实例并完成绑定, 可获得应用ID和密钥等信息,其中应用ID就是appKey( 注意不是应用密钥)

错误代码列表

错误码含义
101缺少必填的参数
102不支持的语言类型
103请求文本过长
104不支持的API类型
105不支持的签名类型
106不支持的响应类型
107不支持的传输加密类型
108appKey无效
109batchLog格式不正确
110无相关服务的有效实例
111用户无效
112请求服务无效
113请求文本不能为空
201解密失败
202签名检验失败
203访问IP地址不在可访问IP列表
301词典查询失败
302小语种翻译失败
303服务的异常
401账户已经欠费停止
402offlinesdk不可用
411访问频率受限,请稍后访问
412超过最大请求字符数
4001不支持的语音识别格式
4002不支持的语音识别采样率
4003不支持的语音识别声道
4004不支持的语音上传类型
4005不支持的语言类型
4006识别音频文件过大
4007识别音频时长过长
4201解密失败
4301语音识别失败
4303服务的异常
4411访问频率受限,请稍后访问
4412超过最大请求时长