arctime吧 关注:3,173贴子:11,548
  • 2回复贴,共1

【科普】哪些因素会影响语音识别的准确率?

只看楼主收藏回复


Arctime采用国内数一数二、业界最优秀的语音识别引擎,确保识别率达到最高水准。
语音识别,通过机器深度学习算法,将语音转成文字,是人工智能比较成熟的技术之一。尽管如此,以下6种客观因素、复杂因素,对语音识别是一大挑战,难免会影响识别率。
以普通话识别来举例。
1、录音不清晰,录音质量太次。
2、人物说话含混不清(口齿不清、吐字咬字不清),或者语速极快,连人耳都难以听清。
3、普通话不标准,说话带方言、带口音。比如港式普通话、广式普通话,既不象广东话,又不象普通话,两者杂交在一起。
4、普通话里夹带外语。比如香港人、新加坡人的普通话喜欢夹带英语,上海人不但夹带英语,还夹带日语。普通话能识别,冷不丁冒出的外语会让机器懵圈,有可能当成普通话来识别。
5、同音字、同音词。汉语存在很多同音的字、同音的词,如果不联系上下文,机器很难正确区分。
6、配乐、噪音,会对识别造成很大干扰,从而降低识别率。


1楼2017-10-09 04:54回复

    一、什么样的视频/音频,适合拿来语音识别?
    最好是标准录音、同期声录音,只有纯粹的人声,没有配乐(背景音乐)、背景噪音。这样的视频/音频,识别率可达95%以上。
    如果有少量配乐、少量背景噪音,也是可以的,不过,识别率会有所降低,问题不大。
    二、什么样的视频/音频,不适合、不推荐拿来语音识别?
    1、音频经过了混音合成,人物对白跟配乐(音乐、音效)完全混合在一起。而且,配乐音量很大,持续不断,在整个音频中占据的比例很大。
    2、背景噪音很大,比如:在热闹场所拍摄的视频、录制的音频,环境嘈杂、不清静,什么杂七杂八的声音都有。
    3、有些娱乐节目,两个人同时说话、N个人同时说话,七嘴八舌的,难以应付。连珠炮般的密集对话,机器招架不住。


    2楼2017-10-09 04:56
    回复
      2026-08-11 01:30:01
      广告
      不感兴趣
      开通SVIP免广告

      一、后期专业工作者。
      大多在影视后期公司、独立工作室,以团队方式协同工作。有专业的录音设备,有能力到录音棚配音录音,有条件对人声单独录制。
      音频师在剪辑音频时,通常会将人声单独放一轨,做完剪辑后,建议将人声这一轨提取出来,交给字幕工作者,用来语音识别,这是最理想、最具效率的方式,避免手工去敲字幕。
      人声轨,如果有少量环境音、噪声,没关系,Arctime在语音识别之前,会对音频进行降噪处理。
      二、个人玩家。
      这个群体大多自已单干,自已独立拍摄,或从网络上搬运素材。条件有限,拿到的视频/音频大多数经过了混音合成,轮到什么就是什么,无法挑肥拣瘦。
      由于经过了混音处理,很难将人声单独提取出来,即便通过技术手段提取出来,人声也不太纯净。
      1、如果视频/音频的配乐,采用舒缓的轻音乐,响度不大,人声比较突出,这种类型可以拿来语音识别。
      2、如果配乐,很激越,很震撼,动静很大,很多地方盖过了人声,这种类型不推荐拿来语音识别。
      如果拿到的片源是5.1/7.1声道的蓝光DVD,可以用专业音频软件或提取工具,将中置声道(C声道)提取出来,C声道是纯粹的人声,用来语音识别挺合适。


      3楼2017-10-09 04:59
      回复