随着各行业数字化进程加快,专业领域音视频转文字的需求爆发式增长,法律文书整理、医学会议纪要、学术讲座转写等场景,对识别准确率的要求远高于通用场景。依托科大讯飞的核心语音技术,讯飞听见从语料、场景、用户协同多个维度发力,针对性提升专业领域识别效果,满足不同行业的高精度转写需求。
千亿级专业语料库定向训练,筑牢术语识别基础
通用语音模型对专业术语的识别错误率往往超过30%,无法满足专业场景的刚需。针对这一痛点,讯飞听见围绕医疗、法律、理工、金融、教育等十余个主流专业领域,积累了超千亿级的垂直领域标注语料,还与国内上百家专业机构达成合作,定期更新领域新增术语:从最新出台的法律条文名词,到刚获批的新药名称,再到前沿科技领域的新兴概念,都能及时纳入语料库完成模型迭代训练,从根源上降低专业术语的识别错误率。

多场景声学建模,适配专业场景复杂收音环境
专业领域的录音环境往往复杂多变:线下学术研讨会存在会场混响、手术直播录屏夹杂器械杂音、远程专家会诊存在网络信号波动导致的收音不稳、跨地域专家交流还存在不同程度的口音问题。讯飞听见针对不同专业场景单独训练声学模型,优化了混响抑制、噪音分离、口音适配等能力,可自动区分多发言人发言轨迹,哪怕是低音质的历史录音,也能通过ai降噪优化提升识别准确率。

开放自定义能力,依托用户反馈实现动态迭代
不同机构、不同细分研究方向往往存在专属的小众术语,通用训练无法完全覆盖所有需求。讯飞听见开放了自定义词表批量上传、转写后人工修正功能,用户可导入项目代号、内部专属名词等个性化词汇,修正后的转写数据也会在脱敏后反哺模型优化,实现“越用越准”的正向循环。目前,讯飞听见在法律、医疗等核心专业领域的整体识别准确率已经超过97%,大幅降低了专业人员整理文稿的时间成本,成为各领域从业者高效处理音视频内容的核心工具。全文约671字。































