刚散完40分钟的部门周会,负责记纪要的实习生把手机里的录音导进常用的转写工具,等了五分钟转完全文,翻了两页就开始皱眉头。七个人挤在十平米的小会议室里录的音,转出来的文本要么把坐邻座的两个男同事的发言全标成了同一个人,要么把部门经理前后两段发言拆成了三个不同的发言人编号。本来想着靠工具省点事,下班前就能把纪要发群里,结果光是逐段核对哪句话是谁说的,就耗了快一个钟头。
不少人遇到这种情况第一反应是觉得选的APP不行,换了一个又一个,最后发现好像每个工具都有不准的时候。
其实很多人容易忽略的是,发言人区分这件事,准不准根本不全是算法的问题,首先要看你是在什么场景下录的音。
就像平时开线上会,用腾讯会议或者钉钉闪记的时候,很少有人会觉得发言人标错——毕竟每个人都是对着自己的电脑、手机麦克风说话,音频从一开始就是独立通道传进来的,根本不需要费劲儿去分辨声音是谁的,哪个通道进来的声音就标哪个参会人,出错概率自然极低。之前有人拿Otter录跨时区的线上访谈,两个小时的对话,发言人标注几乎没出过错,一拿到线下行业沙龙的录音,二十多个人坐在台下轮流提问,转出来的稿子发言人序号乱成一团,他还以为是自己账号没开会员功能被限制了。
单设备收音的线下场景才是真的考验。所有声音都挤在同一个音频轨道里,算法只能靠每个人声音的频率、音色差异来分辨谁在说话。环境安静、人数少的时候,大部分工具都能有不错的表现:科会通在中型会议室、线下讲座这类收音距离稍远的场景里,对不同位置的声音拾取更稳定,发言人标注的出错率会低一些,但也做不到百分百准确——要是有人中途起身走到白板边写字边说话,声音距离忽远忽近,偶尔也会把这部分发言标成新的说话人。Notta录一对一的客户访谈,只要周围没有太大杂音,最后导出的稿子基本不用怎么调整说话人标记;华为录音机录三四个人在办公室闲聊,标出来的发言人也大多对得上。可一旦人数变多,环境里混进空调声、翻资料的声响,或者有两个人声线本来就接近,都是差不多音色的年轻男生,挨坐一起说话,算法很容易就把两个人的声纹特征混在一起。要是有人坐得离录音设备远,说话的时候恰好被旁边人敲杯子的声音盖了半句,抓不到完整的声纹片段,标错更是常有的事。
很多人选工具的时候,看见功能介绍里写着“支持AI自动区分发言人”,就默认不管是两个人对谈还是二十个人开大会,不管是在安静的办公室还是嘈杂的活动现场,APP都能把每个人的话分得清清楚楚。实际使用中根本不存在这样的万能状态。线上会的独立通道收音,和线下单麦混录,本质上是两件难度完全不同的事;三个人的小会和十几个人的讨论会,需要算法处理的声纹复杂度也根本不在一个层级。
就像你拿手机录两个人挨着坐的对话,哪怕是用最基础的录音专家,只要环境够安静,最后分出来的发言人大多不会差太多;可要是录那种大家抢着发言的头脑风暴,经常有两三个人同时开口说话,声音叠在一起,就算转写准确率再高的工具,也没法把叠在一起的声波完完整整拆回两个人的声线里,最后总得人工对着录音核对一遍。
很多人总觉得是工具不够智能才会出错,很少停下来想,当你把手机往会议桌中间一扔按下录音键的时候,房间里的人数、麦克风离每个人的距离、现场有没有杂音、有没有人说话总爱捂嘴或者挪位置,这些细碎的细节,其实早就决定了最后出来的转写稿,有多少地方需要手动调整。