那份转写稿已经生成了。软件没有报错,我却觉得内容不对。回到录音里听,稿子空着的地方明明有人在说话,最长一段漏了五分多钟。
九月七日,我们把同一份录音重新拿来检查。用另一套识别模型听那些空白,它能写出连续的内容。原来不是录音没有声音,也不能简单怪收音不好。
继续查下去,问题出在 Paraformer 的那条 GPU 量化运行路线。它处理某些语音块时报错,外面的程序却把错误当成没有识别到文字,接着往下跑。于是进度走完了,一份残缺的稿子也被当成结果存了下来。
后来把这一条中文识别路线换成 CPU 的安全模式,重跑同一份录音。文字从约 7,600 字增加到约 19,800 字,最大的空白缩到约 9 秒。还加了一道检查:大量有声音的区间没有文字,就报错,不能再悄悄交一份看似完成的稿子。
我原先还在问,显卡怎么没有多用一点。等看见那些漏掉的内容,就先顾不上利用率了。录音里说过的话得留下来,我才有稿子可以改。那次数字是这一份录音的实测,也不能拿来保证别的录音一样快、一样准。

