最近做了一个小工具 Seply ,主要解决多人录音里的说话人分离问题。
这里的“分离”不是只在文字稿里标记 Speaker 1 、Speaker 2 ,而是上传一段播客、采访或者会议录音后,实际生成每位说话人的独立音轨,并且保持和原录音的时间轴对齐,方便后续剪辑、转写或者单独处理某个人的声音。
最开始做这个功能,是因为我发现很多 diarization 工具只能告诉你“谁在什么时候说话”,但如果想真正拿到每个人的音频,仍然需要手工剪辑。
目前主要支持:
上传音频或视频 自动识别或手动设置说话人数 为每位说话人生成独立 WAV 音轨 普通对话和重叠语音两种处理模式 另外做了带说话人和时间轴的语音转文字功能
实际做下来,最难处理的还是多人同时说话。
普通轮流对话的分离效果相对稳定,但遇到抢话、打断或者两个人同时说话时,很难做到完全干净。我后来增加了一个针对重叠语音的 Advanced 模式,效果会好一些,但处理成本也高很多。
所以现在产品里保留了两个模式:
Standard:适合大多数轮流说话的播客、采访和会议 Advanced:适合重叠说话较多、对分离质量要求更高的录音
我没有把它宣传成“可以完美消除重叠语音”,因为实际效果还是会受到噪声、回声、录音设备、声音相似度和重叠程度影响。
网站在这里:
新用户有 30 Credits ,可以免费处理最多 3 分钟的 Standard Separation 。网站目前主要面向海外用户,所以界面是英文的。
想请大家主要帮我看看几个问题:
打开首页后,能不能比较快地理解它和普通说话人识别、语音转文字的区别? Standard 和 Advanced 两个模式会不会让人觉得选择比较复杂? 如果你处理过播客、采访、会议或者多人视频,最希望导出哪些结果? 定价和 Credits 的表达是否容易理解?
目前还是一个比较早期的版本,会持续迭代。