爱意满满的作品展示区。
goingglobal

做了个把多人录音按说话人拆成独立音轨的工具

  •  1
     
  •   goingglobal · 22h 12m ago · 644 views

    最近做了一个小工具 Seply ,主要解决多人录音里的说话人分离问题。

    这里的“分离”不是只在文字稿里标记 Speaker 1 、Speaker 2 ,而是上传一段播客、采访或者会议录音后,实际生成每位说话人的独立音轨,并且保持和原录音的时间轴对齐,方便后续剪辑、转写或者单独处理某个人的声音。

    最开始做这个功能,是因为我发现很多 diarization 工具只能告诉你“谁在什么时候说话”,但如果想真正拿到每个人的音频,仍然需要手工剪辑。

    目前主要支持:

    上传音频或视频 自动识别或手动设置说话人数 为每位说话人生成独立 WAV 音轨 普通对话和重叠语音两种处理模式 另外做了带说话人和时间轴的语音转文字功能

    实际做下来,最难处理的还是多人同时说话。

    普通轮流对话的分离效果相对稳定,但遇到抢话、打断或者两个人同时说话时,很难做到完全干净。我后来增加了一个针对重叠语音的 Advanced 模式,效果会好一些,但处理成本也高很多。

    所以现在产品里保留了两个模式:

    Standard:适合大多数轮流说话的播客、采访和会议 Advanced:适合重叠说话较多、对分离质量要求更高的录音

    我没有把它宣传成“可以完美消除重叠语音”,因为实际效果还是会受到噪声、回声、录音设备、声音相似度和重叠程度影响。

    网站在这里:

    https://seply.org/

    新用户有 30 Credits ,可以免费处理最多 3 分钟的 Standard Separation 。网站目前主要面向海外用户,所以界面是英文的。

    想请大家主要帮我看看几个问题:

    打开首页后,能不能比较快地理解它和普通说话人识别、语音转文字的区别? Standard 和 Advanced 两个模式会不会让人觉得选择比较复杂? 如果你处理过播客、采访、会议或者多人视频,最希望导出哪些结果? 定价和 Credits 的表达是否容易理解?

    目前还是一个比较早期的版本,会持续迭代。

    No Comments Yet
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   3301 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 23ms · UTC 11:43 · PVG 19:43 · LAX 04:43 · JFK 07:43
    ♥ Do have faith in what you're doing.