译声

两小时的技术演讲,
你其实可以边听边写代码

译声读取视频字幕轨,用大模型重新分句并按时长预算翻译,逐句 TTS 合成,以 video.currentTime 为时钟做五层时长对齐。结果就是:每一句中文,都在原句的时间点响起——而且面板上会显示实测起止偏差。

我们踩过的坑(你可能正准备踩)

YouTube 字幕轨现在需要 pot 参数直接请求返回 200 但内容为空。我们做了五路兜底:直连 → 拦截播放器自身请求 → InnerTube get_transcript → 备用客户端 → 页面转录面板。
中文比英文长 40%不做长度控制两分钟就错位。五层闭环:字数预算 → 超长改写 → 按实测语速预调合成速率 → 超容差重合成 → 播放端不变调微调,外加首尾静音裁剪、精确起播、到点收尾。
单纯降低原声会漏出英文尾巴Web Audio 分三个频段,只压 250–4000 Hz 并整句持续压着。诚实说:这是分频压制,不是真正的人声分离,音乐很重的视频会有损失,所以另有“静音 / 中置消除”两种模式;真·人声分离(Demucs 类)在路线图上。
自动字幕是按停顿切的先把带时间戳的碎片交给 LLM 重新分句(校验连续 / 全覆盖 / 唯一,漏了补译),再翻译。
整片预生成很烧钱按播放进度增量生成 + 内容散列缓存 + 服务端共享缓存,热门视频边际成本趋近于零。

如果你想用自己的 Key

¥128 / 年 ¥15 / 月
工具版:翻译 / 配音 / 听写全走你自己的服务商账号。内置 MiniMax / 火山 / Azure / ElevenLabs / OpenAI / DeepSeek / 通义 / Kimi / 硅基流动预设,支持多套配置和主备切换。你的 Key 不经过我们的服务器。
购买工具版

面板里能看到的东西

同步报告

字幕走的第几路、碎片→句子数、合成匹配度、实测起止偏差、起播提前量。可一键复制。

对比试听

“听听没对齐是什么样”:20 秒内用“念完再念下一句”的朴素方式播放,你会看到落后秒数一路累积。

兼容性自检

浏览器、插件版本、站点支持、字幕轨、服务器连通与线路延迟、音频图状态——一键给出原因和解法。