译声读取视频字幕轨,用大模型重新分句并按时长预算翻译,逐句 TTS 合成,以 video.currentTime 为时钟做五层时长对齐。结果就是:每一句中文,都在原句的时间点响起——而且面板上会显示实测起止偏差。
字幕走的第几路、碎片→句子数、合成匹配度、实测起止偏差、起播提前量。可一键复制。
“听听没对齐是什么样”:20 秒内用“念完再念下一句”的朴素方式播放,你会看到落后秒数一路累积。
浏览器、插件版本、站点支持、字幕轨、服务器连通与线路延迟、音频图状态——一键给出原因和解法。