双摄录像能在录制的同时自动加字幕吗
不能。双摄录像做的是采集画面和声音,不会一边拍一边跑语音识别再把结果画进画面里——这不是 DualCam 单独的限制,苹果自己的相机 App,不管录一路还是两路,也做不到这件事。实时字幕是极少数专门的 App 和系统辅助功能才会尝试做的东西,而且即便做了,你在屏幕上看到的也只是一个还没确定下来的猜测,不是已经写进视频文件里的东西。
与其说这是少了一个功能,不如说这是活分给了不同的环节。相机 App 该做好的事,是把画面和声音录得尽量干净准确;把说出来的话变成准确的文字,是另一件事,而且放在事后做效果好得多——因为那时候整句话已经完整地留在音轨里,可以拿来核对。
为什么字幕天生该放在录完之后
语音转文字这件事,光靠一瞬间的声音是不够的。要准确认出一个词,系统通常得先听完整个词,很多时候还得听到它前后的词,才能确定说的到底是什么。这一点哪怕是很好的离线转写也一样成立,也就意味着一边说话一边画到画面上的字幕,永远是一个来不及被后面的话修正过的初步猜测。
双摄录像也没有一层独立于画面之外、可以事后单独调整的文字层。一帧画面在 GPU 上合成完写进文件的那一刻,烧进这一帧里的东西就定死了——版式、画中画所在的角落、滤镜都是这样,字幕要是也烧进去,同样逃不开这一点。把一个当场没听准的猜测直接烧死在画面里,又没法回头改错听的那个词,这比录完之后再加字幕要糟得多——毕竟事后能看见这个错、也能在别人看到之前把它改掉。
一条录完的双摄视频,到底能给字幕提供什么
DualCam 写进磁盘的是一条视频轨加一条音轨——一个普通的 MP4,结构和系统相机拍出来的片段没有区别。这一条音轨录的是两路摄像头都在跑的时候,房间里实际发出的声音。不存在另外一条专门装着台词稿或者文字稿的通道;最后留在录像里的话,只有真正被大声说出来、而且响到麦克风能收到的那些话。
这一点在你打算事后加字幕时很关键:不管是平台自带的自动字幕,还是单独的剪辑软件,能用来生成字幕的,也只有这一条音轨里实际存在的声音。默读卡片上的字、或者说到画面底部声音越来越小,都不会给字幕工具留下什么能准确转写的东西。
停止录制之后,怎么弄出经得起看的字幕
因为录完的双摄视频就是一个普通的 MP4,事后加字幕的常规办法,用在它身上和用在任何别的视频上没有区别——平台自带的自动字幕、专门的剪辑 App,或者自己一个字一个字打上去。这几种办法都比当场的实时猜测靠谱,原因也一样:你可以把片子倒回去看,对着实际说的话核对文字,把自动系统认错的那几个词在别人看到之前改过来。
- 按正常语速把整句话说完整,别说到一半就含糊过去——大多数自动字幕工具一遇到长停顿或者没说完的词就容易断错。
- 如果是照着东西念而不是临场说话,就大声、清楚地念出来。音轨是唯一留下「说了什么」的记录,停在卡片或屏幕上的文字进不了这条音轨。
- 发布前先自己看一遍自动生成的字幕。它是一个不错的初稿,不是成品,这一步才是真正能把错词改掉的地方,而不是就这么带着错发出去。
延伸问题
DualCam 有实时字幕或者自动加字幕的功能吗?
没有。录制过程中能用到的屏幕上的工具是版式、画中画的角落和形状、六种滤镜、镜头选择、手电筒、网格和静音——里面没有文字或字幕工具。字幕都是录完之后,在你用来剪辑或发布视频的那个 App 里加上去的。
如果我把录制静音了,事后还能加字幕吗?
不能自动加。静音录制根本不会生成音轨,自动字幕工具没有声音可以转写,只能像给默片配字幕那样,一个字一个字自己打上去。
iPhone 系统里能在屏幕上显示字幕的辅助功能,会被一起录进视频吗?
不会。DualCam 的每一帧画面都是在 GPU 上把两路摄像头的画面合成出来的,不是屏幕录制。看屏幕时叠在最上层的系统悬浮层,从来就不是合成器从摄像头画面里画出来的东西,所以也进不了写文件的这条流程——就像 DualCam 自己屏幕上的按钮,从来不会出现在成片里一样。