FaceRigで動画を出力した際に、口の動きと音声のズレが気になるときに役立つ調整手順です。
録音時に生成される特定の音声ファイルを差し替えて書き出す方法を解説します。
通常のエクスポートでは参照されない○○_clean.wavを使用することで、リップシンクの精度が向上する場合があります。
FaceRigの口パクを音声に合わせる手順
書き出し時の音声ファイルを差し替えてリップシンクを合わせる手順を説明します。
パフォーマンス録音時に生成されるファイル
FaceRigでパフォーマンスを録音すると、指定フォルダに3種類のデータが保存されます。
- Sample.rpl
- Sample.wav
- Sample_clean.wav
動画出力時に参照されるファイル構成
パフォーマンスをムービーとしてエクスポートする際は、次の2つのファイルが使用されます。
- Sample.rpl
- Sample.wav
以上の2種類が読み込まれます。
エクスポート時は、モーションデータ(.rpl)と同名の音声データ(.wav)が自動的に合成されます。
※.wavファイルを一時的に除外した状態でエクスポートすると、音声なしの動画を出力できます。
※録音時に同時に生成されるSample_clean.wavは、標準のエクスポート処理では読み込まれません。
「○○_clean.wav」の役割と特徴
自動参照されないSample_clean.wavの音声内容について検証しました。
元のSample.wavとSample_clean.wavの波形を重ねて差分を確認すると、以下の状態になります。

波形そのものの形状はほぼ一致しており、音質の変化やノイズ除去が行われたわけではありません。

- 上の波形 Sample.rplとSample.wavのデータから書き出した動画
- 下の波形 Sample.rplとSample_Clean.wavをSample.wavとリネームしたデータから書き出した動画
(もとのSample.wavは削除)
波形を詳細に比較すると、音声の再生タイミングにズレがあります。
実際に動画と組み合わせて再生すると、通常出力よりもアバターの口の開閉と発音のタイミングが一致しやすくなります。
○○_clean.wavには、FaceRigの映像側の口パク動作に同期するようタイミング調整された音声が記録されていると考えられます。
VTuberの機材環境や配信設定の全般的な情報は、まとめ記事でも解説しています。

FaceRigの記事は、ほかにもあります。




リップシンクを正確に合わせる書き出し手順のまとめ
元の○○.wavをそのまま使うのではなく、
○○_clean.wavのファイル名を○○.rplと同名に変更してから動画をエクスポートすることがポイントです。
さらに動画出力を行う前に、対象の.wavファイルを音声編集ソフトで事前処理しておく方法も有効です。
ホワイトノイズの除去や音量調整を済ませた音声データを動画に合成しておくことで、後工程の動画編集作業を効率化できます。
以下の記事では、出力したWebM動画を編集ソフトに読み込んで作業する手順を解説しています。

