S2ST(direct Speech-to-Speech Translation): 音声to音声の直接翻訳

Direct speech-to-speech translation with discrete units [64.2]
本稿では、中間テキスト生成に頼ることなく、ある言語から別の言語に音声を変換する直接音声to音声翻訳(S2ST)モデルを提案する。本稿では,ラベルなし音声コーパスから学習した自己教師付き離散表現の予測を提案する。対象のテキスト書き起こしが利用可能となると、同一の推論パスで2つのモード出力(音声とテキスト)を同時に生成できる、共同音声認識とテキストトレーニングを備えたマルチタスク学習フレームワークを設計する。
論文参考訳（メタデータ） (Mon, 12 Jul 2021 17:40:43 GMT)
- 以前紹介したNiuTransと同様に直接的な音声翻訳の提案。Transformer型アーキテクチャ、self-supervised、マルチタスクを活用などこちらも様々なテクニックを活用している。（データがあれば）end to endでこの手のシステムが作れるかもしれないとは驚き。

コメントを残す

コメントを残す コメントをキャンセル