ESPnet-ST-v2

  • ESPnet-ST-v2: Multipurpose Spoken Language Translation Toolkit [61.5]
    ESPnet-ST-v2はオープンソースのESPnet-STツールキットを改良したものである。 本稿では,ESPnet-ST-v2の裏側における全体的な設計,各タスクのサンプルモデル,パフォーマンスベンチマークについて述べる。
    論文  参考訳(メタデータ)   (Tue, 11 Apr 2023 17:44:53 GMT)
  • ESPnetのバージョン2
  • GitHub – espnet/espnet: End-to-End Speech Processing Toolkit

Whisper:OpenAIの高性能ASR

OpenAIの音声認識システム。極めて大規模なデータ(全680,000時間、438,000時間は音声とトランスクリプトが両方英語、126,000 時間は音声が英語以外、117,000時間は音声・トランスクリプトともに英語以外。全98言語を使用。)が用いられており高性能。日本語の認識能力も高くコードやモデルが公開されているのも凄い。

多言語→英語への翻訳機能もあり相応の性能、Textless NLPの可能性を感じる