Mistral AI、オープンウェイトの音声合成モデル「Voxtral TTS」を発表
Mistral AIが新たなテキスト読み上げ(TTS)モデル「Voxtral TTS」を公開した。オープンウェイトかつ高速で、音声エージェント向けにリアルな発話生成と即時的な声質適応を可能にする。
Mistral AIは、フロンティア級のオープンウェイト音声合成(TTS)モデル「Voxtral TTS」を発表した。同社が以前に公開した音声認識モデル「Voxtral」に続く音声関連モデルで、テキストから自然で人間らしい音声を生成することを目的としている。
特徴
Voxtral TTSは、高速な推論性能を持ち、音声エージェントなどのリアルタイム性が求められる用途を意識した設計となっている。また「即時的に適応可能」とされており、特定の声質や話し方への素早いカスタマイズが可能な点も強調されている。
オープンウェイトでの提供
同モデルはオープンウェイトとして公開されており、開発者が自身の環境で利用・改変できる点が特徴だ。Mistral AIはこれまでもオープン性を重視したモデル展開を進めており、音声認識のVoxtralに続き、TTS分野でもオープンな選択肢を提供する形となる。音声エージェントやカスタマーサポート向けボイスアシスタントなど、実用的な音声インターフェース構築への応用が期待される。
原文ソース
Mistral AI