跳至內容
AI 新聞站
返回

Mistral 發佈一個新的開放原始碼語音生成模型

法國AI公司Mistral週四發布了一款新的開放原始碼文字轉語音模型,可用於語音AI助理或企業應用案例,例如客戶服務。這款讓企業可以建立銷售與客戶互動用語音代理的模型,使Mistral與ElevenLabs、Deepgram和OpenAI等競爭對手直接對抗。新模型名為Voxtral TTS,支援九種語言,包括英語、法語、德語、西班牙語、荷蘭語、葡萄牙語、義大利語、印地語和阿拉伯語。Mistral AI科學運營副總裁Pierre Stock在電話採訪中告訴TechCrunch:「我們的客戶一直在尋求一款語音模型,因此我們開發了一款小型語音模型,可以安裝在智慧手錶、智慧型手機、筆電或其他邊緣裝置上。它的成本僅是市場上其他產品的一小部分,但提供了最先進的表現。」
圖片來源:Mistral
Mistral表示,新模型可以透過少於五秒的樣本,適配自訂語音,並能捕捉到細微的口音、語調、語氣以及語音流暢度的不規則之處。該模型基於Ministral 3B,可以輕鬆切換語言而不會失去語音的特徵,這對配音或即時翻譯等應用場景非常有用。Stock表示,公司希望這款模型聽起來像人類,而不是機器般的。根據公司說明,這款模型是為即時表現而設計的。對於一個包含500個字元、10秒的樣本,模型的首次語音時間(Time-to-First-Audio,TTFA)為90毫秒。模型的即時係數(Real-Time Factor,RTF)為6倍,這意味著它可以在約1.6秒內完成10秒的語音片段。
圖片來源:Mistral AI
今年早些時候,Mistral推出了兩款轉錄模型,一款用於大量批次處理,另一款則用於低延遲的即時應用場景。隨著這款新的語音模型問世,公司很可能正試圖為企業提供完整的語音產品組合。Stock表示:「我們計畫建立一個端到端的平台,可以處理包括音訊、文字和圖像的多模態輸入,並輸出結果。這個端到端代理系統的主要優勢在於,您可以獲得更多資訊,因為系統支援音訊作為輸入或輸出。」
Mistral的定位是,其開放原始碼與自訂化功能將幫助企業採用其語音模型,超越競爭對手,因為他們可以根據自己的需求進行調整。


分享這篇文章:

上一篇
數據中心的「以血還血」:一位參議員對AI失業的回應
下一篇
目前發生的事是《馬努斯》故事中最不意外的一章