跳至內容
AI 新聞站
返回

Cohere 發佈專門用於轉錄的開放源碼語音模型

企業AI公司 Cohere 週四推出了其首款語音模型:Transcribe 是一個開放原始碼的自動語音辨識模型,可用於筆記整理與語音分析等任務。這款模型參數相對輕量,僅有 20 億個參數,適合使用消費者級的 GPU 進行自建伺服器部署。目前 Transcribe 支援 14 種語言:英語、法語、德語、義大利語、西班牙語、葡萄牙語、希臘語、荷蘭語、波蘭語、中文、日語、韓語、越南語以及阿拉伯語。Cohere 表示,Transcribe 在 Hugging Face Open ASR 標準測試排行榜上表現優於 Zoom Scribe v1、IBM Granite 4.0 1B、ElevenLabs Scribe v2 以及 Qwen3-ASR-1.7B Speech,平均字詞錯誤率(WER)為 5.42,低於其他所有模型。公司聲稱,當人類評估者評估其轉錄結果的準確性、連貫性與可用性時,Transcribe 的平均勝率達到 61%。然而,當 Transcribe 要處理葡萄牙語、德語與西班牙語時,表現落後於競爭對手。Cohere 表示,Transcribe 每分鐘可處理 525 分鐘的語音資料,這在其類別中屬於較高的表現。公司計畫將 Transcribe 整合至其企業代理協調平台 North,並透過其 API 免費提供該模型。該模型也會在 Model Vault,Cohere 的受管理推論平台上提供。隨著筆記整理與口述應用程式如 Granola 和 Wispr Flow 的需求不斷成長,語音辨識模型越來越受歡迎。今年早些時候,Cohere 報告表示,預計 2025 年將產生每年 2.4 億美元的經常性收入,其 CEO Aidan Gomez 表示該公司可能「很快」就會公開上市。


分享這篇文章:

上一篇
Contour 獲得 700 萬美元資金來自 General Catalyst 與 YC,用以開發用於安全監視系統的 AI 搜索引擎
下一篇
數據中心的「以血還血」:一位參議員對AI失業的回應