實體: Whisper
所有提到 Whisper 的 AI 新聞與動態。
-
OpenAI 推出全新語音智能功能於其 API
OpenAI 於週四宣佈,其 API 將新增一系列語音智慧功能,協助開發者建立能與使用者進行對話、轉錄及翻譯的應用程式。公司推出的新模型 GPT-Realtime-2 是另一項語音模型,旨在創造逼真的語音模擬以與使用者交談。與前代產品 GPT-Realtime-1.5 不同,此版本內建了 OpenAI 宣稱的 GPT-5 級推理能力,以處理更複雜的使用者請求。此外,公司還推出了 GPT-Realtime-Translate,提供即時翻譯服務,能與使用者對話節奏同步。該功能支援超過 70 種輸入語言(可理解語言)和 13 種輸出語言(轉發語言)。最後,公司推出了新的轉錄功能 GPT-Realtime-Whisper,提供即時語音轉文字能力,捕捉互動過程中的內容。OpenAI 表示,這些新模型將即時音訊從簡單的問答推向真正的語音介面,能聆聽、推理、翻譯、轉錄並採取行動。這些更新主要針對希望擴充套件客戶服務能力的企業,但也適用於教育、媒體、活動及創作者平臺等領域。針對潛在濫用風險,OpenAI 已建立防護機制,嵌入特定觸發器,若偵測到違反有害內容指南的對話將予以中止。所有新語音模型均包含在 OpenAI 的 Realtime API 中,其中 Translate 和 Whisper 按分鐘計費,而 GPT-Realtime-2 則按 token 消耗計費。
-
谷歌悄悄推出一款離線運作的AI口語輸入應用程式
Google 於四月七日更新其 App Store 列表,移除了對 Android 版應用程式的相關提及,並宣佈 iOS 鍵盤功能即將推出。Google 於星期一在 iOS 平臺上悄然發布了一款名為「Google AI Edge Eloquent」的離線優先口語轉文字應用程式,旨在與 Wispr Flow、SuperWhisper 及 Willow 等競爭對手抗衡。該應用程式免費下載,使用者下載基於 Gemma 的自動語音識別(ASR)模型後即可開始使用。應用程式內可顯示即時轉錄內容,當使用者暫停時,系統會自動過濾「um」、「ah」等填充詞並潤飾文字。下方提供「重點」、「正式」、「簡短」及「長篇」等選項以轉換文字格式。使用者亦可關閉雲端模式以使用僅本地處理功能,此時雲端模式則使用基於 Gemini 的模型進行文字清理。應用程式可從 Gmail 帳戶匯入特定關鍵字、名稱及專業術語,並允許使用者新增自訂詞彙。此外,該應用程式還顯示轉錄歷史記錄,支援搜尋所有記錄,並能展示最近一輪轉錄的詞彙、每分鐘詞數及總說詞數。根據官方描述,此應用程式利用 AI 捕捉使用者意圖,自動編輯掉口誤與自我修正,輸出乾淨準確的文稿。目前該應用程式僅在 iOS 平臺可用,但 App Store 描述中提及 Android 版本,並宣稱提供無縫 Android 整合,可設為預設鍵盤以實現系統級訪問,並具備類似 Wispr Flow 的浮動按鈕功能。隨著語音轉文字模型不斷進步,AI 驅動的轉文字應用程式日益普及,Google 此次測試若成功,未來 Android 平臺也可能獲得更優異的轉錄功能。
-
Wispr 繼其語音輸入應用程式受歡迎後,獲得 Notable Capital 的 2500 萬美元投資
美國語音 AI 公司 Wispr 的輸入應用程式 Wispr Flow 近期獲得顯著成長,使用者在連續使用三個月後,平均超過 50% 的輸入字元皆透過該應用程式完成。該公司已成功進入 270 家《財富》500 強企業,且過去幾週每週新增 125 家企業客戶。在 6 月由 Menlo Ventures 領投 3000 萬美元融資後,Wispr 又於近期獲得由 Notable Capital 領投、Steven Bartlett 的 Flight Fund 參與的 2500 萬美元追加融資,總融資額達 8100 萬美元。此輪融資後,公司估值達 7 億美元。Notable Capital 的 Hans Tung 將加入 Wispr 董事會擔任觀察員,他此前曾投資 Affirm、Airbnb、Slack、Coinbase、Anthropic 及 TikTok 等公司。 Wispr CEO Tanay Kothari 表示,自 6 月以來,Wispr Flow 的月增成長率達 40%,使用者規模年增 100 倍,且 12 個月留存率為 70%。儘管初期因非技術使用者發現應用後流失,公司已透過設計流程引導使用者將語音輸入應用至常用軟體。未來,Wispr 計劃推出 Android 版,預計年底進入測試階段,2025 年第一季正式上線,並擴充套件至更多平臺。公司正致力於開發自有語音模型,降低錯誤率,目前約為 10%,低於 OpenAI 的 Whisper(27%)與 Apple 原生轉錄(47%)。此外,Wispr 正測試其技術透過封閉 API 與企業及硬體夥伴合作,並希望未來能自動化處理如回覆郵件等任務,成為語音導向的作業系統。目前 Wispr 的競爭對手包括 YC 支援的 Willow、Aqua、Monologue、Typeless、TalkTastic、Superwhisper 及 BetterDictation 等。
-
迷思特發布voxtral,其首款開放源碼AI音訊模型
法國人工智慧公司 Mistral 於週二推出其首款面向企業的音訊模型家族 Voxtral,旨在挑戰封閉式企業系統的壟斷地位,提供開放權重的替代方案。Mistral 宣稱 Voxtral 是首款能在生產環境中部署真正可用語音智慧的開放模型,讓開發者不再需要在廉價但理解力不足的開放系統與功能良好但昂貴且封閉的系統之間做選擇。該模型可轉錄長達 30 分鐘的音訊,並憑藉 Mistral Small 3.1 的基礎大語言模型架構,能理解長達 40 分鐘的內容,支援使用者就音訊內容提問、生成摘要或將語音指令轉化為即時動作,例如呼叫 API 或執行函式。Voxtral 支援多國語言,包括英語、西班牙語、法語、葡萄牙語、印地語、德語、荷蘭語和義大利語。公司推出兩種變體,Voxtral Small 擁有 240 億引數,適合大規模生產部署,其效能與 ElevenLabs Scribe、GPT-4o-mini 及 Gemini 2.5 Flash 相當;Voxtral Mini 則擁有 30 億引數,適用於本地與邊緣部署。此外,還有一款名為 Voxtral Mini Transcribe 的超經濟版本,專為僅轉錄用途最佳化,宣稱效能優於 OpenAI Whisper 且價格不到其一半。使用者可透過 Hugging Face 下載 API 免費試用,或於 Mistral 的聊天機器人 Le Chat 中測試模型。根據公司說法,將 API 整合至應用程式的起點價格為每分鐘 0.001 美元。此次發布距 Mistral 上月宣佈其首款逐步推理模型家族 Magistral 僅隔一個月。Mistral 作為歐洲頂尖人工智慧企業之一,長期倡導開放原始碼 AI 模型,近期更被 TechCrunch 報導正與投資者洽談籌資高達 10 億美元的事宜。