跳至內容
AI 新聞站
返回

OpenAI 推出全新語音智能功能於其 API

OpenAI 今(四)日表示,其 API 現在將包含數項新的聲音智能功能,旨在協助開發者建立可以對話、轉錄與翻譯與使用者對話的應用程式。該公司的新 GPT-Realtime-2 是另一個聲音模型,用來建立逼真的聲音模擬,可以與使用者對話。然而,與其前一代(GPT-Realtime-1.5)不同,這個模型是使用 GPT-5 等級的推理能力所建構,OpenAI 表示這個能力是用來處理來自使用者更為複雜的請求。該公司同時也推出 GPT-Realtime-Translate,正如其名稱所顯示,這個功能是設計用來提供即時翻譯服務,能與使用者對話般同步進行。這個功能包含超過 70 種輸入語言(也就是它能夠理解的語言),以及 13 種輸出語言(也就是它傳達給發話者使用的語言)。最後,該公司也推出了新的轉錄功能 GPT-Realtime-Whisper,讓使用者擁有即時的語音轉文字能力,並在互動發生時即時記錄。OpenAI 表示:「我們推出的這些模型,將實時音訊從單純的問與答,推向可以實際執行工作的聲音介面:聆聽、推理、翻譯、轉錄,並在對話進行中採取行動。」這些更新會對哪些人有幫助?想要擴充客服功能的企業顯然是明顯的目標。然而,OpenAI 也指出,其新功能將協助許多不同領域,包括教育、媒體、活動與創作者平台等。雖然這些工具從企業觀點看來似乎非常實用,但也有可能被濫用。該公司表示,已建立防護機制,防止新功能被用來製造垃圾訊息、詐欺或其他形式的網際網路濫用。系統中已嵌入某些觸發條件,讓「在檢測到對話違反我們有害內容指引時,可以中止對話」,OpenAI 如此說明。所有新的聲音模型皆包含於 OpenAI 的 Realtime API 中。Translate 與 Whisper 是按分鐘計費,而 GPT-Realtime-2 則是按 token 消耗量計費。


分享這篇文章:

上一篇
電傳機器成為美國醫療體系瓶頸,風投機構開始注意到
下一篇
斯德哥爾摩新興AI創業公司Pit成為最新崛起之星