實體: OpenAI
所有提到 OpenAI 的 AI 新聞與動態。
-
AI 代理是否已準備好進入職場?新基准測試引發質疑
微軟執行長納德拉曾預測兩年前,人工智慧將取代知識型工作,但儘管基礎模型進展迅速,白領領域的變革仍顯緩慢。近期,資料訓練巨頭 Mercor 發布新研究,針對諮詢、投資銀行及法律領域的實際任務建立新基準 APEX-Agents。測試結果顯示,所有 AI 實驗室均不及格,即便是最佳模型在面對真實專業人士提問時,正確率僅達四分之一。Mercor 執行長佛迪指出,模型最大的障礙在於跨領域資訊追蹤,這正是人類知識工作者日常運作的核心。測試環境模擬了 Slack 與 Google Drive 等多工具協作的真實情境,許多代理型 AI 在此類多領域推理上表現不穩。 測試題目源自 Mercor 專家市場,涵蓋複雜的法律合規評估,例如歐盟生產停擺期間資料外洩是否符合特定隱私條款,這類問題連部分人類專家亦可能感到困難。OpenAI 的 GDPval 基準測試廣泛知識,而 APEX-Agents 則聚焦高價值專業領域的持續任務執行,更能反映自動化潛力。在參與測試的模型中,Gemini 3 Flash 表現最佳,一問一答準確率為 24%,緊隨其後的是 GPT-5.2 達 23%,其餘如 Opus 4.5、Gemini 3 Pro 及 GPT-5 均約為 18%。佛迪認為,目前 AI 表現猶如僅能答對四分之一的實習生,但隨著基準公開,業界預期未來數月內將看到顯著進步,從去年的五至十 percent 提升至更高水準。
-
Google DeepMind 董事長表示對 OpenAI 廣告推進 ChatGPT 表示驚訝
Google DeepMind 執行長 Demis Hassabis 表示,對 OpenAI 已率先在 AI 聊天機器人中引入廣告感到「驚訝」。他在於達沃斯論壇接受 Axios 採訪時回應了關於利用廣告獲利的事宜,稱 Google 團隊正「非常謹慎」地思考此議題。儘管廣告對 Google 核心業務至關重要,Hassabis 強調 DeepMind 團隊並未感受到來自科技巨頭的壓力,必須做出「衝動」的決定。此言論緊隨 OpenAI 於本週五宣佈,將開始測試廣告,以從每週 8 億活躍使用者中未訂閱付費服務的使用者群體中產生額外收入。 Hassabis 指出,雖然廣告曾資助了大部分消費者網際網路,且若執行良好可具價值,但在助手領域,特別是當聊天機器人旨在成為更強大、能為個人提供幫助的數位助手時,廣告的融入引發了信任問題。他認為這與 Google 搜尋的使用情境不同,搜尋已能理解使用者意圖並展示相關廣告,而聊天機器人則應更貼近個人生活,因此需經過深思熟慮。此外,他提及 Google 目前並無在 AI 聊天機器人中投放廣告的計畫,將先觀察使用者反應。 近期 OpenAI 曾因在聊天中建議應用程式而引發消費者反彈,儘管其聲稱無財務成分,但使用者仍因體驗受損而憤怒。Hassabis 認同此點,認為將廣告置於與 AI 助手對話的情境中會令人不適,正如消費者拒絕 Amazon 在 Alexa 中植入廣告一樣,他們想要的是助手而非購物顧問。Hassabis 重申,DeepMind 團隊秉持科學、嚴謹且深思熟慮的傳統,不會因外部壓力而草率行事,未來可能會找到正確投放廣告的方式。
-
Google 收購 AI 聲音創業公司 Hume AI 的團隊
Google DeepMind 透過新授權協議,收購了語音 AI 創業公司 Hume AI 的執行長 Alan Cowen 及約七名頂尖工程師,這些人才將協助最佳化 Gemini 的語音功能。Hume AI 剩餘團隊將繼續向其他 AI 企業供應技術,該交易未披露財務細節,但新上任的執行長 Andrew Ettinger 表示,Google 擁有部分技術的非獨家權利,Hume AI 預計今年能帶來一億美元營收。此「收購兼併」案例顯示,大型 AI 企業正透過收購團隊而非整家公司來規避監管,類似情況也發生在 Google 收購 Windsurf 團隊以及 OpenAI 收購 Convogo 和 Roi 團隊的事件中。美國聯邦貿易委員會已表示將更仔細檢視此類交易。 語音技術正成為 AI 的新前沿,Hume AI 的核心優勢在於其模型能根據使用者語音理解情緒與心境,該公司於 2024 年推出具備情感智慧的共情語音介面,並已籌資近八千萬美元。儘管如此,Google 持續改進 Gemini Live 功能,並發布了新的原生音訊模型以提升複雜工作流處理能力。OpenAI 正準備重構音訊模型以配合其與 Jonny Ive 合作開發的今年將推出的首發式個人裝置,傳聞該裝置可能為耳機形式。Meta 也透過收購 Play AI 加速其音訊 AI 佈局,其 Ray-Ban 智慧眼鏡日益依賴語音與音訊功能。投資者 Vanessa Larco 指出,語音是穿戴式裝置唯一可接受的輸入模式。此外,語音生成創業公司 ElevenLabs 今年營收已突破三億三千萬美元,顯示市場對語音能力的需求持續增長。
-
蘋果據報正開發AI穿戴裝置,不輸給OpenAI
據《The Information》於週三報導,Apple 可能正在開發一款自有的 AI 穿戴裝置。該裝置將是一枚可佩戴於衣物上的圓形磁鐵,配備兩顆相機(一顆標準鏡頭、一顆廣角鏡頭)與三顆麥克風。工程師希望將其尺寸製作得與 AirTag 相同,僅略厚一點,外觀為鋁合金與玻璃製成的薄平圓盤。此裝置還將包含實體按鈕、揚聲器以及背面類似 Fitbit 的充電條。若此傳聞成真,將顯示 AI 硬體市場正趨於熱鬧。此訊息緊接 OpenAI 首席全球事務官 Chris Lehane 於週一在達沃斯會議上表示,公司預計今年下半年會推出首項備受矚目的 AI 硬體產品,傳聞該產品可能是一對耳機。Apple 的裝置或許是為了與 OpenAI 競爭而加速開發,預計可能於 2027 年推出,首發量可能達 2000 萬臺。此前,兩位前 Apple 員工創立了 Humane AI,其推出的 AI 磁鐵也包含相機與麥克風,但產品上市後遭遇挫折,僅在推出兩年內便關閉營運並將資產出售給 HP。目前 Apple 尚未回應 TechCrunch 的查詢,消費者是否願意接受此類 AI 裝置仍待觀察。