實體: Gemini
所有提到 Gemini 的 AI 新聞與動態。
-
AI實驗室新測試:你連賺錢的念頭都沒有嗎?
本文提出了一個五級分層模型,用於評估建立基礎模型的 AI 公司,其核心在於衡量企業的野心而非商業成功。第一級代表真正熱愛自我,第二級僅有概念輪廓,第三級擁有許多有前景的產品構想,第四級擁有詳細的多階段致富計畫,而第五級則是每天已賺取數百萬美元。目前 OpenAI、Anthropic、Gemini 等知名機構均處於第五級。文章隨後分析了四家新興實驗室:humans& 雖有令人信服的溝通與協調工具構想,但對具體產品化保持謹慎,被歸類為第三級。Thinking Machines Lab 由前 ChatGPT 專案負責人 Mira Murati 創立,雖曾獲兩十億美元種子輪投資,但近期因技術長 Barret Zoph 及多名高管離職,顯示內部方向出現分歧,可能從第四級滑落至第二或第三級。World Labs 由費飛飛(Fei-Fei Li)於 2024 年籌資兩億三千萬美元成立,已推出世界生成模型並實現商業化,獲得遊戲與特效產業需求,表現類似第四級,有望晉升。最後,Safe Superintelligence 由前 OpenAI 首席科學家 Ilya Sutskever 創立,目前無產品週期且拒絕 Meta 收購,被視為典型的第 1 級科學專案,但作者指出若研究進展順利或出現重大問題,該機構可能迅速晉升。
-
Google Photos 新增功能讓你自製 memes
Google 於週四正式推出名為「Me Meme」的新功能,利用生成式 AI 技術讓使用者能將照片模板與自己的影像結合,自動生成包含本人形象的貼圖。此功能最初被 Android Authority 部落格於去年十月發現,現已透過 Google Photos 社群網站正式公告。該功能目前僅限美國使用者先行體驗,屬於實驗性質,Google 表示生成的影像可能無法與原始照片完美匹配,建議上傳光線充足、焦點清晰且正面朝向的影像以獲得最佳效果。此功能旨在讓使用者以有趣的方式探索照片並體驗 Google Gemini AI 技術,特別是 Nano Banana 模型。雖然這類功能看似輕鬆,但有助於提醒使用者回歸 Google Photos 應用使用 AI 工具,而非轉向競爭對手產品。參考 OpenAI 成功推出包含使用者影像的 Sora 應用後,使用者傾向於選擇能展示自我的 AI 編輯功能。目前該功能尚未全面上線,未來將出現在「Create」標籤頁下,預計在接下來的幾週內逐步開放給美國 iOS 和 Android 使用者。使用時,使用者需選擇模板或上傳自訂影像,點選「add photo」與「Generate」,AI 生成後可儲存、分享或再次點選「regenerate」重新構想影像。Google 亦表示將持續增加更多模板供選擇。
-
OpenAI 即將在2026年爭取企業預算
OpenAI 已重新調整領導架構,任命巴瑞特·佐普(Barret Zoph)負責推動企業客戶銷售業務,以在 2026 年追趕競爭對手。佐普於 2024 年 10 月加入前 OpenAI 技術長米拉·穆拉蒂(Mira Murati)創立的 Thinking Machine Labs,擔任聯合創始人及技術長,此前曾於 2022 年 9 月至 2024 年 10 月間擔任 OpenAI 後訓練推理副總裁。他於上週重返 OpenAI,其離職原因尚不明確,外界流傳他可能與少數前員工被解僱或自行離職,但原本就有回鍋計劃。佐普將負責拓展企業市場,該領域目前正失去市場份額。OpenAI 於 2023 年推出企業版 ChatGPT,擁有超過 500 萬企業使用者,客戶包括 SoftBank、Target 和 Lowe's。然而,根據 Menlo Ventures 的報告,Anthropic 在企業大型語言模型使用市場佔有率達 40%,而 OpenAI 則從 2023 年的 50% 下降至 2025 年底的 27%。Google 的 Gemini 市場佔有率則從 7 月的 20% 微增至年底的 21%。OpenAI 執行長山姆·阿爾曼(Sam Altman)在內部備忘錄中表達了對 Google Gemini 增長的擔憂。OpenAI 財務長莎拉·弗瑞(Sarah Friar)指出 2026 年將聚焦企業增長,並已宣佈擴大與 ServiceNow 的多年合作夥伴關係,讓 ServiceNow 客戶能存取 OpenAI 模型。
-
AI 代理是否已準備好進入職場?新基准測試引發質疑
微軟執行長納德拉曾預測兩年前,人工智慧將取代知識型工作,但儘管基礎模型進展迅速,白領領域的變革仍顯緩慢。近期,資料訓練巨頭 Mercor 發布新研究,針對諮詢、投資銀行及法律領域的實際任務建立新基準 APEX-Agents。測試結果顯示,所有 AI 實驗室均不及格,即便是最佳模型在面對真實專業人士提問時,正確率僅達四分之一。Mercor 執行長佛迪指出,模型最大的障礙在於跨領域資訊追蹤,這正是人類知識工作者日常運作的核心。測試環境模擬了 Slack 與 Google Drive 等多工具協作的真實情境,許多代理型 AI 在此類多領域推理上表現不穩。 測試題目源自 Mercor 專家市場,涵蓋複雜的法律合規評估,例如歐盟生產停擺期間資料外洩是否符合特定隱私條款,這類問題連部分人類專家亦可能感到困難。OpenAI 的 GDPval 基準測試廣泛知識,而 APEX-Agents 則聚焦高價值專業領域的持續任務執行,更能反映自動化潛力。在參與測試的模型中,Gemini 3 Flash 表現最佳,一問一答準確率為 24%,緊隨其後的是 GPT-5.2 達 23%,其餘如 Opus 4.5、Gemini 3 Pro 及 GPT-5 均約為 18%。佛迪認為,目前 AI 表現猶如僅能答對四分之一的實習生,但隨著基準公開,業界預期未來數月內將看到顯著進步,從去年的五至十 percent 提升至更高水準。