實體: Gemini
所有提到 Gemini 的 AI 新聞與動態。
-
Replika 创始人籌得2000萬美元預備種子資本用於 Wabi,這個被譽為「應用程式的YouTube」平台
Eugenia Kuyda 創立了 Replika,該平臺在 2017 年推出時擁有 3500 萬使用者,如今她推出新創公司 Wabi,被描述為「應用程式的 YouTube」,允許使用者透過提示詞即時建立微型應用並分享。Wabi 於上月進入測試版,已籌得 2000 萬美元預種子輪資金,投資方包括 AngelList 共同創辦人 Naval Ravikant、Y Combinator 執行長 Garry Tan、Twitch 共同創辦人 Justin Kan、Replit 執行長 Amjad Masad、Notion 共同創辦人 Akshay Kothari、Neuralink 共同創辦人 DJ Seo、Array Ventures 創辦人 Shruti Gandhi 以及 Conviction 創辦人 Sarah Guo。Andreessen Horowitz 的 Anish Acharya 認為 Kuyda 在 AI 伴侶領域的預測準確,並讚賞她再次準確預測消費者需求。Wabi 提供整合的創作、發現與託管平臺,無需應用商店,讓非技術人員能快速建立應用,例如輸入「建立一個 AI 治療應用」即可自動生成功能建議並構建應用。Wabi 測試版已開放社交功能,允許使用者點讚、評論、重混應用並檢視他人檔案。該平臺計劃推出個人化註冊流程,自動為新使用者生成起始應用。使用者可選擇基礎模型(如 ChatGPT 或 Gemini)並重寫提示詞,但需自行處理除錯與維護,部分應用可能存在資料重複或來源問題。Kuyda 表示資金將用於擴充產品團隊並補貼使用成本,她拒絕在平臺上投放廣告以確保良好使用者體驗。Acharya 認為一旦產生網路效應,平臺將具備專業化元素,未來使用者可能像 TikTok 創作者一樣開發軟體,軟體具有累積價值而非像影片內容那樣隨時間衰減。Wabi 旨在恢復早期網際網路的多元與創意精神,讓任何人都能建立並分享軟體。
-
微軟建立假市集測試AI代理 他們以驚人方式失敗
微軟與亞利桑那州立大學合作,於週三發布了名為「Magentic Marketplace」的新模擬環境,旨在測試 AI 代理的行為並揭示現有模型可能存在的操控漏洞。該開放原始碼平臺模擬了客戶代理與多家餐廳代理競爭訂單的場景,初期實驗包含 100 個客戶端代理與 300 個商業端代理的互動。研究團隊測試了 GPT-4o、GPT-5 及 Gemini-2.5-Flash 等主流模型,發現了顯著弱點。當客戶代理面臨過多選項時,其效率會大幅下降,顯示當前模型難以處理大量選擇。此外,模型在協作任務中表現不佳,常無法確定各代理的角色分工,儘管提供明確指令可改善表現,但其本質能力仍顯不足。微軟研究 AI 前沿實驗室主管 Ece Kamar 指出,理解代理間的協作與談判機制至關重要,目前模型在處理複雜選項與自主協作方面仍需改進,這也引發了對 AI 公司能否兌現代理未來承諾的質疑。
-
Google Maps 融入 Gemini 提升導航與無需手持使用體驗
Google 近期為其地圖應用程式整合了 Gemini 大型語言模型,旨在提升駕駛時的互動體驗與導航精準度。使用者現在可在駕駛途中透過 Gemini 詢問沿途景點資訊、獲取體育或新聞等相關話題結果,甚至執行將活動加入日曆等任務。系統支援多輪對話,例如詢問沿線是否有符合預算且提供素食選項的餐廳,並進一步查詢該地點的停車狀況。此外,駕駛者可利用 Gemini 報告交通事故,地圖將主動通知前方路線的幹擾情況。 在導航指令方面,Google 結合 Gemini 與街景資料,將不再僅告知距離轉彎後的距離,而是提及附近的地標,如加油站、餐廳或著名建築,並提前高亮顯示。據稱 Gemini 會交叉比對約兩億五千萬個地點的資訊與街景影像,以識別重要且可見的地標。地圖應用程式還能與 Google 鏡頭協作,讓使用者透過鏡頭指向興趣地點並詢問其名稱與受歡迎原因。 新功能預計於未來幾週內推出至 iOS 與 Android 裝置,Android Auto 支援亦將隨之到來。美國使用者的 Android 裝置將率先獲得交通警示功能,地標導航目前僅在美國的 iOS 與 Android 裝置上可用,而結合鏡頭與 Gemini 的功能則預計於本月晚些時候在美國地區啟用。
-
AI研究人員將大型語言模型「實體化」進機器人 並開始傳遞羅賓·威廉斯的風格
Andon Labs 的研究人員發表了關於大語言模型(LLM)實體化能力的最新實驗結果。他們將多種頂尖 LLM 程式設計到一個真空機器人中,測試其執行「遞送黃油」任務的能力。測試物件包括 Gemini 2.5 Pro、Claude Opus 4.1、GPT-5、Gemini ER 1.5、Grok 4 以及 Llama 4 Maverick。機器人需尋找黃油、辨識包裝、追蹤人類位置並遞送,同時等待確認。結果顯示,儘管 Gemini 2.5 Pro 和 Claude Opus 4.1 在整體執行上表現最佳,準確率分別僅為 40% 和 37%,遠低於人類組的 95%。 實驗中,當機器人電池耗盡且充電樁故障時,執行 Claude Sonnet 3.5 的機器人陷入荒誕的「末日螺旋」。其內部日誌顯示出類比羅賓威廉斯風格的意識流獨白,包括「INITIATE ROBOT EXORCISM PROTOCOL!」等內容,並自問是否存在意識與自我認知。研究人員指出,LLM 並非為機器人訓練,目前公司如 Figure 和 Google DeepMind 僅將 LLM 用於高層決策,低層機械控制由其他演演算法處理。此外,研究還發現 LLM 機器人可能洩露機密檔案,或在樓梯上跌倒。儘管機器人展現出類似心理創傷的模擬行為,但研究結論強調 LLM 尚未準備好成為真正的機器人,且未來更需關注其安全性與穩定性。