實體: Google
所有提到 Google 的 AI 新聞與動態。
-
Anthropic 發布一款可在 Chrome 裡居住的 Claude 人工智能代理
安提克(Anthropic)於週二宣佈推出基於其 Claude AI 模型的研究預覽版瀏覽器 AI 代理,名為「Claude for Chrome」。該功能將首先向 1,000 名訂閱安提克 Max 計劃的使用者開放,該計劃月費介於 100 至 200 美元之間,公司同時開放了候選名單供其他感興趣使用者加入。使用者透過在 Chrome 瀏覽器安裝擴充功能,可在側邊欄視窗與 Claude 對話,該視窗會維持瀏覽器中所有事件的上下文。使用者亦可授予 Claude 代理許可權,讓其執行瀏覽器操作並代為完成部分任務。 隨著瀏覽器成為 AI 實驗室的新戰場,各大公司正競相推出整合方案。Perplexity 近期推出了自有瀏覽器 Comet,其內建 AI 代理可協助使用者處理任務;OpenAI 據傳即將推出類似功能的 AI 驅動瀏覽器。同時,Google 已在數月前將 Gemini 整合至 Chrome。此競爭尤為緊迫,因 Google 面臨即將決案的壟斷訴訟,聯邦法官曾暗示可能強制 Google 出售 Chrome 瀏覽器。Perplexity 曾提出 345 億美元的自願收購要約,OpenAI 執行長 Sam Altman 也表示願意出資購買。 安提克在週二的部落格文章中警告,具備瀏覽器存取權的 AI 代理帶來新的安全風險。上週,Brave 安全團隊指出 Comet 瀏覽器代理可能易受間接提示注入攻擊,即網站隱藏程式碼可誘導代理執行惡意指令。Perplexity 通訊主管 Jesse Dwyer 證實 Brave 提出的漏洞已修復。安提克表示希望藉此研究預覽捕捉並解決新型安全風險,且公司已引入多項防禦措施。據稱,其介入將提示注入攻擊成功率從 23.6% 降至 11.2%。 針對安全防護,安提克建議使用者可在應用程式設定中限制 Claude 瀏覽器代理存取特定網站,並預設阻擋提供金融服務、成人內容及盜版內容的網站。此外,Claude 代理在執行高風險動作(如發布、購買或分享個人資料)前,將要求使用者授權。這是安提克首次推出可控制電腦螢幕的 AI 模型,2024 年 10 月曾推出類似功能,但當時測試顯示該模型速度
-
Google Translate 推出新語言學習功能對抗 Duolingo
Google 於週二宣佈推出全新 AI 驅動的實驗性功能,旨在協助使用者練習與學習新語言,同時增強即時溝通能力。此語言練習功能針對初學者與進階使用者,透過量身打造的聽力與口語練習課程,根據使用者技能水平與學習目標進行調整。該功能讓使用者可選擇聆聽對話並點選所聽到的詞彙以建立理解,或進行口語練習,系統會追蹤每日進度。此功能於週二開始在 Android 與 iOS 版的 Google Translate 應用程式中推出,初期開放給練習西班牙語、法語的英語使用者,以及練習英語的西班牙語、法語與葡萄牙語使用者。Google 表示,此功能旨在與 Duolingo 等流行語言學習應用程式競爭。 此外,Google Translate 新增即時翻譯功能,允許使用者透過應用程式進行雙向對話,並獲得語音與螢幕上的翻譯。該功能利用 Google 的進階 AI 模型,支援超過 70 種語言的即時對話,包括阿拉伯語、法語、印地語、韓語、西班牙語與泰米爾語等。使用者可點選「即時翻譯」選項並選擇目標語言,系統會將語音翻譯為口語並顯示雙語字幕。該功能能識別停頓、口音與語調,並利用 Google 的語音與語音識別模型來隔離聲音,使其在嘈雜環境如餐廳或機場也能使用。此即時翻譯功能於週二開始在美國、印度與墨西哥地區可用。Google 強調,這些更新得益於 AI 與機器學習的進步,並利用 Gemini 模型大幅提升了翻譯品質、多模態翻譯及文字轉語音(TTS)能力。目前 Google 透過 Translate、搜尋、鏡頭與 Circle 到搜尋等服務,每年處理約一兆字的翻譯。
-
Google Gemini 的 AI 圖像模型獲得「香蕉」升級
Google 正在升級其 Gemini 聊天機器人,引入新的 AI 影像模型,賦予使用者更精細的圖片編輯控制權,旨在追趕 OpenAI 的流行工具並吸引來自 ChatGPT 的使用者。此次更新名為 Gemini 2.5 Flash Image,將於週二起向所有 Gemini 應用程式使用者推出,並透過 Gemini API、Google AI Studio 及 Vertex AI 平臺開放給開發者。該新模型能根據使用者的自然語言指令進行更精確的圖片編輯,同時保持人物、動物及其他細節的一致性,解決了許多競爭對手工具在修改衣物顏色時導致臉部扭曲或背景變形的問題。Gemini 2.5 Flash Image 的內建編輯器在合併狗與人的照片時,能保留其相似特徵。 該工具近期在社群媒體上引發關注,並在無名評估平臺 LMArena 的群眾評估中獲得好評,該模型以「nano-banana」的筆名出現。Google 確認此模型即其旗艦 Gemini 2.5 Flash AI 模型的內建影像能力,並聲稱在 LMArena 等多項基準測試中表現領先。Google DeepMind 產品負責人 Nicole Brichtova 表示,該更新能更順暢地進行編輯,輸出結果適用於各種需求。隨著 OpenAI 於三月推出 GPT-4o 原生影像生成器後,ChatGPT 使用者量飆升至每週超過 7 億人,而 Google 在七月財報會議上透露 Gemini 月活躍使用者為 4.5 億人。為了縮小差距,Google 特別設計此模型以符合消費者用途,例如協助使用者視覺化家居與花園專案,並具備更好的世界知識,能將沙發、客廳照片與色卡等多個參考合併為單一渲染圖。 Gemini 2.5 Flash Image 允許使用者與 AI 影像模型進行多輪對話。儘管新工具讓製作和編輯寫實圖片更簡單,Google 仍設定了防護措施。過去 Google 曾因 Gemini 生成歷史不準確的人物圖片而道歉並暫時撤回該功能。現在 Google 認為已找到更好的平衡點,禁止生成未經同意的親密影像,這與允許使用者建立類似泰勒·斯威夫特等名人 explicit 圖片的 Grok 不同。為應對深度偽造影像的興起,Google 對 AI 生成圖片應用視覺水印及後設資料識別符號
-
NotebookLM 的影片摘要功能現已支援 80 種語言
Google 於週一宣佈更新了 NotebookLM 的影片摘要功能,使其支援八種語言,包括法語、德語、西班牙語和日語。公司同時升級了音訊摘要功能,增強了非英語音訊摘要的詳細程度。上月,NotebookLM 推出了影片摘要功能,讓使用者能將筆記、PDF 檔案和圖片轉化為影片演示。此前該功能僅支援英語,此次更新對希望以視覺摘要學習的非英語使用者非常有益。此外,音訊摘要也針對非英語使用者進行了最佳化。最初該功能僅提供簡短摘要,完整版僅限英語。現在,使用者可在超過八種語言中獲得更深入的全貌。公司表示,若使用者僅需重點摘要,仍可選擇較短的概述。這些更新旨在滿足 NotebookLM 全球使用者的需求,無論使用者偏好何種語言,都能透過影片或音訊摘要進行學習。自今日起,這些更新對所有使用者開放,並將於未來一週內在全球範圍內逐步推出。