實體: Gemini
所有提到 Gemini 的 AI 新聞與動態。
-
Google Translate 推出新語言學習功能對抗 Duolingo
Google 於週二宣佈推出全新 AI 驅動的實驗性功能,旨在協助使用者練習與學習新語言,同時增強即時溝通能力。此語言練習功能針對初學者與進階使用者,透過量身打造的聽力與口語練習課程,根據使用者技能水平與學習目標進行調整。該功能讓使用者可選擇聆聽對話並點選所聽到的詞彙以建立理解,或進行口語練習,系統會追蹤每日進度。此功能於週二開始在 Android 與 iOS 版的 Google Translate 應用程式中推出,初期開放給練習西班牙語、法語的英語使用者,以及練習英語的西班牙語、法語與葡萄牙語使用者。Google 表示,此功能旨在與 Duolingo 等流行語言學習應用程式競爭。 此外,Google Translate 新增即時翻譯功能,允許使用者透過應用程式進行雙向對話,並獲得語音與螢幕上的翻譯。該功能利用 Google 的進階 AI 模型,支援超過 70 種語言的即時對話,包括阿拉伯語、法語、印地語、韓語、西班牙語與泰米爾語等。使用者可點選「即時翻譯」選項並選擇目標語言,系統會將語音翻譯為口語並顯示雙語字幕。該功能能識別停頓、口音與語調,並利用 Google 的語音與語音識別模型來隔離聲音,使其在嘈雜環境如餐廳或機場也能使用。此即時翻譯功能於週二開始在美國、印度與墨西哥地區可用。Google 強調,這些更新得益於 AI 與機器學習的進步,並利用 Gemini 模型大幅提升了翻譯品質、多模態翻譯及文字轉語音(TTS)能力。目前 Google 透過 Translate、搜尋、鏡頭與 Circle 到搜尋等服務,每年處理約一兆字的翻譯。
-
Google Gemini 的 AI 圖像模型獲得「香蕉」升級
Google 正在升級其 Gemini 聊天機器人,引入新的 AI 影像模型,賦予使用者更精細的圖片編輯控制權,旨在追趕 OpenAI 的流行工具並吸引來自 ChatGPT 的使用者。此次更新名為 Gemini 2.5 Flash Image,將於週二起向所有 Gemini 應用程式使用者推出,並透過 Gemini API、Google AI Studio 及 Vertex AI 平臺開放給開發者。該新模型能根據使用者的自然語言指令進行更精確的圖片編輯,同時保持人物、動物及其他細節的一致性,解決了許多競爭對手工具在修改衣物顏色時導致臉部扭曲或背景變形的問題。Gemini 2.5 Flash Image 的內建編輯器在合併狗與人的照片時,能保留其相似特徵。 該工具近期在社群媒體上引發關注,並在無名評估平臺 LMArena 的群眾評估中獲得好評,該模型以「nano-banana」的筆名出現。Google 確認此模型即其旗艦 Gemini 2.5 Flash AI 模型的內建影像能力,並聲稱在 LMArena 等多項基準測試中表現領先。Google DeepMind 產品負責人 Nicole Brichtova 表示,該更新能更順暢地進行編輯,輸出結果適用於各種需求。隨著 OpenAI 於三月推出 GPT-4o 原生影像生成器後,ChatGPT 使用者量飆升至每週超過 7 億人,而 Google 在七月財報會議上透露 Gemini 月活躍使用者為 4.5 億人。為了縮小差距,Google 特別設計此模型以符合消費者用途,例如協助使用者視覺化家居與花園專案,並具備更好的世界知識,能將沙發、客廳照片與色卡等多個參考合併為單一渲染圖。 Gemini 2.5 Flash Image 允許使用者與 AI 影像模型進行多輪對話。儘管新工具讓製作和編輯寫實圖片更簡單,Google 仍設定了防護措施。過去 Google 曾因 Gemini 生成歷史不準確的人物圖片而道歉並暫時撤回該功能。現在 Google 認為已找到更好的平衡點,禁止生成未經同意的親密影像,這與允許使用者建立類似泰勒·斯威夫特等名人 explicit 圖片的 Grok 不同。為應對深度偽造影像的興起,Google 對 AI 生成圖片應用視覺水印及後設資料識別符號
-
蘋果與谷歌討論使用Gemini重組Siri
蘋果在將 Siri 轉型為具備強大能力的 AI 助手競賽中逐漸落後,面對消費者日益增長的耐心耗盡,公司正考慮採用其他公司的技術而非自行開發。據彭博社編輯兼蘋果內部人士馬克·古爾曼報導,蘋果目前正在探索與谷歌的潛在合作關係,這是其在手機業務中最直接的競爭對手。此前,蘋果曾接觸過 OpenAI 和 Anthropic,討論使用其技術驅動 Siri 的可能性,而據報谷歌已開始訓練一個可能執行於蘋果伺服器上的模型。預計蘋果不會在未來數週內就 Siri 翻新專案是否引入合作伙伴做出決定。此外,TechCrunch 邀請讀者提供關於其觀點、反饋及活動的意見,以協助其持續進化,並鼓勵填寫調查表以瞭解其表現,同時有機會贏得獎項。
-
Google 增加 Vids 快捷按鈕讓Drive影片編輯更簡單
Google 於週五宣佈增強 Drive 中影片編輯體驗,推出針對 Vids 的新捷徑按鈕。Vids 是 Google 的 AI 驅動影片創作工具,此新功能允許 Workspace 使用者直接在 Google Drive 介面啟動影片編輯。當使用者在 Drive 中預覽影片時,右上角會出現「開啟」按鈕,點選後影片將自動在 Vids 應用程式中開啟,使用者可進行剪輯、加入音樂與文字等進一步編輯。此捷徑預設啟用,顯示 Google 正將該應用程式更緊密整合至 Workspace 套件中。Vids 於去年推出,旨在簡化影片製作流程,具備從基本文字提示生成影片、自動撰寫指令碼、重排影片片段、加入過渡效果等功能。此舉緊接於五月份 Google 為 Workspace 使用者引入另一項 Gemini AI 功能之後,該功能允許使用者利用 AI 總結儲存於 Drive 中的影片檔案。