當 Google 三年前推出 Gemini 時,目標是要建立一個多模態的大型語言模型 —— 一個被訓練在文字、圖像、音訊與視訊上的單一神經網路,並能產生任何格式的內容。今天,在其 Google I/O 開發者大會上,公司朝這個目標邁出具體一步,推出了 Gemini Omni,這是一個新的多模態模型系列,Google 首席执行長 Sundar Pichai 表示,Omni 將能「從任何輸入創造出任何東西」。Omni 首先會從視訊開始,使用者現在可以結合圖像、音訊、視訊與文字,而 Omni 不只是簡單地將這些輸入串在一起,而是會跨過所有輸入,產生一致的輸出。結果是高品質的視訊,反映對物理、文化、歷史與科學的理解。Omni 還讓使用者能用簡單的文字指令編輯照片,而不是複雜的編輯軟體,類似 Google 的 Nano Banana。Google 已經有一個專用的視訊模型 Veo,讓使用者能將文字與圖像轉換為視訊,甚至能直接與自訂動畫。但 Google DeepMind 產品管理總監 Nicole Brichtova 表示,今天的發佈不只是 Veo 的更新:「這是將 Gemini 的智能與我們媒體模型的渲染能力結合的下一步。」其中一個例子是 Koray Kavukcuoglu,DeepMind 的首席技術官,在週一的媒體簡報中告訴記者:當 Omni 被給予一個簡單的提示,例如「用黏土動畫解釋蛋白質摺疊」時,它迅速產生了一段停格動畫視訊,並搭配旁白說:「蛋白質最初是氨基酸的鏈條,它們會摺疊成類似 alpha 螺旋與稱為 beta 片的平坦區域,形成完美的三維結構。」Omni 的長期願景更為廣泛,包括從音訊生成圖像,或從視訊生成音訊。Pichai 在簡報中表示:「當我們首次宣佈 Gemini 時,這是我們第一個原生多模態的 AI 模型。我們知道將其訓練在文字、程式碼、音訊、圖像與視訊的組合上,會讓它對世界的理解更深。透過世界模型,AI 正從預測文字轉向模擬現實。Gemini Omni 是朝這個方向的下一步。」作為發佈的一部分,使用者將能用自己的數位虛擬形象來製作視訊 —— 這類似 OpenAI 在其已停運的 Sora 應用中推出的 Cameos 功能。為防止深度假訊息,使用者必須透過專用的產品入門流程,這包括錄製自己並朗讀一系列數字,根據 Brichtova 的說明。虛擬形象之後會被儲存以供未來使用。此外,所有使用 Omni 產生的視訊都會包含 Google 的 SynthID 數位水印,讓使用者可以驗證視訊是否是由 Gemini 產品產生。這個系列的第一個模型是 Gemini Omni Flash,將會在今天推出至 Gemini 應用程式、YouTube Shorts 與 AI 創意工作室 Flow。Flash 將能渲染 10 秒的視訊,Brichtova 表示這不是模型的限制,而是基於希望讓更多人使用,以及預期大多數使用者目前還不想要製作更長的視訊。較長的視訊時長預計將在不久的將來推出。Google 看起來是將 Omni Flash 定位為更偏向消費者的工具。Brichtova 與 DeepMind 研究工程師 Gabe Barth-Maron 在與 TechCrunch 的電話會議中提到的數位虛擬形象用途,都是個人化的:製作自己獲獎或去月球的視訊,或從假期視訊背景中移除路人。Barth-Maron 更簡單地說:「它們就像個人化的迷因。」Brichtova 表示:「我們確實專注於讓消費者容易使用。」「並不是很多視訊模型已經跨過消費者這道鴻溝,所以這就是我們要做的。」易用性雖然有其限制:Brichtova 與 Barth-Maron 提到,編輯提示必須非常明確,否則 Omni 會過度編輯或意外改變使用者想要保留的元素 —— 這類問題 Nano Banana 的使用者可能已經遇到過。圖像來源:Google 尽管近來的重點是消費者,Omni 在企業與創意領域的影響也是明顯的,Google 將在未來幾週內透過 API 發布 Omni。虛擬形象產生工具 —— 這項功能目前在 Shorts 上已經可用 —— 是 Google 預期內容創作者會使用的功能。但更廣泛來說,一個完整的多模態工作流程對廣告商與電影導演來說可能是革命性的。創業公司 Luma AI 正在開發類似的工具,一個代理工具可以根據簡短的簡報與產品圖像產生整個廣告活動,並由其自己的「統一」模型驅動。Brichtova 表示:「我們對模型的文字渲染能力感到相當自豪,這對廣告等用途非常有用。」「如果你想在某處展示產品,甚至是簡短的口號,都需要準確 … 我們預期導演和其他類型的創作者也會使用這個模型。」較專業的使用案例可能由 Omni Pro 模型來處理,這個模型在所有 Omni 任務上的表現應該會更好。Google 尚未說明 Pro 模型何時會推出,但 Brichtova 表示這會在「我們覺得達到 Flash 之上有顯著進步」時進行。追蹤 Google I/O 2026 的其他重大消息 Google 搜索將不再是您所知的樣子 Google 更新 Gemini 應用程式對抗 ChatGPT 和 Claude Google 引入 Gemini Spark,一個 24/7 的代理助理,搭配 Gmail 積合 如何使用 Google 新的資訊代理
Google 的 Gemini Omni 可將圖片、音訊和文字轉換為影片 —— 這僅是開始
分享這篇文章: