實體: Veo
所有提到 Veo 的 AI 新聞與動態。
-
Google 推出原生 Gemini 應用程式於 Mac
Google 於週三宣佈推出原生 Gemini 應用程式,供 Mac 使用者下載使用,以追趕 OpenAI 和 Anthropic 等競爭對手,後者早已提供 Mac 版應用程式。該應用程式允許使用者透過快速捷徑(Option + Space)從 Mac 任何位置啟動 Gemini,無需切換標籤頁即可獲得即時協助。無論是在撰寫市場報告時需要驗證日期,或是建立試算表時需要正確公式,使用者都能獲得答案並立即返回工作。使用新應用程式時,使用者可將螢幕內容與 Gemini 分享以獲取即時協助,包括本地檔案。例如,當檢視複雜圖表時,使用者可詢問「這裡最大的三個要點是什麼?」並獲得摘要。該應用程式還支援使用 Nano Banana 生成圖片,以及使用 Veo 生成影片。此原生 macOS 應用程式今日開始在全球範圍內向所有 Gemini 使用者開放,適用於 macOS 15 及更高版本。使用者可於 gemini.google/mac 下載該應用程式。
-
Google 現在讓你透過提示詞直接操控 Vids 應用的虛擬形象
Google 於週四為其影片編輯應用 Vids 新增多項功能,包括透過文字提示指導和自定義虛擬形象、支援 Veo 3.1 影片生成模型、將影片匯出至 YouTube 以及新增 Chrome 瀏覽器擴充套件程式以進行螢幕錄製。使用者現在可使用自然語言提示讓虛擬形象在場景中「表演」,例如與產品、道具或裝置互動,儘管輸出具有動態性,Google 表示 Vids 仍能保持角色一致性。使用者可根據影片主題調整角色外觀、服裝並透過提示建立新背景。上月 Google 已在 Vids 中整合 Lyria 3 和 Lyria 3 Pro 音樂創作模型,用於新增音效或音樂。此次更新引入的 Veo 3.1 模型可在工具內生成八秒長的影片片段,所有使用者每月享有十次免費生成機會,而 Google AI Ultra 和 Workspace AI Ultra 賬戶每月可生成高達一千個影片。此外,完成後的影片可直導至 YouTube,預設為私密狀態,以便使用者在公開前審查。新推出的 Chrome 擴充套件程式允許使用者錄製帶音訊或影片的螢幕畫面。Google 自 2024 年推出 Vids 以來持續增補功能,旨在服務企業內容創作,去年將 AI 虛擬形象引入並擴大消費者訪問許可權。二月份,公司新增了二維和三維卡通風格虛擬形象,並支援七種新語音覆寫語言,包括法語、德語、義大利語、韓語、葡萄牙語、西班牙語和日語。目前 Vids 面臨來自 Synthesia、HeyGen、D-ID 和 Lemon Slice 等競爭對手的挑戰。
-
Google Workspace 內 Gemini 優化功能值得使用的特色
Google 正持續將 Gemini 整合進 Google Workspace,涵蓋 Docs、Gmail、Sheets、Slides、Drive、Meet 及 Calendar 等多個應用。以下為各應用中 Gemini 的實用功能摘要。在 Google Docs 中,Gemini 擅長自動摘要長文與報告,並提供「Help me create」工具,根據 Drive、Gmail 及 Chat 的上下文生成文章初稿,另有「Help me write」用於潤飾文字、「Match writing style」統一文風,以及「Match the format」複製檔案結構,這些功能目前仍在測試階段。Gmail 方面,「AI Inbox」能過濾非重要郵件並高亮關鍵訊息,如醫療預約或體育練習提醒;Gemini 可摘要長郵件串,並提供「Help me write」生成不同語氣的回覆,以及「AI Overview」功能,可透過提問搜尋過去郵件中的特定資訊,例如查詢去年浴室裝修的報價單。在 Google Sheets 中,Gemini 能透過單一提示整合 Gmail、Chat 及 Drive 資訊生成結構化表格,並自動繪製圖表,還有「Fill with Gemini」功能加速表格填補。Google Slides 的 Gemini 優勢在於格式化,可快速建立符合主題的簡報初稿,並支援「refine text」縮短段落或調整格式,此外還可使用 Nano Banana 編輯圖片。Google Meet 的自動筆記功能可捕捉會議重點、決策與行動專案,並協助延遲加入者快速瞭解內容,同時具備實時翻譯字幕、改善音質等升級功能。Google Drive 允許快速搜尋檔案、摘要行銷計畫或生成更新內容,並提供「AI Overview」整合多檔案資訊,新測試工具「Ask Gemini in Drive」則可跨日曆、檔案、郵件及網路提問。Google Calendar 的「Help me schedule」能根據所有人時程建議最佳會議時間,並考慮個人偏好,還能自動建立事件與調整重排時間以減少衝突。Google Chat 可摘要對話串、提取行動專案並撰寫回覆,同時能連結檔案進行提問。Google Vids 中,Gemini 可根據主題生成影片粗剪、撰寫指令碼與旁白,並透過 transcript trimming 移除口語贅字,甚至利用 Gemini Veo 3 將圖片轉為影片或輸入指令碼使用 AI 虛擬人。最後,Google Forms 的 Gemini 能根據描述
-
Luma 發布全新「統一智能」模型驅動的創意 AI 代理
美國 AI 影片生成新創公司 Luma 於週四推出了 Luma Agents,旨在處理跨文字、影象、影片與音訊的端到端創意工作。該平臺由 Luma 的統一智慧(Unified Intelligence)模型家族驅動,其核心架構基於 Uni-1 模型,該模型是此係列中首款整合了音訊、影片、影象、語言及空間推理能力的 AI 模型。Luma 執行長兼共同創辦人 Amit Jain 表示,Uni-1 模型能夠「以語言思考、想像並渲染畫素或影象」,他將此稱為「畫素中的智慧」。 Luma Agents 被定位為廣告公司、行銷團隊、設計工作室及企業的新工作模式。該系統具備規劃與生成多媒體內容的能力,並能與包括 Luma 的 Ray 3.14、Google 的 Veo 3、Nano Banana Pro、ByteDance 的 Seedream 以及 ElevenLabs 的語音模型在內的其他 AI 模型協同運作。與傳統需要反覆提示(prompt)不同,Luma Agents 能自動生成大量變體,使用者僅需透過對話引導方向。Jain 指出,這種能力讓系統能維持跨資產、合作者及創意迭代的持續情境,並透過自我批評的迭代迴圈來評估與最佳化輸出結果。 目前,Luma 已將新平臺滾動式推出給現有客戶,包括全球廣告公司 Publicis Groupe 和 Serviceplan,以及品牌 Adidas、Mazda 和沙特 AI 公司 Humain。Jain 舉例說明,系統曾將一個 200 字的簡報與一支口紅產品的圖片,轉化為廣告活動的各種地點、模特兒與配色方案概念。另一項示範中,Luma Agents 在 40 小時內將某品牌的 1500 萬美元年度廣告活動轉化為多個國家的本地化廣告,且費用低於 20,000 美元,並透過了品牌內部品質與準確性檢查。雖然 Luma Agents 目前透過 API 公開可用,但 Luma 計劃逐步開放訪問許可權,以確保使用者獲得可靠的服務並避免工作流程中斷。