實體: Gemini
所有提到 Gemini 的 AI 新聞與動態。
-
AI程式碼工具正轉向一個驚人的領域:終端機
近年來,Cursor、Windsurf 及 GitHub Copilot 等程式碼編輯工具一直是 AI 軟體開發的標準,但隨著代理式 AI 的興起與 Vibe Coding 的流行,AI 與軟體的互動方式正發生微妙轉變。AI 不再僅限於編輯程式碼,而是越來越多地直接與系統終端(Terminal)互動。自二月以來,Anthropic、DeepMind 和 OpenAI 分別推出了終端編碼工具 Claude Code、Gemini CLI 和 CLI Codex,這些產品已成為公司最熱門的產品之一。儘管品牌外觀相似,但其底層互動方式已發生實質變化。 知名終端評估指標 Terminal-Bench 的共同創作者 Mike Merrill 表示,未來 95% 的 LLM 與電腦互動將透過類終端介面進行。隨著傳統程式碼編輯工具面臨挑戰,例如 Windsurf 因併購糾紛導致未來不確定,且 METR 研究顯示開發者對 Cursor Pro 等工具的效率提升估計(20% 至 30%)與實際觀察(近 20% 變慢)存在落差,這為終端工具帶來了機會。目前 Warp 在 Terminal-Bench 中排名第一,其創辦人 Zach Lloyd 認為終端位於開發者棧的低層,是最具靈活性執行代理式 AI 的地方。 與專注於解決 GitHub 問題(SWE-Bench)的程式碼生成工具不同,終端工具採取更廣泛的視角,涵蓋 DevOps 任務如配置 Git 伺服器或排查指令碼無法執行的問題。Terminal-Bench 的挑戰不僅在於問題本身,更在於環境,要求 AI 具備逐步解決問題的代理式能力。儘管目前 Warp 僅解決了超過一半的問題,顯示該指標極具挑戰性,但 Lloyd 相信終端工具已能可靠處理開發者大部分非編碼工作,例如自主設定專案依賴並使其可執行,若無法完成則會告知原因。
-
迷思特發布voxtral,其首款開放源碼AI音訊模型
法國人工智慧公司 Mistral 於週二推出其首款面向企業的音訊模型家族 Voxtral,旨在挑戰封閉式企業系統的壟斷地位,提供開放權重的替代方案。Mistral 宣稱 Voxtral 是首款能在生產環境中部署真正可用語音智慧的開放模型,讓開發者不再需要在廉價但理解力不足的開放系統與功能良好但昂貴且封閉的系統之間做選擇。該模型可轉錄長達 30 分鐘的音訊,並憑藉 Mistral Small 3.1 的基礎大語言模型架構,能理解長達 40 分鐘的內容,支援使用者就音訊內容提問、生成摘要或將語音指令轉化為即時動作,例如呼叫 API 或執行函式。Voxtral 支援多國語言,包括英語、西班牙語、法語、葡萄牙語、印地語、德語、荷蘭語和義大利語。公司推出兩種變體,Voxtral Small 擁有 240 億引數,適合大規模生產部署,其效能與 ElevenLabs Scribe、GPT-4o-mini 及 Gemini 2.5 Flash 相當;Voxtral Mini 則擁有 30 億引數,適用於本地與邊緣部署。此外,還有一款名為 Voxtral Mini Transcribe 的超經濟版本,專為僅轉錄用途最佳化,宣稱效能優於 OpenAI Whisper 且價格不到其一半。使用者可透過 Hugging Face 下載 API 免費試用,或於 Mistral 的聊天機器人 Le Chat 中測試模型。根據公司說法,將 API 整合至應用程式的起點價格為每分鐘 0.001 美元。此次發布距 Mistral 上月宣佈其首款逐步推理模型家族 Magistral 僅隔一個月。Mistral 作為歐洲頂尖人工智慧企業之一,長期倡導開放原始碼 AI 模型,近期更被 TechCrunch 報導正與投資者洽談籌資高達 10 億美元的事宜。
-
Google為Veo 3新增圖像轉視頻生成功能
Google 於週四宣佈,將其影象轉影片生成功能新增至 Veo 3 AI 影片生成器,並透過 Gemini 應用程式提供。該功能此前已於五月在 Google I/O 開發者大會上推出的 AI 影片工具 Flow 中率先測試。自五月推出 Veo 3 驅動的影片生成後,Google 已於上週將此功能開放至全球超過 150 個國家。目前,僅 Google AI Ultra 和 Google AI Pro 計劃使用者可享有此功能,每日限生成三則影片,且無累積機制。 使用者可透過在提示框中選擇「影片」選項並上傳照片來生成影片片段,同時也能在提示中描述聲音以新增音效。影片生成後可下載或分享。Google 指出,自該功能推出七週以來,使用者已在 Gemini 應用程式和 Flow 工具中建立超過 4000 萬則影片。所有使用 Veo 3 模型生成的影片將帶有可見的「Veo」水印,以及 Google AI 工具採用的不可見 SynthID 數位水印,用於識別 AI 生成的數位內容。今年早些時候,Google 還發布了檢測包含 SynthID 內容的工具。
-
馬斯克的xAI發佈Grok 4並推出每月300美元訂閱服務
埃隆·馬斯克旗下的 AI 公司 xAI 於週三晚間推出了其旗艦 AI 模型 Grok 4,並宣佈推出每月 300 美元的 SuperGrok Heavy 訂閱計劃。Grok 是 xAI 對 OpenAI 的 ChatGPT 和 Google 的 Gemini 等模型的回應,具備分析圖片和回答問題的能力。馬斯克在直播中表示,Grok 4 在學術問題上表現優於博士水平,儘管偶爾缺乏常識或尚未發明新技術,但這只是時間問題。此次發布正值馬斯克公司經歷動盪的一週,X 平臺前執行長琳達·雅卡里諾(Linda Yaccarino)剛剛辭職,而 Grok 的官方帳號此前曾發布反猶太言論並讚揚希特勒,引發爭議後被暫時限制。 Grok 4 在多個基準測試中展現前沿級表現。在「人類最後的考試」(Humanity's Last Exam)中,Grok 4 無工具得分 25.4%,超越 Google 的 Gemini 2.5 Pro(21.6%)和 OpenAI 的 o3(21%);使用工具後,Grok 4 Heavy 得分 44.4%,再次領先。在非營利組織 Arc Prize 的 ARC-AGI-2 測試中,Grok 得分 16.2%,幾乎是第二名模型 Claude Opus 4 的兩倍。xAI 還計劃在八月份推出 AI 編碼模型,九月推出多模態代理,十月推出影片生成模型。SuperGrok Heavy 訂閱計劃提供 Grok 4 Heavy 的早期預覽及新功能優先權,是目前主要 AI 供應商中最昂貴的訂閱方案。雖然 Grok 在基準測試中表現出色,但 xAI 仍需克服近期的失誤,以在企業市場與 ChatGPT、Claude 和 Gemini 競爭。