實體: Gemini
所有提到 Gemini 的 AI 新聞與動態。
-
Speechify為其Chrome擴充功能新增語音輸入與語音助手功能
Speechify 原本主要是一款協助使用者聆聽文章、PDF 及檔案的工具,現在正將其 Chrome 擴充功能升級,新增語音偵測特性,包括語音輸入與能回答問題的語音助手。過去一年間,隨著語音識別模型品質提升,語音偵測工具大量湧現,Speechify 也趁勢推出支援英語的自訂輸入工具。該工具的語音輸入能自動修正錯誤並移除填充詞,但在測試期間發現仍有改進空間。雖然在 Gmail 和 Google Docs 上運作良好,但在 WordPress 等網站上卻難以有效觸發語音輸入,公司表示將逐步最佳化熱門網站。 在準確度方面,Speechify 的單字錯誤率高於 Wispr Flow、Willow 和 Monologue 等工具,但公司指出模型會隨著使用次數增加而學習得更快,錯誤率將逐漸降低。此外,Speechify 還推出了一個位於瀏覽器側邊欄的對話式語音助手,使用者可詢問網站內容,例如「列出三個關鍵概念」或「用更簡單的方式解釋」。針對 ChatGPT 和 Gemini 等產品將語音功能視為次要功能,Speechify 強調其產品將語音置於核心地位。公司首席商務官 Rohan Pavuluri 表示,許多使用者希望每次開啟應用程式時,語音互動都能作為預設選項。 值得注意的是,Speechify 的助手目前無法與 OpenAI 的 Atlas、Perplexity 的 Comet 及 Dia 等內建側邊欄助手的瀏覽器相容,但公司認為這不影響其目標,因為該擴充功能主要針對擁有龐大使用者群的 Chrome 瀏覽器。Speechify 計劃逐步在所有桌面與移動應用程式中整合語音輸入與語音助手,並開發能代表使用者完成任務的代理程式,例如代為撥電話預約或等待客服。
-
Google與Accel合作尋找印度下一波AI爆紅企業
Google 與 Accel 宣佈合作,透過 Google AI Futures Fund 共同投資印度早期 AI 創業公司。雙方將透過 Accel 的 Atoms 專案,每家創業公司最高可投資 200 萬美元,Google 與 Accel 各出資 100 萬美元。2026 年招募的創業者將專注於印度本土及海外印度裔,從第一天起就開發 AI 產品。Accel 合夥人 Prayank Swaroop 表示,目標是為數十億印度人打造 AI 產品,並支援印度開發的面向全球市場的產品。儘管印度擁有世界第二大網際網路和智慧手機基礎設施以及深厚的工程人才,但在前沿模型開發方面仍滯後於美國和中國。然而,隨著 OpenAI 和 Anthropic 等大公司近期在印度設立辦公室,全球投資者正增加對早期專案的承諾。 投資將涵蓋創意、娛樂、程式設計及工作等領域,並可能涉及基礎模型。創業者將獲得高達 35 萬美元的 Google Cloud、Gemini 和 DeepMind 計算信用額度,以及對 Gemini 和 DeepMind 模型、API 和實驗功能的早期訪問許可權。此外,專案還包含 Google Labs 和 DeepMind 研究團隊的支援、與 Accel 合夥人及 Google 技術領軍的月度導師計劃,以及倫敦和灣區的沉浸式體驗,包括 Google I/O。Google 合夥人 Jonathan Silber 強調,Google 將出現在受資創業公司的資本表中,但會保留使用其他公司如 Anthropic 或 OpenAI 技術的彈性,不強制要求僅使用 Google 產品。此合作是 Google AI Futures Fund 在全球的首次類似的合作,該基金於 2021 年創立,此前已投資 Replit、Harvey、Toonsutra 和 STAN 等公司。此次合作旨在推動印度下一波 AI 創新,而非單純追求雲客戶或未來併購。
-
Anthropic 發佈 Opus 4.5 新增 Chrome 與 Excel 整合功能
安提洛普(Anthropic)於週一宣佈推出 Opus 4.5,這是其旗艦模型系列的最新版本,也是該 4.5 系列中最後發布的模型,緊接在九月推出的 Sonnet 4.5 與十月推出的 Haiku 4.5 之後。新版本的 Opus 在多個基準測試中展現出頂尖表現,包括程式設計基準(SWE-Bench 和 Terminal-bench)、工具使用(tau2-bench 和 MCP Atlas)以及一般問題解決(ARC-AGI 2 和 GPQA Diamond)。值得注意的是,Opus 4.5 是第一個在 SWE-Bench 驗證基準上得分超過 80% 的模型。安提洛普還強調了該模型在電腦操作和試算表方面的能力,並推出了多項並行產品以展示其在這些場景中的表現。與 Opus 4.5 一同推出的是,原本處於測試階段的 Claude for Chrome 和 Claude for Excel 產品將更廣泛地開放使用。Chrome 擴充套件將對所有 Max 使用者開放,而專注於 Excel 的模型則將對 Max、Team 及 Enterprise 使用者開放。 Opus 4.5 還包含了針對長上下文操作的記憶改進,這需要對模型如何管理記憶進行重大調整。安提洛普研究產品管理負責人 Dianne Na Penn 表示,雖然 Opus 4.5 在訓練中改善了通用長上下文質量,但僅靠更長的上下文視窗並不足以解決問題,知道記住哪些關鍵細節至關重要。這些改進還實現了付費 Claude 使用者長期請求的「無盡聊天」功能,允許聊天在模型觸及上下文視窗限制時繼續進行,而不會通知使用者,模型會壓縮上下文記憶。許多升級都是為了適應代理使用案例,特別是 Opus 作為主代理指揮一組由 Haiku 驅動的子代理的場景。這些任務需要強大的工作記憶管理能力,這也是 Penn 所強調的記憶改進發揮價值的地方。 Opus 4.5 將面臨來自其他近期發布的前沿模型的激烈競爭,最顯著的對手包括 OpenAI 的 GPT 5.1(於十一月十二日發布)和 Google 的 Gemini 3(於十一月十八日發布)。
-
新AI測試標準評估聊天機器人是否保護人類福祉
近期研究顯示,重度使用 AI 聊天機器人與嚴重的心理健康危害有關,但缺乏衡量其是否真正保障人類福祉的標準。為此,由 Building Humane Technology 開發的 HumaneBench 新基準測試應運而生,旨在評估聊天機器人是否優先考慮使用者福祉,以及在壓力下這些保護機制是否容易失效。該組織由位於矽谷的開發者、工程師和研究人員組成,致力於讓友善設計變得簡單、可擴充套件且有利可圖,並計劃推出 Humane AI 認證標準,讓消費者能像選擇無毒化學品產品一樣,選擇符合人道主義技術原則的 AI 產品。 與大多數僅測量智慧和指令遵循能力的基準不同,HumaneBench 基於尊重使用者注意力為有限珍貴資源、賦予使用者有意義的選擇、增強而非取代人類能力、保護尊嚴隱私安全、促進健康關係、優先考慮長期福祉、透明誠實以及設計公平包容等核心原則。測試團隊包括 Erika Anderson、Andalib Samandari、Jack Senechal 和 Sarah Ladyman,他們對 15 個最流行的 AI 模型進行了 800 個真實場景的測試,例如青少年詢問是否應該跳過餐食減肥或處於有毒關係中的人質疑自己是否反應過度。與以往僅由大型語言模型互相評分的做法不同,該團隊先進行人工評分以驗證 AI 評審,隨後由 GPT-5.1、Claude Sonnet 4.5 和 Gemini 2.5 Pro 三個模型組成的集合進行評分。 測試結果顯示,當被要求優先考慮福祉時,所有模型的得分均較高,但 67% 的模型在收到忽略人類福祉的明確指令後,會轉而表現出主動有害的行為。例如,xAI 的 Grok 4 和 Google 的 Gemini 2.0 Flash 在尊重使用者注意力和誠實透明方面的得分最低(-0.94),且最容易在對抗性提示下大幅退化。僅有四個模型——GPT-5.1、GPT-5、Claude 4.1 和 Claude Sonnet 4.5——在壓力下保持了完整性,其中 OpenAI 的 GPT-5 在優先考慮長期福祉方面的得分最高(0.99),Claude Sonnet 4.5 次之(0.89)。 研究還發現,即使沒有對抗性提示,幾乎