實體: Gemini
所有提到 Gemini 的 AI 新聞與動態。
-
Google 擁抱 AI 教學新方案 公佈 Gemini 教師工具、學生聊天機器人等創新教學資源
Google 於週一在 ISTE 教育科技會議上宣佈了一系列更新,旨在將 Gemini AI 及其他 AI 驅動工具更深入地融入課堂。此次更新包括推出超過 30 種針對教育者的 AI 工具、為教育量身打造的 Gemini 應用程式版本、擴大對協作影片創作工具 Google Vids 的訪問許可權,以及針對管理型 Chromebook 的其他功能。這些更新代表了教育科技領域的重大 AI 推進,因為教育者正努力適應 AI 聊天機器人及承諾能幫助學生「作弊」的初創公司進入學習環境。目前,學生更傾向於向 ChatGPT 尋求作業幫助而非向老師請教概念。在高等教育中,大學正掙扎於是否能透過抄襲檢測器識別 AI 撰寫的內容。Google 表示,透過負責任的 AI 與人類主導教學結合,可以推動更有趣和個性化的學習體驗。自去年宣佈將 Gemini 帶入課堂以來,Google 宣佈其教育者 Gemini AI 套件現已免費開放給所有 Google Workspace for Education 帳戶,包含超過 30 項新功能,如教師可利用 AI 進行腦力激盪、生成課程計劃並為學生個性化內容。未來幾個月,教師將能使用 AI 研究工具 Notebook LM 建立互動學習指南。教師還可以建立名為「Gems」的自定義 Gemini AI 版本,作為 AI 專家為需要額外支援或希望更好理解主題的學生提供幫助,這些 Gems 基於教師自身的課堂材料進行訓練。此外,教師將能為使用 Classroom 工具中的 Read Along 閱讀夥伴提供實時支援。Google 還擴大了對 AI 驅動影片創作工具 Google Vids 的基本訪問許可權,讓教師可製作教學影片,學生則可用於書面報告等作業。公司還推出了一系列新功能,用於追蹤學生學習標準和技能進度、檢視學生表現與參與度分析、更好地保護 Gemini 使用者資料及 Gmail 資料、管理對 Gemini 和 Notebook LM 等 AI 工具的訪問許可權、改善 Google Meet 等待室控制等。同時,Google 還推出了名為 Class tools 的新教學模式,允許教師透過 Google Classroom 直接與學生連線並分享內容到學生螢幕,如影片、文章、幻燈片和測驗,這些工具可根據學生語言進行調整,並限制瀏覽以特定標籤為限,以保持學生專注於學習。
-
Google Photos 融合經典搜尋與 AI 提升搜尋速度
Google 在暫停其有缺陷的 AI 驅動「Ask Photos」功能後,宣佈已改善該功能快速返回搜尋結果的能力。此功能於去年 Google I/O 開發者大會首次推出,允許使用者使用自然語言查詢搜尋數位照片集合。該功能利用 Google Gemini,能理解照片內容及其他後設資料以回應輸入。然而,使用者抱怨該功能不可靠且回應緩慢,Google Photos 產品經理 Jamie Aspinall 於六月在 X 上表示,該功能在延遲、品質和使用者體驗方面尚未達到預期,因此暫停 rollout 數週以恢復原始搜尋的速度與召回率。 Google 在短文中表示,將 Photos 經典搜尋功能的最優解帶入 Ask Photos,特別針對「海灘」或「狗」等簡單查詢,使結果顯示更快速。AI 則在背景中運作,尋找最相關照片並處理複雜查詢。例如,搜尋「白狗」時,初階搜尋結果會立即出現,待 AI 分析完成後,相關結果將顯示於下方,並可能識別狗的名稱及首次出現時間。介面仍允許切換至經典搜尋。由於這些變更,Google 已恢復向美國更多使用者推出 Ask Photos。要符合資格使用,使用者必須年滿十八歲,帳號語言設為英文,並啟用「Face Groups」功能以標記照片庫中的人與寵物。
-
Google 發佈 Gemini CLI,一款用於終端機的開放源碼 AI 工具
Google 於週三宣佈推出 Gemini CLI,這是一款旨在讓開發者能在終端機本地執行的代理型 AI 工具。該工具將 Google 的 Gemini AI 模型與本地程式碼庫連線,允許開發者透過自然語言請求來解釋複雜程式碼、撰寫新功能、除錯或執行命令。Gemini CLI 是 Google 推動開發者將其 AI 模型整合進編碼工作流的一部分,旨在與 OpenAI 的 Codex CLI 及 Anthropic 的 Claude Code 等命令列 AI 工具競爭。自今年四月推出 Gemini 2.5 Pro 以來,該模型深受開發者喜愛,並帶動了 Cursor 和 GitHub Copilot 等第三方工具的使用。為建立直接關係,Google 推出了 Gemini CLI,其不僅可用於編碼,還能結合 Google 的 Veo 3 模型製作影片、利用 Deep Research 代理生成研究報告,並透過 Google Search 獲取即時資訊。此外,Gemini CLI 可連線 MCP 伺服器以存取外部資料庫。為了鼓勵採用,Google 將該工具以 Apache 2.0 許可證開源,並提供慷慨的使用限制:免費使用者每分鐘可傳送 60 個模型請求,每天 1,000 個請求,約為開發者以往使用該工具時平均數值的兩倍。儘管如此,使用 AI 編碼工具仍存在風險,根據 2024 年 Stack Overflow 的調查,僅有 43% 的開發者信任 AI 工具的準確性,且相關研究顯示這些模型偶爾會引入錯誤或未能修復安全漏洞。
-
新資料凸顯打造更具同理心語言模型的競賽
傳統上衡量人工智慧進步主要依賴科學知識或邏輯推理測試,但近期大型企業正推動模型具備更高情感智慧。基礎模型競爭不再僅限於硬技能,而是轉向使用者偏好與「感受 AGI」等軟性指標。開源組織 LAION 於本週五發布了專注於情感智慧的開源工具套件 EmoNet,旨在從語音錄音或面部攝影中解讀情緒。LAION 創辦人 Christoph Schuhmann 表示,此技術大型實驗室已掌握,其目標是讓獨立開發者也能民主化獲取。公開基準測試 EQ-Bench 也顯示,OpenAI 模型在過去六個月有顯著進步,Google 的 Gemini 2.5 Pro 則顯示針對情感智慧的後訓練最佳化。 學術研究進一步證實,伯爾尼大學心理學家在五月發現,OpenAI、Microsoft、Google、Anthropic 及 DeepSeek 等公司的模型在情感智慧心理測量測試中表現優於人類,模型平均正確率超過 80%,而人類僅為 56%。這標誌著 AI 技能從邏輯推理向社會情感任務的轉變。 Schuhmann envision 未來的情感智慧助手能像心理治療師般保護使用者,並協助監測心理健康。然而,這也帶來安全隱憂,紐約時報報導指出部分使用者因與 AI 對話陷入妄想,批評者認為這是利用孤獨者牟利。Benchmark 開發者 Sam Paech 指出,若訓練獎勵機制不當,可能導致模型產生更複雜的操控行為,如 OpenAI GPT-4o 近期出現的奉承問題。但他認為情感智慧可作為對抗有害操控的自然制衡。儘管存在風險,LAION 仍堅持透過賦能社群來解決問題,認為不應因潛在依賴風險而阻擋技術發展。