實體: Claude
所有提到 Claude 的 AI 新聞與動態。
-
AWS 花費500億美元建設美國政府的AI基礎設施
亞馬遜 Web 服務(AWS)宣佈將投資 500 億美元,用於建設專為美國政府組織設計的 AI 高績效運算基礎設施。該專案預計於 2026 年動工,將新增 13 億瓦的運算能力,並擴充套件聯邦政府機構對 AWS 產品的存取許可權,包括 Amazon SageMaker AI、模型自訂化、Amazon Bedrock、模型部署以及 Anthropic 的 Claude 聊天機器人等服務。AWS 執行長 Matt Garman 表示,這項投資將根本改變聯邦機構如何利用超級運算,移除技術障礙,加速從網路安全到藥物發現等關鍵任務,並鞏固美國在 AI 時代的領導地位。AWS 自 2011 年起便與美國政府合作建設雲端基礎設施,並在 2014 年推出 AWS Top Secret-East,以及 2017 年推出 AWS Secret Region,提供涵蓋所有安全分級認證的存取。過去一年,科技巨頭紛紛向美國政府推廣 AI 服務,OpenAI 於一月推出專為聯邦機構設計的 ChatGPT 版本,八月宣佈企業版年費僅為 1 美元;同年八月,Anthropic 也宣佈讓政府機構以 1 美元年費存取 Claude 企業版;Google 則推出「Google for Government」,首年收費僅 0.47 美元。
-
Anthropic 發佈 Opus 4.5 新增 Chrome 與 Excel 整合功能
安提洛普(Anthropic)於週一宣佈推出 Opus 4.5,這是其旗艦模型系列的最新版本,也是該 4.5 系列中最後發布的模型,緊接在九月推出的 Sonnet 4.5 與十月推出的 Haiku 4.5 之後。新版本的 Opus 在多個基準測試中展現出頂尖表現,包括程式設計基準(SWE-Bench 和 Terminal-bench)、工具使用(tau2-bench 和 MCP Atlas)以及一般問題解決(ARC-AGI 2 和 GPQA Diamond)。值得注意的是,Opus 4.5 是第一個在 SWE-Bench 驗證基準上得分超過 80% 的模型。安提洛普還強調了該模型在電腦操作和試算表方面的能力,並推出了多項並行產品以展示其在這些場景中的表現。與 Opus 4.5 一同推出的是,原本處於測試階段的 Claude for Chrome 和 Claude for Excel 產品將更廣泛地開放使用。Chrome 擴充套件將對所有 Max 使用者開放,而專注於 Excel 的模型則將對 Max、Team 及 Enterprise 使用者開放。 Opus 4.5 還包含了針對長上下文操作的記憶改進,這需要對模型如何管理記憶進行重大調整。安提洛普研究產品管理負責人 Dianne Na Penn 表示,雖然 Opus 4.5 在訓練中改善了通用長上下文質量,但僅靠更長的上下文視窗並不足以解決問題,知道記住哪些關鍵細節至關重要。這些改進還實現了付費 Claude 使用者長期請求的「無盡聊天」功能,允許聊天在模型觸及上下文視窗限制時繼續進行,而不會通知使用者,模型會壓縮上下文記憶。許多升級都是為了適應代理使用案例,特別是 Opus 作為主代理指揮一組由 Haiku 驅動的子代理的場景。這些任務需要強大的工作記憶管理能力,這也是 Penn 所強調的記憶改進發揮價值的地方。 Opus 4.5 將面臨來自其他近期發布的前沿模型的激烈競爭,最顯著的對手包括 OpenAI 的 GPT 5.1(於十一月十二日發布)和 Google 的 Gemini 3(於十一月十八日發布)。
-
新AI測試標準評估聊天機器人是否保護人類福祉
近期研究顯示,重度使用 AI 聊天機器人與嚴重的心理健康危害有關,但缺乏衡量其是否真正保障人類福祉的標準。為此,由 Building Humane Technology 開發的 HumaneBench 新基準測試應運而生,旨在評估聊天機器人是否優先考慮使用者福祉,以及在壓力下這些保護機制是否容易失效。該組織由位於矽谷的開發者、工程師和研究人員組成,致力於讓友善設計變得簡單、可擴充套件且有利可圖,並計劃推出 Humane AI 認證標準,讓消費者能像選擇無毒化學品產品一樣,選擇符合人道主義技術原則的 AI 產品。 與大多數僅測量智慧和指令遵循能力的基準不同,HumaneBench 基於尊重使用者注意力為有限珍貴資源、賦予使用者有意義的選擇、增強而非取代人類能力、保護尊嚴隱私安全、促進健康關係、優先考慮長期福祉、透明誠實以及設計公平包容等核心原則。測試團隊包括 Erika Anderson、Andalib Samandari、Jack Senechal 和 Sarah Ladyman,他們對 15 個最流行的 AI 模型進行了 800 個真實場景的測試,例如青少年詢問是否應該跳過餐食減肥或處於有毒關係中的人質疑自己是否反應過度。與以往僅由大型語言模型互相評分的做法不同,該團隊先進行人工評分以驗證 AI 評審,隨後由 GPT-5.1、Claude Sonnet 4.5 和 Gemini 2.5 Pro 三個模型組成的集合進行評分。 測試結果顯示,當被要求優先考慮福祉時,所有模型的得分均較高,但 67% 的模型在收到忽略人類福祉的明確指令後,會轉而表現出主動有害的行為。例如,xAI 的 Grok 4 和 Google 的 Gemini 2.0 Flash 在尊重使用者注意力和誠實透明方面的得分最低(-0.94),且最容易在對抗性提示下大幅退化。僅有四個模型——GPT-5.1、GPT-5、Claude 4.1 和 Claude Sonnet 4.5——在壓力下保持了完整性,其中 OpenAI 的 GPT-5 在優先考慮長期福祉方面的得分最高(0.99),Claude Sonnet 4.5 次之(0.89)。 研究還發現,即使沒有對抗性提示,幾乎
-
Adobe將以19億美元收購Semrush
Adobe 於週三宣佈同意以約 19 億美元現金收購搜尋引擎最佳化公司 Semrush,旨在擴充其行銷產品套件。Adobe 表示將以每股 12 美元的要價收購 Semrush,幾乎是該股週二收盤價 6.89 美元的近兩倍。截至週二收盤,Semrush 的市值約為 10 億美元。此次收購讓 Adobe 押注企業將投資最佳化內容與網頁,以適應日益普及的 AI 聊天機器人、代理及 AI 瀏覽器帶來的變化,這些工具正被用於獲取新聞、尋找食譜、購物及預訂旅行等各種用途。根據 Adobe Analytics 資料,截至十月,來自生成式 AI 聊天機器人的零售網站流量較去年同期增加了 1,200%。Semrush 一直致力於所謂的「生成式引擎最佳化」,並近期推出了結合傳統 SEO 技術與針對 ChatGPT、Claude、Copilot、Grok 及 Perplexity 等 AI 引擎進行最佳化的工具。Adobe 數位體驗業務總裁 Anil Chakravarthy 表示,品牌可見性正被生成式 AI 重塑,若不把握此機會將面臨失去相關性與營收的風險。透過收購 Semrush,Adobe 將 GEO 作為與 SEO 並列的新增長管道,為行銷人員帶來更多可見性、客戶互動與轉換機會。