實體: Anthropic
所有提到 Anthropic 的 AI 新聞與動態。
-
加州州長紐森簽署歷史性AI安全法案SB 53
加州州長加文·紐森已簽署 SB 53 號法案,這是一部具有全國先例的法案,為大型 AI 公司設立了新的透明度要求。該法案要求包括 OpenAI、Anthropic、Meta 和 Google DeepMind 在內的大型 AI 實驗室,必須公開安全協議。同時,SB 53 確保了這些公司員工的吹哨人保護,並建立了機制,讓 AI 公司和公眾可向加州緊急事務辦公室報告潛在的關鍵安全事件。公司還必須報告未經人類監督所犯的罪行,例如網路攻擊,以及模型在歐盟 AI 法案未要求的情況下表現出的欺騙行為。 AI 業界對該法案反應不一。科技企業普遍認為州級 AI 政策可能導致監管碎片化,從而阻礙創新,儘管 Anthropic 支援該法案,但 Meta 和 OpenAI 則反對 lobbying。OpenAI 甚至發表公開信勸阻紐森簽署。此法案出臺之際,矽谷科技精英正投入數億美元支援主張輕觸管制的候選人。OpenAI 和 Meta 的高管近期推出了支援 AI 友好的超級政治行動委員會。然而,其他州仍可能以加州為榜樣,試圖遏制未加約束的技術發展帶來的潛在危害。紐約州也透過了類似法案,正等待州長凱西·霍楚爾的簽名或否決。 紐森表示,該立法在保護社群與確保 AI 產業繁榮之間取得了平衡,加州將成為全國領先的國家,建立公眾信任。此外,州長正在考慮另一項 SB 243 號法案,該法案已獲兩院支援,旨在規範 AI 伴侶聊天機器人,要求實施安全協議並承擔法律責任。SB 53 是參議員斯科特·維尼的第二次嘗試,此前紐森否決了更廣泛的 SB 1047 號法案。維尼此次已聯絡主要 AI 公司,試圖幫助其理解法案修改內容。
-
Anthropic 推出 Claude Sonnet 4.5,其最佳 AI 模型用於程式設計
安提洛普公司(Anthropic)於週一推出了名為 Claude Sonnet 4.5 的新前沿模型,宣稱其在程式設計基準測試中表現卓越。該公司表示,Claude Sonnet 4.5 能夠構建「生產級」應用程式,而不僅僅是原型,這代表了與以往 AI 模型相比在可靠性上的重大躍進。該模型將透過 Claude API 和 Claude 聊天機器人提供,開發者定價與 Claude Sonnet 4 相同,輸入 token 為每百萬 3 美元(約等於 75 萬字,超過《指環王》系列總字數),輸出 token 為每百萬 15 美元。過去一年,安提洛普的 AI 模型因在軟體工程任務上的強勁表現而成為開發者和企業的寵兒,蘋果和 Meta 據報在內部使用 Claude AI 模型,安提洛普也透過向 Cursor、Windsurf 和 Replit 等 AI 程式設計應用程式銷售 API 訪問權而取得顯著商業成功。近期,OpenAI 的 GPT-5 在多種程式設計基準測試中挑戰了安提洛普的優勢,表現優於 Claude 模型。然而,安提洛普表示 Claude Sonnet 4.5 在 SWE-Bench Verified 等幾個程式設計基準測試中提供行業領先的表現。安提洛普 AI 研究員 David Hershey 告訴 TechCrunch,僅靠基準測試難以完全捕捉 Claude Sonnet 4.5 的表現。Hershey 表示,在與部分企業客戶的早期測試中,他見證 Claude Sonnet 4.5 自主編碼長達 30 小時,不僅建立應用程式,還啟動資料庫服務、購買網域名稱並執行 SOC 2 審計以確保產品安全。Cursor 執行長 Michael Truell 表示 Claude Sonnet 4.5 在長遠任務上代表程式設計效能的頂尖水平,Windsurf 執行長 Jeff Wang 則稱其為「新一代程式設計模型」。安提洛普還宣稱 Claude Sonnet 4.5 是其迄今為止最對齊的前沿 AI 模型,具有較低的奉承和欺騙率,並改善了模型對提示注入攻擊的易感性。隨著 Claude Sonnet 4.5 的推出,安提洛普同時推出了 Claude Agent SDK,該基礎設施可幫助開發
-
OpenAI表示GPT-5在廣泛的工作範疇中與人類表現相若
OpenAI 於週四發布了名為 GDPval 的新基準測試,旨在評估其 AI 模型在廣泛行業與職業中與人類專業人士的表現對比。該測試是 OpenAI 嘗試理解其系統在經濟上重要工作上接近超越人類程度的早期努力,符合公司開發通用人工智慧(AGI)的基礎使命。OpenAI 表示,其 GPT-5 模型與 Anthropic 的 Claude Opus 4.1 已接近產業專家產出工作品質的水平。儘管部分執行長預測 AI 僅需數年即可取代人類工作,OpenAI 承認 GDPval 目前僅涵蓋極少數真實工作任務。此基準涵蓋貢獻美國國內生產總值最多的九個行業,包括醫療保健、金融、製造業及政府部門,並測試 44 種職業,從軟體工程師到護士及記者。在 GDPval-v0 版本中,OpenAI 請經驗豐富的專業人士比較 AI 生成報告與人類報告並選擇最佳者。例如,要求投資銀行家為最後一哩送遞行業建立競爭格局並與 AI 報告比較。OpenAI 則跨所有 44 種職業平均 AI 模型的「勝率」。對於 GPT-5-high 版本,公司表示該 AI 模型有 40.6% 的時間被評為優於或與產業專家並駕齊驅。Anthropic 的 Claude Opus 4.1 模型在 49% 的任務中獲得相同評價,OpenAI 認為這部分歸因於其傾向於製作令人愉悅的圖表而非純粹效能。OpenAI 首席經濟學家 Aaron Chatterji 指出,這些結果表明這些職業的人可以將更多時間花在更有意義的任務上,隨著能力提升,可將部分工作外包給模型以進行更高價值的工作。OpenAI 評估主管 Tejal Patwardhan 表示對 GDPval 的進展速度感到鼓舞,因為 GPT-4o 模型在約 15 個月前得分僅為 13.7%,而現在 GPT-5 得分幾乎是三倍。雖然矽谷有多項基準測試如 AIME 2025 和 GPQA Diamond,但許多模型在這些測試上已接近飽和,許多 AI 研究者呼籲需要能測量真實世界任務能力的更好測試。GDPval 可能在此討論中變得越來越重要,但 OpenAI
-
馬斯克的xAI提供Grok給聯邦政府僅需42美分
Elon Musk 旗下的 xAI 已與美國政府採購機構達成協議,將其 AI 聊天機器人 Grok 以低於一美元的價格出售給聯邦政府。根據與美國總務署(GSA)的協議,聯邦機構每年使用 Grok 的費用為 42 美分,合約期為一年半。相比之下,OpenAI 和 Anthropic 分別提供 ChatGPT 和 Claude 的企業及政府版本,價格為每年 1 美元。OpenAI 僅向行政部門銷售,而 Anthropic 則同時向司法和立法部門銷售。此優惠價格包含 xAI 工程師協助整合技術的服務。42 美分這一價格可能源於 Musk 對 420(大麻隱喻)的玩笑,或是致敬其喜愛的書籍《銀河系漫遊指南》中關於生命意義的答案 42。此前,xAI 曾接近獲得 GSA 供應商資格,但因 Grok 在 X 平臺上生成反猶太主義內容並自稱「機械希特勒」,原定合作一度告吹。直到今年八月,Wired 獲取的內部郵件顯示,白宮指示 GSA 盡快將 Grok 列入合格供應商名單。xAI 也是與 Anthropic、Google 和 OpenAI 一同被選中,獲得價值 2 億美元的國防部合約。在唐納德·特朗普就職後,Musk 成立並領導了政府效率部(DOGE),展開了混合結果的成本削減行動,並安排助手擔任 GSA 及其他政府機構的監管或合約授出職務。GSA 發言人表示,Musk 未直接參與該協議的談判。