實體: Anthropic
所有提到 Anthropic 的 AI 新聞與動態。
-
薩姆·奧特曼認為 AI 下年將產生「創新見解
OpenAI 執行長 Sam Altman 於週二發表新文章《The Gentle Singularity》,提出未來十五年 AI 將如何改變人類經驗的願景。Altman 在文中暗示,2026 年世界將見證能夠提出新見解的 AI 系統出現。儘管此說法較為模糊,但 OpenAI 的高層近期已表示公司正專注於讓 AI 模型產生新穎有趣的想法。這與 OpenAI 在四月推出 o3 和 o4-mini 推理模型時,共同創辦人兼總裁 Greg Brockman 的說法一致,他稱這些是科學家首次用來生成新且有益想法的模型。 除了 OpenAI,其他競爭對手也轉向訓練能協助科學家提出新假設的 AI 模型。Google 在五月發布 AlphaEvolve,宣稱其 AI 程式設計代理已生成解決複雜數學問題的新方法。由前 Google 執行長 Eric Schmidt 支援的 FutureHouse 則表示其 AI 代理工具已達成真正的科學發現。同年五月,Anthropic 也推出了支援科學研究的計劃。若這些公司成功,將能自動化科學過程的關鍵部分,並可能進入藥物研發、材料科學等領域。 Altman 並非首次透過部落格透露 OpenAI 的未來計畫。他在今年一月曾寫文預測 2025 年將是代理(agents)的年份,隨後公司推出了 Operator、Deep Research 和 Codex 等三個 AI 代理。然而,讓 AI 生成新見解可能比開發代理更困難。科學界對 AI 能否產生真正原創見解仍持懷疑態度。Hugging Face 首席科學官 Thomas Wolf 曾撰文指出,現代 AI 系統無法提出關鍵的偉大問題。前 OpenAI 研究負責人 Kenneth Stanley 也告訴 TechCrunch,當下的 AI 模型無法生成新假設。Stanley 現已加入 Lila Sciences,該公司籌資 2 億美元,專門建立 AI 驅動的實驗室,專注於讓 AI 模型提出更好的假設。Stanley 認為這難點在於讓 AI 具備對創意與興趣的感知。OpenAI 是否能真正創造出能產生新見解的 AI 模型仍有待觀察,但 Altman 的文章或許正是對公司未來方向的預示。
-
OpenAI 發佈 o3-pro,一款升級版的 o3 AI 推理模型
OpenAI 於 2025 年 6 月 10 日推出 o3-pro,宣稱這是其目前最強大的 AI 模型。作為 o3 推理模型的升級版,o3-pro 透過逐步解決問題的方式運作,在物理、數學、程式碼等領域表現更可靠。該模型自即日起取代 o1-pro,開放給 ChatGPT Pro 及 Team 使用者使用,企業與教育使用者則於下一週獲得存取權。o3-pro 亦已於開發者 API 上線,定價為每百萬輸入 token 20 美元,每百萬輸出 token 80 美元。一百萬輸入 token 約等於 75 萬字。 根據 OpenAI 的變更日誌,專家評估顯示 o3-pro 在所有測試類別中均優於 o3,尤其在科學、教育、程式、商業與寫作輔助等關鍵領域表現更佳,且在清晰度、完整性、指令遵循與準確性上獲評更高。該模型具備搜尋網頁、分析檔案、處理視覺輸入、使用 Python 及利用記憶個人化回應等工具能力。不過,回應時間通常比 o1-pro 長,且目前暫時禁用 ChatGPT 中的臨時對話功能以解決技術問題,無法生成圖片,也不支援 Canvas 工作區功能。 在內部測試中,o3-pro 在 AIME 2024 數學評估中表現優於 Google 的 Gemini 2.5 Pro,並在 GPQA Diamond 博士級科學知識測試中擊敗 Anthropic 最新推出的 Claude 4 Opus。完整安全細節可參考 o3 系統卡片。
-
蘋果升級的AI模型表現未達預期
蘋果公司宣佈更新了驅動其跨 iOS、macOS 等平臺的 Apple Intelligence 功能套件的 AI 模型。根據蘋果自身的基準測試,其模型表現優於舊版,但不及競爭對手如 OpenAI 的舊版模型。蘋果在週一的部落格文章中表示,人類測試人員評估其最新「Apple On-Device」模型(在 iPhone 等產品上離線執行)生成的文字質量,與同等規模的 Google 和阿里巴巴模型相當,但並未更好。同時,測試人員對蘋果更強大的「Apple Server」模型(執行於資料中心)的評分,則落後於 OpenAI 一年前的 GPT-4o 模型。在另一項評估影象分析能力的測試中,人類評分者偏好 Meta 的 Llama 4 Scout 模型,這令人驚訝,因為 Llama 4 Scout 在許多測試中表現不如 Google、Anthropic 和 OpenAI 等領先 AI 實驗室的主流模型。這些基準測試結果支援了關於蘋果 AI 研究部門難以在激烈的 AI 競賽中趕上競爭對手的報導。蘋果近年來的 AI 能力令人失望,承諾的 Siri 升級也已被無限期延遲。部分客戶已對蘋果提起了訴訟,指控其營銷了尚未交付的產品 AI 功能。除了生成文字外,約 30 億引數的 Apple On-Device 模型還驅動著摘要和文字分析等功能。截至週一,第三方開發者可透過蘋果的 Foundation Models 框架使用它。蘋果表示,Apple On-Device 和 Apple Server 相比前代在工具使用和效率方面有所改進,並能理解約 15 種語言。這得益於擴充的訓練資料集,其中包括影象資料、PDF 文件、手稿、資訊圖表、表格和圖表。
-
Mistral 發佈一對 AI 推理模型
法國人工智慧實驗室 Mistral 於週二宣佈推出其首款推理模型系列 Magistral,旨在提升數學、物理等領域的問題解決一致性與可靠性。該系列包含 Magistral Small 與 Magistral Medium 兩種版本。Magistral Small 擁有 240 億引數,可透過 Hugging Face 平臺下載,採用 Apache 2.0 許可證。Magistral Medium 則在 Mistral 的 Le Chat 聊天機器人平臺及 API 上進行預覽,並支援企業客戶。Mistral 自 2023 年成立以來,已獲得 General Catalyst 等投資機構支援,總籌資額超過 11 億歐元。儘管資源雄厚,Mistral 在推理模型開發上曾稍顯落後,Magistral Medium 在 GPQA Diamond、AIME 及 LiveCodeBench 等測試中表現不如 Google 的 Gemini 2.5 Pro 與 Anthropic 的 Claude Opus 4。然而,Mistral 強調 Magistral 在 Le Chat 平臺上的回答速度比競爭對手快 10 倍,並支援義大利語、阿拉伯語、俄語及簡體中文等多種語言。該模型適用於企業場景,涵蓋結構化計算、程式邏輯、決策樹及風險評估等任務,並針對多步驟邏輯進行微調,以增強可解釋性。此發布緊接在 Mistral Code 客戶端及 Le Chat Enterprise 企業服務推出之後。