實體: OpenAI
所有提到 OpenAI 的 AI 新聞與動態。
-
薩姆·奧特曼認為 AI 下年將產生「創新見解
OpenAI 執行長 Sam Altman 於週二發表新文章《The Gentle Singularity》,提出未來十五年 AI 將如何改變人類經驗的願景。Altman 在文中暗示,2026 年世界將見證能夠提出新見解的 AI 系統出現。儘管此說法較為模糊,但 OpenAI 的高層近期已表示公司正專注於讓 AI 模型產生新穎有趣的想法。這與 OpenAI 在四月推出 o3 和 o4-mini 推理模型時,共同創辦人兼總裁 Greg Brockman 的說法一致,他稱這些是科學家首次用來生成新且有益想法的模型。 除了 OpenAI,其他競爭對手也轉向訓練能協助科學家提出新假設的 AI 模型。Google 在五月發布 AlphaEvolve,宣稱其 AI 程式設計代理已生成解決複雜數學問題的新方法。由前 Google 執行長 Eric Schmidt 支援的 FutureHouse 則表示其 AI 代理工具已達成真正的科學發現。同年五月,Anthropic 也推出了支援科學研究的計劃。若這些公司成功,將能自動化科學過程的關鍵部分,並可能進入藥物研發、材料科學等領域。 Altman 並非首次透過部落格透露 OpenAI 的未來計畫。他在今年一月曾寫文預測 2025 年將是代理(agents)的年份,隨後公司推出了 Operator、Deep Research 和 Codex 等三個 AI 代理。然而,讓 AI 生成新見解可能比開發代理更困難。科學界對 AI 能否產生真正原創見解仍持懷疑態度。Hugging Face 首席科學官 Thomas Wolf 曾撰文指出,現代 AI 系統無法提出關鍵的偉大問題。前 OpenAI 研究負責人 Kenneth Stanley 也告訴 TechCrunch,當下的 AI 模型無法生成新假設。Stanley 現已加入 Lila Sciences,該公司籌資 2 億美元,專門建立 AI 驅動的實驗室,專注於讓 AI 模型提出更好的假設。Stanley 認為這難點在於讓 AI 具備對創意與興趣的感知。OpenAI 是否能真正創造出能產生新見解的 AI 模型仍有待觀察,但 Altman 的文章或許正是對公司未來方向的預示。
-
OpenAI 的開放模型延宕
OpenAI 執行長 Sam Altman 於 2025 年 6 月 10 日透過 X 平臺宣佈,該公司數年來的首個開放模型發布將延後至今年夏天後期,而非原本目標的 6 月。Altman 表示,研究團隊做出了意外且驚人的突破,認為雖然值得等待,但需要更多時間。該開放模型預計將具備與 OpenAI o 系列模型相似的「推理」能力,並旨在超越 DeepSeek R1 等其他開放推理模型的表現。隨著 Mistral 在週二發布 Magistral 系列模型,以及中國實驗室 Qwen 在四月推出可切換推理模式的混合模型,該領域競爭日益激烈。除了提升基準測試表現外,OpenAI 還曾考慮讓開放模型連線至公司雲端託管的模型以處理複雜查詢,但這些功能是否會出現在最終版本尚不明確。Altman 曾指出 OpenAI 在開放模型原始碼方面處於「歷史錯誤的一側」,因此公司面臨巨大壓力,必須發布一款與行業最佳開放解決方案具有競爭力的模型,以修復與研究人員和開發者之間的關係。
-
OpenAI 發佈 o3-pro,一款升級版的 o3 AI 推理模型
OpenAI 於 2025 年 6 月 10 日推出 o3-pro,宣稱這是其目前最強大的 AI 模型。作為 o3 推理模型的升級版,o3-pro 透過逐步解決問題的方式運作,在物理、數學、程式碼等領域表現更可靠。該模型自即日起取代 o1-pro,開放給 ChatGPT Pro 及 Team 使用者使用,企業與教育使用者則於下一週獲得存取權。o3-pro 亦已於開發者 API 上線,定價為每百萬輸入 token 20 美元,每百萬輸出 token 80 美元。一百萬輸入 token 約等於 75 萬字。 根據 OpenAI 的變更日誌,專家評估顯示 o3-pro 在所有測試類別中均優於 o3,尤其在科學、教育、程式、商業與寫作輔助等關鍵領域表現更佳,且在清晰度、完整性、指令遵循與準確性上獲評更高。該模型具備搜尋網頁、分析檔案、處理視覺輸入、使用 Python 及利用記憶個人化回應等工具能力。不過,回應時間通常比 o1-pro 長,且目前暫時禁用 ChatGPT 中的臨時對話功能以解決技術問題,無法生成圖片,也不支援 Canvas 工作區功能。 在內部測試中,o3-pro 在 AIME 2024 數學評估中表現優於 Google 的 Gemini 2.5 Pro,並在 GPQA Diamond 博士級科學知識測試中擊敗 Anthropic 最新推出的 Claude 4 Opus。完整安全細節可參考 o3 系統卡片。
-
蘋果升級的AI模型表現未達預期
蘋果公司宣佈更新了驅動其跨 iOS、macOS 等平臺的 Apple Intelligence 功能套件的 AI 模型。根據蘋果自身的基準測試,其模型表現優於舊版,但不及競爭對手如 OpenAI 的舊版模型。蘋果在週一的部落格文章中表示,人類測試人員評估其最新「Apple On-Device」模型(在 iPhone 等產品上離線執行)生成的文字質量,與同等規模的 Google 和阿里巴巴模型相當,但並未更好。同時,測試人員對蘋果更強大的「Apple Server」模型(執行於資料中心)的評分,則落後於 OpenAI 一年前的 GPT-4o 模型。在另一項評估影象分析能力的測試中,人類評分者偏好 Meta 的 Llama 4 Scout 模型,這令人驚訝,因為 Llama 4 Scout 在許多測試中表現不如 Google、Anthropic 和 OpenAI 等領先 AI 實驗室的主流模型。這些基準測試結果支援了關於蘋果 AI 研究部門難以在激烈的 AI 競賽中趕上競爭對手的報導。蘋果近年來的 AI 能力令人失望,承諾的 Siri 升級也已被無限期延遲。部分客戶已對蘋果提起了訴訟,指控其營銷了尚未交付的產品 AI 功能。除了生成文字外,約 30 億引數的 Apple On-Device 模型還驅動著摘要和文字分析等功能。截至週一,第三方開發者可透過蘋果的 Foundation Models 框架使用它。蘋果表示,Apple On-Device 和 Apple Server 相比前代在工具使用和效率方面有所改進,並能理解約 15 種語言。這得益於擴充的訓練資料集,其中包括影象資料、PDF 文件、手稿、資訊圖表、表格和圖表。