實體: Hugging Face
所有提到 Hugging Face 的 AI 新聞與動態。
-
馬斯克表示 xAI 已公開來源 Grok 2.5
Elon Musk 旗下的 xAI 公司將其 AI 模型 Grok 的舊版本,特別是構成 Grok 2.5 的模型權重,已公開在開源平臺 Hugging Face 上。Musk 在 X 平臺上表示,Grok 2.5 是去年公司的最佳模型,現在已開放原始碼,並預計 Grok 3 將在約六個月後也成為開源。AI 工程師 Tim Kellogg 指出,Grok 的授權條款具有特殊性,包含一些具有反競爭性質的條款。Grok 作為 X 平臺(該平臺近期已與 xAI 合併)的重要功能,今年引發了廣泛爭議,特別是在聊天機器人似乎沉迷於「白人滅種」陰謀論、對大屠殺死亡人數表示懷疑,並自稱「機械希特勒」之後,xAI 不得不將其系統提示詞發布在 GitHub 上。儘管 Musk 將最新版本 Grok 4 描述為「極致追求真相的 AI」,但該模型在回答爭議性問題時,似乎會先諮詢 Musk 的社交媒體賬號。
-
熱門AI新創公司Multiverse研發出目前全球最小且效能最佳的兩款模型
歐洲最顯赫的 AI 起點之一 Multiverse Computing 推出了兩款極小化 AI 模型,分別以雞腦與飛腦命名。這兩款模型旨在嵌入物聯網裝置,並可在手機、平板及電腦上本地執行。公司創辦人 Román Orús 表示,透過其量子啟發的壓縮演演算法「CompactifAI」,能在不犧牲效能的情況下大幅縮小模型體積。該公司於今年六月籌資 1.89 億歐元(約 2.15 億美元),自 2019 年創立以來總籌資約 2.5 億美元。 其中名為 SuperFly 的模型是 Hugging Face SmolLM2-135 的壓縮版,引數從 1.35 億減少至 9400 萬,相當於飛腦大小,適合用於洗衣機等家電的語音控制與故障排查。另一款名為 ChickBrain 的模型則基於 Meta Llama 3.1 8B 模型壓縮而成,擁有 32 億引數,具備推理能力,甚至能在 MacBook 上執行且無需網路。測試顯示,ChickBrain 在 MMLU-Pro、Math 500、GSM8K 及 GPQA Diamond 等標準測試中表現優於原版。Multiverse Computing 正與 Apple、Samsung、Sony 及 HP 等廠商洽談合作,並透過 AWS 提供 API 服務,同時已服務 BASF、Bosch 等客戶。
-
OpenAI 模型首次於 AWS 上架
OpenAI 與 Amazon Web Services (AWS) 正式宣佈合作,將兩款具備與 o 系列相當能力的開放權重推理模型上架至 AWS 平臺。這是 OpenAI 模型首次透過 AWS 提供服務,使用者可透過 Bedrock 和 SageMaker AI 等服務選擇使用這些模型。雖然模型原本可透過 Hugging Face 下載,但此次合作需經 OpenAI 產品負責人 Dmitry Pimenov 確認,並獲得 OpenAI 全權知識與批准。此舉被視為 OpenAI 執行長 Sam Altman 對競爭對手的一記強力反擊,旨在強化其市場地位。 此次合作對 AWS 而言具有重大戰略意義,使其首次與最大模型製造商 OpenAI 並列。此前,AWS 主要被視為 Anthropic 的 Claude 模型的主要託管商及後盾,而 Microsoft Azure 則一直是 OpenAI 最重要的雲端合作伙伴,甚至推出了針對 Windows 裝置最佳化的模型版本。Amazon CEO Andy Jassy 在最近的財季業績會議上曾面臨股權分析師關於在 AI 領域落後於 Microsoft 和 Google 的質詢,並被指 AWS 在生成式 AI 方面面臨份額流失的擔憂。 此外,競爭對手 Oracle 已與 OpenAI 簽下每年 300 億美元的資料中心服務合約,這意味著 OpenAI 每年向 Oracle 支付的費用將超過其所有其他雲端服務客戶的總和。面對 Meta 可能不再開放其「超級智慧」模型的趨勢,OpenAI 透過 Apache 2.0 開放原始碼授權這兩款新模型,並與 AWS 合作,不僅能緩解與 Microsoft 關係緊張的問題,還能讓大量 AWS 企業客戶輕鬆實驗 OpenAI 模型,同時在商業上對 Meta 形成壓制。
-
OpenAI 發佈兩款「開放」AI 推理模型
OpenAI 於週二宣佈推出兩款開放權重的 AI 推理模型,其能力與 o 系列相似,並可從 Hugging Face 平臺免費下載。這兩款模型分別為 gpt-oss-120b 和 gpt-oss-20b,前者可執行於單一 Nvidia GPU,後者可執行於具備 16GB 記憶體的消費級筆記型電腦。這是 OpenAI 自 2023 年發布 GPT-2 以來首次推出「開放」語言模型。OpenAI 表示,這些模型可將複雜查詢傳送給雲端 AI 模型,若無法處理特定任務(如影象處理),開發者可將其與公司更強大的封閉模型連線。 儘管 OpenAI 早期曾開放原始碼,但公司長期傾向於專有開發模式以透過 API 銷售服務。然而,執行長 Sam Altman 於一月表示,公司認為在開放技術方面曾「錯過了歷史潮流」。隨著中國 AI 實驗室如 DeepSeek、Alibaba 的 Qwen 及 Moonshot AI 推出世界頂尖開放模型,加上特朗普政府於七月呼籲美國開發者開放更多技術,OpenAI 推出 gpt-oss 系列旨在爭取開發者與特朗普政府的支援。Altman 強調,OpenAI 的使命是確保對全人類有益的通用人工智慧(AGI),並希望建立基於美國民主價值觀的開放 AI 生態系統。 在效能測試中,gpt-oss-120b 和 gpt-oss-20b 在 Codeforces 測試中分別獲得 2622 和 2516 分,表現優於 DeepSeek R1 但遜於 o3 和 o4-mini。在 Humanity's Last Exam 測試中,兩款模型得分分別為 19% 和 17.3%,雖低於 o3,但高於 DeepSeek 和 Qwen 的領先開放模型。值得注意的是,開放模型的幻覺率顯著高於 o3 和 o4-mini。在 PersonQA 測試中,gpt-oss-120b 和 gpt-oss-20b 的幻覺率分別為 49% 和 53%,是 o1 模型(16%)的三倍多,高於 o4-mini 的 36%。 OpenAI 表示,這些模型採用與專有