實體: Hugging Face
所有提到 Hugging Face 的 AI 新聞與動態。
-
Reflection AI 融資 20 億美元成為美國開放前沿 AI 實驗室,挑戰 DeepSeek
Reflection AI 是一家由前 Google DeepMind 研究人員米沙·拉斯金和伊奧尼斯·安東諾格盧於 2024 年 3 月創立的起點公司,近期以 80 億美元估值籌資 20 億美元,較七個月前 5.45 億美元的估值增長了 15 倍。該公司最初專注於自主編碼代理,現正定位為 OpenAI 和 Anthropic 等封閉前沿實驗室以及中國 AI 企業如 DeepSeek 的開源替代方案或西方對等夥伴。拉斯金曾領導 DeepMind Gemini 專案的獎勵建模,而安東諾格盧則共同創造了 2016 年擊敗世界冠軍的 AlphaGo。團隊目前約有 60 名成員,主要來自 DeepMind 和 OpenAI,並已建立先進的 AI 訓練堆疊,承諾對所有人開放。 公司宣稱已識別出一種可擴充套件的商業模式,與其開放智慧戰略一致。團隊計劃明年發布一個前沿語言模型,該模型將基於「數兆兆 token」進行訓練,並具備訓練大規模專家混合(MoE)模型的能力。MoE 架構此前僅大型封閉 AI 實驗室能訓練,但 DeepSeek、Qwen 等中國模型的突破讓拉斯金意識到,若美國不採取行動,全球智慧標準將由他人建立,美國將處於劣勢。由於企業和主權國家可能因法律後果而不使用中國模型,美國及其盟友面臨競爭劣勢或迎頭趕上的選擇。 美國技術界對 Reflection AI 的使命表示支援。白宮 AI 與加密事務負責人戴維·薩克斯在 X 上表示,開放源開源 AI 模型對全球市場有重要意義,美國希望在此類別中獲勝。Hugging Face 聯合創始人克萊姆·德朗格也稱讚此舉,但指出挑戰在於展示開放 AI 模型和資料集的高速度共享。Reflection AI 對「開放」的定義側重於訪問而非開發,類似 Meta 的 Llama 或 Mistral 策略。公司將公開模型權重供公眾使用,但保留資料集和完整訓練管道專有。 商業模式方面,研究人員可免費使用模型,但收入將來自大型企業基於 Reflection AI 模型開發產品,以及政府開發「主權
-
Meta Llama:你需知的開放生成式 AI 模型一切資訊
Meta 推出了其旗艦式生成式 AI 模型 Llama,該系列包含 Llama 3 及最新發布於 2025 年 4 月的 Llama 4。Llama 4 系列包含三個版本:Scout 擁有 170 億個活躍引數、1090 億總引數及 1000 萬 token 的上下文視窗;Maverick 擁有 170 億活躍引數、4000 億總引數及 100 萬 token 上下文;Behemoth 則擁有 2880 億活躍引數及 2 兆總引數,目前尚未發布。這些模型採用專家混合(MoE)架構,並具備原生多模態支援,訓練資料涵蓋 200 種語言及大量未標記的文字、影像與影片資料。Llama 4 Scout 適合長流程與大資料分析,Maverick 則在推理能力與回應速度間取得平衡,適用於程式碼與聊天機器人,Behemoth 則專為高階研究與 STEM 任務設計。 Meta 透過與 AWS、Google Cloud、Microsoft Azure 等廠商合作,提供雲端託管服務,並透過 Llama Cookbook 提供工具協助開發者微調模型。Llama 模型可整合 Brave Search、Wolfram Alpha API 及 Python 解譯器等第三方工具。目前 Llama 已支援在 Facebook Messenger、WhatsApp、Instagram 等 Meta 平臺運作,並透過 Llama.com 及 Hugging Face 提供下載。Meta 擁有超過 25 家合作夥伴託管 Llama,包括 Nvidia、Databricks 等。然而,Llama 授權條款限制開發者使用,月活躍使用者超過 7 億的應用程式開發者需申請特殊許可。 Meta 提供 Llama Guard、Prompt Guard、CyberSecEval 及 Code Shield 等安全工具,以檢測不當內容、防止提示注入攻擊及過濾不安全程式碼。儘管如此,Llama 仍存在限制,例如多模態功能目前僅支援英語,且訓練資料包含盜版電子書及社群媒體內容。在程式碼生成方面,Llama 4 Maverick 在 LiveCodeBench 測試中得分為 40%,低於 OpenAI 的 GPT-5(85%)及 xAI 的
-
DeepSeek 發佈「稀疏注意力」模型,將 API 使用成本減半
DeepSeek 研究團隊於本週一發布了名為 V3.2-exp 的新實驗模型,旨在大幅降低長上下文運算時的推論成本。該模型透過 Hugging Face 平臺及 GitHub 上的學術論文正式公佈,其核心技術稱為 DeepSeek Sparse Attention。此係統包含兩個主要模組:「閃電索引器」用於優先處理上下文視窗的特定片段,以及「細粒度標記選擇系統」則從這些片段中篩選出關鍵標記載入有限的注意力視窗。兩者結合使模型能在處理長上下文時保持較小的伺服器負載。初步測試顯示,在長情境下,簡單的 API 呼叫價格最高可降低一半。DeepSeek 基於中國,其 R1 模型曾因採用強化學習而引發關注,但此次推出的稀疏注意力方法雖可能不會造成同等規模的轟動,卻能為美國供應商提供降低推論成本的寶貴經驗。由於模型為開放權重且免費提供,第三方將很快能驗證相關聲稱。
-
邁向未來:TechCrunch Disrupt 2025 全場 AI 會議議程
TechCrunch Disrupt 2025 的 AI 舞臺活動已於 10 月 27 日至 29 日在舊金山正式確定,匯聚了 Character.AI、Hugging Face、Mercor、Runway、Wayve 等科技領袖,探討生成式 AI、開發者工具、自動駕駛、創意機器及國家安全等議題。創業者可親眼見證定義下一波創新技術,並聆聽團隊策略與見解。活動包含分組討論、圓桌會議及網路交流,報名截止日期為 9 月 26 日,可節省高達 668 美元。 活動涵蓋多個主題,包括 Aileen Lee、Steve Jang 與 Jon McNeill 等風險投資家對 AI 創業公司的看法,Wayve 執行長 Alex Kendall 探討 AI 自駕技術,Apptronik 與 Waabi 執行長討論物理世界 AI 應用,Pinecone 執行長 Edo Liberty 分析向量搜尋技術,以及 Hugging Face 共同創辦人 Thomas Wolf 解析 AI 基礎設施演進。此外,還有 JetBrains 執行長 Kirill Skrygan 談論開發者工具、Character.AI 執行長 Karandeep Anand 分享對話式 AI 趨勢,以及 Twelve Labs、Wonder Dynamics 等公司探討創意內容生成。 活動亦涵蓋 Runway 執行長 Alejandro Matamala Ortiz 解析生成式影片應用,Kinsey Institute 與 Tinder 專家討論 AI 對人際關係的影響,Google Cloud CTO Will Grannis 分享 AI 擴充套件策略,Mach Industries 執行長 Ethan Thornton 探討國防 AI 應用,DARPA 主任 Kathleen Fisher 分析國家安全領域的 AI 競爭,Mercor 執行長 Brendan Foody 討論 AI 對就業的影響,以及 Uber 與 Nuro 技術專家分享 AI 如何改變交通運輸。創業者應把握機會參與,鎖定優惠並掌握 AI 未來發展動態。