實體: DeepSeek
所有提到 DeepSeek 的 AI 新聞與動態。
-
Reflection AI 融資 20 億美元成為美國開放前沿 AI 實驗室,挑戰 DeepSeek
Reflection AI 是一家由前 Google DeepMind 研究人員米沙·拉斯金和伊奧尼斯·安東諾格盧於 2024 年 3 月創立的起點公司,近期以 80 億美元估值籌資 20 億美元,較七個月前 5.45 億美元的估值增長了 15 倍。該公司最初專注於自主編碼代理,現正定位為 OpenAI 和 Anthropic 等封閉前沿實驗室以及中國 AI 企業如 DeepSeek 的開源替代方案或西方對等夥伴。拉斯金曾領導 DeepMind Gemini 專案的獎勵建模,而安東諾格盧則共同創造了 2016 年擊敗世界冠軍的 AlphaGo。團隊目前約有 60 名成員,主要來自 DeepMind 和 OpenAI,並已建立先進的 AI 訓練堆疊,承諾對所有人開放。 公司宣稱已識別出一種可擴充套件的商業模式,與其開放智慧戰略一致。團隊計劃明年發布一個前沿語言模型,該模型將基於「數兆兆 token」進行訓練,並具備訓練大規模專家混合(MoE)模型的能力。MoE 架構此前僅大型封閉 AI 實驗室能訓練,但 DeepSeek、Qwen 等中國模型的突破讓拉斯金意識到,若美國不採取行動,全球智慧標準將由他人建立,美國將處於劣勢。由於企業和主權國家可能因法律後果而不使用中國模型,美國及其盟友面臨競爭劣勢或迎頭趕上的選擇。 美國技術界對 Reflection AI 的使命表示支援。白宮 AI 與加密事務負責人戴維·薩克斯在 X 上表示,開放源開源 AI 模型對全球市場有重要意義,美國希望在此類別中獲勝。Hugging Face 聯合創始人克萊姆·德朗格也稱讚此舉,但指出挑戰在於展示開放 AI 模型和資料集的高速度共享。Reflection AI 對「開放」的定義側重於訪問而非開發,類似 Meta 的 Llama 或 Mistral 策略。公司將公開模型權重供公眾使用,但保留資料集和完整訓練管道專有。 商業模式方面,研究人員可免費使用模型,但收入將來自大型企業基於 Reflection AI 模型開發產品,以及政府開發「主權
-
DeepSeek:關於這款AI對話應用的所有資訊
中國人工智慧實驗室 DeepSeek 近期因聊天機器人應用程式在 Apple App Store 及 Google Play 排名上升而引發全球關注。該實驗室由量化對沖基金高飛者資本管理(High-Flyer Capital Management)支援,該基金由梁文風於 2019 年創立,專注於開發人工智慧演演算法。DeepSeek 實驗室於 2023 年獨立成為公司,並自建立之初便自建資料中心叢集進行模型訓練。由於受美國出口管制影響,公司訓練模型時被迫使用較弱版本的英偉達 H800 晶片,而非 H100。 DeepSeek 技術團隊以年輕且高學歷為特色,積極招募來自中國頂尖大學的博士研究員,並聘請非電腦科學背景的人才以擴充套件知識領域。該公司在 2023 年 11 月推出首批模型,包括 DeepSeek Coder、DeepSeek LLM 和 DeepSeek Chat。2024 年春季推出的 DeepSeek-V2 系列模型在效能上表現優異且執行成本較低,迫使國內競爭對手如位元組跳動和阿里巴巴降低價格或免費提供服務。2024 年 12 月推出的 DeepSeek-V3 模型在內部測試中表現優於 Meta 的 Llama 和 OpenAI 的 GPT-4o。此外,其 R1 推理模型在關鍵測試指標上與 OpenAI 的 o1 模型相當,能夠自我事實核查,在物理、科學和數學領域更具可靠性。 然而,作為中國開發的人工智慧,DeepSeek 的模型需符合中國網際網路監管機構的要求,確保回應體現「社會主義核心價值觀」。例如,其聊天機器人不會回答關於天安門廣場或臺灣自治的問題。截至 3 月,DeepSeek 的日活躍使用者量已超過 1650 萬,雖低於 ChatGPT 的 5 億周活躍使用者,但增長迅速。DeepSeek 的商業模式不明確,產品定價遠低於市場價值,且未接受風險投資。儘管模型非完全開源,但允許商業使用,這導致開發者在其平臺上建立了超過 500 個衍生模型,總下載量達 250 萬。 DeepSeek 的成功對行業產生了巨大衝擊,導致英偉達股價在 1 月下跌 18%,並
-
DeepSeek 發佈「稀疏注意力」模型,將 API 使用成本減半
DeepSeek 研究團隊於本週一發布了名為 V3.2-exp 的新實驗模型,旨在大幅降低長上下文運算時的推論成本。該模型透過 Hugging Face 平臺及 GitHub 上的學術論文正式公佈,其核心技術稱為 DeepSeek Sparse Attention。此係統包含兩個主要模組:「閃電索引器」用於優先處理上下文視窗的特定片段,以及「細粒度標記選擇系統」則從這些片段中篩選出關鍵標記載入有限的注意力視窗。兩者結合使模型能在處理長上下文時保持較小的伺服器負載。初步測試顯示,在長情境下,簡單的 API 呼叫價格最高可降低一半。DeepSeek 基於中國,其 R1 模型曾因採用強化學習而引發關注,但此次推出的稀疏注意力方法雖可能不會造成同等規模的轟動,卻能為美國供應商提供降低推論成本的寶貴經驗。由於模型為開放權重且免費提供,第三方將很快能驗證相關聲稱。
-
Groq 超過預期籌獲資金,估值達 69 億美元
美國 AI 晶片新創公司 Groq 於週三確認,以 69 億美元的投後估值籌資 7.5 億美元,此金額高於七月份洩漏時所傳的約 6 億美元及 60 億美元的籌資規模。Groq 此前於 2024 年 8 月以 28 億美元估值籌資 6.4 億美元,此次估值約為一年前兩倍。截至目前,PitchBook 估計 Groq 總籌資額已超過 30 億美元。Groq 之所以成為市場焦點,是因為其致力於打破 NVIDIA 在 AI 晶片領域的壟斷地位。與通常用於 AI 系統的 GPU 不同,Groq 推出的是語言處理單元(LPU),並將其硬體稱為推理引擎,專為快速高效執行 AI 模型而設計。其產品面向開發者與企業,提供雲端服務或本地部署的伺服器機櫃。無論雲端或本地硬體,皆支援 Meta、DeepSeek、Qwen、Mistral、Google 及 OpenAI 等主流模型的開放版本。Groq 宣稱其產品在顯著降低成本的情況下,能維持或提升 AI 效能。創辦人 Jonathan Ross 曾於 Google 開發專為機器學習設計的張量處理單元(TPU),該產品自 2016 年推出至今仍是 Google Cloud AI 服務的核心。Groq 目前服務超過 200 萬名開發者,較一年前與 TechCrunch 交流時的 35.6 萬名大幅增長。本次融資由 Disruptive 主導,BlackRock、Neuberger Berman、Deutsche Telekom Capital Partners 等機構參與,既有投資者如 Samsung、Cisco、D1 及 Altimeter 亦加入此輪。