實體: Qwen
所有提到 Qwen 的 AI 新聞與動態。
-
阿里巴巴Qwen技術領隊在重大AI布局後請辭
阿里巴巴的 Qwen AI 專案在剛推出 Qwen 3.5 開源小模型後,核心技術領導人林軍陽(Junyang Lin)宣佈辭職。林軍陽於 2019 年 7 月加入阿里巴巴,2023 年 4 月加入 Qwen 團隊,其離職引發了同事與業界夥伴的強烈反應。此次離職發生在全球 AI 開發競爭加劇的背景下,各大公司正努力研發能與 OpenAI、Google 及 Anthropic 抗衡的模型。Qwen 系列模型作為中國最具代表性的開源 AI 努力之一,其近期發布的基準測試結果常與美國領先開發者的系統相媲美。該系列模型於 2023 年 4 月推出,並在獲得監管批准後於同年 9 月向公眾開放使用。阿里巴巴於週一推出了 Qwen 3.5 小模型系列,包含四款引數分別為 0.8B、2B、4B 和 9B 的模型,這些原生多模態模型適用於從裝置端 AI 部署到輕量級代理等多種用途。AI 社群知名人士如埃隆·馬斯克(Elon Musk)對新模型表示讚賞,稱其展現了「令人印象深刻的智慧密度」。Qwen 團隊成員王濤(Wenting Zhao)將此事件描述為「一個時代的結束」,感謝林軍陽在開源 AI 和工程方面的貢獻。Hyperbolic 技術長金雨辰(Yuchen Jin)和 Hugging Face 亞太生態系統負責人王鐵真(Tiezhen Wang)也稱林軍陽的離職為巨大損失。目前林軍陽未回應求證,其離職原因尚不清楚。部分團隊成員如陳成(Chen Cheng)和匯斌元(Binyuan Hui)在社交平臺上表達了悲痛或更新了個人狀態,但阿里巴巴方面尚未回應關於離職原因及團隊領導結構的提問。
-
印度AI實驗室Sarvam新推出的模型是對開放源碼AI可行性的重大押注
印度人工智慧實驗室 Sarvam 於二日在印度新德里舉辦的印度 AI 影響峰會上,正式推出新一代大型語言模型。該公司希望透過較小且高效的開源 AI 模型,從美國和中國等競爭對手提供的昂貴系統中搶佔市場份額。此次發布的模型包含 300 億引數與 1050 億引數兩種版本,並搭配文字轉語音、語音轉文字及檔案解析等視覺模型。這組產品相比於 2024 年 10 月推出的 20 億引數 Sarvam 1 模型有顯著升級。新模型採用專家混合架構,僅在特定時刻啟用部分引數以大幅降低運算成本。300 億引數模型支援 32,000 token 的上下文視窗,適用於即時對話;而 1050 億引數模型則提供 128,000 token 視窗,專為複雜的多步驟推理任務設計。 Sarvam 宣稱這些模型是全新訓練而非基於現有開源系統微調。300 億引數模型在約 16 兆 token 的文字上進行預訓練,1050 億引數模型則涵蓋多種印度語言的兆級資料。這些模型旨在支援即時應用,包括印度語言的語音助手和聊天系統。1050 億引數模型被定位為與 OpenAI 的 GPT-OSS-120B 及阿里巴巴的 Qwen-3-Next-80B 競爭。模型訓練使用了印度政府支援的 IndiaAI Mission 提供的計算資源,基礎設施由 Yotta 支援,技術支援來自 Nvidia。Sarvam 執行長表示,公司將採取謹慎方式擴充套件模型,專注於實際應用而非單純追求規模。公司計劃將 300 億與 1050 億引數模型開源,但尚未說明是否公開訓練資料或完整訓練程式碼。此外,Sarvam 還計劃開發專注於程式碼的模型及企業工具,並推出名為 Samvaad 的對話式 AI 代理平臺。該公司成立於 2023 年,已籌資超過 4000 萬美元,投資方包括 Lightspeed Venture Partners、Khosla Ventures 及 Peak XV Partners。
-
迷思特以新開放權重邊境與小模型接近大型AI競爭對手
法國人工智慧新創公司 Mistral 於週二推出了全新的 Mistral 3 系列開放權重模型,旨在證明其在讓 AI 公開可用及服務企業客戶方面能超越大型科技競爭對手。此次發布包含一個具備多模態與多語言能力的 frontier 大模型,以及九個小型離線可用且可完全自訂的模型。Mistral 由前 DeepMind 與 Meta 的研究人員創立,兩年前成立,目前籌資約 27 億美元,估值為 137 億美元,遠低於競爭對手 OpenAI(籌資 570 億美元,估值 5000 億美元)與 Anthropic(籌資 450 億美元,估值 350 億美元)。Mistral 共同創辦人兼首席科學家 Guillaume Lample 指出,許多企業客戶發現直接使用大型封閉模型成本高昂且速度緩慢,因此轉向自訂小型模型以更有效率地處理特定用例。 Mistral 的大型 frontier 模型 Mistral Large 3 在功能上追平 OpenAI 的 GPT-4o 與 Google 的 Gemini 2,並具備多模態與多語言能力,與 Meta 的 Llama 3 及阿里巴巴的 Qwen3-Omni 並駕齊驅。該模型採用「精細專家混合」架構,擁有 410 億個活躍引數與 6750 億個總引數,支援 256,000 的上下文視窗,適用於檔案分析、程式編寫、內容創作及工作流自動化。新推出的 Ministral 3 系列則包含九個不同的高效能稠密模型,涵蓋 140 億、80 億與 30 億引數三種規格,並提供 Base、Instruct 與 Reasoning 三種變體。Mistral 聲稱這些小型模型在效能、成本效率及專有能力上優於其他開放權重領導者,且能產生較少的 token。 所有變體均支援視覺功能,處理 128,000 至 256,000 的上下文視窗,並支援多種語言。Mistral 強調其小型模型可在單一 GPU 上執行,使其能部署於廉價硬體,包括本地伺服器、筆記型電腦、機器人及其他邊緣裝置。這
-
Databricks創辦人認為美國必須採用開放原始碼以在AI領域擊敗中國
Databricks 共同創辦人 Andy Konwinski 警告美國正失去在人工智慧研究領域的優勢,並認為這種趨勢對民主制度構成「生存級」威脅。他在近期於 Cerebral Valley AI Summit 發表的演講中指出,目前伯克利和斯坦福等校的人工智慧博士學生表示,過去一年閱讀到的來自中國公司的有趣人工智慧想法數量是美國公司的兩倍。Konwinski 除了透過去年與 NEA 資深人士 Pete Sonsini 及 Antimatter 執行長 Andrew Krioukov 共同創立的 Laude 進行投資外,也經營著提供研究補助的 Laude Institute。儘管 OpenAI、Meta 和 Anthropic 等主要人工智慧實驗室持續創新,但其成果多為專有技術而非開放原始碼,且這些公司提供的百萬美元級薪資遠高於大學,導致頂尖學術人才被吸納。Konwinski 強調,若要讓想法真正繁榮,必須自由交換與討論。他指出生成式人工智慧的興起直接源於 Transformer 架構,這項關鍵訓練技術來自一份免費的研究論文。他認為,第一個在 Transformer 架構層級取得突破的國家將享有優勢,而中國政府支援並鼓勵 DeepSeek 或阿里巴巴 Qwen 等實驗室將成果開放原始碼,這有助於他人建立並帶來更多突破。相比之下,美國科學家之間的交流已乾涸。Konwinski 警告這不僅是民主風險,也是商業威脅,若美國不保持領先並保持開放,五年後大型實驗室將面臨失敗。