實體: Llama
所有提到 Llama 的 AI 新聞與動態。
-
微小創投 Arcee AI 從頭建立 4000億參數開源 LLM,超越 Meta 的 Llama
美國小型創業公司 Arcee AI 挑戰了大科技壟斷 AI 模型市場的現狀,宣佈發布名為 Trinity 的通用基礎模型。該模型採用 Apache 許可證,被宣稱為美國公司訓練並發布的最大開源基礎模型之一,引數數量達 400B。根據測試,Trinity 在程式設計、數學、常識、知識和推理等任務上表現優異,部分測試結果甚至略勝 Meta 的 Llama 4 Maverick 400B 和中國清華大學 Z.ai 的 GLM-4.5。儘管目前僅支援文字輸入,尚未具備多模態能力,但 Arcee AI 強調其目標是讓開發者和學者信服,並試圖將美國企業從依賴中國開源模型轉為使用美國本土模型。 Arcee AI 在六個月內耗資 2000 萬美元,動用 2048 張 Nvidia Blackwell B300 晶片完成了 Trinity 系列模型的訓練,包括 26B 引數的 Trinity Mini 和 6B 引數的 Trinity Nano。公司創辦人 Mark McQuade 指出,Trinity 系列將提供三種版本:Trinity Large Preview、Trinity Large Base 以及可自由客製化的 TrueBase。所有模型均可免費下載,預計大版本將推出六週內。此外,Arcee AI 已推出 Trinity Mini 的 API 服務,價格為每百萬字元 0.045 美元或 0.15 美元,並提供限額免費層級。公司承諾透過 Apache 許可證確保模型永久開源,以應對 Meta 等公司對開源策略的變動,並致力於建立美國獨立的 frontier-grade 開源 AI 實驗室。
-
Meta與出版商簽署商業AI數據協議,為Meta AI提供即時新聞
Meta 已與多家新聞出版商簽署商業 AI 資料協議,旨在為 Meta AI 提供即時全球、娛樂及突發新聞。此舉讓使用者在詢問新聞相關問題時,能獲得整合不同內容來源的資訊與連結,並可點選前往出版商網站閱讀更多詳情。參與合作的新聞機構包括 CNN、Fox News、Fox Sports、Le Monde Group、People Inc. 旗下媒體品牌、The Daily Caller、The Washington Examiner 以及 USA Today。Meta 表示,此策略有助於其合作夥伴觸及新受眾,並回應其平臺不再作為新聞中心樞紐的轉變,例如 Facebook 於 2024 年取消「新聞」標籤,且自 2022 年起停止向出版商付費,現則透過此合作強化 AI 聊天機器人對即時新聞的存取能力。Meta 強調其目標是讓 Meta AI 更即時、準確且平衡,以應對當前系統難以跟隨即時事件的挑戰,並提供多樣觀點與內容型別。此舉亦有助於 Meta 在面臨競爭對手挑戰及 Llama 4 引發效能爭議後,吸引更多使用者並維持在 AI 競賽中的相關性。Meta AI 目前已在超過 200 個國家可用,透過 Facebook、Instagram、WhatsApp、Messenger 應用程式及獨立 Meta AI 應用程式存取。
-
AWS 加大對自有 LLMs 的投入,推出簡化模型創建功能
亞馬遜雲服務(AWS)在 AWS re:Invent 會議上宣佈推出更多企業級工具,旨在簡化自訂大型語言模型(LLMs)的構建與微調過程。此次更新涵蓋 Amazon Bedrock 與 Amazon SageMaker AI 的新功能,其中 SageMaker 引入了無伺服器模型自訂能力,開發者無需擔心計算資源或基礎設施即可開始構建模型。此功能支援自導式點選操作或代理導向體驗,後者允許開發者使用自然語言提示 SageMaker AI。該功能目前處於預覽階段,適用於自訂 Amazon Nova 模型及特定開源模型,包括 DeepSeek 與 Meta 的 Llama。此外,AWS 還在 Bedrock 中推出強化微調功能,開發者可選擇獎勵函式或預設工作流,由 Bedrock 自動完成整個模型自訂流程。 此前,AWS 執行長 Matt Garman 在演講中宣佈 Nova Forge 服務,提供自訂 Nova 模型,年費為 10 萬美元。針對企業客戶希望透過自訂模型建立差異化的需求,AWS 強調自訂模型能最佳化品牌與特定使用場景。儘管 AWS 目前使用者基礎尚未大規模擴張,一項由 Menlo Ventures 於七月進行的調查顯示,企業更傾向於使用 Anthropic、OpenAI 和 Gemini 等競爭對手模型。然而,隨著自訂與微調能力的提升,AWS 有望在競爭中取得優勢。此次會議重點聚焦於前沿 LLM 與模型自訂技術,展現 AWS 在企業 AI 領域的戰略佈局。
-
迷思特以新開放權重邊境與小模型接近大型AI競爭對手
法國人工智慧新創公司 Mistral 於週二推出了全新的 Mistral 3 系列開放權重模型,旨在證明其在讓 AI 公開可用及服務企業客戶方面能超越大型科技競爭對手。此次發布包含一個具備多模態與多語言能力的 frontier 大模型,以及九個小型離線可用且可完全自訂的模型。Mistral 由前 DeepMind 與 Meta 的研究人員創立,兩年前成立,目前籌資約 27 億美元,估值為 137 億美元,遠低於競爭對手 OpenAI(籌資 570 億美元,估值 5000 億美元)與 Anthropic(籌資 450 億美元,估值 350 億美元)。Mistral 共同創辦人兼首席科學家 Guillaume Lample 指出,許多企業客戶發現直接使用大型封閉模型成本高昂且速度緩慢,因此轉向自訂小型模型以更有效率地處理特定用例。 Mistral 的大型 frontier 模型 Mistral Large 3 在功能上追平 OpenAI 的 GPT-4o 與 Google 的 Gemini 2,並具備多模態與多語言能力,與 Meta 的 Llama 3 及阿里巴巴的 Qwen3-Omni 並駕齊驅。該模型採用「精細專家混合」架構,擁有 410 億個活躍引數與 6750 億個總引數,支援 256,000 的上下文視窗,適用於檔案分析、程式編寫、內容創作及工作流自動化。新推出的 Ministral 3 系列則包含九個不同的高效能稠密模型,涵蓋 140 億、80 億與 30 億引數三種規格,並提供 Base、Instruct 與 Reasoning 三種變體。Mistral 聲稱這些小型模型在效能、成本效率及專有能力上優於其他開放權重領導者,且能產生較少的 token。 所有變體均支援視覺功能,處理 128,000 至 256,000 的上下文視窗,並支援多種語言。Mistral 強調其小型模型可在單一 GPU 上執行,使其能部署於廉價硬體,包括本地伺服器、筆記型電腦、機器人及其他邊緣裝置。這