實體: Stable Diffusion
所有提到 Stable Diffusion 的 AI 新聞與動態。
-
馬丁·斯科西斯成為最新且最出人意料的華納兄弟AI聲援者
好萊塢傳奇導演馬丁·史柯西斯已簽約成為 AI 影像生成起點 Black Forest Labs 的合夥人與顧問,據紐約時報於週二報導。史柯西斯強調,他將僅將此技術用於故事板創作,並表示過去七十多年來一直自行製作故事板。他認為該工具能幫助他與攝影師及製片設計師更快速、高效地溝通創作構想。Black Forest Labs 是一家擁有七十名員工的公司,總部設在德國弗賴堡,而非舊金山,該地為實際黑森林最近的major城市。儘管地址獨特,該起點已為 Adobe、Canva、Microsoft 及 Meta 等公司提供影像功能,並曾被投資者以 32.5 億美元估值,其投資方包括由史柯西斯的才華經理 Rick Yorn 共同創立的 BroadLight Capital。該公司由 Stable Diffusion 團隊創立,據 Wired 報導,近期拒絕與埃隆·馬斯克旗下的 xAI 合作,此前因 Grok 影像生成器內容防護問題導致合作結束。儘管此發展僅限於特定範圍,但娛樂產業部分人士仍可能感到擔憂。這標誌著好萊塢曾經對 AI 的強烈抵制正在軟化。
-
黑森林實驗室籌得3億美元資金,企業估值達32.5億美元
德國人工智慧實驗室 Black Forest Labs 於週一宣佈完成 B 輪融資,籌得 3 億美元,估值達 32.5 億美元。該輪融資由 Salesforce Ventures 和 Anjney Midha (AMP) 共同領投,參與機構包括 a16z、NVIDIA、Northzone、Creandum、Earlybird VC、BroadLight Capital、General Catalyst、Temasek、Bain Capital Ventures、Air Street Capital、Visionaries Club、Canva 以及 Figma Ventures。公司表示將資金用於研發。Black Forest Labs 專注於開發生成與編輯圖片的基礎人工智慧模型,自 2024 年 8 月推出後迅速聞名。該公司去年因被揭露其模型被 Elon Musk 的 Grok 聊天機器人用於生成圖片而受到關注,目前 Adobe、fal.ai、Picsart、ElevenLabs、VSCO 及 Vercel 等多家公司亦在使用其模型。公司近期推出了最新版本的圖片生成模型 Flux 2,該版本據稱在文字與圖片渲染方面表現更佳,並可參考最多 10 張圖片以維持風格與語調,同時支援最高 4K 畫素的圖片生成。Black Forest Labs 的聯合創辦人 Robin Rombach、Patrick Esser 和 Andreas Blattmann 曾為 Stability AI 的 Stable Diffusion 模型開發者。
-
訊飛智慧投資五千万美元建置用於程式碼與文字的擴散模型
隨著大量資金湧入 AI 創業公司,擁有新想法的 AI 研究者現在是時候去測試了。如果想法足夠新穎,獨立公司可能比大實驗室更容易獲得所需資源。這正是 Inception 的故事,這是一家開發基於擴散模型的 AI 模型的創業公司,剛剛籌資 5000 萬美元。該輪融資由 Menlo Ventures 主導,參與機構包括 Mayfield、Innovation Endeavors、Microsoft 的 M12 基金、Snowflake Ventures、Databricks Investment 以及 Nvidia 的投資部門 NVentures。Andrew Ng 和 Andrej Karpathy 也提供了額外的天使投資。該專案的領導者是斯坦福大學教授 Stefano Ermon,他的研究專注於擴散模型,這種模型透過迭代 refinement 生成輸出,而非逐字生成。這些模型驅動了 Stable Diffusion、Midjourney 和 Sora 等基於影象的 AI 系統。Ermon 自 AI boom 之前就開始研究這些系統,現在他利用 Inception 將這些模型應用於更廣泛的任務。 與資金同時,公司推出了其 Mercury 模型的新版本,專為軟體開發設計。Mercury 已經整合進 ProxyAI、Buildglare 和 Kilo Code 等多個開發工具中。Ermon 表示,擴散方法將幫助 Inception 的模型在延遲(response time)和計算成本這兩個最重要指標上節省資源。他說,這些基於擴散的 LLM 比其他人今天構建的都要快且高效,這是一種完全不同的方法,仍有大量創新可以帶來。 理解技術差異需要一些背景知識。擴散模型在結構上與主導文字 AI 服務的自回歸模型不同。像 GPT-5 和 Gemini 這樣的自回歸模型是順次執行的,根據先前處理的材料預測下一個詞或詞片段。擴散模型是為影象生成訓練的,採用更整體的方法,逐步修改回應的整體結構,直到匹配所需結果。傳統觀點認為應使用自回歸模型處理文字應用,這對於最近一代 AI 模型非常成功。但越來越多的研究表明,當模型處理大量文字或管理資料約束時,擴散模型可能表現更好。Ermon 指出,當在大型程式碼庫上執行操作時,這些品質成為真正的優勢。 擴散模型在利用硬體方面也有更大的靈活性,這在 AI 基礎設施需求日益明顯時特別重要。自回歸
-
消息人士透露,多模態 AI 新創公司 Fal AI 已經達到 40 億美元以上的估值
Fal.ai 是一家為開發者提供影象、影片和音訊 AI 模型託管服務的創業公司,近日完成了一輪融資,估值超過 40 億美元。據知情人士透露,該輪融資約為 2.5 億美元,主要投資機構包括 Kleiner Perkins 和 Sequoia。此輪融資發生在 Fal 宣佈由 Meritech 領投的 12.5 億美元 Series C 融資不到三個月的時間。當時 Fal 的營收已突破 9500 萬美元,平臺使用者超過 200 萬開發者,而一年前其年度重複營收(ARR)僅為 1000 萬美元,開發者數量為 50 萬。Fal 提供超過 600 個影象、影片、音訊和 3D 模型,其雲端擁有數千張 Nvidia H100 和 H200 GPU,並針對快速推理進行最佳化。公司客戶涵蓋 Adobe、Canva、Perplexity 和 Shopify 等大型企業,應用場景包括廣告、電商和遊戲內容創作。Fal 的競爭優勢在於專注於媒體和多模態領域,與 Microsoft、Google 等競爭對手形成區隔。該公司由前 Coinbase 機器學習負責人 Burkay Gur 和 Amazon 開發者 Gorkem Yurtseven 於 2021 年共同創立,專注於最佳化 Stable Diffusion 並擴充套件至多模態模型託管。Fal 過往已籌資近 2 億美元,現有投資者包括 Bessemer Venture Partners、Andreessen Horowitz 等知名機構。