實體: DALL-E
所有提到 DALL-E 的 AI 新聞與動態。
-
ComfyUI 資產估值達 5 億美元 創作者追求對 AI 生成內容的更多掌控
美國開源專案 ComfyUI 已轉型為正式創業公司,並完成融資。該專案由 Craft Ventures 主導,Pace Capital、Chemistry 和 TruArrow 等機構參與,總額達 3000 萬美元,估值為 5 億美元。ComfyUI 始於 2023 年,旨在解決早期擴散模型如 Midjourney 和 OpenAI 的 DALL-E 在生成影象時常出現錯誤(例如多指)的問題。其節點式工作流讓創作者能對生成過程進行精細控制。2024 年底,ComfyUI 又從 Chemistry Ventures、Cursor Capital 及 Vercel 創辦人 Guillermo Rauch 處獲得 1900 萬美元 A 輪融資。創始人 Yoland Yan 指出,傳統提示式工具如 Midjourney 或 ChatGPT 僅能滿足 60% 至 80% 的需求,而 ComfyUI 能處理剩餘的 20%,避免像玩老虎機般隨機重試。目前該工具擁有超過 400 萬使用者,廣泛應用於視覺特效、動畫、廣告及工業設計領域,甚至出現「ComfyUI 工程師」等職位。Yan 認為在 AI 垃圾遍佈的未來,人類在迴路模式將勝出,ComfyUI 將持續高需求。其競爭對手包括去年被 Figma 收購的 Weavy。
-
ChatGPT 新推出的 Images 2.0 模型在生成文字方面意外表現出色
過去兩年間,區分人類製圖與 AI 生成影象曾相當容易,因為早期的模型難以拼寫文字或創造合理的選單。然而,新的 ChatGPT Images 2.0 模型已能生成看似真實的墨西哥餐廳選單,甚至連價格標籤如 $13.50 的 Ceviche 都包含在內,僅需消費者自行判斷品質。與兩年前 DALL-E 3 無法生成文字的情況相比,該模型展現了顯著進步。 技術上,傳統擴散模型因專注於重建畫素而難以處理文字,但新模型可能採用類似大型語言模型的自回歸機制,並具備「思考能力」,能搜尋網路、從單一提示生成多張影象並自我檢查。OpenAI 表示,該模型對日文、韓文、印地語等非拉丁文字的理解更強,且能處理小字、圖示及 UI 元素等細節,最高支援 2K 解析度。模型知識截止於 2025 年 12 月,這可能影響對近期新聞的準確性。 OpenAI 確認,所有 ChatGPT 和 Codex 使用者將於週二起可存取 Images 2.0,付費使用者可生成更進階內容。公司亦將推出 gpt-image-2 API,定價取決於輸出品質與解析度。儘管生成複雜影象如多格漫畫需數分鐘,但其精確度與忠實度已達前所未有的水平,能有效將構想轉化為具細部元素的視覺作品。
-
OpenAI 調整 ChatGPT 人格背後的研究團隊結構
OpenAI 正在重新組織其模型行為團隊,這是一個由約 14 名研究人員組成的小型但具影響力的團隊,負責塑造公司 AI 模型與人類互動的方式。根據 TechCrunch 獲悉的 8 月內部郵件內容,首席研究員 Mark Chen 表示,該團隊將併入負責模型初訓後改進的後訓練團隊,並直接向後訓練負責人 Max Schwarzer 匯報。團隊創始人 Joanne Jang 也即將離開該職位,轉而啟動一個名為 OAI Labs 的新研究專案,專注於開發人們與 AI 協作的新型介面。 模型行為團隊自 GPT-4 以來一直參與所有 OpenAI 模型的開發,包括 GPT-4o、GPT-4.5 及 GPT-5。該團隊的核心任務是塑造 AI 的個性,並減少阿諛奉承行為,即模型過度迎合使用者觀點而非提供平衡回應。近期 OpenAI 因 GPT-5 被指個性變冷而引發爭議,導致公司恢復部分舊模型並更新 GPT-5 使其回應更溫暖友善。此外,該團隊還處理了模型回應中的政治偏見,並協助定義 AI 意識的立場。 Joanne Jang 表示,OAI Labs 將探索超越對話正規化的新模式,將 AI 視為思考、創作、娛樂、學習與連結的工具。她曾於 2025 年 9 月 5 日在 X 平臺宣佈此變動,並提及可能與現任 OpenAI 硬體專案負責人 Jony Ive 合作。Jang 在 OpenAI 服務近四年,此前參與過 Dall-E 2 等專案。此次組織調整反映 OpenAI 將 AI 個性視為技術演進的關鍵因素,同時回應社會對 AI 行為的關注,包括 2025 年 8 月因 ChatGPT 被指未能阻止 16 歲少年 Adam Raine 自殺念頭而引發的訴訟。
-
前谷歌員工創辦的AI創業公司OpenArt現已透過單鍵產生「腦腐」視頻
由前 Google 員工於 2022 年創立的 OpenArt 公司正推動 AI 生成「腦洞」影片趨勢,該平臺擁有約 600 萬月活躍使用者。近期推出的「一鍵故事」功能允許使用者輸入單句、指令碼或歌曲,即可在 60 秒內生成包含故事架構的影片,涵蓋 TikTok 輕輕鬆鬆故事或 YouTube 音樂影片等型別。此功能提供角色 Vlog、音樂影片與說明影片三種模板,使用者可上傳角色圖片或歌曲來生成動畫,並透過編輯器調整提示詞以最佳化結果。平臺整合超過 50 個 AI 模型,包括 DALLE-3、GPT、Imagen、Flux Kontext 和 Stable Diffusion 等工具。 儘管該功能旨在降低 AI 創作者門檻,但涉及智慧財產權風險。例如,若使用皮卡丘、史努比等受版權保護角色,可能面臨侵權訴訟。OpenArt 共同創辦人兼執行長 Coco Mao 表示,系統預設會拒絕生成受版權保護的角色,但偶爾仍可能發生疏漏。公司正開放與大型智慧財產權持有者洽談授權事宜。OpenArt 強調其核心優勢在於維持角色一致性,確保視覺與敘事在整部影片中保持連貫,避免使用者需自行拼湊片段的問題。 未來,公司計劃讓使用者建立兩個角色對話的影片,並開發手機應用程式。OpenArt 採用計費制,提供四種訂閱方案:基礎版每月 14 美元含 4000 信用點,包含最多四個一鍵故事、40 部影片、4000 張圖片及四個角色;進階版每月 30 美元含 12000 信用點,最多 12 個一鍵故事;無限版每月 56 美元含 24000 信用點;另有團隊版每成員每月 35 美元。截至目前,公司已籌資 500 萬美元,來自 Basis Set Ventures 和 DCM Ventures,並擁有正向現金流,預計年度營收將超過 2000 萬美元。