過去要區分人為創作與AI生成的圖像還相對簡單 —— 去年這時候,你還無法用圖像模型為墨西哥餐廳設計菜單,而不會創造出像「enchuita」、「churiros」、「burrto」、「margartas」這樣的新料理。現在,當我請剛推出的ChatGPT Images 2.0模型為我產生一份墨西哥料理的菜單時,它所創造出的內容看起來就像是可以直接用在餐廳裡,顧客也看不出有任何問題。(不過,13.5美元的酸橘魚可能會讓我質疑魚的新鮮度。)圖片來源:ChatGPT Images 2.0
作為比較,這是兩年前我用DALL-E 3產生的結果(當時ChatGPT還無法產生圖像):圖片來源:Microsoft Designer(DALL-E 3)
歷來AI圖像生成器在拼寫方面都比較吃力,因為它們通常使用擴散模型,這種模型運作方式是透過從噪音中重建圖像。Asmelash Teka Hadgu,Lesan AI創辦人兼首席執行官告訴TechCrunch在2024年時表示:「擴散模型……是在重建一個給定的輸入,我們可以假設圖像上的文字是非常、非常小的一部分,因此圖像生成器會學習這些覆蓋更多像素的模式。」研究人員隨後探討了其他圖像生成機制,例如自回归模型,這種模型會預測圖像應該長什麼樣子,運作方式更接近LLM。不幸的是,OpenAI這個星期在一次記者會上拒絕回答有關ChatGPT Images 2.0使用什麼樣型模型的問題。該公司雖然說明新模型擁有「思考能力」,這讓它能夠在網路上搜尋、根據一個提示產生多張圖像,並檢查自己的創作 —— 這讓Images 2.0可以產生不同尺寸的行銷素材,以及多格漫畫條帶。OpenAI也表示,這個模型對於日文、韓文、印地文和孟加拉文中非拉丁文字的顯示有更強的理解能力。這個模型的知識截止於2025年12月,這可能會影響它產生某些與近期新聞相關提示的準確度。OpenAI在一份聲明中表示:「Images 2.0為圖像創作帶來了前所未有的細節與忠實度。它不僅能夠構思更複雜的圖像,還能實際將這個視覺呈現出來,能遵循指示、保留所要求的細節,並呈現經常讓圖像模型失敗的細節元素:小文字、圖示、UI元素、密集的構圖,以及微妙的風格限制,所有這些都能在最高達2K解析度下完成。」這些能力意味著圖像生成不像向ChatGPT提問那樣快速,但產生像多格漫畫這樣複雜的內容仍然只需要幾分鐘。所有ChatGPT與Codex用戶從星期二開始都能使用Images 2.0;付費用戶則能產生更複雜的輸出。該公司也會推出gpt-image-2 API,價格則根據輸出的品質與解析度而定。
ChatGPT 新推出的 Images 2.0 模型在生成文字方面意外表現出色
分享這篇文章: