當 Brett Levenson 在 2019 年離開 Apple,擔任 Facebook 的業務誠信總監時,這家社交媒體巨擘正處於劍橋分析醜聞的風暴中心。當時他認為,只要用更好的技術,就能解決 Facebook 的內容審核問題。然而,他很快發現,這個問題遠比技術更為深層。他表示,人審評核員被要求記住一項 40 頁的政策文件,而這份文件已經被機器翻譯成他們的語言。他們還有約 30 秒的時間,來決定 flagged 內容是否違反規則,以及該如何處理:封鎖、封禁用戶或限制傳播。根據 Levenson 的說法,這些快速的決定僅略優於 50% 的準確率。他告訴 TechCrunch:「這就像在翻硬幣,人類評核員是否能正確執行政策,而且這已經是在傷害發生後好幾天的事情了。」這種延遲且反應式的做法,在面對靈活且資金充足的對手時,是無法持續的。隨著 AI 聊天機器人的興起,這個問題更為嚴重,因為內容審核失敗導致一連串高調事件,例如聊天機器人向青少年提供自傷建議,或 AI 生成的圖像逃過安全過濾器。Levenson 的挫折促使他提出「政策即代碼」的概念——一種將靜態政策文件轉化為可執行、可更新的邏輯,並緊密結合執行的辦法。這個想法促使他創立 Moonbounce,該公司今日宣布已獲得 1200 萬美元的資金,TechCrunch 獨家得知。這筆資金由 Amplify Partners 和 StepStone Group 共同領投。Moonbounce 與企業合作,提供額外的安全層,用於任何內容生成的場合,無論是用戶還是 AI 產生的內容。該公司已訓練出自己的大型語言模型,用來分析客戶的政策文件,實時評估內容,並在 300 毫秒內做出回應並採取行動。根據客戶偏好,這項行動可以是 Moonbounce 的系統在內容等待人為評核前減緩傳播速度,或是在當下直接封鎖高風險內容。目前,Moonbounce 服務三大垂直領域:處理用戶生成內容的平台,例如交友應用;建立角色或伴侶的 AI 公司;以及 AI 圖像生成器。Levenson 表示,目前 Moonbounce 支援超過 4 億次每日評核,服務超過 1 億名每日活躍用戶。客戶包括 AI 伴侶創業公司 Channel AI、圖像與影片生成公司 Civitai,以及角色扮演平台 Dippy AI 和 Moescape。Levenson 對 TechCrunch 表示:「安全其實可以成為一種產品優勢。只是從來都不是,因為它總是被放在產品之後,而不是可以實際內建到產品中的東西。我們看到客戶正在找到非常有趣且創新的方式來使用我們的技術,讓安全成為他們產品差異化的部分。」Tinder 的信任與安全主管最近解釋了該交友平台如何透過這些大型語言模型驅動的服務,將檢測準確率提升 10 倍。Lenny Pruss,Amplify Partners 的總經理表示:「內容審核一直是困擾大型線上平台的問題,但現在隨著大型語言模型成為每個應用的核心,這個挑戰變得更加困難。我們投資 Moonbounce 是因為我們預見一個世界,其中客觀、實時的防護措施成為每個 AI 媒介應用的基礎。」在聊天機器人被指控推廣青少年與易受傷害用戶自殺,以及圖像生成器如 xAI 的 Grok 被用來創作出非情願的裸體圖像後,AI 公司正面臨日益嚴重的法律與聲譽壓力。顯而易見,內部的安全防護措施正在失敗,這也成為一項負擔。Levenson 表示,AI 公司正越來越尋求外部協助來強化安全基礎設施。他表示:「我們是第三方,介於用戶與聊天機器人之間,因此我們的系統不會像聊天本身那樣被大量上下文所淹沒。聊天機器人本身必須記住,可能有數萬個之前出現的 token……我們唯一擔心的就是在執行時強制執行規則。」Levenson 與前 Apple 同事 Ash Bhardwaj 共同經營這家 12 人公司,Ash 前任於 iPhone 廠商的核心業務中建立大規模雲端與 AI 基礎設施。他們接下來的重點是開發一種名為「迭代導向」的功能,這項功能是針對 2024 年佛羅里達州一名 14 歲男孩因沉迷於 Character AI 聊天機器人而自殺的案例所開發的。該系統將在有害話題出現時,不直接拒絕,而是干預對話並轉向,實時修改提示,讓聊天機器人朝更積極支持的方向發展。Levenson 表示:「我們希望能在行動工具中加入能力,讓系統能引導聊天機器人朝更好的方向發展,換句話說,就是修改用戶的提示,讓聊天機器人不僅只是傾聽者,更能成為有幫助的傾聽者。」當被問及是否考慮被 Meta 收購,讓他的內容審核工作回到原點時,Levenson 表示他認同 Moonbounce 在舊雇主的架構中會有很好的契合度,以及作為 CEO 的財務責任。他說:「我的投資人會說我瘋了,但我會很遺憾看到有人買下我們,然後限制這項技術。就像說:『這現在是我們的了,沒有人可以受益。』」
Facebook內部組建專案推動AI時代的內容審核機制
分享這篇文章: