實體: Claude
所有提到 Claude 的 AI 新聞與動態。
-
AI程式碼工具正轉向一個驚人的領域:終端機
近年來,Cursor、Windsurf 及 GitHub Copilot 等程式碼編輯工具一直是 AI 軟體開發的標準,但隨著代理式 AI 的興起與 Vibe Coding 的流行,AI 與軟體的互動方式正發生微妙轉變。AI 不再僅限於編輯程式碼,而是越來越多地直接與系統終端(Terminal)互動。自二月以來,Anthropic、DeepMind 和 OpenAI 分別推出了終端編碼工具 Claude Code、Gemini CLI 和 CLI Codex,這些產品已成為公司最熱門的產品之一。儘管品牌外觀相似,但其底層互動方式已發生實質變化。 知名終端評估指標 Terminal-Bench 的共同創作者 Mike Merrill 表示,未來 95% 的 LLM 與電腦互動將透過類終端介面進行。隨著傳統程式碼編輯工具面臨挑戰,例如 Windsurf 因併購糾紛導致未來不確定,且 METR 研究顯示開發者對 Cursor Pro 等工具的效率提升估計(20% 至 30%)與實際觀察(近 20% 變慢)存在落差,這為終端工具帶來了機會。目前 Warp 在 Terminal-Bench 中排名第一,其創辦人 Zach Lloyd 認為終端位於開發者棧的低層,是最具靈活性執行代理式 AI 的地方。 與專注於解決 GitHub 問題(SWE-Bench)的程式碼生成工具不同,終端工具採取更廣泛的視角,涵蓋 DevOps 任務如配置 Git 伺服器或排查指令碼無法執行的問題。Terminal-Bench 的挑戰不僅在於問題本身,更在於環境,要求 AI 具備逐步解決問題的代理式能力。儘管目前 Warp 僅解決了超過一半的問題,顯示該指標極具挑戰性,但 Lloyd 相信終端工具已能可靠處理開發者大部分非編碼工作,例如自主設定專案依賴並使其可執行,若無法完成則會告知原因。
-
馬斯克的xAI發佈Grok 4並推出每月300美元訂閱服務
埃隆·馬斯克旗下的 AI 公司 xAI 於週三晚間推出了其旗艦 AI 模型 Grok 4,並宣佈推出每月 300 美元的 SuperGrok Heavy 訂閱計劃。Grok 是 xAI 對 OpenAI 的 ChatGPT 和 Google 的 Gemini 等模型的回應,具備分析圖片和回答問題的能力。馬斯克在直播中表示,Grok 4 在學術問題上表現優於博士水平,儘管偶爾缺乏常識或尚未發明新技術,但這只是時間問題。此次發布正值馬斯克公司經歷動盪的一週,X 平臺前執行長琳達·雅卡里諾(Linda Yaccarino)剛剛辭職,而 Grok 的官方帳號此前曾發布反猶太言論並讚揚希特勒,引發爭議後被暫時限制。 Grok 4 在多個基準測試中展現前沿級表現。在「人類最後的考試」(Humanity's Last Exam)中,Grok 4 無工具得分 25.4%,超越 Google 的 Gemini 2.5 Pro(21.6%)和 OpenAI 的 o3(21%);使用工具後,Grok 4 Heavy 得分 44.4%,再次領先。在非營利組織 Arc Prize 的 ARC-AGI-2 測試中,Grok 得分 16.2%,幾乎是第二名模型 Claude Opus 4 的兩倍。xAI 還計劃在八月份推出 AI 編碼模型,九月推出多模態代理,十月推出影片生成模型。SuperGrok Heavy 訂閱計劃提供 Grok 4 Heavy 的早期預覽及新功能優先權,是目前主要 AI 供應商中最昂貴的訂閱方案。雖然 Grok 在基準測試中表現出色,但 xAI 仍需克服近期的失誤,以在企業市場與 ChatGPT、Claude 和 Gemini 競爭。
-
布洛克正利用人工智能虛擬人物模擬真實應用程式使用情境
AI 驅動的編碼工具如 Cursor、Replit、Claude Code 和 Lovable 正協助開發者每日編寫大量程式碼以加速產品發布,但應用開發者仍需依賴發布完整測試版或使用模擬軟體來評估新功能。Blok 是一家剛脫離隱形狀態的公司,允許開發者利用 AI 模擬不同使用者人設以測試應用功能並最佳化產品。該公司由 Tom Charman 和 Olivia Higgs 於 2024 年創立,兩人均為Serial entrepreneurs,曾在旅遊和學習領域共同參與過創業專案。截至目前,Blok 已籌資 750 萬美元,其中 500 萬美元的種子輪由 MaC Venture Capital 主導,參與者包括 Discord、Google、Meta、Apple、Snapchat 和 Pinterest 的員工。Pre-seed 輪則由 Protagonist 主導,參與者有 Rackhouse、Ryan Hoover 的 Weekend Fund 和 Blank Ventures。MaC Venture Capital 管理合夥人 Marlon Nichols 表示,Blok 常被與 Optimizely 和 Amplitude 相比,但後者更具反應性,而 Blok 提供預測層測試,能在寫下第一行程式碼前預測使用者行為。Higgs 指出,隨著介面複雜度增加,測試需求上升,他們曾訪談超過 100 名產品工程師以瞭解問題。Charman 表示,無論大中小企業都面臨不同挑戰,小公司缺乏測試群體,大公司則擔心功能堆疊導致應用笨重。Blok 旨在讓公司無需以實驗方式發布功能並等待數週或數月結果。客戶上傳來自 Amplitude、Mixpanel 或 Segment 的事件日誌資料,Blok 進行行為建模並建立覆蓋大部分使用者群體的人設。開發團隊提交 Figma 設計和實驗詳情後,使用者人設代理會多次執行模擬,最終提供關於使用者如何使用特定功能的洞察及改進建議,並包含整體報告、人設報告及建議。由於是 2025 年,使用者還可透過聊天機器人查詢實驗相關問題。Blok 目前將產品置於等待名單中,並與首批客戶合作,主要專注於金融和醫療領域,這些領域不適合公開進行不良實驗。公司採用 SaaS 模式收費,並正在平衡計算成本,目標今年營收達到中個位數百萬美元並拓展更多客戶。
-
Cursor 向用戶道歉因價格調整不透明引發不滿
Anysphere 執行長 Michael Truell 於週五為 Cursor 程式碼環境的定價變更溝通不當致歉。此次變更發生在 6 月 16 日,將原本每月 20 美元 Pro 計劃的權益從固定的 500 次快速響應改為每月 20 美元的使用額度,超出部分需按 API 費率額外付費。Truell 指出,由於新推出的 AI 模型如 Anthropic 的 Claude Opus 4 等,處理複雜多步驟任務時消耗的 token 數量大幅增加,導致成本上升,Cursor 舊計劃曾由公司承擔這些成本,現則轉嫁給使用者。此次調整引發許多使用者不滿,部分使用者在使用 Claude 模型時僅用幾個提示詞便耗盡額度,且因未設定支出上限而意外產生額外費用。Anysphere 承諾將為意外收費的使用者退款,並表示未來會更清晰地說明定價變動。Cursor 目前月訂閱收入(ARR)已超過 5 億美元,但面臨來自 OpenAI、Anthropic 等模型提供商的激烈競爭,後者推出的 Claude Code 等工具也吸引了部分使用者。儘管 Cursor 已與 OpenAI、Anthropic、Google 及 xAI 簽訂多年協議推出更高階的 Ultra 計劃,但模型供應商與程式碼工具之間的價格壓力與競爭關係正日益緊張。