
但一看數(shù)據(jù)就會(huì)發(fā)現(xiàn),這款定價(jià) $5/$25(每百萬輸入 / 輸出 token)的模型,在編程、自主搜索、計(jì)算機(jī)使用、企業(yè)業(yè)務(wù)流程等多個(gè)關(guān)鍵基準(zhǔn)測試上,把定價(jià) $10/$50 的 Fable 5 給超了。而它的成本,只有 Fable 5 的一半。
Anthropic 在官方公告里表示:"Opus 5 comes close to the frontier intelligence of Claude Fable 5 at half the price",意思是接近 Fable 5 的智能,價(jià)格減半。但他們自己發(fā)布的基準(zhǔn)測試圖表顯示,Opus 5 在至少四項(xiàng)核心評測中明確領(lǐng)先 Fable 5,而且是在更低的成本下做到的。
被 " 次旗艦 " 反超的 " 旗艦 "
先看編程能力。Frontier-Bench v0.1 是當(dāng)前最直接映射企業(yè)開發(fā)團(tuán)隊(duì)實(shí)際工作的基準(zhǔn)測試之一,讓模型自己在終端里寫代碼、跑代碼、調(diào)試多文件變更。Opus 5 拿到了 43.3%,F(xiàn)able 5 是 33.7%。將近 10 個(gè)百分點(diǎn)的差距,在編程評測里屬于碾壓級別。Opus 4.8 在這個(gè)測試上是 21.1%,Opus 5 直接翻了一倍多。
在 CursorBench 3.2 上,Opus 5 在最高推理強(qiáng)度下達(dá)到 Fable 5 峰值成績的 94.5%,單次任務(wù)成本只有一半。Anthropic 還宣稱,在 high、xhigh 和 max 三個(gè)推理等級上,Opus 5 在同成本下的性能都超過了所有其他模型。Cognition(Devin 背后的公司)CEO Scott Wu 在 FrontierCode 1.1 評測后確認(rèn):"Claude Opus 5 在調(diào)試和根因分析方面以一半成本達(dá)到了接近 Fable 級別的性能。"
在自主搜索(Agentic Search)上,Opus 5 拿到 90.8%,F(xiàn)able 5 是 87.4%。十次搜索有九次以上能獨(dú)立搞定。計(jì)算機(jī)使用(OSWorld 2.0)上,Opus 5 在約三分之一成本下就超過了 Fable 5 的最優(yōu)成績。企業(yè)業(yè)務(wù)流程自動(dòng)化(Business Workflows)方面,Opus 5 拿到 26%,F(xiàn)able 5 只有 17.4%。
科學(xué)領(lǐng)域同樣不弱。Opus 5 在有機(jī)化學(xué)任務(wù)上比 Opus 4.8 高出 10.2 個(gè)百分點(diǎn)(包括從光譜數(shù)據(jù)推斷分子結(jié)構(gòu)),在蛋白質(zhì)相關(guān)任務(wù)上高出 7.7 個(gè)百分點(diǎn)(包括預(yù)測序列變異對功能的影響)。在號稱 " 人類最后考試 " 的 Humanity's Last Exam 上,開啟工具后 Opus 5 拿到 64.7%,F(xiàn)able 5 是 63.9%(不開工具時(shí)分別為 56.3% 和 56.5%),差距不到一個(gè)百分點(diǎn)。
但真正讓整個(gè) AI 研究圈停下滾動(dòng)的,是 ARC-AGI 3 的成績。
ARC-AGI 3 是 Fran ois Chollet 設(shè)計(jì)來衡量 " 流體智能 " 的基準(zhǔn)。它不是讓模型回憶訓(xùn)練數(shù)據(jù)里見過的東西,而是把它扔進(jìn)完全陌生的交互式環(huán)境里,沒有指令、沒有規(guī)則說明、沒有目標(biāo)提示,靠試錯(cuò)自己摸索。人類能完成 100% 的任務(wù)。今年 3 月 ARC Prize Foundation 發(fā)布這個(gè)基準(zhǔn)時(shí),最強(qiáng) AI 模型的得分是 0.37%(Gemini 3.1 Pro)。到 Opus 5 發(fā)布前,公開最強(qiáng)成績是 GPT-5.6 Sol 在最大推理強(qiáng)度下的 7.8%。Opus 4.8 只有 1.5%。
Opus 5 拿到了 30.2%。是 GPT-5.6 Sol 的近四倍,Opus 4.8 的二十倍。

它不只是分?jǐn)?shù)高
基準(zhǔn)數(shù)字告訴我們 Opus 5 考了多少分。但 Anthropic 公布的案例告訴了我們是它怎么考到這些分的。
Anthropic 公布了一個(gè) 3D 建模任務(wù),只給模型一張機(jī)械零件的設(shè)計(jì)圖紙,要求它自主編寫代碼重建完整的 FreeCAD 3D 模型。在 Opus 5 之前,沒有任何模型能完成這個(gè)任務(wù),即使人工提前搭好開發(fā)框架、給出詳細(xì)方案,模型依然會(huì)出錯(cuò)。Opus 5 不僅完成了全過程自主閉環(huán),還自己搭建了配套的測試工具,逐一校驗(yàn)代碼的數(shù)據(jù)解析邏輯,反復(fù)核查修正問題,直到通過驗(yàn)證。
在沒有任何人工干預(yù)的情況下,自主完成了一個(gè)完整的工程驗(yàn)證循環(huán),設(shè)定目標(biāo)、規(guī)劃步驟、編寫代碼、測試輸出、發(fā)現(xiàn)錯(cuò)誤、回溯修正、再次測試、通過。
Zapier CEO Wade Foster 透露,團(tuán)隊(duì)用 Opus 5 處理客戶健康度原始表格,要求 AI 獨(dú)立完成全套客戶流失預(yù)防流程,包括標(biāo)記高風(fēng)險(xiǎn)賬戶、通知對應(yīng)負(fù)責(zé)人、整理運(yùn)營報(bào)告。" 以前的模型沒有能完整跑通這條流程的,"Foster 說,"Opus 5 做到了 100% 完整交付。"
Box CTO Ben Kus 給出了量化對比:Opus 5 在專業(yè)企業(yè)內(nèi)容處理上整體比 Opus 4.8 提升 8%,數(shù)據(jù)分析工作流提升 11%,盡職調(diào)查提升 17%。一家金融建模團(tuán)隊(duì)的評估負(fù)責(zé)人 Richard Pham 測出了準(zhǔn)確率高 9 個(gè)百分點(diǎn),同時(shí)周轉(zhuǎn)次數(shù)少三分之一、耗時(shí)少 60%。法律 AI 團(tuán)隊(duì) Applied Research 負(fù)責(zé)人 Niko Grupen 發(fā)現(xiàn) Opus 5 在保持質(zhì)量的同時(shí),平均比 Opus 4.8 在最高推理強(qiáng)度下少生成了 26% 的 token。
更少的 token、更少的交互輪次、更少的人盯著屏幕。這就是 Opus 5 對 " 性價(jià)比 " 的真正定義。
沒人預(yù)料到的 30.2%
回到 ARC-AGI 3。這個(gè)數(shù)字的沖擊力需要放在時(shí)間線上理解。
今年 3 月,Gemini 3.1 Pro 以 0.37% 領(lǐng)先。到 Opus 5 發(fā)布前,公開最強(qiáng)成績是 GPT-5.6 Sol 在最大推理強(qiáng)度下的 7.8%。Opus 4.8 掛在 1.5%。Opus 5 發(fā)布當(dāng)天直接拉到 30.2%。Anthropic 在公告中說 Opus 5 的成績是 " 次優(yōu)模型的三倍 ",這個(gè)表述甚至可能是保守的,因?yàn)?GPT-5.6 Sol 的 7.8% 是在最大推理強(qiáng)度設(shè)置的極端資源消耗下拿到的,而 Opus 5 在標(biāo)準(zhǔn)推理設(shè)置下就做到了 30.2%。
ARC-AGI 3 它測的是遇到完全沒見過的問題時(shí)的應(yīng)變能力,Chollet 設(shè)計(jì)的邏輯是,把模型扔進(jìn)一個(gè)沒有任何參考框架的新世界,看它能不能靠自己理解規(guī)則、制定策略、達(dá)成目標(biāo)。這才是 " 通用智能 " 的真正含義。不是知識(shí)面有多廣,而是面對未知時(shí)的適應(yīng)速度有多快。
30.2% 意味著 Opus 5 在三分之一的情況下能獨(dú)立完成人類能完成的任務(wù),而這些任務(wù)是它絕對沒有在訓(xùn)練數(shù)據(jù)里遇到過同類題型的。AI 從 " 超強(qiáng)模式匹配器 " 向 " 自主推理系統(tǒng) " 的轉(zhuǎn)變,正在被量化驗(yàn)證,而不是停留在口號層面。
但更值得追問的是,為什么 Anthropic 要發(fā)布一款在核心指標(biāo)上碾壓自家 " 旗艦 " 的模型,還只賣一半的價(jià)格?
這需要看一圈 Opus 5 周圍的定價(jià)坐標(biāo)。

Anthropic 面臨的困境是,F(xiàn)able 5 的定價(jià)正在被市場拋棄,而競爭對手,尤其是 Kimi K3 的開源攻勢,正在從下方蠶食。繼續(xù)守著 Fable 5 的高價(jià)策略,等于把高頻使用場景(編程、搜索、辦公自動(dòng)化)的客戶拱手讓人。Anthropic 的選擇是,與其等競爭對手來拆,不如自己先拆。用 Opus 5 把旗艦級能力注入中端產(chǎn)品線,在性價(jià)比戰(zhàn)場正面迎戰(zhàn),同時(shí)讓 Fable 5 繼續(xù)守住 " 極致推理 " 的利基市場。
Opus 5 的商業(yè)使命可以概括為一句話,證明 Anthropic 還能收前沿溢價(jià)。而 Anthropic 給出的回答是,不收了?;蛘哒f,前沿溢價(jià)的門檻被自己抬高了。你得先在 $5/$25 這個(gè)價(jià)格點(diǎn)上拿出比 Fable 5 更強(qiáng)的編程和推理能力,才有資格談 " 溢價(jià) "。
大模型定價(jià)的邏輯,已經(jīng)不太一樣了
Opus 5 的發(fā)布,本質(zhì)上宣告了大模型行業(yè) " 越貴越強(qiáng) " 定價(jià)范式的終結(jié)。
過去兩年,行業(yè)默認(rèn)的邏輯是,更強(qiáng)的模型需要更大的參數(shù)、更多的訓(xùn)練算力、更高的推理成本,所以必然更貴。Fable 5 的 $10/$50 定價(jià)就是這條邏輯鏈的終極產(chǎn)物。我比任何人都強(qiáng),所以我可以收最貴的錢。但 Opus 5 用數(shù)據(jù)證明了一件事,更強(qiáng)的推理架構(gòu)和更高效的訓(xùn)練方法,可以讓模型在價(jià)格不變甚至更低的情況下,性能跳升一個(gè)量級。
Opus 5 的定價(jià)和 Opus 4.8 完全相同($5/$25),但 Frontier-Bench 得分從 21.1% 跳到了 43.3%,ARC-AGI 3 從 1.5% 跳到了 30.2%。同樣的價(jià)格,推理能力提升了一個(gè)量級。這不是邊際改善,是范式躍遷。
" 旗艦 " 這個(gè)詞本身的含義正在被重新定義。當(dāng)一款 $5/$25 的模型能在你每天實(shí)際使用的場景里跑贏 $10/$50 的模型," 旗艦 " 就從一個(gè)能力標(biāo)簽變成了一個(gè)價(jià)格標(biāo)簽,而價(jià)格標(biāo)簽是最容易被競爭對手撕掉的。
這給整個(gè)行業(yè)傳遞了一個(gè)清晰的信號:如果你今天的旗艦?zāi)P筒荒茉谛噬铣掷m(xù)拉開代差,明天就會(huì)有一個(gè)價(jià)格只有你一半的模型在功能上超越你。Anthropic 今天自己動(dòng)手拆掉了自己的價(jià)格金字塔,意味著它已經(jīng)預(yù)判到了這個(gè)趨勢不可逆轉(zhuǎn),選擇主動(dòng)引領(lǐng)而不是被動(dòng)防守。
對于企業(yè)用戶來說,Opus 5 是 2026 年迄今為止最值得認(rèn)真評估的 AI 投入。在編程輔助(尤其是 Claude Code 和 Cursor 等 IDE 場景)、自動(dòng)化辦公(Zapier 等平臺(tái))、數(shù)據(jù)分析、科學(xué)研究等高頻使用場景中,$5/$25 的定價(jià)結(jié)合超越 Fable 5 的性能,構(gòu)成了當(dāng)前市場上最清晰的性價(jià)比錨點(diǎn)。
但真正的變量在 7 月 27 日,Kimi K3 開源全部權(quán)重。當(dāng)一個(gè) 2.8T 參數(shù)的模型可以免費(fèi)部署、自由修改,且性能已經(jīng)逼近前沿,整個(gè)行業(yè)的定價(jià)地板將再次被擊穿。Opus 5 證明了 " 可以更便宜地做得更好 ",而 Kimi K3 即將證明 " 可以幾乎免費(fèi)地做得差不多 "。兩條線同時(shí)推進(jìn),留給任何一家 AI 公司維持高溢價(jià)的窗口期,正在以天為單位收窄。
當(dāng)一家公司開始用中端型號的價(jià)格賣旗艦級別的性能,這表明與其等對手來拆你的定價(jià),不如自己先把牌桌掀了。
(本文首發(fā)鈦媒體 APP,作者 | AGI-Signal,編輯 | 秦聰慧)