电竞比分网-中国电竞赛事及体育赛事平台

關(guān)于ZAKER Skills 合作
科技狐 1小時前

Claude Opus 5 上線,性能逼近 Fable 5,價格只有一半!

最近,AI 圈天天有熱鬧。

昨天,黃仁勛先發(fā)了入駐社媒平臺后的第一條帖子,公開力挺開源模型。

沒過多久,Anthropic 緊跟著就甩出了 Claude Opus 5,號稱用一半的價格,逼近 Fable 5 的表現(xiàn)。

這看起來像和老黃暗戳戳地較勁,畢竟 Claude 系列產(chǎn)品一直閉源,開源哪有賺錢香!

其實,大模型的開源和閉源,兩種路線之爭早就擺在明面上了。很多人覺得開源是大勢所趨,閉源遲早要完,但現(xiàn)實沒這么簡單。

開源模型有成本優(yōu)勢,靠部署和服務(wù)賺錢,但它的天花板也很明顯,最頂尖的能力,往往不會出現(xiàn)在開源模型里。

前沿的科研突破、最復(fù)雜的推理能力,大多時候是閉源模型先跑出來。

一邊是開源陣營敲鑼打鼓聯(lián)名造勢,一邊是閉源巨頭悶聲降價卷性能,兩相對比,相信很多人還是更關(guān)注模型的具體表現(xiàn)。

尤其這次更新的 Claude Opus 5 專門為日常工作設(shè)計,官方表示,它的運(yùn)行效率遠(yuǎn)遠(yuǎn)高于其他型號,可以說是綜合性能相當(dāng)能打的模型。

比如 Opus 5 在軟件工程等領(lǐng)域的任務(wù)上表現(xiàn)卓越,在 Frontier-Bench v0.1 中,Opus 5 的性能優(yōu)于所有其他模型,并且在單位任務(wù)成本更低的情況下,比 Opus 4.8 的性能提升了兩倍以上。

在 CursorBench 3.2 上,用最大推理強(qiáng)度運(yùn)行模型,Opus 5 的得分僅比 Fable 5 的峰值得分低 0.5%,但單位任務(wù)的成本僅為后者的半數(shù)。

這個迭代程度,Anthropic 真是對自家模型也下死手啊!

在知識型工作和問題解決類任務(wù)中,Opus 5 的測試表現(xiàn)同樣優(yōu)異。

ARC-AGI 3,用于測試模型解決全新問題的表現(xiàn),Opus 5 的得分是排名第二的模型的 3 倍。

而在 OSWorld 2.0 這一計算機(jī)性能基準(zhǔn)測試中,Opus 5 在任何預(yù)算條件下均優(yōu)于所有其他型號,其最佳成績僅相當(dāng)于 Fable 5 的三分之一不到。

除此以外,Opus 5 還擁有更為強(qiáng)大的視覺生成能力。

Opus 5 能夠精準(zhǔn)可視化氣流在空氣動力學(xué)(以及非空氣動力學(xué))物體表面的流動情況。

以及制作精致的可交互式細(xì)胞示意圖。

價格方面,每百萬輸入 Token 收費(fèi) 5 美元,每百萬輸出 Token 收費(fèi) 25 美元,和 Opus 4.8 相同,屬于加量不加價。

講真,我第一反應(yīng)是:Fable 5 還有存在的必要嗎?干脆停產(chǎn)得了!

不過轉(zhuǎn)念一想,F(xiàn)able 5 和 Opus 5,或許根本就不是一個賽道的產(chǎn)品。

Fable 5 瞄準(zhǔn)極致場景,超大型科研項目、跨領(lǐng)域巨型商業(yè)規(guī)劃、長期自治的復(fù)雜 Agent,動輒幾十萬 Token 的長周期任務(wù),要的是全局統(tǒng)籌能力和極致的深度。

而 Opus 5 覆蓋的,是剩下的日常高頻場景,程序員寫代碼改 Bug、企業(yè)做文檔分析、中小型自動化辦公、普通的智能體流水線。

說白了,絕大多數(shù)人花著旗艦的錢,用的其實是次旗艦就能搞定的需求。

Opus 5 完全可以精準(zhǔn)解決這個痛點,用一半的價格,給到 99% 的旗艦體驗,把中間最龐大的用戶群體牢牢攥在手里。

同時,在部署前的測試中,通過自動化行為審計發(fā)現(xiàn),Opus 5 比 Opus 4.8、Sonnet 5 和 Fable 5 更好地遵循預(yù)先設(shè)定的準(zhǔn)則,并表現(xiàn)出最低的欺騙性行為率,并且最不容易被誤導(dǎo)而遭到濫用。

Anthropic 認(rèn)為,這可以極大程度避免可能帶來的難以逆轉(zhuǎn)的副作用,Opus 5 也是他們迄今為止最安全的模型。

當(dāng)然,Opus 5 也并非完全沒有短板。

Anthropic 刻意沒有讓 Opus 5 接受針對網(wǎng)絡(luò)任務(wù)的訓(xùn)練,或許正因如此,在網(wǎng)絡(luò)安全方面的表現(xiàn),Opus 5 距離 Mythos 5 還有差距。

在 OSS-Fuzz 上,評估模型在無需大量人工干預(yù)的情況下,發(fā)現(xiàn)并利用漏洞的能力,Mythos 5 和 Opus 5 在漏洞識別方面的表現(xiàn)不相上下,但 Opus 5 在漏洞利用的構(gòu)建能力上卻遠(yuǎn)遠(yuǎn)落后于 Mythos 5。

考慮到 Anthropic 有意為之,那其實這不是 Opus 5 的能力短板,而是它針對應(yīng)用場景做的一個很有意思的取舍。

網(wǎng)絡(luò)安全賽道,Opus 5 漏洞挖掘能力很強(qiáng),逼近專業(yè)的安全模型,但寫漏洞利用程序的成功率差很多,并非模型做不到,是 Anthropic 主動限制了。

一旦檢測到高危標(biāo)記請求,系統(tǒng)會自動回落到權(quán)限更低的舊版本模型,相當(dāng)于主動給自己上了安全鎖。

在能力和安全之間主動做平衡,而不是一味堆性能,這點反而比很多只管跑分的模型,要成熟得多。

當(dāng)然,也可能是 Anthropic 對模型能力做出的硬區(qū)分,以針對個人和企業(yè)的不同需求,畢竟都便宜一半了,還要啥自行車!

開源也好,閉源也罷,路線之爭最終還是要落到用戶價值上。

對我們普通人來說,不用糾結(jié)誰是未來,誰代表正義。模型越來越強(qiáng),價格越來越實在,干活越來越靠譜,這就夠了。

至于 Opus 5 這款半價旗艦的更新,到底是常規(guī)迭代,還是應(yīng)對老黃影響力的見招拆招,以及閉源能不能擋住開源的浪潮,沒人知道。

但可以肯定的是,大模型的內(nèi)卷,已經(jīng)從拼性能,卷到了拼性價比、拼落地能力的深水區(qū)。

真正的好戲,才剛剛開始。

撰稿:SC

相關(guān)閱讀

最新評論

沒有更多評論了
科技狐

科技狐

科技狐,讓科技簡單點。

訂閱

覺得文章不錯,微信掃描分享好友

掃碼分享