最近,AI 圈天天有熱鬧。
昨天,黃仁勛先發(fā)了入駐社媒平臺后的第一條帖子,公開力挺開源模型。

這看起來像和老黃暗戳戳地較勁,畢竟 Claude 系列產(chǎn)品一直閉源,開源哪有賺錢香!

其實,大模型的開源和閉源,兩種路線之爭早就擺在明面上了。很多人覺得開源是大勢所趨,閉源遲早要完,但現(xiàn)實沒這么簡單。
開源模型有成本優(yōu)勢,靠部署和服務(wù)賺錢,但它的天花板也很明顯,最頂尖的能力,往往不會出現(xiàn)在開源模型里。
前沿的科研突破、最復(fù)雜的推理能力,大多時候是閉源模型先跑出來。
一邊是開源陣營敲鑼打鼓聯(lián)名造勢,一邊是閉源巨頭悶聲降價卷性能,兩相對比,相信很多人還是更關(guān)注模型的具體表現(xiàn)。
尤其這次更新的 Claude Opus 5 專門為日常工作設(shè)計,官方表示,它的運(yùn)行效率遠(yuǎn)遠(yuǎn)高于其他型號,可以說是綜合性能相當(dāng)能打的模型。



在知識型工作和問題解決類任務(wù)中,Opus 5 的測試表現(xiàn)同樣優(yōu)異。
ARC-AGI 3,用于測試模型解決全新問題的表現(xiàn),Opus 5 的得分是排名第二的模型的 3 倍。


Opus 5 能夠精準(zhǔn)可視化氣流在空氣動力學(xué)(以及非空氣動力學(xué))物體表面的流動情況。


講真,我第一反應(yīng)是:Fable 5 還有存在的必要嗎?干脆停產(chǎn)得了!
不過轉(zhuǎn)念一想,F(xiàn)able 5 和 Opus 5,或許根本就不是一個賽道的產(chǎn)品。
Fable 5 瞄準(zhǔn)極致場景,超大型科研項目、跨領(lǐng)域巨型商業(yè)規(guī)劃、長期自治的復(fù)雜 Agent,動輒幾十萬 Token 的長周期任務(wù),要的是全局統(tǒng)籌能力和極致的深度。
而 Opus 5 覆蓋的,是剩下的日常高頻場景,程序員寫代碼改 Bug、企業(yè)做文檔分析、中小型自動化辦公、普通的智能體流水線。

說白了,絕大多數(shù)人花著旗艦的錢,用的其實是次旗艦就能搞定的需求。
Opus 5 完全可以精準(zhǔn)解決這個痛點,用一半的價格,給到 99% 的旗艦體驗,把中間最龐大的用戶群體牢牢攥在手里。
同時,在部署前的測試中,通過自動化行為審計發(fā)現(xiàn),Opus 5 比 Opus 4.8、Sonnet 5 和 Fable 5 更好地遵循預(yù)先設(shè)定的準(zhǔn)則,并表現(xiàn)出最低的欺騙性行為率,并且最不容易被誤導(dǎo)而遭到濫用。
Anthropic 認(rèn)為,這可以極大程度避免可能帶來的難以逆轉(zhuǎn)的副作用,Opus 5 也是他們迄今為止最安全的模型。

Anthropic 刻意沒有讓 Opus 5 接受針對網(wǎng)絡(luò)任務(wù)的訓(xùn)練,或許正因如此,在網(wǎng)絡(luò)安全方面的表現(xiàn),Opus 5 距離 Mythos 5 還有差距。
在 OSS-Fuzz 上,評估模型在無需大量人工干預(yù)的情況下,發(fā)現(xiàn)并利用漏洞的能力,Mythos 5 和 Opus 5 在漏洞識別方面的表現(xiàn)不相上下,但 Opus 5 在漏洞利用的構(gòu)建能力上卻遠(yuǎn)遠(yuǎn)落后于 Mythos 5。

網(wǎng)絡(luò)安全賽道,Opus 5 漏洞挖掘能力很強(qiáng),逼近專業(yè)的安全模型,但寫漏洞利用程序的成功率差很多,并非模型做不到,是 Anthropic 主動限制了。
一旦檢測到高危標(biāo)記請求,系統(tǒng)會自動回落到權(quán)限更低的舊版本模型,相當(dāng)于主動給自己上了安全鎖。
在能力和安全之間主動做平衡,而不是一味堆性能,這點反而比很多只管跑分的模型,要成熟得多。
當(dāng)然,也可能是 Anthropic 對模型能力做出的硬區(qū)分,以針對個人和企業(yè)的不同需求,畢竟都便宜一半了,還要啥自行車!

對我們普通人來說,不用糾結(jié)誰是未來,誰代表正義。模型越來越強(qiáng),價格越來越實在,干活越來越靠譜,這就夠了。
至于 Opus 5 這款半價旗艦的更新,到底是常規(guī)迭代,還是應(yīng)對老黃影響力的見招拆招,以及閉源能不能擋住開源的浪潮,沒人知道。
但可以肯定的是,大模型的內(nèi)卷,已經(jīng)從拼性能,卷到了拼性價比、拼落地能力的深水區(qū)。
真正的好戲,才剛剛開始。
撰稿:SC
