电竞比分网-中国电竞赛事及体育赛事平台

關(guān)于ZAKER Skills 合作
極客公園 昨天

從「視覺(jué)生成」到「世界生成」:智象未來(lái)三個(gè)月融資超 21 億,躋身獨(dú)角獸

從視覺(jué)理解到生成世界,這條路他們走了二十多年。

作者|徐珊

編輯|鄭玄

2017 年,微軟亞洲研究院。梅濤帶著姚霆等團(tuán)隊(duì)做出了全球最早的文生視頻模型之一,當(dāng)時(shí)無(wú)人問(wèn)津。

九年后的這個(gè)夏天,同一群人創(chuàng)辦的公司三個(gè)月融了超 20 億,估值突破 10 億美金,成為獨(dú)角獸企業(yè)。

7 月 15 日,智象未來(lái)宣布完成 15 億元 C 輪融資,本輪融資由社?;鹚拇ㄕ衽d科創(chuàng)基金、工銀資本、弘頤資管、敦鴻資本聯(lián)合領(lǐng)投,廈門(mén)國(guó)貿(mào)資本、上影新視野基金、華策影視等多家機(jī)構(gòu)跟投。老股東合肥產(chǎn)投、東方富海等科技投資機(jī)構(gòu)持續(xù)加注。

智象未來(lái)成立于 2023 年,試圖通過(guò)自研原生全模態(tài)世界模型,讓 AI 不再只是生成圖像、視頻和 3D 內(nèi)容,而是在統(tǒng)一架構(gòu)中理解空間、時(shí)間、運(yùn)動(dòng)與物體關(guān)系,讓 AI 從視覺(jué)內(nèi)容生成,走向?qū)ΜF(xiàn)實(shí)世界的理解、預(yù)測(cè)與重構(gòu)。

創(chuàng)始人梅濤是加拿大工程院外籍院士,曾先后在微軟亞洲研究院和京東工作多年,作為創(chuàng)業(yè)家的另一面,他其實(shí)也是國(guó)際四大學(xué)會(huì) Fellow 的知名人工智能學(xué)者。

智象所在的視覺(jué)模型賽道,是當(dāng)下競(jìng)爭(zhēng)最激烈的戰(zhàn)場(chǎng)之一。幾個(gè)月前,就連背靠 OpenAI 的 Sora,都在上線兩年后關(guān)停。但 Sora 的失敗并沒(méi)有給視覺(jué)賽道降溫,近期快手為可靈完成上限 30 億美元的增資,國(guó)內(nèi)視頻生成廠商也先后拿到大額融資,產(chǎn)業(yè)明顯開(kāi)始更關(guān)注多模態(tài)大模型的架構(gòu)創(chuàng)新、工程化能力和商業(yè)落地。

不過(guò),這輪融資中更值得關(guān)注的或許是給錢(qián)的人。公開(kāi)信息顯示 , 這是社?;鹱鳛?LP 首次投資多模態(tài)大模型方向的公司,更是工銀資本第一次出手多模態(tài)大模型企業(yè)。跟投名單里,還站著來(lái)自安徽、上海、浙江、福建、湖南多地的國(guó)資,以及上影股份和華策影視兩家頭部影視上市公司。

熱錢(qián)追風(fēng)口,慢錢(qián)認(rèn)路線。當(dāng)最慢的錢(qián)不約而同開(kāi)始為一家大模型公司下注,我們好奇,這些人在智象未來(lái)身上看到了什么?

01

「模型把所見(jiàn)的東西都記住,

甚至復(fù)刻出來(lái)」

理解智象未來(lái)的不同,要先理解一張圖是怎么被生成出來(lái)的。想讓 AI 學(xué)會(huì)生成圖像,得先讓它「看」圖。怎么看,行業(yè)分成了兩派。

主流的行業(yè)做法,相當(dāng)于讓模型隔著一層毛玻璃看世界:圖片先被壓縮,變小、變糊,再喂給模型;文字則由另一個(gè)模塊單獨(dú)處理,兩邊各學(xué)各的,最后拼在一起出結(jié)果。這么做省算力,訓(xùn)練快,所以幾乎所有文生圖模型都這么干。但信息一旦被壓縮,細(xì)節(jié)也就丟了,補(bǔ)不回來(lái)。

智象干脆把毛玻璃拆了,不壓縮,讓模型直接看原圖,圖片和文字也不再分開(kāi)處理,一起交給同一套自研的原生全模態(tài)架構(gòu)— UiT(Unified Transformer),讓它一邊看、一邊學(xué)著畫(huà)。模型記住的,是世界本來(lái)的樣子?!肝蚁MP桶阉?jiàn)的東西都記住,甚至復(fù)刻出來(lái)?!怪窍笪磥?lái) CTO 姚霆對(duì)極客公園說(shuō)道。當(dāng)然,看得越清楚,學(xué)得越費(fèi)勁,模型更大,更吃數(shù)據(jù),訓(xùn)練也更慢。

圖片由 HiDream-O1-Image-1.5 模型生成|來(lái)源:智象未來(lái)

選擇這條路線背后,同樣也離不開(kāi)智象對(duì)「世界模型」的獨(dú)特理解。

過(guò)去,人們常討論的多模態(tài)模型主要是在語(yǔ)言模型之外掛上圖片理解、再補(bǔ)一個(gè)生成模塊,重心仍在文字。而智象說(shuō)的原生全模態(tài),重心壓在所有模態(tài)從原始信號(hào)出發(fā),進(jìn)行端到端的全模態(tài)對(duì)齊:用一個(gè)神經(jīng)網(wǎng)絡(luò),同時(shí)理解和生成文本、圖像、視頻、3D 以及動(dòng)作,各個(gè)模態(tài)不單獨(dú)編碼,而是統(tǒng)一 tokenization,端到端地在同一套網(wǎng)絡(luò)里完成。

下一代大模型競(jìng)爭(zhēng)的關(guān)鍵,不是單一模態(tài)能力的疊加,而是能否從多模態(tài)走向全模態(tài),以原生統(tǒng)一架構(gòu)對(duì)真實(shí)物理世界進(jìn)行統(tǒng)一建模,構(gòu)建原生全模態(tài)世界模型,這是我們篤定的路線和方向?!怪窍笪磥?lái)創(chuàng)始人兼 CEO 梅濤說(shuō)道。他認(rèn)為通往世界模型尚未收斂,目前主要有三條分岔路:一條路線以 3D 原生模型切入,強(qiáng)調(diào)空間一致性;另外一條從 Sora、Veo、Seedance 等多模態(tài)視頻模型切入,用視頻生成逼近世界模擬;也有人沿著具身智能路線推進(jìn),從 JEPA、VLA 到 WAM,試圖解決動(dòng)作規(guī)劃、物理交互和長(zhǎng)程決策。

比如說(shuō),谷歌是目前全模態(tài)上走得非??壳暗墓?,文本是它最強(qiáng)的地方之一,所以它會(huì)沿著 Gemini 的文本架構(gòu)去擴(kuò)充其他模態(tài);智象則從自己積累最深的視覺(jué)像素出發(fā),以此為底座向外生長(zhǎng)。「每家公司一定要立足自己的稟賦,去做自己的判斷。兩條路無(wú)關(guān)對(duì)錯(cuò),分出的只是各自能觸到的天花板?!挂f(shuō)道。

天花板是有價(jià)碼的。架構(gòu)切換之前,團(tuán)隊(duì)內(nèi)部有過(guò)一場(chǎng)關(guān)鍵討論:到底沿著原來(lái)的隱式表達(dá)繼續(xù)做,拿個(gè) 80 分的效果就知足了,還是換「像素」路線,爭(zhēng)取沖擊 90 分的機(jī)會(huì)?!缸?90 分是有代價(jià)的,這條路本來(lái)就不那么容易走通,甚至可能做不成。」姚霆說(shuō)道。在模型企業(yè)創(chuàng)業(yè)的早期,團(tuán)隊(duì)往往會(huì)遇到很多選擇的問(wèn)題,幾番糾結(jié)后,在正確而難和容易見(jiàn)效的路線上,他們選了前者。

賭注的第一筆回報(bào)落在模型榜單上。采用 UiT 架構(gòu)的 HiDream-O1-Image 開(kāi)源版本,今年 5 月登頂全球獨(dú)立模型評(píng)測(cè)平臺(tái) Artificial Analysis 文生圖榜單開(kāi)源模型全球第一,也是該榜單排名前 20 的模型中公開(kāi)參數(shù)最小的模型版本;6 月,商用版 HiDream-O1-Image-1.5 再次成為該榜單排名最高的中國(guó)圖像模型,位列全球前三,在光影、復(fù)雜構(gòu)圖、指令跟隨和中英文字渲染上表現(xiàn)突出。這也是原生全模態(tài)架構(gòu)第一次從「技術(shù)驗(yàn)證」走到「生產(chǎn)驗(yàn)證」。

數(shù)據(jù)來(lái)源:以上榜單截圖時(shí)間為 2026 年 6 月 22 日

但榜單第一說(shuō)服不了客戶,架構(gòu)創(chuàng)新是入場(chǎng)券,真正的問(wèn)題是誰(shuí)買(mǎi)單 ?

02

模型是底座,Know-How 才是賣(mài)點(diǎn)

幾乎所有的創(chuàng)業(yè)團(tuán)隊(duì)都離不開(kāi)一個(gè)究極問(wèn)題:為什么你能做,但大廠不能做。

智象未來(lái)對(duì)此的破題思路很清晰。首先,沒(méi)有任何企業(yè)能夠做出一個(gè)完美的模型;其次,沒(méi)有哪家企業(yè)不能做什么模型,不過(guò)是時(shí)間、資源、金錢(qián)投入的力度和選擇的方向。因此,在多模態(tài)視頻賽道,考驗(yàn)的更多的是認(rèn)知理解,也是關(guān)鍵選擇?!肝覀儗?duì)行業(yè)的認(rèn)知理解比其他人要領(lǐng)先行業(yè)三到六個(gè)月,這就是我們的優(yōu)勢(shì)所在。」姚霆分析道。

但認(rèn)知領(lǐng)先無(wú)法直接「開(kāi)發(fā)票」,它必須先變成產(chǎn)品,再變成交付,最后變成客戶愿意續(xù)約的理由。

在智象看來(lái),其針對(duì) OPC 產(chǎn)品的內(nèi)容創(chuàng)作智能體 vivago 是天然的模型驗(yàn)證場(chǎng)。「C 端產(chǎn)品就是一個(gè)放大器。5000 萬(wàn)用戶的日常使用,把實(shí)驗(yàn)室里看不見(jiàn)的問(wèn)題成規(guī)模地暴露出來(lái);解決這些問(wèn)題的過(guò)程,就是理解模型落進(jìn)產(chǎn)業(yè)會(huì)碰到什么的過(guò)程?!挂f(shuō)。這是 vivago 好用的原因,也是這套架構(gòu)能持續(xù)轉(zhuǎn)動(dòng)的原因。

vivago 生成 |來(lái)源:智象未來(lái)

5 月 17 日,vivago 在全球頂級(jí)科技產(chǎn)品首發(fā)平臺(tái)、美國(guó)硅谷產(chǎn)品風(fēng)向標(biāo) Product Hunt 上,位列日榜第一,如今 vivago 積累了超 5000 萬(wàn)用戶。在剛剛結(jié)束的 WAIC 2026 上,智象未來(lái)將 vivago 升級(jí)為全球首個(gè)具備無(wú)限時(shí)長(zhǎng)視頻生成與編輯能力的多模態(tài)創(chuàng)作智能體 vivago R1,提高了智能體的長(zhǎng)程推理能力。這也說(shuō)明了 AI 能從輔助生成單點(diǎn)素材的工具,成長(zhǎng)為能自主規(guī)劃、調(diào)度并完成長(zhǎng)鏈路創(chuàng)作任務(wù)的「AI 搭子」。

以下視頻來(lái)源于

HiDream 智象未來(lái)

,時(shí)長(zhǎng) 01:21

vivago |來(lái)源:智象未來(lái)

「這個(gè)數(shù)字的大部分貢獻(xiàn)不僅來(lái)自模型能力的本質(zhì)區(qū)別,也來(lái)自對(duì)影視制作流程的理解能力,比如說(shuō),分鏡怎么拆,敘事怎么接,策略怎么寫(xiě)?!挂J(rèn)為行業(yè) Know-How 會(huì)被沉淀成一個(gè)個(gè) Skill,長(zhǎng)在模型之上。

不僅如此,智象未來(lái)研發(fā)的 AI 創(chuàng)作智能體「幀贊」累計(jì)制作短漫劇超過(guò) 5000 分鐘,,平臺(tái)入駐專業(yè)團(tuán)隊(duì)近千家。

商業(yè)營(yíng)銷方向上,商業(yè)營(yíng)銷智能體 HiBurst,已覆蓋跨境電商內(nèi)容營(yíng)銷、媒體運(yùn)營(yíng)和應(yīng)用出海等場(chǎng)景,支持 TikTok、Meta、抖音、小紅書(shū)等主流平臺(tái),并成為 TikTok 官方 top 5 服務(wù)商,年生產(chǎn)電商營(yíng)銷視頻超過(guò)百萬(wàn)條,覆蓋 GMV 已超億元。

這些成果也意味著,如今視覺(jué)模型的出路 , 不再是過(guò)去語(yǔ)言模型那樣單一賣(mài)通用 API,而是「專屬模型 + 工作流 + 結(jié)果交付」,一旦和客戶的素材庫(kù)、業(yè)務(wù)系統(tǒng)、協(xié)作流程綁定,遷移成本就立起來(lái)了?!?strong>影視公司真正需要的不是單點(diǎn)生成能力,而是能理解鏡頭語(yǔ)言、敘事節(jié)奏,并進(jìn)入劇本評(píng)估、視覺(jué)預(yù)演、后期制作等真實(shí)流程的協(xié)同系統(tǒng)。這也是 AI 從工具走向產(chǎn)業(yè)工作流的關(guān)鍵。華策影視副總裁張思拓談及為何投資智象未來(lái)時(shí)說(shuō)道。

最直觀的體現(xiàn)是營(yíng)收增速。從 2025 年開(kāi)始年商業(yè)化收入持續(xù)快速增長(zhǎng),其中企業(yè)業(yè)務(wù)的占比更高,也說(shuō)明其訂單來(lái)自長(zhǎng)期愿意續(xù)約的企業(yè)客戶,更為穩(wěn)定。

如果用一句話概括這門(mén)生意:語(yǔ)言模型賣(mài)的是 Token,智象賣(mài)的是結(jié)果。而能把結(jié)果賣(mài)出去,靠的不是這四年,是過(guò)去的二十年。

03

視覺(jué)理解這件事,他們做了二十余年

中國(guó) AI 創(chuàng)業(yè)公司大多有個(gè)「隱疾」,會(huì)寫(xiě)論文的不懂產(chǎn)業(yè),懂產(chǎn)業(yè)的技術(shù)總是靠拿來(lái)主義。但想要同時(shí)會(huì)技術(shù)創(chuàng)新、又能做出好的產(chǎn)品,就要求同一群人先后在最好的實(shí)驗(yàn)室和競(jìng)爭(zhēng)最激烈的產(chǎn)業(yè)里各泡上幾年。智象未來(lái)對(duì)視覺(jué)產(chǎn)業(yè)的理解,正是這樣泡出來(lái)的。

開(kāi)頭那個(gè) 2017 年時(shí)刻,只是這群人二十年長(zhǎng)跑中的一步。他們是投身中國(guó)視覺(jué)研究的頭一批人,在微軟亞研院做圖像搜索、支撐 Bing 和小冰,對(duì)手常年是谷歌與伯克利?!肝覀兲烊坏某砷L(zhǎng)基因里,就是希望做全世界最好的視覺(jué)模型?!挂f(shuō)。

2018 年,這群人做了一個(gè)學(xué)院派中罕見(jiàn)的選擇,加入京東。此后五年是一段學(xué)術(shù)和產(chǎn)業(yè)緊密融合的歲月,他們?cè)诰〇|做拍照購(gòu)項(xiàng)目,實(shí)現(xiàn) 10 億級(jí)別全圖庫(kù)秒級(jí)檢索,這個(gè)功能至今仍然是京東 APP 首頁(yè)上使用量超高的一個(gè)用戶入口;讓京東亞洲一號(hào)物流倉(cāng)里兩套 7×24 小時(shí)機(jī)械臂實(shí)現(xiàn)了持續(xù)的穩(wěn)態(tài)運(yùn)營(yíng),支持 10 萬(wàn) +SKU 的揀選——只有真正深入過(guò)具身工業(yè)應(yīng)用的行業(yè),才知道這意味著什么。

有關(guān)產(chǎn)業(yè)的知識(shí)在快速積累。大客戶為什么買(mǎi)單,產(chǎn)線容忍什么誤差,一個(gè)模型從驚艷的 Demo 到敢簽合同的產(chǎn)品之間,要填多少坑。中國(guó) AI 行業(yè)后來(lái)反復(fù)需要驗(yàn)證的一課,他們花了五年去學(xué)習(xí)。最后發(fā)現(xiàn),技術(shù)的價(jià)值,最終以交付的形態(tài)存在。

所以 2023 年的創(chuàng)業(yè),是這群人終于等到了自己的時(shí)代?!父h(yuǎn)的 AI for Science 我們參與不了,只能見(jiàn)證;而視覺(jué)生成,是我們堅(jiān)持做了二十年的事,應(yīng)該在場(chǎng)?!姑窛崖殬I(yè)生涯再次押進(jìn)最熟悉的領(lǐng)域。

智象未來(lái) 創(chuàng)始人兼 CEO 梅濤 |來(lái)源:智象未來(lái)

有意思的是,在智象未來(lái)內(nèi)部,學(xué)術(shù)氛圍仍然明顯。技術(shù)團(tuán)隊(duì)的專業(yè)交流氛圍仍是師生式的,姚霆、潘博這些核心成員之間,稱呼和做事的方式仍保留實(shí)驗(yàn)室的習(xí)慣;企業(yè)背后也站著中科大的產(chǎn)學(xué)脈絡(luò),種子輪甚至都是十五位科大校友湊的錢(qián)。來(lái)到產(chǎn)業(yè)后,他們也沒(méi)放棄對(duì)創(chuàng)新的研究。

「不過(guò),如果只按純科研的心態(tài)做,很難落地,這個(gè)時(shí)候我會(huì) push 自己往前走半步?!挂勂鹱约簭膶W(xué)界走入產(chǎn)業(yè)界時(shí)調(diào)整姿態(tài)的方式。

四年四換架構(gòu)的大膽與創(chuàng)新,和五千分鐘短劇的耐心,體現(xiàn)在這同一群人身上并不矛盾。而現(xiàn)在,有人愿意為這兩面同時(shí)下注了。

04

國(guó)家隊(duì)入場(chǎng)后,下一站瞄準(zhǔn) IPO

回到開(kāi)頭那個(gè)問(wèn)題:國(guó)家隊(duì)的慢錢(qián)到底看到了什么?

除了常見(jiàn)的企業(yè)敘事,我們發(fā)現(xiàn)這輪融資最強(qiáng)的信號(hào),其實(shí)是國(guó)家隊(duì)的入場(chǎng)姿態(tài)。工銀資本此前從未碰過(guò)多模態(tài)大模型,這類資本決策周期以年計(jì),多出現(xiàn)在半導(dǎo)體、存儲(chǔ)、儲(chǔ)能公司的股東名單里,這類資本往往押注的是一個(gè)時(shí)代的關(guān)鍵判斷。

在產(chǎn)業(yè)上,國(guó)資的偏好向來(lái)明確:投一家公司,最好能撬動(dòng)幾條產(chǎn)業(yè)鏈。視覺(jué)恰好是大模型里離產(chǎn)業(yè)最近的一層,影視、文旅、營(yíng)銷、電商都是現(xiàn)成場(chǎng)景;而智象交出的成果,又都經(jīng)得起逐項(xiàng)驗(yàn)收。錢(qián)穿過(guò)公司,落進(jìn)產(chǎn)業(yè),能用一個(gè)支點(diǎn)帶起一片規(guī)模。

在路線上,谷歌正把全模態(tài)收進(jìn) Gemini 這一張網(wǎng)中,Sora 退場(chǎng)之后,窗口期內(nèi),國(guó)內(nèi)需要有從架構(gòu)層就完全自研的公司站上視覺(jué)模型主賽道的牌桌。智象砍掉 VAE、把像素與文本統(tǒng)一進(jìn)一套網(wǎng)絡(luò)的 UiT,成為其核心技術(shù)自研的支點(diǎn)。

對(duì)公司自己,這份股東名單也是一份隱形的背書(shū)。B 端客戶簽約前掂量的,是一家創(chuàng)業(yè)公司靠不靠得住、能走多遠(yuǎn),國(guó)家級(jí)資本的入局,本身就是一種市場(chǎng)信任的背書(shū)。

隨著賽道整體轉(zhuǎn)入上市競(jìng)賽。本次融資的同時(shí),智象未來(lái)已經(jīng)悄然完成股改,第三方企查查平臺(tái)的工商資料顯示,智象未來(lái)的合肥主體已經(jīng)正式更名為智象未來(lái)(合肥)科技股份有限公司。接下來(lái),它要做的,是將技術(shù)積累與商業(yè)落地轉(zhuǎn)化為持續(xù)穩(wěn)健的增長(zhǎng),在多模態(tài)大模型賽道的資本角逐中,以第一梯隊(duì)的姿態(tài)進(jìn)入下一輪競(jìng)賽

* 頭圖來(lái)源:智象未來(lái)

本文為極客公園原創(chuàng)文章,轉(zhuǎn)載請(qǐng)聯(lián)系極客君微信 geekparkGO

相關(guān)標(biāo)簽

相關(guān)閱讀

最新評(píng)論

沒(méi)有更多評(píng)論了
極客公園

極客公園

這里匯聚著優(yōu)秀的產(chǎn)品觀察報(bào)道、高質(zhì)量的線下活動(dòng)

訂閱

覺(jué)得文章不錯(cuò),微信掃描分享好友

掃碼分享