咨詢服務(wù)熱線:400-099-8848
姚順雨重整騰訊多模態(tài)道路:靠攏梁文鋒,遠離李飛飛 |
| 發(fā)布時間:2026-08-19 文章來源:本站 瀏覽次數(shù):262 |
騰訊混元多模態(tài)團隊又發(fā)生了一同人事變動。據(jù)媒體報道,曾擔(dān)任xAI多模態(tài)了解擔(dān)任人藺旭東,現(xiàn)已脫離xAI,參加騰訊混元,擔(dān)任多模態(tài)內(nèi)容生成算法擔(dān)任人。 這則人事消息之所以值得關(guān)注,是由于它發(fā)生在混元多模態(tài)團隊持續(xù)調(diào)整的布景下。 過去一段時間,混元內(nèi)部陸續(xù)傳出擔(dān)任人離任、研討人員轉(zhuǎn)崗和新成員參加的消息。 原多模態(tài)了解擔(dān)任人胡瀚離任創(chuàng)業(yè),田永龍等人參加騰訊,原有多模態(tài)團隊的報告聯(lián)系也隨著大言語模型部分和多模態(tài)模型部分的整合而發(fā)生改動。 但這是否意味著騰訊多模態(tài)團隊正在“改朝換代”,現(xiàn)在還不能直接下結(jié)論。 揭露信息能夠承認的是,混元的確呈現(xiàn)了人員流動和安排重組。藺旭東的參加風(fēng)聞,更像是這場調(diào)整中的一個新信號:騰訊正在重新組合多模態(tài)了解和內(nèi)容生成這兩條道路。 那么問題來了,藺旭東究竟是什么來頭,他能為騰訊補上什么才能?以及騰訊的多模態(tài)道路是否正在從“生成內(nèi)容”轉(zhuǎn)向了姚順雨更傾向的“了解上下文并在國際中行動”? 藺旭東是什么來頭,他參加騰訊后能做什么? 揭露材料顯示,藺旭東2018年結(jié)業(yè)于清華大學(xué),隨后赴哥倫比亞大學(xué)攻讀博士。 在讀博期間,他的研討方向包含嵌入學(xué)習(xí)、視頻剖析和生成模型,也曾參與哥倫比亞大學(xué)與Facebook AI協(xié)作的Vx2Text項目。 V指的是視頻,x指的是未知數(shù),可所以聲響、語音甚至是環(huán)境音,2代表to,Text則代表字幕。它的邏輯是,先把視頻、聲響等不同模態(tài)轉(zhuǎn)換成相似“言語token”的向量,再一致送入言語模型進行交融,終究由自回歸解碼器生成開放式文本。 Transformer只能了解token,所以AI本質(zhì)上是不了解視頻和音頻這兩種文件方法的,也就更不或許將其轉(zhuǎn)換成文字。 舉個比方,一只狗在游泳池旁邊跳進水里,那么Vx2Text的視頻辨認器看(V)就會輸出要害詞:狗、跳動、游泳池;聲響辨認器(x)就會輸出:水聲、撲通。 盡管Vx2Text的產(chǎn)品功用是“生成”,但產(chǎn)品的中心難點在于“了解”。 當(dāng)然,Vx2Text并不是簡單地把畫面“翻譯”成幾句話而已。模型需要從視頻里辨認人物、物體、動作和事情,還要了解這些東西在時間上的改動,終究再把視覺信息安排成言語。 博士結(jié)業(yè)后,藺旭東進入DeepMind,參與Gemini相關(guān)的多模態(tài)預(yù)訓(xùn)練和后訓(xùn)練工作。2025年,他又參加xAI,揭露材料稱其擔(dān)任多模態(tài)了解方向,并參與多模態(tài)內(nèi)容了解與生成模型的訓(xùn)練。 現(xiàn)在他參加騰訊混元,將擔(dān)任混元多模態(tài)內(nèi)容生成算法。 藺旭東的參加與其說是提高混元多模態(tài)生成的功能,倒不如說是為了處理一個困擾所有多模態(tài)的問題——了解。 曾經(jīng)的生成模型更像一個畫面制造器。給它一句提示詞,它能夠生成一張圖片、一段視頻。但只要用戶提出更雜亂的要求,模型就有點跟不上了。比方人物在長視頻里變了,物體的形狀前后不一致,攝像機運動不符合空間聯(lián)系等等。 這不是由于模型不會生成,而是由于它沒有穩(wěn)定地記住和了解國際。 所以,把藺旭東放到多模態(tài)內(nèi)容生成的位置上,或許正是由于他把多模態(tài),“翻譯”成AI能了解的東西。 藺旭東的參加要放在一個更大的布景下才能看得清楚,那便是現(xiàn)在騰訊混元正在重新整理自己的多模態(tài)道路。 2025年1月,騰訊杰出科學(xué)家(Tencent Distinguished Scientist)胡瀚接替此前離任的劉威,全面擔(dān)任混元多模態(tài)大模型的研制,一起擔(dān)任騰訊混元大模型Tech Lead。 2025年下半年騰訊內(nèi)部安排調(diào)整,他從多模態(tài)模型部,調(diào)入了大言語模型部旗下的“Frontier”前沿技能研討組,頭銜變成了多模態(tài)了解方向擔(dān)任人,報告線也改為向姚順雨報告。 實際位置從“一個獨立部分的領(lǐng)導(dǎo)”變成了“大言語模型部下面一個研討組里某個方向的擔(dān)任人”,管的規(guī)模從整個多模態(tài)大模型收縮到只剩多模態(tài)了解這一塊,多模態(tài)生成等方向被劃出去了。 2026年3月騰訊現(xiàn)已吊銷了建立近十年的AI Lab,部分人員并入混元大言語模型部轉(zhuǎn)向姚順雨報告。在這次調(diào)整后,此前混元實際掌舵人、騰訊公司副總裁蔣杰,正式與姚順雨完結(jié)工作交接,不再兼管AI Lab和混元。 2026年7月初,前OpenAI研討員、姚順雨清華本科校友田永龍參加騰訊,擔(dān)任視覺言語模型方向。 緊接著沒過幾天,騰訊TEG正式發(fā)文,吊銷大言語模型部和多模態(tài)模型部,合并建立“根底模型部”,姚順雨任擔(dān)任人,向TEG總裁盧山報告。騰訊稱,此舉旨在提高模型研制與協(xié)同效率,探究全模態(tài)模型的智能上限。 隨后,胡瀚被曝離任創(chuàng)業(yè)。 前亞馬遜首席科學(xué)家、京東數(shù)科首席科學(xué)家、阿里通義實驗室使用視覺團隊擔(dān)任人、原騰訊多模態(tài)模型部擔(dān)任人Linus在這次調(diào)整之后,從原本和姚順雨平行的位置,改為了向姚順雨報告。 還沒完,騰訊混元多模態(tài)根底模型擔(dān)任人鐘釗,擔(dān)任HunyuanVideo和HunyuanImage兩條生成線,是混元多模態(tài)生成方向的實際掌舵人。 他在8月14日發(fā)了一條朋友圈,稱“即將發(fā)布的版別或?qū)⑹俏以贖unyuanVideo與HunyuanImage項目中的終究版別”,字里行間充滿了告別。 藺旭東或許僅僅混元多模態(tài)換血中的一員,可是他的參加釋放出了一個明顯的信號,整個騰訊對于多模態(tài)的研制方向,現(xiàn)已發(fā)生了改動。 在此之前,騰訊是怎么做多模態(tài)的? 此前騰訊的言語模型和多模態(tài)是底子的兩條線,而混元多模態(tài)中心的兩個產(chǎn)品,正是前文提到的HunyuanVideo和HunyuanImage。 HunyuanVideo是文生視頻模型,2024年12月首發(fā)即以130億參數(shù)成為其時全球大的開源視頻生成模型,支撐5秒720p輸出。2025年密布擴展才能,3月上線圖生視頻,5月推出定制化生成HunyuanCustom和數(shù)字人驅(qū)動Avatar,11月發(fā)布1.5版別,將參數(shù)緊縮至83億,支撐原生生成5至10秒的480p或720p視頻,并可經(jīng)過超分辨率得到1080p輸出。 HunyuanImage起步更早,這是2024年5月,混元推出的首個中文原生DiT架構(gòu)圖像模型,2025年迭代出業(yè)界首個工業(yè)級實時生圖的2.0版別,同年9月發(fā)布了2.1版別(170 億參數(shù)、原生 2K 分辨率)和3.0版別(800 億參數(shù)、首個工業(yè)級開源原生多模態(tài)生圖模型),2026年1月進一步推出帶推理才能的Instruct版別,支撐提示詞自改寫和圖生圖修改。 還有一條線是Hy 3D,這是一個專門生成單體3D模型的模型,2024年11月隨Hunyuan-Large一同開源1.0版別,2025年1月晉級到了2.0,拆分為DiT形狀生成加Paint紋理組成的兩階段流水線,6月2.1完整開源訓(xùn)練代碼,9月發(fā)布3.0將建模精度提高3倍、幾許分辨率達1536³,現(xiàn)在已迭代至 3.1,廣泛用于電商建模、產(chǎn)品規(guī)劃和3D打印。 在這三座大山之后,或許是李飛飛的空間智能理論影響了騰訊,亦或者是多年曾經(jīng),騰訊在數(shù)字孿生中掌握的相關(guān)常識,在AI的加持下得以再次利用。 就如同劉關(guān)張之后有趙云相同,混元多模態(tài)在2025年7月下旬也迎來了四弟,Hy World 1.0。 所謂空間智能,根據(jù)李飛飛旗下World Labs的表述,它是指讓AI感知、生成、推理并與三維空間中的國際互動。 言語模型學(xué)習(xí)的是文本的計算結(jié)構(gòu),而國際模型需要學(xué)習(xí)空間和時間的結(jié)構(gòu),例如光線怎么落到物體表面、從沒有拍照過的角度看花園會是什么樣,以及物體受到外力后會怎么運動。 騰訊稱,Hy World 1.0是全球首個開源、支撐仿真的沉浸式3D國際生成模型,技能道路是先生成一張360度全景圖作為“國際代理”,再分解成語義層做分層3D重建,終究輸出可導(dǎo)入游戲引擎的分層Mesh。 由于騰訊本身就很擅長開發(fā)游戲引擎和游戲內(nèi)容,Hy World盡管表現(xiàn)力十分驚人,卻也被網(wǎng)友調(diào)侃成了“騰訊不肯脫離舒適圈”。 在Hy World 1.0發(fā)布的一個多月后,騰訊又發(fā)布了Hy World-Voyager,定位是根據(jù)相機軌跡控制的超長周游國際模型。 Hy World-Voyager處理的是1.0留下的一個痛點。盡管1.0生成的3D國際質(zhì)量不錯,但周游規(guī)模是相當(dāng)有限的,走不了多遠就會呈現(xiàn)幾許漂移和穿模。 Voyager的思路是換一條技能道路,不直接生成3D資產(chǎn),而是先做RGB-D雙模態(tài)視頻生成,每一幀畫面在輸出顏色的一起同步輸出一張深度圖,然后用深度圖即時重建3D點云。 總而言之,Hy World簡直能夠說是藉由騰訊在引擎和美術(shù)上的優(yōu)勢,完美復(fù)原了李飛飛空間智能的設(shè)想。 要知道,Hy World 2.0它的技能報告全稱便是《HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds》,其間的“Reconstructing, Generating, and Simulating 3D Worlds”(重建、生成、模擬3D國際),也便是前文所提到的,World Labs對空間智能的論述。 但是并不是所有人都認同李飛飛,就包含姚順雨。在多模態(tài)這件事上,姚順雨好像更認同梁文鋒的觀念。 姚順雨認同梁文鋒 李飛飛的觀念是,國際模型作為空間智能的一部分,是AGI重要的一條線,梁文鋒則持反對意見。 曾有投資者在多模態(tài)這個問題上向梁文鋒發(fā)問,梁文鋒回答說:“咱們只做AGI主線——GPT、CoT、Agent。AI范疇很廣泛,但3D、視頻生成、國際模型,跟智能的主線沒有太大聯(lián)系! DeepSeek有個產(chǎn)品,叫做DeepSeek OCR,簡直便是梁文鋒多模態(tài)觀的技能具象化。把視覺模態(tài)當(dāng)成服務(wù)于言語模型的東西,而不是獨立的智能方向。 DeepSeek OCR的中心叫做“上下文光學(xué)緊縮”(Contexts Optical Compression),中心思路是把長文本渲染成圖像,用視覺編碼器把文本緊縮成緊湊的視覺token,再交給言語模型解碼。 是不是有點眼熟?翻回前面看看藺旭東的Vx2Text,姚順雨或許正是想學(xué)梁文鋒,把混元現(xiàn)有的多模態(tài)根底,轉(zhuǎn)換成為這樣一種了解方法,從而更好地交融進Hy模型主線。 包含OpenAI在內(nèi),許多AI大廠其實都是相似的做法。姚順雨曾上任于OpenAI,很或許便是在那時,確立了這個方向。 姚順雨參加騰訊后的第一款旗艦產(chǎn)品是Hy3,他把重點放在推理、智能體、長上下文和出產(chǎn)力使命上。 官方稱,Hy3在軟件開發(fā)、工作出產(chǎn)、金融建模、前端規(guī)劃和游戲制造等使命上進行了優(yōu)化,并且在東西調(diào)用穩(wěn)定性、雜亂上下文承接和多輪目的堅持方面持續(xù)改進。 Hy3的方針并非“屠榜”,而是讓模型在實在產(chǎn)品里少犯錯、能了解上下文、能夠把使命持續(xù)做下去。 這個產(chǎn)品本身就十分的“姚順雨”。 2026年6月5日,在騰訊云AI工業(yè)使用大會與湯道生的對談中,姚順雨是這么判斷的,AI下半場的競賽壁壘不在模型參數(shù)量,而在Context(上下文)。 “咱們現(xiàn)在就像是擁有了一個全能的錘子,它能夠去砸任何釘子。方法論現(xiàn)已變得十分老練,相反,尋覓真實有價值的問題,變得越來越困難!币樣耆绱颂岬。 同樣在那場會上,公布了騰訊長期AGI建設(shè)的三層架構(gòu):根底底座(預(yù)訓(xùn)練+后訓(xùn)練+基建)、產(chǎn)品落地、前沿探究。推理才能屬于根底底座要處理的問題,上下文才能屬于產(chǎn)品落地和前沿探究的交叉點。 此前,為了測驗?zāi)P兔撾x原有常識,只從上下文中尋覓答案,姚順雨還特地制造了測驗上下文的基準(zhǔn)CL-bench以及CL-bench life。 可見,姚順雨其實也跟梁文鋒相同,覺得主線是Agent相關(guān)的內(nèi)容,而非多模態(tài)生成。 至于Hy3到底怎么樣,那就要看WorkBuddy了。WorkBuddy是Hy3的首發(fā)渠道之一,這哥倆屬于是“產(chǎn)品+模型”雙螺旋聯(lián)系,互相成就。 接入Hy3后WorkBuddy的表現(xiàn)提高十分明顯。根據(jù)工作場景內(nèi)部測評,使命處理率從72%躍升至 90%,平均耗時縮短34%,可多處理約五分之一的雜亂需求。 Hy3上線后,WorkBuddy上主動選擇Hy3的用戶數(shù)增加了 6 倍,日均文字處理量較預(yù)覽版增加20倍,7月8日算力消耗一度到達峰值,排隊率超越50%,騰訊為此緊迫擴容。 一個猜測,Hy提高多模態(tài)了解后,它的GUI Agent場景下的體會會更上一層樓。GUI Agent的中心鏈路是“感知屏幕 — 了解界面 — 決議計劃操作 — 履行驗證”,其間多模態(tài)了解是連接視覺感知與言語決議計劃的要害瓶頸。 但這并不足以證明李飛飛是錯的,只能說姚順雨認同梁文鋒算了。 |
|