李飞飞 · 14
姚顺雨重整腾讯多模态路线:靠拢梁文锋,远离李飞飞

姚顺雨重整腾讯多模态路线:靠拢梁文锋,远离李飞飞

文|苗正编辑|王靖来源|字母AI腾讯混元多模态团队又发生了一起人事变动。据媒体报道,曾负责xAI多模态理解负责人蔺旭东,已经离开xAI,加入腾讯混元,担任多模态内容生成算法负责人。这则人事消息之所以值得关注,是因为它发生在混元多模态团队持续调整的背景下。过去一段时间,混元内部陆续传出负责人离职、研究人员转岗和新成员加入的消息。原多模态理解负责人胡瀚离职创业,田永龙等人加入腾讯,原有多模态团队的汇报关系也随着大语言模型部门和多模态模型部门的整合而发生变化。但这是否意味着腾讯多模态团队正在“改朝换代”,目前还不能直接下结论。公开信息能够确认的是,混元确实出现了人员流动和组织重组。蔺旭东的加入传闻,更像是这场调整中的一个新信号:腾讯正在重新组合多模态理解和内容生成这两条路线。那么问题来了,蔺旭东究竟是什么来头,他能为腾讯补上什么能力?以及腾讯的多模态路线是否正在从“生成内容”转向了姚顺雨更偏向的“理解上下文并在世界中行动”?蔺旭东是什么来头他加入腾讯后能做什么?公开资料显示,蔺旭东2018年毕业于清华大学,随后赴哥伦比亚大学攻读博士。在读博期间,他的研究方向包括嵌入学习、视频分析和生成模型,也曾参与哥伦比亚大学与Facebook AI合作的Vx2Text项目。V指的是视频,x指的是未知数,可以是声音、语音甚至是环境音,2代表to,Text则代表字幕。它的逻辑是,先把视频、声音等不同模态转换成类似“语言token”的向量,再统一送入语言模型进行融合,最后由自回归解码器生成开放式文本。Transformer只能理解token,所以AI本质上是不理解视频和音频这两种文件形式的,也就更不可能将其转换成文字。举个例子,一只狗在游泳池旁边跳进水里,那么Vx2Text的视频识别器看(V)就会输出关键词:狗、跳跃、游泳池;声音识别器(x)就会输出:水声、扑通。虽然Vx2Text的产品功能是“生成”,但产品的核心难点在于“理解”。当然,Vx2Text并不是简单地把画面“翻译”成几句话而已。模型需要从视频里识别人物、物体、动作和事件,还要理解这些东西在时间上的变化,最后再把视觉信息组织成语言。博士毕业后,蔺旭东进入DeepMind,参与Gemini相关的多模态预训练和后训练工作。2025年,他又加入xAI,公开资料称其负责多模态理解方向,并参与多模态内容理解与生成模型的训练。如今他加入腾讯混元,将负责混元多模态内容生成算法。蔺旭东的加入与其说是提升混元多模态生成的性能,倒不如说是为了解决一个困扰所有多模态的问题——理解。以前的生成模型更像一个画面制造器。给它一句提示词,它可以生成一张图片、一段视频。但只要用户提出更复杂的要求,模型就有点跟不上了。比如人物在长视频里变了,物体的形状前后不一致,摄像机运动不符合空间关系等等。这不是因为模型不会生成,而是因为它没有稳定地记住和理解世界。所以,把蔺旭东放到多模态内容生成的位置上,可能正是因为他把多模态,“翻译”成AI能理解的东西。蔺旭东的加入要放在一个更大的背景下才能看得清楚,那就是如今腾讯混元正在重新整理自己的多模态路线。2025年1月,腾讯杰出科学家(Tencent Distinguished Scientist)胡瀚接替此前离职的刘威,全面负责混元多模态大模型的研发,同时担任腾讯混元大模型Tech Lead。2025年下半年腾讯内部组织调整,他从多模态模型部,调入了大语言模型部旗下的“Frontier”前沿技术研究组,头衔变成了多模态理解方向负责人,汇报线也改为向姚顺雨汇报。实际地位从“一个独立部门的领导”变成了“大语言模型...

2天前字母AI#AI #李飞飞 #梁文峰 #腾讯

李飞飞警告美国反 AI 情绪情绪升温:若缺乏积极发展路径,全球都将受影响

比推消息, 人工智能先驱李飞飞表示,科技行业需要更好地向公众解释人工智能带来的价值,并警告美国日益增长的反 AI 情绪可能对全球 AI 发展造成风险。李飞飞在接受彭博采访时表示,科技从业者需要加强与公众沟通,展示 AI 技术能够带来的积极影响。她指出“如果我们没有展示出积极的态度和积极的发展方向,所有人都会受到影响”,美国在全球科技领域具有重要影响力,如果美国无法展现“积极的 AI 态度和发展路径”,最终将影响整个世界。作为计算机视觉领域的重要研究者,李飞飞近年来持续推动 AI 技术从实验室走向现实应用,她创办的 AI 初创公司 World Labs 致力于开发空间智能(Spatial Intelligence)技术,探索 AI 理解和交互现实世界的能力。李飞飞认为,当前 AI 行业面临的不仅是技术挑战,也包括社会接受度、公众信任以及监管环境等问题。随着生成式 AI 快速普及,围绕就业影响、数据隐私、安全风险等方面的担忧不断增加,美国社会对 AI 发展的反弹声音正在扩大。她强调,AI 行业需要更加主动地解释技术如何改善医疗、科学研究、生产效率等领域,而不是仅关注技术竞争本身。近年来,全球主要科技公司持续加大 AI 投资,推动大模型、AI 基础设施和智能代理等技术发展。但与此同时,AI 监管、就业替代以及社会影响问题也成为政策制定者和公众关注焦点。

2天前
辛顿、李飞飞、吴恩达首次同台:矛头一起对准AI大公司

辛顿、李飞飞、吴恩达首次同台:矛头一起对准AI大公司

来源:第一电动网作者: 第一电动编辑部北京时间8月6日凌晨(拉斯维加斯当地时间8月5日上午),杰弗里·辛顿、李飞飞与吴恩达首次同台。这场名为“智能的建筑师:一次历史性汇聚”的圆桌,是本届Ai4大会最受关注的场次。因为辛顿和吴恩达在“AI会不会毁灭人类”上立场几乎完全对立,所以会前大家都在期待现场交锋。事实上三人在监管、失业和中国开放权重模型上都各执一词。辛顿在台上直接说“我们并不总是意见一致”,李飞飞立刻补了一句“但我们还是朋友”。但这三个立场相去甚远的人,把矛头对准了同一个方向:AI大公司。一个被视为末日论代表的人,一个人本主义AI的旗手,一个长期反对生存风险叙事的开源派,在这件事上,他们观点完全一致。截至发稿,主办方尚未公开本场圆桌的录像或完整实录。第一电动根据与会者的即时记录、会后总结及现场媒体报道,整理了三人的核心观点。▍李飞飞:生产力提升不等于繁荣共享李飞飞现任空间智能公司World Labs首席执行官,她主导的ImageNet数据集及其2012年竞赛,被普遍视为这一轮深度学习浪潮的起点。她同时是斯坦福以人为本AI研究院的联合创始人。她在圆桌上批评了当下围绕AI的“不理性、不科学”的言论。在她列出的三个来源里,除了批评者和许多记 者,还有那些有经济动机把竞争对手挡在门外的大AI公司。“让我们把科学、而不是科幻,带回AI辩论。”她同时批评,乌托邦式的说法同样无益,“如果使用方式不当,它也会带来伤害”。在这场圆桌上,李飞飞被引用最多的一句话是,生产力的提升并不会自动转化为共享的繁荣。效率提升是一回事,好处流向谁是另一回事。在就业问题上,她认为AI会提高某些工作环节的效率,而不是一整份工作的消失或保留,毕竟“没有哪份工作是单一任务”。但对那些确实被取代的岗位,她认为需要“软着陆”。多位与会者同时描述,李飞飞是三人中对AI快速加速及其社会影响最为谨慎的一位,并获得了全场掌声。李飞飞还表示:把AI发展说成开源与闭源的路线之争,是一场伪辩论。她打了两个比方。一是核物理,基础研究公开进行,但最敏感的下游应用比如铀浓缩始终严格管控,AI大概率也会落在类似的光谱上,而不是收敛成单一模式。二是上世纪九十年代的人类基因组计划:当时一家私营公司和一个公共资金支持的高校联合体在抢先完成测序,如果私营一方彻底胜出并申请专利,这项技术可能就被挡在了更广泛的科研和制药界之外。但实际是两方成果由克林顿政府联合宣布,形成的公共数据集成了此后多年药物研发的基础。她以此强调政府支持AI研究、并让基础性突破被广泛应用的重要性。“这场辩论,尤其是在「我们只能容下一种」这个笼统层面上,是个伪辩论。”李飞飞点名记 者有责任跳出这个框架,去讨论何时、何地、以何种方式使用不同程度的开放或封闭。被问到未来五六年世界可能醒来看到什么样的AI头条,她的答案是:以AI为工具,世界宣布消灭文盲。▍辛顿:要监管,但不要这样的监管辛顿因神经网络研究获得2024年诺贝尔物理学奖,2023年从谷歌离职后持续就AI风险发声,曾公开估计AI发展导致人类灭绝的概率在10%至20%之间。尽管科技领袖普遍认为监管会扼杀创新,但辛顿认为监管对于引导AI安全发展至关重要。“你不能把人工智能的监管权,交给像埃隆·马斯克和马克·扎克伯格这样的人”,这句话赢得了当天上午最热烈的掌声。他要的不是更少的规则,而是规则不要由最有动机把它写歪的人来写。在就业问题上,辛顿的判断偏悲观。他指出AI在某些方面已经超越人类,并预测呼叫中心接线员、律师助理这类工作将日益面临失业风险。“一旦人工智能能够胜任常规的脑力劳动,任何涉及常规脑力劳动的...

14天前Wendy#AI #吴恩达 #大模型 #李飞飞 #辛顿

李飞飞旗下 World Labs 收购机器人公司 SceniX

比推消息, 李飞飞旗下人工智能公司 World Labs 宣布收购机器人公司 SceniX,具体收购金额暂未披露。World Labs 表示,机器人是空间智能落地现实世界的重要载体,未来机器人系统需要具备环境感知、空间理解、行为推理以及可靠执行能力。此次收购后,SceniX 将并入 World Labs 团队,双方计划结合各自在空间建模和机器人技术方面的优势,推动更多应用场景落地。

30天前
梅西投了李飞飞;梁文锋四小时投资人会议语录刷屏;美股第二波行情信号...

梅西投了李飞飞;梁文锋四小时投资人会议语录刷屏;美股第二波行情信号...

亲爱的读者朋友们好~过去24小时,X上的KOL们在聊什么呢?注:以下内容整理自X平台,均为个人观点,不代表本平台立场,更不构成投资建议。梅西投资李飞飞创办的World Labs扩展阅读:https://36kr.com/p/3906511292994950梁文锋四小时投资人会议语录刷屏原文链接:https://www.bitpush.news/articles/7662849美股第二波行情信号?Twitter:https://twitter.com/BitpushNewsCN比推 TG 交流群:https://t.me/BitPushCommunity比推 TG 订阅: https://t.me/bitpush

30天前Wendy#KOL

梅西投了李飞飞,球王开始押注世界模型

比推消息,据监测,梅西旗下投资平台 Play Time 已将李飞飞创办的 World Labs 列入投资组合。World Labs 研究空间智能和世界模型,目标是让 AI 理解、生成并操作 3D 世界。Play Time 是梅西在 2022 年成立的主要投资平台,最初聚焦体育、媒体和科技。如今投资名单还包括机器人公司 FieldAI、语音 AI 公司 Fish Audio 和 AI 数据平台 SuperAnnotate。World Labs 今年 2 月融资 10 亿美元。主要投资者包括英伟达、AMD 和 Autodesk。

31天前
李飞飞:世界模型的功能分类法与空间智能展望

李飞飞:世界模型的功能分类法与空间智能展望

作者:加洋原标题:李飞飞最新长文:当视频生成、机器人和NVIDIA都自称世界模型,我们需要一个分类法“世界模型”大概是 2025 年以来 AI 领域里最热也最混乱的概念。Sora 出来的时候,OpenAI 管它叫世界模拟器;Genie 让你在生成的画面里走来走去,也叫世界模型;机器人公司说自己在做世界模型,NVIDIA 说 Omniverse 是世界模型的基础设施,连游戏引擎也被拉进了这个叙事。大家都在用同一个词,但各自说的又完全不是同一件事。今天,李飞飞在个人 Substack 发表了一篇新文章,对这一概念进行了厘清。她首先回到强化学习教科书里那个最经典的图(POMDP 闭环:智能体→动作→状态→观测→智能体),然后指出:现在被叫做“世界模型”的东西,其实是这个闭环的三种不同投影。输出像素(观测)的是渲染器,输出状态的是模拟器,输出动作的是规划器。分类标准非常简洁,就看你输出的是闭环里的哪个部分。(来源:《麻省理工科技评论》)她判断,三者之中,渲染器商业化最成熟但有天花板(好看不等于物理正确),规划器最令人兴奋但离真实部署最远(实验室演示和实际可用之间的鸿沟依然巨大),而模拟器是被严重低估的关键枢纽。因为模拟器工作在几何、物理和动力学的层面上,既能向上投射为像素供人类消费,也能向下推导出动作后果供机器人使用。掌握了模拟,就同时拥有了渲染和规划的基础;反过来则不行。这篇文章当然也是 World Labs 的产品宣言。他们的 Marble 已经在同时输出高斯泼溅和碰撞网格,试图把渲染器和模拟器统一到一个模型里。文章末尾描绘的终局是一个统一的世界基础模型,能根据下游需求在渲染、模拟和规划之间自由切换。这个愿景是否能实现另说,但作为一个分析框架,渲染器/模拟器/规划器的三分法也许确实有助于穿透当前"世界模型"概念的一部分噪音。全文译出如下。“世界是所有发生的事情的总和。”——维特根斯坦,《逻辑哲学论》,1921世界不是由文字构成的。在早先的一篇文章中,我们提出空间智能是 AI 的下一个前沿,而世界模型是通向它的路径。在此,World Labs 团队和我想再深入一层:在如今被冠以“世界模型”之名的众多事物中,哪些功能模块真正构成了这种能力?它们各自的用途又是什么?语言模型赋予了机器对概念、词汇和推理的强大掌控力,但物理世界,无论虚拟还是真实,运行在完全不同的基底之上。语言模型学习的是文本的统计结构,世界模型学习的是空间与时间的统计结构:光如何落在一个表面上,一座花园从一个从未被相机捕捉过的角度看起来是什么样子,物体如何响应力并遵循物理定律。这使得“世界模型”成了当下 AI 领域最重要、同时也最被滥用的术语之一。计算机视觉、机器人学、强化学习和生成式 AI 都声称自己在构建世界模型,但各自指的是截然不同的东西。一个能生成华丽但物理上不可能的火焰的视频模型,一个即兴生成可玩游戏的语言模型,一个忠实模拟燃烧过程的物理引擎,它们都被叫作同一个名字。古希腊人从来无法就世界由什么构成达成一致,不管是火、水还是不可分割的原子,因为"世界"从来就不是单一的东西。它始终是某个思想家为了推理某种总体性而使用的替代词。AI 继承了同样的问题,而且恰好发生在这个领域最需要精确性的时刻。分类法背后的闭环要厘清这种混乱,可以从一张比上述所有技术都更古老的图开始。所有强化学习教材,包括经典的 Sutton 和 Barto,几十年来一直使用同一幅图的变体来描述智能体如何与世界交互。这幅图的正式名称是部分可观测马尔可夫决策过程(POMDP...

46天前谢伟伦#AI #Omniverse #机器人 #李飞飞
“万物皆可世界模型”:一个模糊概念如何撑起百亿融资叙事?

“万物皆可世界模型”:一个模糊概念如何撑起百亿融资叙事?

作者:动察 Beating原标题:万物皆可世界模型世界模型这个词快被投资人们盘出包浆了。李飞飞的 World Labs 今年二月完成十亿美元融资,估值五十亿美元,一年前它还只估值十亿。杨立昆的新公司 AMI Labs 种子轮就融了十亿美元出头,创下欧洲 AI 创业公司历史上最大的种子轮纪录。国内头一个季度就有二十五起世界模型相关融资,有公司一个月里连拿两轮共二十五亿,估值从五十亿蹿到一百亿。更让人匪夷所思的是,别看投资人 FOMO 成这样,现在整个 AI 行业对「世界模型」这四个字到底指什么,都还没有形成共识。一个连定义都没谈拢的词,已经融到了几百亿。天天喊口号找反共识,最后把钱投给了没共识,然后管这叫风口。不过我最近听几个大 VC 的小登投资人说,这个方向的泡沫他们自己看得清清楚楚,内部复盘会上也不是没人拍过桌子,讨论来讨论去,结论是还得投。不投,明年 LP 会问你为什么踏空了世界模型;投了,就算最后错了,也是整个行业一起错。不过钱热到这个份上,就该问一个不礼貌的问题了。既然没人说得清它是什么,那大家投的到底是什么呢?一道工序先说公道话,这个概念本来是真有东西的。2018 年,两位研究者发表了一篇论文,标题就叫《World Models》。他们让 AI 在赛车游戏里给自己造了一个梦境,先在梦里把车练熟,再回到游戏里跑。那时候 ChatGPT 还不存在,这篇论文只在研究员的小圈子里流传。杨立昆其实很早就在坚持这个研究方向。全硅谷把钱押给大语言模型的那几年,他反复重申自己的观点,认为光靠预测下一个词,机器永远摸不到人的智能,所以必须得让它理解物理世界。这话讲了快十年,但风一直没往他在这边吹。像他这样的人不是听见了风声才转向的,在他们的认知里,世界模型真有东西。不过,「真有东西」进了创投圈,通常要先经过一道工序。这道工序会把一个研究方向,加工成一个可以批发的名词。创投圈最爱的从来不是技术概念,是技术概念的可加盟性。世界模型在这方面属于天选之子。它比「元宇宙」更技术,比「空间智能」更性感,比「具身智能」更宽泛,比「多模态」更新鲜。最关键的是,它非常难证伪。在 BP 里一个词越难证伪越值钱,因为无法证伪就意味着下一轮还能找到新的投资人来接盘,叙事赚的就是无法证伪的钱。世界模型折叠于是就有了眼下的盛况。做游戏的说自己是世界模型,做短剧的说自己是世界模型,做视频工具的说自己是世界模型,做 3D 素材的说自己是世界模型,做仿真机器人的说自己是世界模型。再往后,做广告素材、教育课件、玄学算命、虚拟人陪聊的,只要敢吹,就都能进世界模型圈子。之前在一个活动上听有投资人在圆桌上分享,医疗、金融、法律,每个领域都可以看作一个独立的 world。照这个用法,我楼下修车师傅的脑子里也有一个世界模型,专门预测三环什么时候堵,准确率高于我坐过的多数辅助驾驶。前不久还看见一家机器人公司宣布,同时构建工业世界模型和家庭世界模型。我悟了,世界原来是可数名词,可以论个卖。这个盛况不是没人预见过,预见它的人身份还相当特殊。今年三月,AMI Labs 融到那十亿美元的当天,这家公司的 CEO 对媒体说,我预测「世界模型」会是下一个流行词,六个月之内,每家公司都会自称世界模型去融资。他说得一点没错,唯一没算准的是时间,根本用不了六个月。习惯性叙事追逐叙事其实早就是投资人和创业者的习惯性动作了。2015 年 5 月 10 日,一家主业是地砖和房地产的上市公司发了份公告,说立志做中国首家互联网金融公司,要改名「匹凸匹」,英文名直接注册成 P2P Financial Information Ser...

47天前burnking#AI #融资

李飞飞创立的 World Labs 融资 10 亿美元,英伟达参投

比推消息,据投资界报道,李飞飞创办的初创公司 World Labs 在新一轮融资中筹集 10 亿美元,以追求一种新颖的 AI 开发方法。作为本轮融资的一部分,Autodesk Inc. 向 World Labs 投资了 2 亿美元。World Labs 表示,其他支持者还包括 Andreessen Horowitz、英伟达和 AMD。World Labs 专注于研发“世界模型(World Models)”,旨在让 AI 能够理解并对三维物理世界进行决策。

183天前

李飞飞旗下 AI 初创公司 World Labs 完成 10 亿美元融资,NVIDIA 等参投

比推消息,据官方消息,李飞飞旗下 AI 初创公司 World Labs 完成 10 亿美元融资,AMD、Autodesk、Emerson Collective、Fidelity Management & Research Company、NVIDIA 和 Sea 参投。 World Labs 致力于加速推进空间智能的发展使命,通过构建世界模型来革新叙事方式、激发创造力、推动机器人技术、促进科学发现等诸多领域。 World Labs 表示,其首款产品 Marble 能让任何人从图像、视频或文本中创建空间连贯、高保真且持久的 3D 世界。

184天前