MULTI · 368
姚顺雨重整腾讯多模态路线:靠拢梁文锋,远离李飞飞

姚顺雨重整腾讯多模态路线:靠拢梁文锋,远离李飞飞

文|苗正编辑|王靖来源|字母AI腾讯混元多模态团队又发生了一起人事变动。据媒体报道,曾负责xAI多模态理解负责人蔺旭东,已经离开xAI,加入腾讯混元,担任多模态内容生成算法负责人。这则人事消息之所以值得关注,是因为它发生在混元多模态团队持续调整的背景下。过去一段时间,混元内部陆续传出负责人离职、研究人员转岗和新成员加入的消息。原多模态理解负责人胡瀚离职创业,田永龙等人加入腾讯,原有多模态团队的汇报关系也随着大语言模型部门和多模态模型部门的整合而发生变化。但这是否意味着腾讯多模态团队正在“改朝换代”,目前还不能直接下结论。公开信息能够确认的是,混元确实出现了人员流动和组织重组。蔺旭东的加入传闻,更像是这场调整中的一个新信号:腾讯正在重新组合多模态理解和内容生成这两条路线。那么问题来了,蔺旭东究竟是什么来头,他能为腾讯补上什么能力?以及腾讯的多模态路线是否正在从“生成内容”转向了姚顺雨更偏向的“理解上下文并在世界中行动”?蔺旭东是什么来头他加入腾讯后能做什么?公开资料显示,蔺旭东2018年毕业于清华大学,随后赴哥伦比亚大学攻读博士。在读博期间,他的研究方向包括嵌入学习、视频分析和生成模型,也曾参与哥伦比亚大学与Facebook AI合作的Vx2Text项目。V指的是视频,x指的是未知数,可以是声音、语音甚至是环境音,2代表to,Text则代表字幕。它的逻辑是,先把视频、声音等不同模态转换成类似“语言token”的向量,再统一送入语言模型进行融合,最后由自回归解码器生成开放式文本。Transformer只能理解token,所以AI本质上是不理解视频和音频这两种文件形式的,也就更不可能将其转换成文字。举个例子,一只狗在游泳池旁边跳进水里,那么Vx2Text的视频识别器看(V)就会输出关键词:狗、跳跃、游泳池;声音识别器(x)就会输出:水声、扑通。虽然Vx2Text的产品功能是“生成”,但产品的核心难点在于“理解”。当然,Vx2Text并不是简单地把画面“翻译”成几句话而已。模型需要从视频里识别人物、物体、动作和事件,还要理解这些东西在时间上的变化,最后再把视觉信息组织成语言。博士毕业后,蔺旭东进入DeepMind,参与Gemini相关的多模态预训练和后训练工作。2025年,他又加入xAI,公开资料称其负责多模态理解方向,并参与多模态内容理解与生成模型的训练。如今他加入腾讯混元,将负责混元多模态内容生成算法。蔺旭东的加入与其说是提升混元多模态生成的性能,倒不如说是为了解决一个困扰所有多模态的问题——理解。以前的生成模型更像一个画面制造器。给它一句提示词,它可以生成一张图片、一段视频。但只要用户提出更复杂的要求,模型就有点跟不上了。比如人物在长视频里变了,物体的形状前后不一致,摄像机运动不符合空间关系等等。这不是因为模型不会生成,而是因为它没有稳定地记住和理解世界。所以,把蔺旭东放到多模态内容生成的位置上,可能正是因为他把多模态,“翻译”成AI能理解的东西。蔺旭东的加入要放在一个更大的背景下才能看得清楚,那就是如今腾讯混元正在重新整理自己的多模态路线。2025年1月,腾讯杰出科学家(Tencent Distinguished Scientist)胡瀚接替此前离职的刘威,全面负责混元多模态大模型的研发,同时担任腾讯混元大模型Tech Lead。2025年下半年腾讯内部组织调整,他从多模态模型部,调入了大语言模型部旗下的“Frontier”前沿技术研究组,头衔变成了多模态理解方向负责人,汇报线也改为向姚顺雨汇报。实际地位从“一个独立部门的领导”变成了“大语言模型...

3天前字母AI#AI #李飞飞 #梁文峰 #腾讯

BitBox:AI 在其固件中发现严重漏洞,已发布修复更新

比推消息,据 Decrypt 报道,瑞士硬件钱包制造商 BitBox 在内部 AI 审计中发现固件存在两处严重漏洞及一个引导加载程序问题,已发布 Dixence 安全更新。漏洞利用需结合钓鱼攻击和用户解锁被篡改设备,但 BitBox 表示无用户资金被盗,助记词未受威胁。 引导加载程序漏洞影响旧款 BitBox02,攻击者可加载恶意固件盗取资产,该问题已在 7 月的 Oeschinen 更新中部分修复;第二个严重漏洞影响 Multi 版本设备初始化前阶段,可能允许任意代码执行;第三个问题涉及静默支付功能,无法直接盗币但可能锁定资金。新款 Nova 版本不受影响。BitBox 警告旧固件用户需尽快安装更新,目前无用户资金损失报告。

3天前

APRO 与 Venus Protocol 达成合作,为 Binance bStocks 提供价格数据支持

比推消息,由 YZi Labs 投资的 AI 预言机 APRO 宣布,BNB Chain 头部借贷协议 Venus Protocol 已加入其多预言机韧性计划(Multi-Oracle Resilience Program,MORE)。 根据合作,APRO 将为 Venus Protocol 上的 Binance bStocks 提供可靠的价格喂价服务,进一步增强其资产喂价可靠性,首批覆盖 SKHYB、NVDAB、SPCXB 和 TSLAB 四个代币化股票标的。 APRO 表示,通过 MORE 计划可以降低单一预言机失效或受攻击带来的风险,并提升整个 DeFi 生态的价格稳定性与安全性。APRO 团队将持续通过 MORE 计划引入更多独立、可验证的数据源,为链上生态构建更具韧性、更可靠的基础设施。 本文由GENG赞助,Build Your Fortune on GENG (https://geng.one)

5天前burnking

本周解锁数据一览:ZRO、KAITO、SOON 等将迎来一次性代币大额解锁

比推消息,据 Token Unlocks 数据,ZRO、KAITO、SOON 等代币将于本周迎来大额解锁,其中:LayerZero(ZRO)将于 8 月 20 日晚 7 点解锁约 2571 万枚代币,与流通量的比值约为 4.40%,价值约 1990 万美元;KAITO(KAITO)将于 8 月 20 日晚 8 点解锁约 3260 万枚代币,与流通量的比值约为 7.63%,价值约 1150 万美元;MBG By MultiBank Group(MBG)将于 8 月 22 日晚 8 点解锁约 2715 万枚代币,与流通量的比值约为 6.16%,价值约 280 万美元。SOON(SOON)将于 8 月 23 日下午 4 点 30 分解锁约 2024 万枚代币,与流通量的比值约为 3.76%,价值约 390 万美元。

5天前

AMD 发布全开源 MoE 大模型 Instella-MoE,16B 参数规模挑战主流开源模型

比推消息,AMD 宣布推出全开源混合专家模型(MoE)Instella-MoE,该模型拥有 160 亿总参数,每个 Token 激活 28 亿参数,号称在同规模开源语言模型中具备领先性能。AMD 表示,Instella-MoE 完全基于自家 AMD Instinct MI300X 和 MI325X GPU,以及 ROCm 软件栈从零训练完成,并采用 Gated Multi-head Latent Attention(Gated MLA)和 FarSkip-Collective 等架构创新,以提升训练和推理效率。性能测试显示,Instella-MoE-16B-A3B 基础模型平均得分达到 76.7 分,在全开源模型中排名领先,超过 SmolLM3-3B、OLMo-3-7B 等模型,并在仅激活 28 亿参数的情况下,与更大规模模型竞争。此外,该模型支持 64K Token 长上下文处理,并完成预训练、中期训练、长上下文扩展、监督微调(SFT)、直接偏好优化(DPO)以及强化学习(RL)等完整训练流程。AMD 此次同步公开 Instella-MoE 全部模型权重、训练配置、数据配比、中间检查点及推理代码,推动开放 AI 模型研究与复现。AMD 表示,Instella-MoE 展示了基于 AMD 硬件和开放软件生态进行大规模 MoE 模型训练的能力,未来将继续推进更大规模、更强推理能力和更高效率的开源语言模型研发。

28天前
加密风投正在消亡吗?

加密风投正在消亡吗?

来源:Token Dispatch作者:Vaidik Mandloi编译及整理:BitpushNews当造就了一个时代的顶尖投资者,开始离它而去作为有史以来组建的规模最大的加密货币专属基金之一,Paradigm 最近筹集了 12 亿美元,开始转向投资人工智能(AI)、机器人和航空航天领域的初创公司。他们甚至已经从官网上彻底抹去了“加密”(crypto)一词!他们的投资逻辑是:加密货币只是他们的第一个前沿阵地,但现在正在发生的其他新事物实在太多了,他们绝不能视而不见。无独有偶,Framework Ventures 也于 6 月关闭了一支 4 亿美金的基金,开始将投资触角伸向加密领域之外,而且他们绝非孤例。在过去一年里,几乎每一家头部加密专业基金都开始向更广泛的主题和投资授权漂移。2026 年第一季度,全球仅成立了 8 支新的加密专属风险投资基金,创下了 2020 年以来的最低纪录。本文将深入探讨加密专业风投作为一个基金类别是否真的在消亡。如果是这样,这场洗牌如何映射到这些基金的生命周期中,这对加密初创公司又意味着什么——它们现在将不得不在多行业投资组合中争夺关注。专业基金的生命周期加密专业基金之所以能应运而生,是因为他们愿意花时间去建立竞争优势,并且是当时唯一愿意去承担并承销这种风险的人。理解 Solidity 合约实际上是如何运行的,以及在 Discord 频道里与匿名开发者建立联系——这些可不是 2017 年 Tiger Global 的成长型股权合伙人能够触及的事情。要想理解加密 VC 作为一个投资品类是否正在走向终局,看看专业基金品类在历史上是如何演变的会大有裨益,因为这种现象在过去已经发生过不止一次了。在 2006 年至 2011 年期间,清洁科技(Climate Tech)作为一种投资逻辑走向主流。VC 们纷纷设立清洁能源专属基金,原因与加密 VC 设立专属区块链基金如出一辙:他们认为自己在通用型投资人(Generalists)反应过来之前,敏锐地捕捉到了一个划时代的技术转变,并希望围绕这一坚定信念打造全新的投资机构。他们向清洁能源初创公司倾注了超过 250 亿美元,但损失了超过一半的资金。有趣的是,这项技术本身确实奏效了,如今的清洁能源市场规模极其庞大——这导致该领域的太阳能成本在同一时期大幅下降了 85%。但 VC 们误判的是,他们硬套了套用在软件公司身上的那一套模式,向那些实际上需要 2 亿美金项目融资、且需要 15 年才能实现盈利的公司投下了 500 万美金的种子轮支票。麻省理工学院(MIT)的能源倡议组织(Energy Initiative)进行了一项事后复盘,发现风投模式对该领域存在根本性的缺陷。专业 VC 通过承担技术风险出资完成了实验阶段,资助了早期研发,并为该领域赋予了吸引更大规模资本的公信力;但一旦技术成熟到足以让基础设施贷款人和项目融资机构(project finance facilities)进行承销时,专业投资人的信息优势就消失了。数据来源:MIT Energy InitiativeSPAC(特别吸收合并收购公司)也演变出了类似的轨迹。作为背景补充,SPAC 是一家没有实际业务的“空白支票公司”,通过 IPO 筹集资金,随后与一家私人公司合并,帮助其以比传统 IPO 更快的速度上市。在 2020 年和 2021 年,一些投资者将其视为一种可复制的载体,并围绕它们建立起了整家公司。Chamath Palihapitiya 曾筹集了 16 亿美元的 SPAC 专属资本。但到了 2022 年,2021 年成立的 SP...

32天前Wendy#AI #Framework Ventures #Paradigm #VC #投资基金

大模型实现小时级自我进化,开源 SkyRL 并发训练栈带来 2.8 倍效率跃升

比推消息,据监测,Trajectory 联合 UC 伯克利 Sky Computing Lab、Anyscale 宣布推出开源多 LoRA 强化学习训练平台 SkyRL,并发布支持大模型持续学习的并发训练架构 Multi-LoRA Training。在传统的大模型微调实验中,为了测试不同的训练策略,开发者必须为每个微调任务单独调度 GPU 节点,在服务器上频繁加载和卸载同一个巨型大模型。例如训练一个拥有 3970 亿参数的巨型大模型,传统模式需要多组算力节点来回载入几百 GB 的权重文件,造成了计算时间与算力资源的极大浪费。Multi-LoRA 架构彻底告别了反复冷启动的困境。系统选择在 GPU 显存中常驻一个在线运行的共享模型底座,并将多个不同的微调实验作为轻量级适配器模块统一管理。在训练阶段,系统通过在 CPU 与 GPU 之间快速换入和换出(Swap-in/Swap-out)各个适配器的状态来串行执行前向与反向传播,省去了重复加载巨型底座模型的冷启动开销。结合推理阶段的并发处理,多任务的整体实验吞吐量得到大幅提升。测试数据显示,在保证大模型性能没有衰退的前提下,端到端实验吞吐量最高提升了 2.81 倍,单节点绝对时间内的吞吐量则提升了约 3.25 倍。目前,训练代码已在 SkyRL 仓库中开源,旨在帮助开发者以极低显存成本让大模型通过实时生产数据完成小时级自我进化。

83天前

引入 AlphaGo 搜索,全新 MCTS 视频生成框架长视频时长超 Sora

比推消息,据监测,来自滑铁卢大学、布朗大学等机构的研究人员,在 ICLR 2026 提交的论文中提出了一种名为 Planning at Inference 的全新推理时缩放 (Test-Time Scaling) 框架,首次将 AlphaGo 的蒙特卡洛树搜索 (MCTS) 算法跨界应用于长视频生成。这套框架将长视频生成任务建模为顺序决策问题,系统在推理阶段引入 MCTS,利用前瞻性回溯 (look-ahead rollouts) 和反向传播奖励评估多种视频延续片段,从根本上解决了传统分块或单次生成中普遍面临的语义漂移与误差累积难题。为了在连续的视频生成空间中实现高效探索,研究团队特别设计了 Multi-Tree MCTS (多树蒙特卡洛树搜索) 变体。相较于在固定算力预算下采用单一搜索树的传统方法,多树架构能够以更合理的剪枝与分支系数在连续状态空间中展开广泛搜寻,显著提升探索效率。更重要的是, Planning at Inference 具有极高的模块化特征,属于完全即插即用的推理时优化方案。开发人员无需对底层大模型进行任何重新训练或微调,即可将这套方案直接部署于现有的视频生成底座。在以英伟达开源视频预测模型 Cosmos-Predict2 为底座的实验中, Planning at Inference 展现出强大的生成表现。在长视频生成评测中,这套方案成功生成了超过 20 秒的高质量连贯视频。测试数据表明,在物体持久性、时间连贯性以及文本-视频对齐度等核心指标上, MCTS 搜索生成质量相比贪婪搜索 (Greedy Search) 、束搜索 (Beam Search) 和 Best-of-N 等传统基线方法实现了大幅提升。相比当前行业领先的闭源大模型,这套方法生成的视频在时长上分别比 Sora 长 18% 和比 Kling 长 47% ,同时在画面精细度与视觉保真度上与两者保持相当。尽管搜索机制带来了极其优异的画面连贯性,但在推理阶段引入多树搜索也带来了高昂的算力开销。研究人员坦言,当前的 Planning at Inference 框架在生成速度上明显慢于传统的自回归直接生成,这在一定程度上限制了实时部署的可能。然而,随着底层视频生成底座的效率演进与计算硬件算力的不断增长,以计算成本换取画面质量的推理时缩放路线,有望在大模型基础能力突破特定门槛后,成为长视频生成走向工程实用的关键技术路径。

87天前