大模型 · 739

小米 MiMo-V3-Pro 跑分疑似泄露,SWE-Bench Pro 达 72.8 或逼近海外顶尖闭源模型

比推消息,Max For AI 发文披露,一张疑似小米下一代大模型 MiMo-V3-Pro 的 Benchmark 截图在社群中流传。截图显示,该模型重点瞄准 Coding Agent 和通用 Agent 场景,部分测试成绩已接近 Claude Opus、GPT 等海外顶尖模型。据疑似截图,MiMo-V3-Pro 在 SWE-Bench Pro 上取得 72.8 分,高于 GLM 5.3 的 67.9 分和 Kimi K3 的 65.8 分,与 Claude Opus 5 的 74.6 分、GPT-5.6 Sol Max 的 75.4 分相差不到 3 分;Terminal-Bench 2.0 得分 70.6 分,同样接近 Claude Opus 5 的 72.0 分和 GPT-5.6 Sol Max 的 73.5 分。此外,其τ3-bench 得分达到 76.4 分,而 GPT-5.6 Sol Max 为 78.8 分。若上述成绩最终经官方确认并能在正式版本中复现,MiMo-V3-Pro 或将进入全球顶尖模型第一梯队。不过,目前该 Benchmark 截图的真实性及测试条件尚未得到小米官方确认,相关数据仍应视为未经证实的爆料。值得注意的是,小米目前官方公开的最新 MiMo 旗舰为 MiMo-V2-Pro 及 MiMo-V2.5-Pro,因此 V3-Pro 是否存在以及具体发布时间仍有待官方进一步披露。

1天前
唱衰Anthropic的人,可能要失望了

唱衰Anthropic的人,可能要失望了

作者:硅谷Alan Walker 原标题:Anthropic的增长放缓了吗争议的源头。TickerTrends 制作的 Claude Code ARR 追踪图,最新数据为 2026 年 8 月 10 日当周,151.2 亿美元,占 Anthropic 总 ARR 的 21.9%。请注意:这是第三方机构的估算,不是 Anthropic 的官方披露。下面第一节会讲清楚这个区别有多重要。硅谷 Alan Walker 在香港约了顿晚饭,等人的功夫翻群,发现这张图已经被转了三十几次,配的话大同小异——「Anthropic 增长拉平 了,两万亿是泡沫」。Alan 把图存下来,放大看了一遍,然后又看了一遍。问题不在这张图。这张图做得很好,数据也大概率是认真做的。问题在于,几乎所有转发它的人,都在用它回答一个它根本回答不了的问题。01先搞清楚这张图是谁做的左上角有个 Claude 的图标,配色是 Claude 那个熟悉的橙色,一眼看过去很像官方出品。它不是。这张图的作者是 TickerTrends,右上角写着自己的名字。它是一家 第三方数据追踪机构,靠各种外部信号(应用数据、支付面板、招聘、渠道口径等等)去估算一家非上市公司的收入。图里那行小字写得很老实:「tracked allocation」——追踪出来的分配比例。说白了:Anthropic 从来没有公开披露过 Claude Code 单独的 ARR 数字,一次都没有。这条曲线上的每一个点,都是 外人估的。举个例子这就好比有人用「某餐厅门口每天排多长队」来估算它的营业额,然后画出一条漂亮的周度曲线。队伍长度和营业额确实相关,但中间隔着翻台率、客单价、外卖占比、包厢生意——你看到队伍短了三周,可能是那三周厨房在装修。更要命的是口径本身。ARR 的算法是「最近一段时间的收入 × 12」。企业软件的合同不是每天均匀落地的,是一批一批签的。一个季度末签下的大单,会让某一周的曲线跳一大截;下一个季度的大单还没签,曲线就横着走。周度 ARR 追踪对这种块状落地极不敏感——它会把「签约节奏」画成「需求变化」。一句话解读你手里拿的是一张外人估的、口径很钝的、非官方的周度图。用它下"泡沫"这么重的判断,等于用体温计量血压。02这张图自己就打了自己的脸接下来这一点,没见有人提过,但它是整件事里最有意思的地方。图上写着两个数:Claude Code 是 151.2 亿美元,占 Anthropic 总 ARR 的 21.9%。做个除法:算一下151.2 亿 ÷ 21.9% = 约 690 亿美元这是这张图自己隐含的、截至 8 月 10 日当周的 Anthropic 公司总 ARR。而 Bloomberg、Reuters、CNBC 在 8 月 17 日报道的官方口径数字是——7 月底 650 亿美元。看清楚了:这张被拿来论证"增长放缓"的图,它自己隐含的公司总量,比十天前的官方数字还高出 40 亿美元。再往后推十天到今天,如果趋势没断,700 亿以上 是合理的推算(这一句是推断,不是数据)。一句话解读转发的人只读了 151.2 这个数和柱子的高度,跳过了旁边那个 21.9%。而那个 21.9% 说的是:这家公司在大家喊"它慢下来了"的时候,又往上走了一截。同一张图上的两个数,只信对自己观点有利的那个,这不叫分析。03你在看下面那张图,钱在上面那张图里那张图有上下两块。上面是绝对金额(多少亿美元),下面是百分比变化(比四周前涨了百分之多少)。绝大多数人的推理是:在下面...

1天前Wendy#Anthropic #ARR #IPO #MiniMax
百万资金压哨入场,有人却急着退出:Pharos 高息金库引发「时间观」碰撞

百万资金压哨入场,有人却急着退出:Pharos 高息金库引发「时间观」碰撞

撰文:Sanqing,Foresight NewsPharos Network 联合 Vault 基础设施协议 R25 与信贷资产管理机构 Axil,于 7 月 15 日推出了 Axil Prime Credit Vault(APC),一款基于 Pharos 发行的机构级消费信贷 RWA 理财产品。产品同步上线币安钱包、TopNod、OKX Wallet、Bitget Wallet 与 KuCoin Wallet,总募集额度上限 1 亿 USDC,目标年化约 14.3%。截至预存窗口关闭,共计存入 4539 万美元。今年,Web3 链上策略安全暴雷频发,用户资金寻找新的稳健收益落脚处,而项目方也在。币安钱包本次额外拿出 30 万美金 PROS 作为激励,探索 RWA Vault 的市场空间,使该 Vault 在市场引起大量讨论。上线时间正好撞上 Pharos TGE 预存活动的赎回期。上一期金库要求在锁定期结束前约半个月提交赎回申请,7 月 20 日停止计息,七日内完成赎回。习惯 DeFi T+0 的用户回头一看,发现自己不明不白错过了赎回期,开始质疑赎回时间和资产安全。R25 与 Axil 随后在币安广场举办 AMA,Haotian、天晴等知名 KOL 参与讨论,详细说明 RWA 资产与 DeFi Vault 的区别,基金经理(Curator)的角色、消费信贷为什么值得配置,以及从投前到投后的风险管理办法。在复杂的资产逻辑和各有论调的社媒讨论中,有用户在最后一天放入百万资金,有用户找项目方要求提早赎回。7 月 23 日,Pharos 发布公告:上一期按时提交申请的用户已收到全部本金与利息,打破「资金安全」疑虑;错过窗口的资金按金库预设规则自动结转下一个三个月周期,继续按 14% USDC 年化计息。这场争论暴露的问题比赎回本身更重要,尽管 RWA TVL 已超 380 亿美元,非机构链上用户在投资 RWA 产品时明显水土不服。机构驱动、稳定、高息,但往往需要更长的锁定期和复杂的理解成本,从 DeFi 到 RWA,市场是否真的已准备好?高收益、低门槛、高流动性,RWA 的「不可能三角」贝莱德的 BUIDL 门槛 500 万美元、只对合格购买者开放,却能通过稳定币通道近乎即时申赎;APC 门槛低到普通用户随手可买,反而必须锁三个月。决定流动性的从来不是门槛高低,而是底层资产的变现速度。BUIDL 的底层是美国国债,全球最深的二级市场随时能接盘;APC 的底层是几十万笔新兴市场消费贷,鲜有人会随时准备资金大量买入。由此形成了 RWA 现阶段绕不开的三角:高收益、低门槛、高流动性,三者只能取其二。例如富兰克林邓普顿的 BENJI,二十美元起投(低门槛)、支持日赎回(高流动性),年化就只有 3% 到 5%;想要两位数收益,就得接受非标资产和锁定期。这即是流动性溢价,超额收益的相当一部分,正是放弃流动性换来的对价。APC 则是高收益与低门槛的组合,代价则是流动性。这个取舍本身没有对错,也能解释这场争议的全部来源。散户拿到了原本只对机构开放的资产,也一并接过了机构那套讲究久期匹配的时间规矩。机构资金的使用期限在投入之前就已排定,锁定期属于可预期的成本;私募信贷、封闭式基金本就带着赎回限制。而大多数链上普通用户不一样,后者的第一诉求多是随进随出。所以眼下的「零售化」 RWA,准确说大多只是分发端的零售化。Web3 钱包和低起投金额促成了低门槛,但流动性结构仍按机构的逻辑设计。理解了这个三角,剩下的问题就变得具体:流动性这条边为什么非牺牲不可,14.3% 的高收...

1天前Foresight News#WEB3

钉钉推出 AI 办公 App QwenNote,硬件 QwenNote A2 曝光

比推消息,据《读佳》报道,钉钉正推进全新 AI 办公应用 QwenNote(千问听记)。该应用定位为 AI 随身助理,通过软硬结合将实时语音转写、总结与翻译融为一体,并与 AI Agent 深度结合,把 Agent 能力嵌入语音输入,推动从单纯记录转向自动化执行。应用支持实时转写与中英双语识别及语种切换,可生成结构化会议纪要、大纲与待办,并内置基于听记素材的 AI 问答与快捷指令。QwenNote 提供语音备忘功能,需扫码连接录音设备,长按设备背面按钮即可记录灵感,录音完成后自动归档、生成标题与简要总结并标注时间。产品还设有无痕保护模式,开启后原始音频将被物理删除、仅保留转写文本,以适应涉密场景。应用内已亮相配套硬件 QwenNote A2,同属千问听记硬件生态,生态中还包括 DingTalk A1、DingTalk A1 Pro、Cleer H1 等,用户可扫码完成绑定。报道称,钉钉希望借软硬一体补齐线下语音采集入口,形成现场收音、实时双语转写、AI 纪要问答与钉钉组织协同的闭环,听记素材可同步至钉钉 AI 听记并支持个人私有隔离。软件侧其持续将大模型嵌入文档、会议与 IM 等场景,硬件侧则扩展千问听记产品线。相关硬件尚未大范围公开检索到更多正式发布信息。

2天前

宇树科技宣布推动“物理 AI 机器人自进化”

比推消息, 宇树科技创始人、董事长王兴兴在 2026 世界机器人大会主论坛上宣布,宇树科技推动“物理 AI 机器人自进化”,由 AI 大模型驱动,自动搜索论文、编写控制代码、在仿真环境中验证、部署真机测试,再由 AI 和人类共同评分反馈,形成闭环迭代。该体系一旦运行,可大幅提升开发效率与迭代速度。王兴兴提到,下一个十年,在 AI 大爆发背景下,机器人进化速度已远超预期,“这是一个全新的起点”。未来产业的临界爆发点将是,用户将机器人带到任意陌生环境,仅通过语言或文字指令就能完成 80%左右的日常任务,这个节点有望快则 2-3 年、慢则 5-10 年就会到来。(每经)

2天前

宇树王兴兴:具身智能 ChatGPT 时刻或需 2 至 10 年

比推消息,在 2026 世界机器人大会上,宇树科技创始人、董事长王兴兴发表题为“展品到产品:人形机器人产业的下一个十年”的主题演讲。他表示,公司近年持续推动机器人走进生活,包括在汽车工厂落地应用、在自家工厂部署进行简单测试,以及 AI 团队推进机器人进入家庭干活,但因整体效率与泛用性仍不够高,尚未大规模推广。王兴兴认为,迈向具身智能的 ChatGPT 时刻,理想情况下需要 2 至 3 年,或更长 5 至 10 年。达到这一时刻意味着在 80% 的陌生场景中,机器人能通过语音或文字指令顺利完成约 80% 的任务。目前最核心的挑战是 AI 大模型的输入输出与真实机器人的对齐。

2天前
姚顺雨重整腾讯多模态路线:靠拢梁文锋,远离李飞飞

姚顺雨重整腾讯多模态路线:靠拢梁文锋,远离李飞飞

文|苗正编辑|王靖来源|字母AI腾讯混元多模态团队又发生了一起人事变动。据媒体报道,曾负责xAI多模态理解负责人蔺旭东,已经离开xAI,加入腾讯混元,担任多模态内容生成算法负责人。这则人事消息之所以值得关注,是因为它发生在混元多模态团队持续调整的背景下。过去一段时间,混元内部陆续传出负责人离职、研究人员转岗和新成员加入的消息。原多模态理解负责人胡瀚离职创业,田永龙等人加入腾讯,原有多模态团队的汇报关系也随着大语言模型部门和多模态模型部门的整合而发生变化。但这是否意味着腾讯多模态团队正在“改朝换代”,目前还不能直接下结论。公开信息能够确认的是,混元确实出现了人员流动和组织重组。蔺旭东的加入传闻,更像是这场调整中的一个新信号:腾讯正在重新组合多模态理解和内容生成这两条路线。那么问题来了,蔺旭东究竟是什么来头,他能为腾讯补上什么能力?以及腾讯的多模态路线是否正在从“生成内容”转向了姚顺雨更偏向的“理解上下文并在世界中行动”?蔺旭东是什么来头他加入腾讯后能做什么?公开资料显示,蔺旭东2018年毕业于清华大学,随后赴哥伦比亚大学攻读博士。在读博期间,他的研究方向包括嵌入学习、视频分析和生成模型,也曾参与哥伦比亚大学与Facebook AI合作的Vx2Text项目。V指的是视频,x指的是未知数,可以是声音、语音甚至是环境音,2代表to,Text则代表字幕。它的逻辑是,先把视频、声音等不同模态转换成类似“语言token”的向量,再统一送入语言模型进行融合,最后由自回归解码器生成开放式文本。Transformer只能理解token,所以AI本质上是不理解视频和音频这两种文件形式的,也就更不可能将其转换成文字。举个例子,一只狗在游泳池旁边跳进水里,那么Vx2Text的视频识别器看(V)就会输出关键词:狗、跳跃、游泳池;声音识别器(x)就会输出:水声、扑通。虽然Vx2Text的产品功能是“生成”,但产品的核心难点在于“理解”。当然,Vx2Text并不是简单地把画面“翻译”成几句话而已。模型需要从视频里识别人物、物体、动作和事件,还要理解这些东西在时间上的变化,最后再把视觉信息组织成语言。博士毕业后,蔺旭东进入DeepMind,参与Gemini相关的多模态预训练和后训练工作。2025年,他又加入xAI,公开资料称其负责多模态理解方向,并参与多模态内容理解与生成模型的训练。如今他加入腾讯混元,将负责混元多模态内容生成算法。蔺旭东的加入与其说是提升混元多模态生成的性能,倒不如说是为了解决一个困扰所有多模态的问题——理解。以前的生成模型更像一个画面制造器。给它一句提示词,它可以生成一张图片、一段视频。但只要用户提出更复杂的要求,模型就有点跟不上了。比如人物在长视频里变了,物体的形状前后不一致,摄像机运动不符合空间关系等等。这不是因为模型不会生成,而是因为它没有稳定地记住和理解世界。所以,把蔺旭东放到多模态内容生成的位置上,可能正是因为他把多模态,“翻译”成AI能理解的东西。蔺旭东的加入要放在一个更大的背景下才能看得清楚,那就是如今腾讯混元正在重新整理自己的多模态路线。2025年1月,腾讯杰出科学家(Tencent Distinguished Scientist)胡瀚接替此前离职的刘威,全面负责混元多模态大模型的研发,同时担任腾讯混元大模型Tech Lead。2025年下半年腾讯内部组织调整,他从多模态模型部,调入了大语言模型部旗下的“Frontier”前沿技术研究组,头衔变成了多模态理解方向负责人,汇报线也改为向姚顺雨汇报。实际地位从“一个独立部门的领导”变成了“大语言模型...

2天前字母AI#AI #李飞飞 #梁文峰 #腾讯

字节 Seed 重组:预训练、RL 收拢,办公 Agent 单独成组

比推消息, AI 快讯,字节跳动大模型团队 Seed 完成新一轮组织调整。Seed Foundation Model 新设四个一级部门,把此前分散在文本、代码、视觉和语音等方向的数据、后训练团队重新合并。核心变化是统一预训练数据和强化学习,同时把应用后训练拆成 Work 和 Chat 两条线。Pretrain Data 统一负责 Omni 模型的多模态数据,以及超大模型预训练所需的数据。Horizon RL 集中负责强化学习,提升模型基础能力。Product Posttrain-Work 面向办公和 B 端,重点优化模型调用工具、操作电脑和执行长任务的能力。原 Application 团队则更名为 Product Posttrain-Chat,继续负责 C 端对话模型。四个部门均向吴永辉汇报。过去 Seed 更多按文本、代码、视觉、语音等方向分团队,各自都有数据和后训练人员。现在字节希望下一代模型直接走向 Omni,让不同模态进入同一个基座。Seed 此前还在讨论训练超过 5 万亿参数的模型。模型越大、模态越多,原来分散的研发方式也越容易出现重复投入。类似的调整也出现在腾讯。腾讯 7 月将混元的大语言模型和多模态团队合并,由姚顺雨统一负责。字节这次还专门成立了 Work 后训练部门,说明办公 Agent 已经成为基础模型团队单独优化的一条产品线。

3天前

李飞飞警告美国反 AI 情绪情绪升温:若缺乏积极发展路径,全球都将受影响

比推消息, 人工智能先驱李飞飞表示,科技行业需要更好地向公众解释人工智能带来的价值,并警告美国日益增长的反 AI 情绪可能对全球 AI 发展造成风险。李飞飞在接受彭博采访时表示,科技从业者需要加强与公众沟通,展示 AI 技术能够带来的积极影响。她指出“如果我们没有展示出积极的态度和积极的发展方向,所有人都会受到影响”,美国在全球科技领域具有重要影响力,如果美国无法展现“积极的 AI 态度和发展路径”,最终将影响整个世界。作为计算机视觉领域的重要研究者,李飞飞近年来持续推动 AI 技术从实验室走向现实应用,她创办的 AI 初创公司 World Labs 致力于开发空间智能(Spatial Intelligence)技术,探索 AI 理解和交互现实世界的能力。李飞飞认为,当前 AI 行业面临的不仅是技术挑战,也包括社会接受度、公众信任以及监管环境等问题。随着生成式 AI 快速普及,围绕就业影响、数据隐私、安全风险等方面的担忧不断增加,美国社会对 AI 发展的反弹声音正在扩大。她强调,AI 行业需要更加主动地解释技术如何改善医疗、科学研究、生产效率等领域,而不是仅关注技术竞争本身。近年来,全球主要科技公司持续加大 AI 投资,推动大模型、AI 基础设施和智能代理等技术发展。但与此同时,AI 监管、就业替代以及社会影响问题也成为政策制定者和公众关注焦点。

3天前

特斯拉上线豆包大模型

比推消息,特斯拉上线豆包大模型。据介绍,特斯拉车机现已陆续推送。(火山引擎)

3天前