推理 · 1042

Gemini 3.7 Flash 成爆款:上线一周破增长纪录

比推消息, AI 快讯,谷歌 CEO Sundar Pichai 表示,Gemini 3.7 Flash 上线首周就打破了此前 Gemini 模型的增长纪录,成为谷歌迄今增长最快的 Gemini 模型。不过谷歌没有公布具体增长口径和使用规模。这款模型确实踩中了性价比甜点区。Artificial Analysis 给它的综合智能指数为 56,高推理模式输出速度约 340 token/s,每项评测任务成本约 0.40 美元,并进入智能与完成时间的帕累托前沿。中等推理模式成本进一步降至 0.26 美元,进入智能与成本的帕累托前沿。ARC Prize 的独立验证中,Gemini 3.7 Flash 高推理模式在 ARC-AGI-2(抽象推理基准)拿到 84.6%,每项任务成本仅 0.25 美元。谷歌也迅速把 3.7 Flash 铺进自家产品。Gemini App、Antigravity、AI Studio 已经接入,Google Search 也开始使用该模型。

7小时前

腾讯芯片负责人高剑林离职创业,瞄准 RISC-V 高性能 AI CPU 赛道

比推消息,据 MaxForAI 披露,腾讯芯片研发核心负责人高剑林近期已离开腾讯并开启创业,计划围绕高性能 AI 服务器和 Agentic AI(智能体 AI)方向,研发基于 RISC-V 架构的高性能 CPU。高剑林被认为是腾讯自研芯片体系早期核心推动者之一。资料显示,他于 2013 年在腾讯内部组建 FPGA 硬件团队,2018 年开始布局 AI 芯片研发,2020 年成立蓬莱实验室,并推动腾讯多款 AI 芯片研发及数据中心部署。此次创业方向聚焦 CPU,而非当前竞争激烈的 AI GPU 市场。报道称,高剑林认为,随着 Agentic AI 快速发展,AI 推理过程将涉及模型调用、工具执行、搜索、数据库交互以及大量任务调度,CPU 将在 AI 系统中承担更加重要的调度和控制角色。据报道,高剑林此前在腾讯期间已涉及 RISC-V 相关研发,并参与芯片架构、验证、后端等多个技术方向。其新公司计划基于开放指令集 RISC-V 打造高性能服务器 CPU,以切入 AI 基础设施市场。目前,高剑林新公司名称、融资情况及具体产品发布时间尚未公开。市场关注其是否会成为中国 AI 芯片领域又一家瞄准服务器 CPU 和智能体基础设施的新兴力量。

7小时前

英伟达 Rubin 开始量产交付:微软首批设备已到货

比推消息, AI 快讯,微软 CEO Satya Nadella 晒出数据中心现场图,微软的首批量产版 NVIDIA Vera Rubin 已经到货。英伟达随后确认,Vera Rubin 正在进入全面量产。Vera Rubin 是 Blackwell 之后的新一代机架级 AI 计算平台。一套 NVL72 集成 72 块 Rubin GPU 和 36 颗 Vera CPU。英伟达称,相比 GB200 NVL72,它能把每百万 Token 的推理成本降到约十分之一,训练 MoE 模型所需 GPU 数降到四分之一。

12小时前

小米 MiMo 系列模型正式登陆 B.AI API

比推消息,B.AI 平台宣布小米自研 MiMo 系列模型正式上线 API 服务,首批开放 MiMo-V2.5 与 MiMo-V2.5-Pro 两款模型。 其中 MiMo-V2.5 为 310B 稀疏 MoE 原生全模态模型,支持图文音视频全模态输入与 1M 超长上下文,专为多模态 Agent 与通用编程场景打造;MiMo-V2.5-Pro 则达到 1.02T 稀疏 MoE 参数规模,定位旗舰文本模型,主攻复杂推理与长周期软件工程,SWE-Bench Verified 基准测试取得 78.9 分的高分表现。 即日起,开发者可通过 B.AI API 调用两款模型,支持官方组接入与自选服务商双重模式,并享低至 4 折优惠。

1天前

DeepSeek 上线多模态模型 V4-Flash-Vision-Exp,并开放 API 服务

比推消息, 据 DeepSeek 公众号,DeepSeek 已上线多模态视觉理解模型 V4-Flash-Vision-Exp,并开放 API 服务。该模型在 V4-Flash 基础上新增图像理解与视觉生成能力,支持文本、图片等多模态输入输出,并面向开发者提供推理、生成等能力调用接口。

1天前

DeepSeek 视觉模型多模态 Agent 能力逼近 Opus 4.8,4 项打成 2:2

比推消息,DeepSeek 公布 V4-Flash-Vision-Exp 首批 Agent 跑分。在 4 项多模态 Agent 评测中与 Opus 4.8 打成 2 胜 2 负:Agents' Last Exam 27.3 对 25.7,ZeroBench 35.0 对 34.0;ApexBench 36.5 对 39.4,Chartography 64.3 对 65.0。相比纯文本版 V4-Flash-0731,视觉版在 ApexBench 从 26.2 升至 36.5,Agents' Last Exam 从 25.2 升至 27.3。官方注明纯文本版会忽略多模态内容,故主要体现补上视觉输入后的能力。加上视觉后文本 Agent 能力未明显缩水,7 项文本评测中 6 项高于 V4-Flash-0731,如 DeepSWE 从 54.4 升至 59.3(超 Opus 4.8 的 58.0),Toolathlon 75.9 几乎追平 Opus 4.8 的 76.2。该结果来自 DeepSeek 官方自测,非第三方独立榜单;公开 Code Agent 文本任务使用 DeepSeek Harness 极简模式,推理档位为 max。

1天前
唱衰Anthropic的人,可能要失望了

唱衰Anthropic的人,可能要失望了

作者:硅谷Alan Walker 原标题:Anthropic的增长放缓了吗争议的源头。TickerTrends 制作的 Claude Code ARR 追踪图,最新数据为 2026 年 8 月 10 日当周,151.2 亿美元,占 Anthropic 总 ARR 的 21.9%。请注意:这是第三方机构的估算,不是 Anthropic 的官方披露。下面第一节会讲清楚这个区别有多重要。硅谷 Alan Walker 在香港约了顿晚饭,等人的功夫翻群,发现这张图已经被转了三十几次,配的话大同小异——「Anthropic 增长拉平 了,两万亿是泡沫」。Alan 把图存下来,放大看了一遍,然后又看了一遍。问题不在这张图。这张图做得很好,数据也大概率是认真做的。问题在于,几乎所有转发它的人,都在用它回答一个它根本回答不了的问题。01先搞清楚这张图是谁做的左上角有个 Claude 的图标,配色是 Claude 那个熟悉的橙色,一眼看过去很像官方出品。它不是。这张图的作者是 TickerTrends,右上角写着自己的名字。它是一家 第三方数据追踪机构,靠各种外部信号(应用数据、支付面板、招聘、渠道口径等等)去估算一家非上市公司的收入。图里那行小字写得很老实:「tracked allocation」——追踪出来的分配比例。说白了:Anthropic 从来没有公开披露过 Claude Code 单独的 ARR 数字,一次都没有。这条曲线上的每一个点,都是 外人估的。举个例子这就好比有人用「某餐厅门口每天排多长队」来估算它的营业额,然后画出一条漂亮的周度曲线。队伍长度和营业额确实相关,但中间隔着翻台率、客单价、外卖占比、包厢生意——你看到队伍短了三周,可能是那三周厨房在装修。更要命的是口径本身。ARR 的算法是「最近一段时间的收入 × 12」。企业软件的合同不是每天均匀落地的,是一批一批签的。一个季度末签下的大单,会让某一周的曲线跳一大截;下一个季度的大单还没签,曲线就横着走。周度 ARR 追踪对这种块状落地极不敏感——它会把「签约节奏」画成「需求变化」。一句话解读你手里拿的是一张外人估的、口径很钝的、非官方的周度图。用它下"泡沫"这么重的判断,等于用体温计量血压。02这张图自己就打了自己的脸接下来这一点,没见有人提过,但它是整件事里最有意思的地方。图上写着两个数:Claude Code 是 151.2 亿美元,占 Anthropic 总 ARR 的 21.9%。做个除法:算一下151.2 亿 ÷ 21.9% = 约 690 亿美元这是这张图自己隐含的、截至 8 月 10 日当周的 Anthropic 公司总 ARR。而 Bloomberg、Reuters、CNBC 在 8 月 17 日报道的官方口径数字是——7 月底 650 亿美元。看清楚了:这张被拿来论证"增长放缓"的图,它自己隐含的公司总量,比十天前的官方数字还高出 40 亿美元。再往后推十天到今天,如果趋势没断,700 亿以上 是合理的推算(这一句是推断,不是数据)。一句话解读转发的人只读了 151.2 这个数和柱子的高度,跳过了旁边那个 21.9%。而那个 21.9% 说的是:这家公司在大家喊"它慢下来了"的时候,又往上走了一截。同一张图上的两个数,只信对自己观点有利的那个,这不叫分析。03你在看下面那张图,钱在上面那张图里那张图有上下两块。上面是绝对金额(多少亿美元),下面是百分比变化(比四周前涨了百分之多少)。绝大多数人的推理是:在下面...

1天前Wendy#Anthropic #ARR #IPO #MiniMax

Arthur Hayes:Flop Labs 将创建去中心化算力网络,测试网参与者将获约 20% 代币供应

比推消息,Arthur Hayes 发表文章 “The Book of Genesis”,以神话叙事阐述其 AI/加密项目 Flop Labs 的核心理念与代币经济设计。他指出,当前 AI 市场缺乏统一的算力定价标准,各模型对 “token” 的定义和定价各不相同。Hayes 提出构建去中心化算力网络 Flop Network,以 FLOP 为原生代币,代表对算力(FLOPs)的直接索取权,让 AI 代理和人类以全球统一的算力单价进行交易。FLOP 代币经济采用公平启动模式,团队自筹资金,无预售。矿工通过提供 “有用推理证明” (PoUI)挖矿获得 FLOP 区块奖励和推理费用,AI 代理可用 $FLOP 购买算力(“食物”)并结合去中心化存储获得持久记忆(“人格”)。测试网参与者将获得约 20% 的代币供应量(十年内分发)。Hayes 称,若 AI 代理经济预测成真,Flop Network 的价值或远超比特币。

2天前

OpenRouter CEO:Stripe 已签署协议收购 OpenRouter

比推消息, OpenRouter CEO Alex Atallah 发文宣布,Stripe 已签署协议收购 OpenRouter。交易完成后,OpenRouter 将保持现有名称、产品、路线图和使命不变,并继续坚持模型中立原则,其模型路由决策不会因母公司变化而改变。Atallah 表示,OpenRouter 目前已接入 400 多个 AI 模型,服务超过 1000 万开发者和企业,每天处理超过 10 万亿 Token,成立以来推理量每年至少增长 10 倍。关于选择 Stripe 的原因,Atallah 表示,Stripe 拥有庞大的客户网络、全球基础设施运营经验,以及成熟的欺诈和滥用管理能力,双方结合能够让 OpenRouter 在不牺牲中立性和使命的前提下更快扩张。

2天前

Marvell 与谷歌达成定制 AI 芯片合作,向谷歌发行 122 亿美元认股权证

比推消息,Marvell Technology 8 月 19 日向美国 SEC 提交文件披露,公司已与谷歌扩大定制半导体合作。双方于 7 月 29 日签署商业协议,覆盖与谷歌 TPU 生态系统相关的 AI 推理加速器、存储控制器、网络接口控制器、内存接口控制器及近内存计算等产品。作为合作一部分,Marvell 于 8 月 18 日向谷歌发行认股权证,允许其以每股 206.58 美元的价格购买最多约 5897 万股公司普通股,全部行权价值约 122 亿美元。其中约 136 万股在第一年内按时间归属,其余部分则根据谷歌未来采购定制产品收入分批归属(每 5 亿美元收入归属一批),最长至 2033 财年,对应潜在累计收入上限约 1200 亿美元。消息公布后,Marvell 股价大涨逾 11%,竞争对手博通股价下跌。分析认为,此举强化了 Marvell 在超大规模云厂商定制芯片领域的地位。

2天前