KIMI · 212

小米 MiMo-V3-Pro 跑分疑似泄露,SWE-Bench Pro 达 72.8 或逼近海外顶尖闭源模型

比推消息,Max For AI 发文披露,一张疑似小米下一代大模型 MiMo-V3-Pro 的 Benchmark 截图在社群中流传。截图显示,该模型重点瞄准 Coding Agent 和通用 Agent 场景,部分测试成绩已接近 Claude Opus、GPT 等海外顶尖模型。据疑似截图,MiMo-V3-Pro 在 SWE-Bench Pro 上取得 72.8 分,高于 GLM 5.3 的 67.9 分和 Kimi K3 的 65.8 分,与 Claude Opus 5 的 74.6 分、GPT-5.6 Sol Max 的 75.4 分相差不到 3 分;Terminal-Bench 2.0 得分 70.6 分,同样接近 Claude Opus 5 的 72.0 分和 GPT-5.6 Sol Max 的 73.5 分。此外,其τ3-bench 得分达到 76.4 分,而 GPT-5.6 Sol Max 为 78.8 分。若上述成绩最终经官方确认并能在正式版本中复现,MiMo-V3-Pro 或将进入全球顶尖模型第一梯队。不过,目前该 Benchmark 截图的真实性及测试条件尚未得到小米官方确认,相关数据仍应视为未经证实的爆料。值得注意的是,小米目前官方公开的最新 MiMo 旗舰为 MiMo-V2-Pro 及 MiMo-V2.5-Pro,因此 V3-Pro 是否存在以及具体发布时间仍有待官方进一步披露。

1天前
从4个模型到500多个,OpenRouter三年增长3万倍后被收购

从4个模型到500多个,OpenRouter三年增长3万倍后被收购

作者:Menlo Ventures编译:佳欢,ChainCatcher原标题:OpenRouter 背后早期投资人复盘投资始末今天,OpenRouter 宣布已与 Stripe 达成收购协议。距离 OpenRouter 于 2023 年正式推出,刚刚过去三年。OpenRouter 最初以“LLM 的统一接口”为定位上线,当时只支持 4 个模型:GPT-3.5、GPT-4、Together 的 GPT NeoXT 和 Cohere xlarge。公司成立之初基于两个核心判断:第一,AI 的使用规模最终会非常庞大,并渗透到各个领域;第二,市场上会出现大量不同模型,它们各有取舍,用户也会根据不同需求选择不同模型。事实证明,这两个判断都远远超出了当时的预期。自上线以来,OpenRouter 平台处理的 Token 数量增长了约 3 万倍,目前按年化计算已经超过 4500 万亿 Token,平台上的支出规模也达到了相当惊人的水平。与此同时,OpenRouter 支持的模型数量已经从最初的 4 个增加到 500 多个。图:从成立到被收购,OpenRouter Token 使用量增长情况Menlo Ventures 很幸运能够参与这段旅程。2025 年 3 月,我们通过与 Anthropic 合作设立的 Anthology Fund 参与了 OpenRouter 的种子轮融资。OpenRouter 创始人兼 CEO Alex Atallah 此前曾创办 OpenSea,后者估值一度达到 133 亿美元。他的联合创始人包括在 Discord 上认识的技术高手 Louis Vichy,以及执行力极强的 COO Chris Clark。2025 年 5 月,我们领投了 OpenRouter 的 A 轮融资,Matt 加入公司董事会,Deedy 担任董事会观察员。今年早些时候,看到 OpenRouter 的客户数量和收入迅速增长,以及公司围绕模型选择和评估构建更强“模型智能”能力的产品路线后,我们又继续加码了 B 轮融资。在科技行业,一个想法往往需要经过多年时间,才能从少数人的判断变成行业共识。而就在几周前,这件事发生了:从 Ramp 到 Cursor,超过 10 家公司几乎同时推出了自己的模型路由产品。短短几年时间,OpenRouter 已经成为 AI 时代最重要的公司之一。图:确定领投 OpenRouter A 轮时的合影乍看之下,Stripe 似乎并不是 OpenRouter 最自然的收购方,但两家公司实际上惊人地相似。两者都通过一个可以直接接入的 API,把原本复杂的交易流程变得简单,并从中收取一定比例的费用。只不过 OpenRouter 处理的是 AI 模型。按照 Stripe 一贯的说法,两家公司结合之后,仍然是在做同一件事:提高“互联网 GDP”。事实上,一年多以前,OpenRouter 就已经把自己称为“LLM 领域的 Stripe”。OpenRouter 的核心价值OpenRouter 是 Deedy 在 2024 年加入 Menlo 后最早接触的公司之一。这家公司几乎正好处于我们 AI 基础设施投资逻辑的核心位置。Menlo 在《2024 企业 AI 报告》中提出了两个投资 OpenRouter 所必须成立的判断:AI 支出会大幅增长,同时开发者不会只使用一个模型,而会同时采用多个模型。图:Menlo 最初发给 OpenRouter 的联系邮件作为同样会写代码、会实际使用这些模型的人,我们很早就意识到,不同模型在成本、延迟和性能之间存在非常明显的差...

1天前burnking#OpenRouter

里昂:智谱 GLM-5.3 后训练能力显著提升,维持跑赢大市评级

比推消息,据金十报道,里昂发表研究报告指,智谱 (02513.HK) GLM-5.3 API 即日起开放调用,在复杂编码及长周期代理任务方面展现国内同业中领先性能,虽然参数规模较小,但在一众基准测试中都取得开放权重 SOTA 表现,并在 Artificial Analysis 智能指数中获得 60 分,与 Kimi 3 持平,超越通义千问 3.8 Max。该行估算 GLM 模型的 OpenRouter 收入份额已从今年 1 月的 1% 升至 7 月的 7%,领先 DeepSeek 的 6% 及月之暗面的 3%。认为 DeepSeek 近期加价反映行业竞争健康,而 GLM 5.3 已重夺帕累托前沿地位。近期股价疲弱或反映市场对 Anthropic 年化经常性收入减速的过度反应,维持智谱跑赢大市评级,目标价为 2061 港元。

3天前

GLM-5.3 智能指数暴涨到 60:追平 Kimi K3,API 单价没涨

比推消息,据监测,智谱正式开放 GLM-5.3 API。此前模型发布时,API 没有立即上线。与此同时,Artificial Analysis 的独立评测也出炉了:Intelligence Index 从 GLM-5.2 的 53 暴涨到 60,追平 Kimi K3,只比 GPT-5.6 Sol 低 1 分。等权重按计划公开后,它将和 Kimi K3 并列 AA 评分最高的开放权重模型。涨得最猛的是 Agent。GDPval-AA v2 的 Elo 从 1524 跳到 1770,一次涨了 246 分,排所有模型第二,仅次于 Claude Opus 5 的 1855,也比 Kimi K3 的 1668 高出 100 多分。API 单价没有跟着涨。输入仍是每百万 Token 1.40 美元,输出 4.40 美元,缓存输入 0.26 美元,和 GLM-5.2 完全一样。不过 5.3 明显更能花 Token。AA 测得它每项任务平均输出约 1.87 万 Token,比 5.2 多 20%。因此单任务实际成本从 0.44 美元涨到 0.68 美元,贵了约 55%。即便如此,同档模型里仍比 Kimi K3 的 0.84 美元和 GPT-5.6 Sol 的 1.23 美元便宜。

3天前
为什么资本追逐 AI Native,不再理睬互联网老登

为什么资本追逐 AI Native,不再理睬互联网老登

资本不奖励守旧,不是因为守旧的人有错。是守旧的部分已经明码标价,没有信息差,也就没有超额收益。2026 年上半年,全球风险投资 5100 亿美元,一个半年超过了 2025 全年的 4400 亿。七成以上进了 AI,OpenAI 和 Anthropic 两家拿走 2170 亿,占 43%。钱多到这个份上,你会以为人人都能分一点。事实是分配比总量更极端,而且第一道筛子不筛行业,筛人。被筛掉的那一类,现在有个不太客气的叫法:互联网老登。先说死一件事:本文里的「老登」跟年龄没关系。它指的是一套在移动互联网周期里成型、被反复验证、给持有人带来过巨大回报的方法论。持有它的人可能四十五岁,也可能三十二岁。被重新定价的是这套方法论,不是出生年份。把这两件事搞混,是老登最常犯、也最舒服的一个错——因为如果问题是别人年龄歧视,你就一个字都不用改。01什么叫 AI Native这个词已经被用烂了。会用 ChatGPT 不叫 AI native,公司名里带个 AI 也不叫,二十几岁更不叫。真正把人分开的是三条。第一条,出发点是模型,不是需求。老登做产品的顺序是:看用户要什么,写成需求,找技术实现。AI native 的顺序反过来:先摸清模型今天能干到哪一步、明天可能到哪一步,然后从这个能力边界往外长产品。前者把模型当工具,后者把模型当地基。这两种人做出来的东西,第一版看不出差别,到第三版差出一个物种。第二条,组织的默认单位不是人。互联网时代的分工,是把一件事拆给十个人。AI native 公司的分工,是把十件事收给一个人加一堆 agent。国内一家应用层公司的 CEO 说过,团队不到十个人,但有大量 AI 在夜里干活,员工每天早上第一件事是检查 AI 前一晚交的活。Cursor 那边更极端,公开报道里提到公司没有产品经理,工程师自己写代码、自己跟用户聊、自己参与招人。第三条,信息是一手的。AI native 的输入来源是论文、模型卡、GitHub 的 issue、X 上的原始讨论、自己跑的 eval。老登的输入来源是行业峰会、闭门会、券商报告、公众号解读,以及找人喝咖啡。这一条最不起眼,杀伤力最大,后面单独说。三条都满足,二十五岁是 AI native,四十五岁也是。三条都不满足,二十五岁照样是老登。AI native 是个状态,不是个年龄段。麻烦在于,这个状态的入场券是作品,不是履历。02两张名单把这一轮的结果摊在桌面上,是两张名单。第一张全是 AI native 的公司。它们的估值不是在涨,是在换量级。名单一 · 上游OpenAI 2026 年 Q1 单轮融资 1220 亿美元,投后 8520 亿美元,史上最大一笔私募融资。Anthropic Q2 单轮 650 亿美元,投后 9650 亿美元,约占该季度全球风投总额的一半;5 月的收入运行率已到约 470 亿美元。DeepSeek 2026 年 5 月首轮融资约 700 亿元人民币。同年 4 月,梁文锋将直接持股由 1% 提至 34%,通过关联主体合计控制约 84.29% 股权。月之暗面(Kimi) 2025 年 12 月估值 43 亿美元;2026 年 1‒2 月连做三轮至 180 亿;5 月 D 轮约 20 亿美元、投后破 200 亿;7 月一轮超 35 亿美元、投后 350 亿;Pre-IPO 目标投前 500 亿。ARR 3 月破 1 亿、5 月破 2 亿、6 月站稳 3 亿美元,API 占七成以上。智谱 · MiniMax 2026 年初先后登陆港股,市值均破千亿元人民币,国内首批上市的大模型公司。第二张...

3天前Wendy#AI #DeepSeek
当地方城投开始卖Token,这门生意见顶了?

当地方城投开始卖Token,这门生意见顶了?

作者:小饼原标题:当地方城投开始卖 Token7 月 30 日,嘉兴,长三角(嘉兴)Token 运营中心正式启动。站在台前的运营方,是嘉兴市城市投资发展集团,一家修过路、建过桥、管过燃气、做过城市更新的城建国企 。市领导调研时问了一句所有人心里都想问的话:“为什么是你们城投来做?”过去二十年,中国城市化的默认分工是:政府出地、城投修路、企业上楼。如今,一家城建国企,开始亲自下场卖 Token。有人解读道,城投入场之日,Token 利润见顶之时。修路的,卖起了 Token首先澄清一个概念:城投并不直接生产 Token,也不建万卡集群,运营中心负责人马寅枭自己说得直白:“我们是搬运工”,也就是把分散的算力和模型整合起来,做“模型批发商”。以嘉兴模式为例,其核心是“五个统一”,统一 API 入口、统一 Token 计量、统一费用结算、统一政策抵扣、统一安全审计。企业一次接入,即可按需调用 DeepSeek、Qwen 等一百余款主流大模型,并提供普惠包、按需套餐和专属定制三类服务,目标是让 AI 能力“像水、电一样便捷透明、随取随用” 。为什么此刻地方城投开始下场卖 Token?中国过去三十年的基础设施建设有一条清晰路径:任何一种新型基础设施,一旦被国家认定为“公共服务”,就会走上同一条路,先是民间资本探路,然后国资平台接管运营,最终变成市政公用事业。水、电、气、宽带,无一例外。探路者负责证明需求存在,国资负责把它变成人人可用、价格可控、长期运营的公共品。嘉兴这次的操作,从逻辑上看,就是算力基础设施走到了这条路径的“国资接管”阶段。而且嘉兴的底牌很硬:作为国家算力枢纽节点城市,全市集聚了润泽、阿里、中国电信、中国移动四个万卡级算力中心,算力规模居浙江首位;产业侧,全市拥有规上工业企业 6327 家、AI 科创企业 230 余家。修路是把分散的出行需求聚合成可收费的路网,卖 Token 是把分散的 AI 需求聚合成可计量的算力网,题材不同,手法相同。一张越来越拥挤的牌桌城投不是唯一想卖 Token 的国资玩家。2026 年春天,三大运营商几乎同时宣布进入“Token 时刻”。中国电信董事长柯瑞文的原话是“智能云体系就是词元经营体系”,中国移动要推动“Byte+Token 双高速增长”,上海移动直接推出 1 元 40 万 Token 的通用服务,连话费都能付。运营商转向 Token 的动力很朴素: 2025 年,中国移动营收增速 0.9%,中国电信 0.07%,中国联通 0.68%。三家增速全部跌进 1%以内,传统流量业务见顶,必须找到新的计量单元来支撑增长曲线。从卖 Byte 到卖 Token,换的是计量单位,底层逻辑没变,谁控制了新一代“管道”,谁就能收过路费。再往上看,云厂商(阿里云、腾讯云、百度智能云)在卖 Token,模型公司(DeepSeek、智谱、KIMI)在卖 Token,Token 工厂(硅基流动)在卖 Token,中转站在卖 Token……现在,连城投都来了。把这张牌桌上的玩家列一遍: 模型公司、云厂商、Token 工厂、三大运营商、地方城投。上游到下游,从造 Token 的到搬运 Token 的到分销 Token 的,全产业链都挤在“卖 Token”这一个动作上。正如上文所言,Token 正在全面水电气化,那么“卖 Token”的利润空间会急剧下降。一方面,AI 能力的获取成本会持续降低,企业和个人使用 AI 的门槛在消失,Token 会像水电一样成为数字经济的底层供给。另一方面,单纯卖 Token 的利润率会无限趋近于卖自来水、卖电,...

3天前深潮TechFlow#代币 #算力

月之暗面(Kimi):警惕冒用公司名义虚假融资,不存在所谓朋友基金或特殊通道

比推消息,月之暗面(Kimi)发布严正声明称,针对市场上冒用公司名义进行虚假融资、涉嫌违法犯罪的行为,公司已向公安机关反映,并表示将追责到底。 月之暗面强调,不存在所谓朋友基金或特殊通道,不存在所谓老股份额或预留额度,也不存在所谓官方代理或授权中介,提醒市场参与者警惕相关虚假信息及可疑交易。 本文由GENG赞助,Build Your Fortune on GENG (https://geng.one)

7天前burnking
Kimi K3币圈诊断:两周扫遍501个项目、1280个高危隐患

Kimi K3币圈诊断:两周扫遍501个项目、1280个高危隐患

作者:克洛德,深潮 TechFlow原标题:Kimi K3 币圈诊断:两周扫遍 501 个比特币项目、1280 个高危隐患深潮导读:一支志愿者组成的「比特币红队」用月之暗面的 Kimi K3 在两周内扫了 501 个比特币开源项目,记录 7958 条发现,其中 1280 条被评为高危或严重。干这件事的之所以是中国模型,是因为 OpenAI 和 Anthropic 以安全为由拒绝了这些防守方。如果你的币放在某个多年没更新的钱包或节点软件里,这篇值得读完。8 月 13 日,比特币红队成员、Cashu 协议创始人 Calle 在 X 上总结了这场行动的阶段性结论,推文获得近 26 万次查看。他的原话很直白:「几十年的开源代码,和两周的 Kimi K3 撞在一起,结果就是所有东西都是破的,比特币在燃烧。」一切始于一个卷走 1 亿美元的钱包漏洞7 月 30 日,硬件钱包 Coldcard 被爆出固件缺陷:设备生成助记词时退回到一个可预测的软件流程,安全芯片只提供了 32 位熵,有效密钥空间只剩约 43 亿种可能。攻击者按图索骥,分多波抽干用户钱包,确认损失超过 1 亿美元,疑似总损失接近 1.3 亿美元。Bitcoin Magazine 罕见地发布了「立即转移资金」的紧急通告。这场灾难直接催生了比特币红队。Calle 和托管保险公司 AnchorWatch 的首席执行官 Rob Hamilton 牵头,数十名贡献者参与,非营利机构 OpenSats 报销了大部分算力开销,对几乎整个比特币开源生态做了一遍 AI 审计。两周扫完 501 个项目,但发现不等于漏洞到 8 月 8 日,这支队伍用上百小时扫完 501 个项目,记录 7958 条发现,1280 条被评为高危或严重。这些数字需要拆开看: 在第 108 小时的节点上,只有 24.7% 的发现被动态复现,29.4% 上报给了项目方,AI 审计会有误报和重复,人工核验仍在进行。但「水分论」挡不住最硬的那个案例。 支付软件 BTCPay Server 的官方发布记录显示,红队成员 Bruno Garcia 和 Ben Carman 报告的一个严重漏洞(双因素认证绕过)在被修复前已经遭真实利用,攻击者借此拿到节点的管理凭证,进而控制了关联的闪电网络钱包。BTCPay 连发两个安全版本,社区为受害者设立了追回悬赏,基金会另拨 0.21 枚比特币注入红队基金。维护者们用行动给这批发现投了信任票。美国模型在道歉,中国模型在找漏洞为什么主力是 Kimi K3 而不是 GPT 或 Claude?因为美国模型不接这活。 Rob Hamilton 自述,他完成全部身份验证后,用 OpenAI 的模型分析一个已公开披露的代码库,不到 20 分钟就被拒。 比特币核心贡献者 PortlandHODL 的对比在社区疯传:同一份代码,美国前沿模型的回答是「你说得对!」,中国开源模型直接找出 78 个严重漏洞。Hamilton 的吐槽更扎心:「我现在基本上是在求 Xi 别让我的软件被黑。」8 月 10 日,超过 70 家托管商、交易所、矿企和开发组织联名签署比特币政策研究所的公开信,要求前沿 AI 实验室为可信的防守方开放访问权限。Galaxy 研究主管 Alex Thorn 的联署留言写道:「美国人不该被迫依赖中国 AI 来保护自己。红队需要这些模型。」 不过也要给狂欢泼点冷水:英国 AI 安全研究所与美国 CAISI 的联合评测显示,Kimi K3 在漏洞开发测试上强于 GLM-5.2,但仍落后于美国最强闭源模型。防守方不是选最强的,...

8天前burnking#AI #Anthropic #OpenAI #比特币 #钱包

路透:微软过去五年关闭至少 15 家中国分支机构,AI 出海业务成留存关键

比推消息,据路透社报道,受中美关系紧张、中国推动国产软件替代及美国出口管制等多重因素影响,微软过去五年已关闭至少 15 家中国分支机构及合资企业,正执行战略收缩。2023 年公司内部曾考虑退出中国市场,因部分高管认为“承担过多地缘政治风险而经济回报有限”,但最终未执行。微软 2024 年披露中国业务仅占其全球营收约 1.5%。 报道称,微软最终决定继续留在中国,主要原因是已开辟出一条盈利路径——为字节跳动、Shein 等出海中国企业提供 Azure 云及 AI 服务,帮助其在海外市场合规运营。此外,公司认为保留在华业务对获取中国工程人才仍具战略意义。但分析师质疑该 AI 业务模式的可持续性:该服务依赖 OpenAI 等第三方模型,且中国企业已越来越多采用 Kimi 等国产替代模型,性能相当而成本更低。 微软在华研发布局也正收缩。其前身微软亚洲研究院已陆续在温哥华、新加坡及东京设立新实验室。2024 年公司曾向 1000 名顶尖工程师提供调往美国及其他三国的工作机会,仅约三分之一接受,多数资深工程师转投国内高校及科技企业。微软发言人回应称公司将继续致力于中国市场,但未就具体决策细节置评。字节跳动及 Shein 未回应相关询问。

8天前

Meta 要终结中国开源模型?Muse 核心成员唱衰 Kimi,结果被评论区围攻

比推消息,据监测,Meta 超级智能实验室成员、Muse Spark 核心贡献者 Zengyi Qin 公开唱衰中国开源模型。他称,Meta 有多一个数量级的算力和更好的数据,Muse Spark 最终会超过 Kimi 等中国模型。他还把判断推到了商业层面:JPMorgan 等美国大客户会因为合规改用美国开放模型,中国实验室也会失去这部分推理收入。Meta 自己有 Facebook、Instagram 挣钱,中国模型公司却更依赖模型收入。评论区很快开始反问:Meta 过去两年一直不缺算力和数据,怎么没压住中国模型?还有人追问,JPMorgan 到底给 Kimi 贡献了多少收入。有人甚至讽刺,如果这就是Muse Spark 核心成员的推理水平,反而开始担心 Muse 的模型表现。Muse Spark 1.2 即将开放权重,Meta 确实会给 Kimi、DeepSeek、Qwen 多添一个重量级美国对手。但从多了一个强敌直接推到中国模型会被算力碾压、美国收入也会流失,中间还差了一大截。

11天前