Terminal · 402

小米 MiMo-V3-Pro 跑分疑似泄露,SWE-Bench Pro 达 72.8 或逼近海外顶尖闭源模型

比推消息,Max For AI 发文披露,一张疑似小米下一代大模型 MiMo-V3-Pro 的 Benchmark 截图在社群中流传。截图显示,该模型重点瞄准 Coding Agent 和通用 Agent 场景,部分测试成绩已接近 Claude Opus、GPT 等海外顶尖模型。据疑似截图,MiMo-V3-Pro 在 SWE-Bench Pro 上取得 72.8 分,高于 GLM 5.3 的 67.9 分和 Kimi K3 的 65.8 分,与 Claude Opus 5 的 74.6 分、GPT-5.6 Sol Max 的 75.4 分相差不到 3 分;Terminal-Bench 2.0 得分 70.6 分,同样接近 Claude Opus 5 的 72.0 分和 GPT-5.6 Sol Max 的 73.5 分。此外,其τ3-bench 得分达到 76.4 分,而 GPT-5.6 Sol Max 为 78.8 分。若上述成绩最终经官方确认并能在正式版本中复现,MiMo-V3-Pro 或将进入全球顶尖模型第一梯队。不过,目前该 Benchmark 截图的真实性及测试条件尚未得到小米官方确认,相关数据仍应视为未经证实的爆料。值得注意的是,小米目前官方公开的最新 MiMo 旗舰为 MiMo-V2-Pro 及 MiMo-V2.5-Pro,因此 V3-Pro 是否存在以及具体发布时间仍有待官方进一步披露。

1天前
5.4亿枚空投面临取消,OP治理投票陷内战

5.4亿枚空投面临取消,OP治理投票陷内战

作者:Foresight News原标题:5.4亿枚代币空投即将被充公?OP治理投票陷内战8 月初,Optimism 基金会在治理论坛正式提交提案,计划将用户空投分配中剩余的 5.469 亿枚 OP 重新划定为「战略生态基金」,因其可能实质影响代币持有者对未来空投的预期,需经投票通过。投票已于北京时间 8 月 14 日启动,截止时间为 8 月 20 日 12:07。截至目前最新链上数据,支持票约 910.5 万枚 OP,反对票约 425.8 万枚 OP。法定人数要求约 1654 万枚 OP,当前参与规模距离达标仍有明显差距。投票结果尚未最终敲定,社区博弈仍在持续。今年 5 月后暂停 OP 回购OP 初始总供应量约为 42.95 亿枚。其中 19%(约 8.16 亿枚)被明确预留给用户空投。这一安排虽非正式法律义务,但 Optimism 官方在多年公开沟通中反复确认,包括 2024 年 10 月 Airdrop 5 发放时仍提及约 5.5 亿枚可用于未来空投。实际执行情况显示:2022 年至 2024 年间共完成五轮空投,累计发放约 2.691 亿枚 OP,占预留总量的约 33%。第一轮占比最高,后续轮次标准持续调整,从早期使用与 Gas 消耗,逐步转向委托治理、OP 主网活跃度、NFT 创作者以及 Superchain 活动等。第四年(2025 年 5 月至 2026 年 4 月)已无新空投,官方明确转向「可衡量留存与收入结果的定向增长项目」。链上数据也显示,Optimism 自 5 月后并未按照原计划回购 OP。其在完成第二轮和第三轮(3 月和 4 月)月度社区回购后,官方即单方面叫停了后续回购计划。官方在 3 月花费 367.905 枚 ETH 回购 6951453 枚 OP,4 月花费 50.16 枚 ETH 回购 925654 枚 OP,截至目前其累计回购的 OP 数量为 9451924 枚 OP,按照 0.08 美元的最新价计算,价值约 75.62 万美元。基金会表示将在 12 个月期结束后重新评估,不承诺长期延续。与此同时,第四年整体投入 OP 规模较第三年下降约 35%。治理基金新流通量同比减少 53%,Retro Funding(OP 根据实际贡献发奖励的公共产品资助机制。)支出下降 30%,空投归零。基金会同步发布第四年预算更新与第五年展望,预计第五年新增流通量约 2.73 亿枚 OP(不含此次可能重划的空投配额),其中生态基金预计投入约 2 亿枚。据 DefiLlama 数据显示,目前其总 TVL 已从巅峰期的 55 亿美元,大幅回落至 5.26 亿美元。战略转向企业增长加密市场二层网络目前面临用户流失,创新乏力等问题。据 token terminal 最新数据显示,其核心开发者已减少为 42 位,而在 2024 年年底的巅峰期,这个数字是 144 位。目前,Optimism 正转向企业市场,包括金融科技、交易平台、支付机构及传统金融机构,目前已有合作包括 Bitpanda、Ink 以及 Dunamu 等。具体而言,提案要求:· 创建新的分配类别「战略生态基金」;· 将剩余 5.469 亿枚 OP 从用户空投类别重新划入该基金;· 用途包括促成链、协议、机构与基础设施加入 OP Stack 的合作交易,深化 OP Mainnet 链上活动与流动性的激励,以及拓展顶级品牌与机构合作。已发放的 1 至 5 轮空投不受影响。若提案通过,基金会将更新代币分配文档与公开会计记录,并沿用既有的赠款监督与年度预算报告机制。第五年预算展望本身...

3天前Foresight News#Optimism #代币 #提案 #治理 #空投

Fluid Q2 TVL 降至 34 亿美元,营收环比降 29%

比推消息,据 Token Terminal 报告,由 Instadapp 团队打造的 DeFi 协议 Fluid 发布 2026 年第二季度数据。当季平均 TVL 为 34 亿美元,环比下降 21.1%、同比仍增 84.9%;活跃贷款 15 亿美元,环比降 15.1%、同比增 92.9%;交易量 181 亿美元,环比降 37.3%;费用 950 万美元,环比降 21.5%;协议收入 180 万美元,环比降 29.3%、同比增 9.8%;月活用户 7.07 万,环比降 43.8%。资本结构继续向 Solana 上与 Jupiter 合作的 Jupiter Lend 倾斜,其平均 TVL 约 17 亿美元,占近一半并实现环比增长,成为最大借贷部署。季度初受 Resolv 等第三方事件影响出现流出,Fluid 合约未受攻击,相关坏账由金库等覆盖,用户资金无损失。期间 Bitwise 开始在 Jupiter Lend 上管理 USDe 市场,Liquidity-as-a-Service 上线并落地约 1 亿美元 sUSDai 流动性设施,Huma PST 等 RWA 相关资产也接入 Fluid。团队表示将继续推进机构级部署、Jupiter DEX 及 Sui 扩展等,通过垂直化产品与机构合作引入增量资本并提升收入效率。

3天前#链上动态

爆火 AI 项目 J-Space 被质疑造假,社区复测结果与官方数据完全相反

比推消息,据 MaxForAI 披露,今日在 X 平台爆火的 AI 项目 J-Space Cognition Suite 遭社区质疑,被指其宣传的 DeepSeek V4 测试成绩无法复现。项目此前宣称,V4 Flash 搭配 J-Space 可追平 GLM-5.3,V4 Pro 则能在多个 Agent Benchmark 上超过 Fable 5,同时速度提升 2.53 倍、Token 效率提升 2.21 倍。GitHub 用户 GoForceX 使用 Terminal Bench 2.1 的 87 道题子集进行高并发复测,并确认加载 J-Space 相关模块。结果显示,加入 J-Space 后 Benchmark 成绩反而略有下降,Token 使用量和成本均有所增加,与项目宣称的性能、速度及 Token 效率提升方向相反。社区随后要求项目公开完整评测配置、逐题结果、运行日志、原始耗时及 Token 消耗等数据。目前项目主要公开汇总结果,尚未提供足以验证上述精确数据的完整原始实验记录。值得注意的是,面对质疑,项目作者曾回应称相关数据确实是夸张的,并表示实际提升大致处于 1.6 倍至 3 倍之间。截止目前,作者尚未就社区质疑作出正式回应,部分相关质疑 Issue 已被删除。

4天前

“牛来”市值短时突破 4900 万美元后回落,24H 涨幅 237.4%

比推消息, 据 GMGN 数据,BSC 生态 Meme 币牛来市值短时突破 4900 万美元,续创新高,但随后回落,现报 3773 万美元,24H 涨幅 237.4%。提醒用户,Meme 币价格波动较大,请投资者谨慎参与。      Will the market cap of the BSC meme coin 牛来 exceed $60 million at any point this week?Yes      No    Powered by        Moment      Predict. Earn Points. Unlock the Airdrop编辑删除    cryptoWill the market cap of the BSC meme coin 牛来 exceed $60 million at any point this week?YesNoResolve YES if any major reliable on-chain/DEX tracker (GMGN, DEX Screener, CoinMarketCap, GeckoTerminal, or equivalent) shows fully diluted / circulating market cap ≥ $60,000,000 at any timestamp during the week. Resolve NO if it never reaches that level. Prefer the highest credible peak print; minor discrepancies across sites are resolved by consensus of primary sources. 0xbeea1d618e533a387d941f58a7d4c9b7bd377777crypto2026-08-242026-08-24T06:59:59.999Zhttps://moment.vision/mapi/uploads/openai/images/20260817222231_6b40b7b05a53a1dd.jpg6a8389c5f00c055788898b52

5天前

DHH 横测编程模型:DeepSeek23 美元跑完,Fable 约 550 美元

比推消息,据监测,Ruby on Rails 作者 DHH 用同一个 Python 转 Rust 任务测试多款模型。DeepSeek Pro V4 Max 最终完成,用时约 2.5 小时,总 Token 成本 23 美元。Grok 4.6 花了 55 美元、约 1.5 小时,GPT-5.6 Sol 花了 43 美元;DeepSeek V4 Flash 和 GPT-5.6 Luna 没能完成。最初一轮由 Fable 主导,DHH 统计成本约 550 美元、耗时约 45 分钟。它把 TerminalTextEffects 从 Python 重写成 Rust,共用了约 1100 万 Token。启动时间从 87ms 降到 2ms,渲染速度提高 9.6 倍。不过对比有个前提。Fable 先写了一份 483 行的实施方案,Codex xhigh 审核后,其他模型都直接沿用了这份方案。因此这里更像是在比较不同模型执行同一方案的成本和效率。项目已经开源。仓库包含 354 项一致性测试,会逐帧、逐字节比较 Rust 版和 Python 原版,最终产物可编译成约 3.3MB 的静态单文件。

6天前

千问 27B 打到 Opus4.6 门口:Muse Glimmer 8 项全败

比推消息,据监测,千问正式开源 Qwen3.8-27B,官方跑分也一起公布。这个只有 27B 参数的本地模型,在官方列出的 8 项可直接对比测试中,全部超过 Meta 刚发布的 30B 模型 Muse Glimmer。差距在 Agent 和编程上尤其明显。Terminal-Bench 2.1,Qwen3.8-27B 得分 73.0,Muse Glimmer 为 51.7;SWE-bench Pro 是 61.7 对 51.2;OSWorld-Verified 则是 84.3 对 65.9。通用推理、文档和视觉测试也全部领先。更夸张的是和 Claude Opus 4.6 对比。两边都有成绩的 19 项测试中,Qwen3.8-27B 赢了 15 项。SWE-bench Pro、LiveCodeBench、OSWorld、AndroidWorld 和多项视觉任务都已经反超;Terminal-Bench、GPQA、HLE 和 NL2Repo 仍落后。一个能在个人电脑本地跑的 27B 模型,官方跑分已经摸到了上一代闭源旗舰的水平。

8天前
Hermes 登顶背后:一个 Web3 团队的进阶之路

Hermes 登顶背后:一个 Web3 团队的进阶之路

作者:Jacob Zhao原标题:IOSG Weekly Brief|Hermes 登顶背后:一个 Web3 团队的进阶之路 #340Hermes 的现象级增长,并非源于 OpenClaw 原理上无法复制的独家技术,而是因为在个人 Agent 品类成型的关键窗口期,最精准地闭合了一套「挑战者增长系统」:承接 OpenClaw 已经教育成熟的用户池,建立起「可委托性」(Delegation Trust)这一比「自我进化」叙事更真实的体验差异。当专业执行 Agent 越来越强时,用户仍然需要一个长期在线、值得托付的总管家。打开 OpenRouter 的公开应用排行榜,Hermes Agent 以 30.5 万亿的 Token 使用量位居全平台第一,同时在 Productivity、Coding Agents、Personal Agents 和 CLI Agents 四个品类中排名第一,断崖式领先 OpenClaw、Claude Code 等知名 Agent。▲ 图 1 · Hermes Agent 在 OpenRouter 的历史数据快照(截取于 2026 年 8 月 4 日,动态页面数据会随时间变化)尽管 OpenRouter 的统计口径无法覆盖直连官方 API(如 Claude 或 Codex 原生订阅)的全行业 Token 消耗,但作为当前全球最具规模的 AI 大模型路由与聚合平台,其榜单具有极强的「风向标」意义。虽然在高端专业任务层面,大量用户的核心业务工作流——复杂代码生成、架构设计、高价值数据分析——仍流向 Claude Code 和 ChatGPT,但 Hermes 在后台自动化、消息入口响应、长期在线监听与轻量级任务调度等使用场景保持优势。作为一个由 Web 3 团队打造的 Agent 产品,Hermes 取得了远超预期的传播、社区与使用强度成功,我们不禁要关注:· Hermes 为何能在 OpenRouter 推理调用上实现反超?· 它与 OpenClaw 之间的真实分野,究竟在哪里?· 与 Claude Code 和 Codex 的关系中,Hermes 如何保持「差异化共存」而非「正面竞争」?从开发框架到个人 AI 系统——OpenClaw 之路为什么早期 Agent 框架没有产生消费产品在 OpenClaw 出现前,Agent 领域虽已具备成熟的基础设施,但存在根本局限:其采用单位是「开发项目企业工作流」,而非「个人用户」。早期框架的共同特征是面向开发者、输出代码或配置——它们构建了 Agent 的基础设施,却未交付 Agent 本身。过高的工程门槛导致始终困于「开发者工具」阶段,缺乏将技术转化为「个人专属资产」的产品化闭环,直接面向终端用户的「个人 Agent 产品层」几乎处于空白。▲ 图 1 · Agent 技术栈六层结构(模型层→协议层→ SDK 开发框架层→编排运行时层→执行基础设施层→部署治理层)▲ 图 1 · Hermes Agent 在 OpenRouter 的历史数据快照(截取于 2026 年 8 月 4 日,动态页面数据会随时间变化)OpenClaw 真正改变了什么OpenClaw 并未在底层重新发明 Agent Loop 或任务调度技术,其核心贡献在于产品层面的系统性封装。LangChain 解决的是「如何构建 Agent」,而 OpenClaw 解决的是「如何拥有 Agent」。它跳过了技术栈的中间层,将散落的框架能力整合为个人可直接配置与长期使用的完整产品,实现了采用单位从「开发项目」向「个人」的根本转移...

9天前burnking#agent #Hermes #WEB3

韩模之光Solar Pro4 智能指数冲到 42 分,但还是打不过 DeepSeek V4Flash

比推消息,据监测,韩国 AI 公司 Upstage 发布旗舰推理模型 Solar Pro 4。Artificial Analysis 最新评测中,它的智能指数从上一代 Solar Pro 3 的 14 分冲到 42 分,主要提升来自 Agent 和长上下文能力。其中 Terminal-Bench v2.1 从 12% 升到 57%,长上下文推理从 31 升到 71。GDPval-AA v2 也从 498 Elo 升到 1277,超过 1000 的人类基线。Solar Pro 4 已经是韩国模型冲击全球前列的一张代表牌。但放到 DeepSeek V4 Flash 0731 面前,还是不够看。同一套 Artificial Analysis 智能指数里,DeepSeek 拿到 52 分,比 Solar Pro 4 高 10 分。DeepSeek 每秒输出约 122 个 Token,Solar Pro 4 约 65 个,前者接近快一倍。价格差距更大。Solar Pro 4 每百万 Token 输入、输出分别要 0.30 和 1.20 美元,DeepSeek 只要 0.14 和 0.28 美元。Solar 的输出价格超过 DeepSeek 的 4 倍。至少按这套综合评测和 API 性价比,韩模之光还没追上 DeepSeek。

9天前

DeepSeek-V4-Pro 正式版 Agent 能力暴涨,DeepSWE 一次升近 50 分

比推消息,据监测,DeepSeek-V4-Pro-0813 的 Agent 成绩大幅跃升。DeepSeek 官方流出的自测表显示,DeepSWE 从 Preview 版的 12.8 飙到 62.7,一次涨了 49.9 分。CyberGym 也从 52.7 升到 83.3,AutomationBench 从 12.8 升到 31.8。新版已经在多项评测反超 Claude Opus 4.8。Terminal Bench 2.1 达到 87.9 对 85.0,CyberGym 为 83.3 对 78.3,DeepSWE 为 62.7 对 58.0。AutomationBench 甚至以 31.8 超过 Fable 5 的 29.1。离谱的是,模型从 Preview 升到 0813,价格一分钱没涨。V4-Pro API 仍维持每百万 Token 输入 3 元、输出 6 元。不过这批成绩目前还是 DeepSeek 自测,第三方尚未完整复现。尤其 DeepSWE 一次暴涨近 50 分,Agent 评测又很依赖 Harness,实际提升还要等外部测试。

9天前