Opus · 160

Anthropic 把 Mythos 5 塞进 Claude Security:企业能用,但拿不到模型

比推消息, AI 快讯,Anthropic 将 Claude Security 的底层扫描模型升级为 Claude Mythos 5,并向所有 Claude Enterprise 客户开放公测。企业接入 GitHub 仓库后,Mythos 5 会扫描代码漏洞,返回 CWE 分类、置信度、严重等级和修复建议。Claude Security 其实早已上线。4 月底开放公测时,它用的还是 Claude Opus 4.7。此次最大的变化,是把此前严格限制访问的 Mythos 5 放进现有安全产品。Mythos 5 不仅能发现漏洞,还能把漏洞转成可工作的攻击,因此一直只向经过审核的机构开放。企业现在依然不能直接调用 Mythos 5。模型只在扫描后台运行,用户拿到漏洞报告和修复建议。后续在 Claude Code 里修改代码,仍使用企业已有的模型,而且补丁必须人工批准。扫描按现有套餐正常计 Token,不需要单独购买 Mythos 5。Anthropic 还准备把 Mythos 5 接入合作伙伴的安全产品,并推出 3500 万美元 Claude 额度的 Defender Advantage Fund,用于帮助开源项目查漏洞和修补漏洞。

16小时前

DeepSeek 视觉模型多模态 Agent 能力逼近 Opus 4.8,4 项打成 2:2

比推消息,DeepSeek 公布 V4-Flash-Vision-Exp 首批 Agent 跑分。在 4 项多模态 Agent 评测中与 Opus 4.8 打成 2 胜 2 负:Agents' Last Exam 27.3 对 25.7,ZeroBench 35.0 对 34.0;ApexBench 36.5 对 39.4,Chartography 64.3 对 65.0。相比纯文本版 V4-Flash-0731,视觉版在 ApexBench 从 26.2 升至 36.5,Agents' Last Exam 从 25.2 升至 27.3。官方注明纯文本版会忽略多模态内容,故主要体现补上视觉输入后的能力。加上视觉后文本 Agent 能力未明显缩水,7 项文本评测中 6 项高于 V4-Flash-0731,如 DeepSWE 从 54.4 升至 59.3(超 Opus 4.8 的 58.0),Toolathlon 75.9 几乎追平 Opus 4.8 的 76.2。该结果来自 DeepSeek 官方自测,非第三方独立榜单;公开 Code Agent 文本任务使用 DeepSeek Harness 极简模式,推理档位为 max。

1天前

小米 MiMo-V3-Pro 跑分疑似泄露,SWE-Bench Pro 达 72.8 或逼近海外顶尖闭源模型

比推消息,Max For AI 发文披露,一张疑似小米下一代大模型 MiMo-V3-Pro 的 Benchmark 截图在社群中流传。截图显示,该模型重点瞄准 Coding Agent 和通用 Agent 场景,部分测试成绩已接近 Claude Opus、GPT 等海外顶尖模型。据疑似截图,MiMo-V3-Pro 在 SWE-Bench Pro 上取得 72.8 分,高于 GLM 5.3 的 67.9 分和 Kimi K3 的 65.8 分,与 Claude Opus 5 的 74.6 分、GPT-5.6 Sol Max 的 75.4 分相差不到 3 分;Terminal-Bench 2.0 得分 70.6 分,同样接近 Claude Opus 5 的 72.0 分和 GPT-5.6 Sol Max 的 73.5 分。此外,其τ3-bench 得分达到 76.4 分,而 GPT-5.6 Sol Max 为 78.8 分。若上述成绩最终经官方确认并能在正式版本中复现,MiMo-V3-Pro 或将进入全球顶尖模型第一梯队。不过,目前该 Benchmark 截图的真实性及测试条件尚未得到小米官方确认,相关数据仍应视为未经证实的爆料。值得注意的是,小米目前官方公开的最新 MiMo 旗舰为 MiMo-V2-Pro 及 MiMo-V2.5-Pro,因此 V3-Pro 是否存在以及具体发布时间仍有待官方进一步披露。

1天前

GLM-5.3 智能指数暴涨到 60:追平 Kimi K3,API 单价没涨

比推消息,据监测,智谱正式开放 GLM-5.3 API。此前模型发布时,API 没有立即上线。与此同时,Artificial Analysis 的独立评测也出炉了:Intelligence Index 从 GLM-5.2 的 53 暴涨到 60,追平 Kimi K3,只比 GPT-5.6 Sol 低 1 分。等权重按计划公开后,它将和 Kimi K3 并列 AA 评分最高的开放权重模型。涨得最猛的是 Agent。GDPval-AA v2 的 Elo 从 1524 跳到 1770,一次涨了 246 分,排所有模型第二,仅次于 Claude Opus 5 的 1855,也比 Kimi K3 的 1668 高出 100 多分。API 单价没有跟着涨。输入仍是每百万 Token 1.40 美元,输出 4.40 美元,缓存输入 0.26 美元,和 GLM-5.2 完全一样。不过 5.3 明显更能花 Token。AA 测得它每项任务平均输出约 1.87 万 Token,比 5.2 多 20%。因此单任务实际成本从 0.44 美元涨到 0.68 美元,贵了约 55%。即便如此,同档模型里仍比 Kimi K3 的 0.84 美元和 GPT-5.6 Sol 的 1.23 美元便宜。

3天前

AI 离自己改进自己还有多远?Scale 推出 RSI Bench

比推消息, AI 快讯,Scale AI 推出 RSI Bench,专门测试 AI 能不能像研究员一样,自己做 AI 研发。AI 会直接拿到论文、代码和算力,然后自己想实验、跑训练、改方法,再看能不能把原来的 AI 做得更好。首批测试用了 Claude Opus 5 和 GPT-5.6 Sol。两款模型已经能自己跑实验、调参数、迭代方案,部分任务确实能超过给定基线。但现在的 AI 还不太会发明。让它们挑战最新研究时,大多数尝试仍停留在论文已有方法和调参数上,很少提出真正的新思路。

4天前

千问 27B 打到 Opus4.6 门口:Muse Glimmer 8 项全败

比推消息,据监测,千问正式开源 Qwen3.8-27B,官方跑分也一起公布。这个只有 27B 参数的本地模型,在官方列出的 8 项可直接对比测试中,全部超过 Meta 刚发布的 30B 模型 Muse Glimmer。差距在 Agent 和编程上尤其明显。Terminal-Bench 2.1,Qwen3.8-27B 得分 73.0,Muse Glimmer 为 51.7;SWE-bench Pro 是 61.7 对 51.2;OSWorld-Verified 则是 84.3 对 65.9。通用推理、文档和视觉测试也全部领先。更夸张的是和 Claude Opus 4.6 对比。两边都有成绩的 19 项测试中,Qwen3.8-27B 赢了 15 项。SWE-bench Pro、LiveCodeBench、OSWorld、AndroidWorld 和多项视觉任务都已经反超;Terminal-Bench、GPQA、HLE 和 NL2Repo 仍落后。一个能在个人电脑本地跑的 27B 模型,官方跑分已经摸到了上一代闭源旗舰的水平。

8天前

传 Google DeepMind 拟裁超 1/3:短期停更 Pro,资源转向 Flash

比推消息,据监测,Google DeepMind 正在酝酿进一步重组,可能裁掉三分之一甚至更多员工。GDM 目前约有 7000 至 8000 人,重组将重点精简岗位和实际工作不匹配的冗余人员。更大的变化是模型路线。谷歌短期没有更新 Pro 模型的计划,也将减少对 Fable、Opus 同级超大旗舰模型的投入,把更多资源转向成本更低、迭代更快的 Flash。这可能和 GDM 能拿到的资源有关。GDM 最近一个考核年的整体 OKR 只有 0.5/1,过去一段时间很难争取到更多大型模型训练资源。搜索、YouTube、Gmail 等谷歌核心业务同样需要大量 TPU。还有一个内部细节或许可以解释为什么谷歌 Gemini 模型体验不佳:GDM 核心团队此前从未真正把 Gemini 当成日常主力模型,反而是非核心团队仍被要求使用 Gemini。

8天前

DeepSeek-V4-Pro 越跑越猛:三轮找回 87.5%漏洞,超过 Claude Opus 5 和 Qwen3.8 Max

比推消息,据监测,安全公司 Aikido 用 8 款前沿模型测试 32 个真实漏洞。DeepSeek-V4-Pro-0813 单跑平均只能找出 58.3%,但连续跑 3 次再合并结果,直接找出 28 个,覆盖 87.5%,冲到第一。Claude Opus 5 和 Qwen3.8 Max 都只有 81.3%。更夸张的是成本。DeepSeek 每找到一个漏洞平均只花 7.34 美元,Opus 5 要 66.97 美元,前者只有后者约 1/9。DeepSeek 的表现也很反常:单跑不稳,多跑几次反而最能挖。它每一轮会找到不同的漏洞,三轮叠加后覆盖面超过所有对手。代价是误报很多,它报出来的问题里只有 65.6% 最终被确认是真漏洞,在 8 款模型中最低。

9天前

DeepSeek-V4-Pro 正式版 Agent 能力暴涨,DeepSWE 一次升近 50 分

比推消息,据监测,DeepSeek-V4-Pro-0813 的 Agent 成绩大幅跃升。DeepSeek 官方流出的自测表显示,DeepSWE 从 Preview 版的 12.8 飙到 62.7,一次涨了 49.9 分。CyberGym 也从 52.7 升到 83.3,AutomationBench 从 12.8 升到 31.8。新版已经在多项评测反超 Claude Opus 4.8。Terminal Bench 2.1 达到 87.9 对 85.0,CyberGym 为 83.3 对 78.3,DeepSWE 为 62.7 对 58.0。AutomationBench 甚至以 31.8 超过 Fable 5 的 29.1。离谱的是,模型从 Preview 升到 0813,价格一分钱没涨。V4-Pro API 仍维持每百万 Token 输入 3 元、输出 6 元。不过这批成绩目前还是 DeepSeek 自测,第三方尚未完整复现。尤其 DeepSWE 一次暴涨近 50 分,Agent 评测又很依赖 Harness,实际提升还要等外部测试。

9天前

同一模型会攻不会守,Corma 融资 6000 万美元专训防御 AI

比推消息,据监测,网络安全创业公司 Corma 正式亮相,并完成 6000 万美元种子轮融资,红杉领投。它正在从头训练专门做网络防御的基础模型,再把模型做成安全 Agent,直接调用企业现有的安全工具。Corma 还做了一组攻防测试。Claude Opus 4.8、GPT-5.5、Grok 4.3 和 DeepSeek V4 在同一个模拟企业网络里轮流攻防,共跑了 241 次。攻击方 85% 的测试成功留下重启后仍存在的后门,防守方平均只发现 19%。甚至让模型去找自己埋的后门,78% 也没找到。Corma 认为,攻击主要考验代码和推理,防守却更像大海捞针,要长期从日志、流量和正常活动里找异常。这类能力恰好不是通用模型训练的重点。不过,Corma 还没公开自家模型在同一套测试里的成绩。公司称自家模型已经远超通用模型,但目前看不到直接对比。 本文由GENG赞助,Build Your Fortune on GENG (https://geng.one)

11天前burnking