DeepSeek · 475

DeepSeek 上线多模态模型 V4-Flash-Vision-Exp,并开放 API 服务

比推消息, 据 DeepSeek 公众号,DeepSeek 已上线多模态视觉理解模型 V4-Flash-Vision-Exp,并开放 API 服务。该模型在 V4-Flash 基础上新增图像理解与视觉生成能力,支持文本、图片等多模态输入输出,并面向开发者提供推理、生成等能力调用接口。

1天前

DeepSeek 视觉模型多模态 Agent 能力逼近 Opus 4.8,4 项打成 2:2

比推消息,DeepSeek 公布 V4-Flash-Vision-Exp 首批 Agent 跑分。在 4 项多模态 Agent 评测中与 Opus 4.8 打成 2 胜 2 负:Agents' Last Exam 27.3 对 25.7,ZeroBench 35.0 对 34.0;ApexBench 36.5 对 39.4,Chartography 64.3 对 65.0。相比纯文本版 V4-Flash-0731,视觉版在 ApexBench 从 26.2 升至 36.5,Agents' Last Exam 从 25.2 升至 27.3。官方注明纯文本版会忽略多模态内容,故主要体现补上视觉输入后的能力。加上视觉后文本 Agent 能力未明显缩水,7 项文本评测中 6 项高于 V4-Flash-0731,如 DeepSWE 从 54.4 升至 59.3(超 Opus 4.8 的 58.0),Toolathlon 75.9 几乎追平 Opus 4.8 的 76.2。该结果来自 DeepSeek 官方自测,非第三方独立榜单;公开 Code Agent 文本任务使用 DeepSeek Harness 极简模式,推理档位为 max。

1天前

DeepSeek 视觉模型正式上线 API:价格和 V4 Flash 完全一样

比推消息,DeepSeek 正式上线全新视觉模型 deepseek-v4-flash-vision-exp。官方 API 文档已经将它与 V4 Flash、V4 Pro 并列,开发者可以直接通过 DeepSeek API 传入图片。模型支持 100 万 Token 上下文,最大输出 38.4 万 Token,还支持 JSON Output、Tool Calls、Responses API 和 Anthropic API。价格直接对齐 V4 Flash。每百万 Token 输入在缓存未命中时,高峰期为 3 元、空闲期 1.5 元;缓存命中分别只要 0.1 元和 0.05 元。每百万 Token 输出高峰期 9 元、空闲期 4.5 元。相比 V4 Pro,同档价格只有三分之一。图片没有单独按张收费。DeepSeek 会根据图片尺寸把图片换算成 Token,再和文本 Token 一起计费。高峰期为北京时间 9:00–12:00、14:00–18:00,其余时间价格减半。

1天前

DeepSeek V4 Flash 视觉模型疑似即将发布

比推消息,据 X 用户 MaxForAI 披露,DeepSeek 视觉模型相关迹象已出现。今天下午 3 点,deepseek-v4-flash-vision-exp 这一名称已出现在 DeepSeek Harness 相关代码中,且 Harness 最新版本已开始加入原生图片请求适配。不过在模型 endpoint 准备就绪前,该模型不会被放入正式模型目录。目前来看,DeepSeek 应正在测试 V4 Flash 的视觉版本,公开 API 尚未正式开放。已有用户直接使用该模型 ID 请求 DeepSeek API,目前仍会返回错误,官方文档中也尚未列出该模型。客户端与 Harness 侧的适配路径已基本铺好,DeepSeek V4 Flash 有望很快具备视觉能力。

1天前
从4个模型到500多个,OpenRouter三年增长3万倍后被收购

从4个模型到500多个,OpenRouter三年增长3万倍后被收购

作者:Menlo Ventures编译:佳欢,ChainCatcher原标题:OpenRouter 背后早期投资人复盘投资始末今天,OpenRouter 宣布已与 Stripe 达成收购协议。距离 OpenRouter 于 2023 年正式推出,刚刚过去三年。OpenRouter 最初以“LLM 的统一接口”为定位上线,当时只支持 4 个模型:GPT-3.5、GPT-4、Together 的 GPT NeoXT 和 Cohere xlarge。公司成立之初基于两个核心判断:第一,AI 的使用规模最终会非常庞大,并渗透到各个领域;第二,市场上会出现大量不同模型,它们各有取舍,用户也会根据不同需求选择不同模型。事实证明,这两个判断都远远超出了当时的预期。自上线以来,OpenRouter 平台处理的 Token 数量增长了约 3 万倍,目前按年化计算已经超过 4500 万亿 Token,平台上的支出规模也达到了相当惊人的水平。与此同时,OpenRouter 支持的模型数量已经从最初的 4 个增加到 500 多个。图:从成立到被收购,OpenRouter Token 使用量增长情况Menlo Ventures 很幸运能够参与这段旅程。2025 年 3 月,我们通过与 Anthropic 合作设立的 Anthology Fund 参与了 OpenRouter 的种子轮融资。OpenRouter 创始人兼 CEO Alex Atallah 此前曾创办 OpenSea,后者估值一度达到 133 亿美元。他的联合创始人包括在 Discord 上认识的技术高手 Louis Vichy,以及执行力极强的 COO Chris Clark。2025 年 5 月,我们领投了 OpenRouter 的 A 轮融资,Matt 加入公司董事会,Deedy 担任董事会观察员。今年早些时候,看到 OpenRouter 的客户数量和收入迅速增长,以及公司围绕模型选择和评估构建更强“模型智能”能力的产品路线后,我们又继续加码了 B 轮融资。在科技行业,一个想法往往需要经过多年时间,才能从少数人的判断变成行业共识。而就在几周前,这件事发生了:从 Ramp 到 Cursor,超过 10 家公司几乎同时推出了自己的模型路由产品。短短几年时间,OpenRouter 已经成为 AI 时代最重要的公司之一。图:确定领投 OpenRouter A 轮时的合影乍看之下,Stripe 似乎并不是 OpenRouter 最自然的收购方,但两家公司实际上惊人地相似。两者都通过一个可以直接接入的 API,把原本复杂的交易流程变得简单,并从中收取一定比例的费用。只不过 OpenRouter 处理的是 AI 模型。按照 Stripe 一贯的说法,两家公司结合之后,仍然是在做同一件事:提高“互联网 GDP”。事实上,一年多以前,OpenRouter 就已经把自己称为“LLM 领域的 Stripe”。OpenRouter 的核心价值OpenRouter 是 Deedy 在 2024 年加入 Menlo 后最早接触的公司之一。这家公司几乎正好处于我们 AI 基础设施投资逻辑的核心位置。Menlo 在《2024 企业 AI 报告》中提出了两个投资 OpenRouter 所必须成立的判断:AI 支出会大幅增长,同时开发者不会只使用一个模型,而会同时采用多个模型。图:Menlo 最初发给 OpenRouter 的联系邮件作为同样会写代码、会实际使用这些模型的人,我们很早就意识到,不同模型在成本、延迟和性能之间存在非常明显的差...

1天前burnking#OpenRouter

传腾讯混元 Hy4 现身元宝 App 模型列表,开启灰测

比推消息,据 X 用户 MaxForAI 披露,腾讯已开始对全新旗舰模型混元 Hy4 进行灰测。有用户发现,腾讯元宝 App 的模型选择列表中已出现 Hy4,并标注为专家级模型,排名位于 Hy3 与 DeepSeek 之上。官方账号 @TencentHunyuan 相关入口同步可见该模型选项。腾讯上周在 Q2 财报中确认,参数规模更大的 Hy4 将于近期上线,并进一步提升模型性能与多模态能力。目前腾讯尚未正式发布 Hy4,外界尚无法确认此次为小范围灰测或提前开放入口,但从进度看该模型上线临近。

2天前

DeepSeek V4 Pro 跑 5 套 Harness:Pi 成功率第一,DSH 最省钱

比推消息, AI 快讯,Agent 工具公司 Composio 把同一个 DeepSeek V4 Pro 0813 分别放进 Pi Agent、DeepSeek Harness 0.1、Claude Code、OpenCode 和 Hermes Agent,统一开到 max reasoning,跑了 30 个多步骤 Agent 任务。通过率:1. Pi Agent:21/302. DeepSeek Harness:20/303. Claude Code:19/304. OpenCode:19/305. Hermes Agent:18/3030 道题里,15 道五家全过,7 道五家全挂。剩下 8 道只换了 Harness,结果就会翻转。速度排名:1. Claude Code:181.8 秒2. DeepSeek Harness:252.1 秒3. Hermes Agent:273.6 秒4. OpenCode:280.6 秒5. Pi Agent:362.9 秒单次成功成本:1. DeepSeek Harness:0.028 美元2. Pi Agent:0.031 美元3. OpenCode:0.032 美元4. Hermes Agent:0.037 美元5. Claude Code:0.074 美元Pi 通过率最高,DeepSeek 官方 Harness 最省钱,Claude Code 最快但最贵。Composio 此前用 DeepSeek V4 Flash 做过同类测试,当时 Pi 同样拿到最高通过率。

2天前
姚顺雨重整腾讯多模态路线:靠拢梁文锋,远离李飞飞

姚顺雨重整腾讯多模态路线:靠拢梁文锋,远离李飞飞

文|苗正编辑|王靖来源|字母AI腾讯混元多模态团队又发生了一起人事变动。据媒体报道,曾负责xAI多模态理解负责人蔺旭东,已经离开xAI,加入腾讯混元,担任多模态内容生成算法负责人。这则人事消息之所以值得关注,是因为它发生在混元多模态团队持续调整的背景下。过去一段时间,混元内部陆续传出负责人离职、研究人员转岗和新成员加入的消息。原多模态理解负责人胡瀚离职创业,田永龙等人加入腾讯,原有多模态团队的汇报关系也随着大语言模型部门和多模态模型部门的整合而发生变化。但这是否意味着腾讯多模态团队正在“改朝换代”,目前还不能直接下结论。公开信息能够确认的是,混元确实出现了人员流动和组织重组。蔺旭东的加入传闻,更像是这场调整中的一个新信号:腾讯正在重新组合多模态理解和内容生成这两条路线。那么问题来了,蔺旭东究竟是什么来头,他能为腾讯补上什么能力?以及腾讯的多模态路线是否正在从“生成内容”转向了姚顺雨更偏向的“理解上下文并在世界中行动”?蔺旭东是什么来头他加入腾讯后能做什么?公开资料显示,蔺旭东2018年毕业于清华大学,随后赴哥伦比亚大学攻读博士。在读博期间,他的研究方向包括嵌入学习、视频分析和生成模型,也曾参与哥伦比亚大学与Facebook AI合作的Vx2Text项目。V指的是视频,x指的是未知数,可以是声音、语音甚至是环境音,2代表to,Text则代表字幕。它的逻辑是,先把视频、声音等不同模态转换成类似“语言token”的向量,再统一送入语言模型进行融合,最后由自回归解码器生成开放式文本。Transformer只能理解token,所以AI本质上是不理解视频和音频这两种文件形式的,也就更不可能将其转换成文字。举个例子,一只狗在游泳池旁边跳进水里,那么Vx2Text的视频识别器看(V)就会输出关键词:狗、跳跃、游泳池;声音识别器(x)就会输出:水声、扑通。虽然Vx2Text的产品功能是“生成”,但产品的核心难点在于“理解”。当然,Vx2Text并不是简单地把画面“翻译”成几句话而已。模型需要从视频里识别人物、物体、动作和事件,还要理解这些东西在时间上的变化,最后再把视觉信息组织成语言。博士毕业后,蔺旭东进入DeepMind,参与Gemini相关的多模态预训练和后训练工作。2025年,他又加入xAI,公开资料称其负责多模态理解方向,并参与多模态内容理解与生成模型的训练。如今他加入腾讯混元,将负责混元多模态内容生成算法。蔺旭东的加入与其说是提升混元多模态生成的性能,倒不如说是为了解决一个困扰所有多模态的问题——理解。以前的生成模型更像一个画面制造器。给它一句提示词,它可以生成一张图片、一段视频。但只要用户提出更复杂的要求,模型就有点跟不上了。比如人物在长视频里变了,物体的形状前后不一致,摄像机运动不符合空间关系等等。这不是因为模型不会生成,而是因为它没有稳定地记住和理解世界。所以,把蔺旭东放到多模态内容生成的位置上,可能正是因为他把多模态,“翻译”成AI能理解的东西。蔺旭东的加入要放在一个更大的背景下才能看得清楚,那就是如今腾讯混元正在重新整理自己的多模态路线。2025年1月,腾讯杰出科学家(Tencent Distinguished Scientist)胡瀚接替此前离职的刘威,全面负责混元多模态大模型的研发,同时担任腾讯混元大模型Tech Lead。2025年下半年腾讯内部组织调整,他从多模态模型部,调入了大语言模型部旗下的“Frontier”前沿技术研究组,头衔变成了多模态理解方向负责人,汇报线也改为向姚顺雨汇报。实际地位从“一个独立部门的领导”变成了“大语言模型...

2天前字母AI#AI #李飞飞 #梁文峰 #腾讯

里昂:智谱 GLM-5.3 后训练能力显著提升,维持跑赢大市评级

比推消息,据金十报道,里昂发表研究报告指,智谱 (02513.HK) GLM-5.3 API 即日起开放调用,在复杂编码及长周期代理任务方面展现国内同业中领先性能,虽然参数规模较小,但在一众基准测试中都取得开放权重 SOTA 表现,并在 Artificial Analysis 智能指数中获得 60 分,与 Kimi 3 持平,超越通义千问 3.8 Max。该行估算 GLM 模型的 OpenRouter 收入份额已从今年 1 月的 1% 升至 7 月的 7%,领先 DeepSeek 的 6% 及月之暗面的 3%。认为 DeepSeek 近期加价反映行业竞争健康,而 GLM 5.3 已重夺帕累托前沿地位。近期股价疲弱或反映市场对 Anthropic 年化经常性收入减速的过度反应,维持智谱跑赢大市评级,目标价为 2061 港元。

3天前
为什么资本追逐 AI Native,不再理睬互联网老登

为什么资本追逐 AI Native,不再理睬互联网老登

资本不奖励守旧,不是因为守旧的人有错。是守旧的部分已经明码标价,没有信息差,也就没有超额收益。2026 年上半年,全球风险投资 5100 亿美元,一个半年超过了 2025 全年的 4400 亿。七成以上进了 AI,OpenAI 和 Anthropic 两家拿走 2170 亿,占 43%。钱多到这个份上,你会以为人人都能分一点。事实是分配比总量更极端,而且第一道筛子不筛行业,筛人。被筛掉的那一类,现在有个不太客气的叫法:互联网老登。先说死一件事:本文里的「老登」跟年龄没关系。它指的是一套在移动互联网周期里成型、被反复验证、给持有人带来过巨大回报的方法论。持有它的人可能四十五岁,也可能三十二岁。被重新定价的是这套方法论,不是出生年份。把这两件事搞混,是老登最常犯、也最舒服的一个错——因为如果问题是别人年龄歧视,你就一个字都不用改。01什么叫 AI Native这个词已经被用烂了。会用 ChatGPT 不叫 AI native,公司名里带个 AI 也不叫,二十几岁更不叫。真正把人分开的是三条。第一条,出发点是模型,不是需求。老登做产品的顺序是:看用户要什么,写成需求,找技术实现。AI native 的顺序反过来:先摸清模型今天能干到哪一步、明天可能到哪一步,然后从这个能力边界往外长产品。前者把模型当工具,后者把模型当地基。这两种人做出来的东西,第一版看不出差别,到第三版差出一个物种。第二条,组织的默认单位不是人。互联网时代的分工,是把一件事拆给十个人。AI native 公司的分工,是把十件事收给一个人加一堆 agent。国内一家应用层公司的 CEO 说过,团队不到十个人,但有大量 AI 在夜里干活,员工每天早上第一件事是检查 AI 前一晚交的活。Cursor 那边更极端,公开报道里提到公司没有产品经理,工程师自己写代码、自己跟用户聊、自己参与招人。第三条,信息是一手的。AI native 的输入来源是论文、模型卡、GitHub 的 issue、X 上的原始讨论、自己跑的 eval。老登的输入来源是行业峰会、闭门会、券商报告、公众号解读,以及找人喝咖啡。这一条最不起眼,杀伤力最大,后面单独说。三条都满足,二十五岁是 AI native,四十五岁也是。三条都不满足,二十五岁照样是老登。AI native 是个状态,不是个年龄段。麻烦在于,这个状态的入场券是作品,不是履历。02两张名单把这一轮的结果摊在桌面上,是两张名单。第一张全是 AI native 的公司。它们的估值不是在涨,是在换量级。名单一 · 上游OpenAI 2026 年 Q1 单轮融资 1220 亿美元,投后 8520 亿美元,史上最大一笔私募融资。Anthropic Q2 单轮 650 亿美元,投后 9650 亿美元,约占该季度全球风投总额的一半;5 月的收入运行率已到约 470 亿美元。DeepSeek 2026 年 5 月首轮融资约 700 亿元人民币。同年 4 月,梁文锋将直接持股由 1% 提至 34%,通过关联主体合计控制约 84.29% 股权。月之暗面(Kimi) 2025 年 12 月估值 43 亿美元;2026 年 1‒2 月连做三轮至 180 亿;5 月 D 轮约 20 亿美元、投后破 200 亿;7 月一轮超 35 亿美元、投后 350 亿;Pre-IPO 目标投前 500 亿。ARR 3 月破 1 亿、5 月破 2 亿、6 月站稳 3 亿美元,API 占七成以上。智谱 · MiniMax 2026 年初先后登陆港股,市值均破千亿元人民币,国内首批上市的大模型公司。第二张...

3天前Wendy#AI #DeepSeek