harness · 54

DeepSeek 视觉模型多模态 Agent 能力逼近 Opus 4.8,4 项打成 2:2

比推消息,DeepSeek 公布 V4-Flash-Vision-Exp 首批 Agent 跑分。在 4 项多模态 Agent 评测中与 Opus 4.8 打成 2 胜 2 负:Agents' Last Exam 27.3 对 25.7,ZeroBench 35.0 对 34.0;ApexBench 36.5 对 39.4,Chartography 64.3 对 65.0。相比纯文本版 V4-Flash-0731,视觉版在 ApexBench 从 26.2 升至 36.5,Agents' Last Exam 从 25.2 升至 27.3。官方注明纯文本版会忽略多模态内容,故主要体现补上视觉输入后的能力。加上视觉后文本 Agent 能力未明显缩水,7 项文本评测中 6 项高于 V4-Flash-0731,如 DeepSWE 从 54.4 升至 59.3(超 Opus 4.8 的 58.0),Toolathlon 75.9 几乎追平 Opus 4.8 的 76.2。该结果来自 DeepSeek 官方自测,非第三方独立榜单;公开 Code Agent 文本任务使用 DeepSeek Harness 极简模式,推理档位为 max。

1天前

DeepSeek V4 Flash 视觉模型疑似即将发布

比推消息,据 X 用户 MaxForAI 披露,DeepSeek 视觉模型相关迹象已出现。今天下午 3 点,deepseek-v4-flash-vision-exp 这一名称已出现在 DeepSeek Harness 相关代码中,且 Harness 最新版本已开始加入原生图片请求适配。不过在模型 endpoint 准备就绪前,该模型不会被放入正式模型目录。目前来看,DeepSeek 应正在测试 V4 Flash 的视觉版本,公开 API 尚未正式开放。已有用户直接使用该模型 ID 请求 DeepSeek API,目前仍会返回错误,官方文档中也尚未列出该模型。客户端与 Harness 侧的适配路径已基本铺好,DeepSeek V4 Flash 有望很快具备视觉能力。

1天前

DeepSeek V4 Pro 跑 5 套 Harness:Pi 成功率第一,DSH 最省钱

比推消息, AI 快讯,Agent 工具公司 Composio 把同一个 DeepSeek V4 Pro 0813 分别放进 Pi Agent、DeepSeek Harness 0.1、Claude Code、OpenCode 和 Hermes Agent,统一开到 max reasoning,跑了 30 个多步骤 Agent 任务。通过率:1. Pi Agent:21/302. DeepSeek Harness:20/303. Claude Code:19/304. OpenCode:19/305. Hermes Agent:18/3030 道题里,15 道五家全过,7 道五家全挂。剩下 8 道只换了 Harness,结果就会翻转。速度排名:1. Claude Code:181.8 秒2. DeepSeek Harness:252.1 秒3. Hermes Agent:273.6 秒4. OpenCode:280.6 秒5. Pi Agent:362.9 秒单次成功成本:1. DeepSeek Harness:0.028 美元2. Pi Agent:0.031 美元3. OpenCode:0.032 美元4. Hermes Agent:0.037 美元5. Claude Code:0.074 美元Pi 通过率最高,DeepSeek 官方 Harness 最省钱,Claude Code 最快但最贵。Composio 此前用 DeepSeek V4 Flash 做过同类测试,当时 Pi 同样拿到最高通过率。

2天前

DeepSeek-V4-Pro 被曝一个 API 三个模型?社区测试揭示背后或是 Agent 环境差异

比推消息,近日 AI 社区热议 DeepSeek-V4-Pro 疑似存在多个版本。有用户发现,同样调用 deepseek-v4-pro 接口,在更换 IP 或重新创建会话后,模型会出现三种不同的推理风格:一类频繁以Let me开头,接近此前 V4 Pro Preview;一类常出现The user wants me,类似 V4 Flash;另一类大量使用we,被部分用户称为能力更强的神版 V4 Pro。由于同一会话一旦进入某种模式后,后续表现通常保持稳定,社区一度猜测 DeepSeek 是否在 API 背后隐藏了多个模型,并通过路由机制分发。不过,进一步分析 DeepSeek Harness 源码后,出现了另一种解释:差异可能并非来自不同模型权重,而是来自 Agent 运行环境。社区发现,8 月 10 日,DeepSeek Harness 官方仓库更新了一条关键 commit:fix(preset): align minimal agent with RL composition该更新旨在让 Minimal Agent 与强化学习(RL)训练时使用的 Agent 环境保持一致。官方文档显示,Minimal preset 包含极简 system prompt、persistent Bash 环境、指定编辑工具、RL 训练使用的 compaction policy,并移除了额外身份提示、Web 提示及工具说明。这意味着,DSH Minimal 可能并不是 Standard 版本的阉割版,而是在模拟模型训练阶段真实接触的 Agent 环境。社区测试也支持这一观点。同一个 DeepSeek V4 Pro 在不同 Harness 环境下表现:DSH Standard:91 分;DSH PTC:92 分;DSH Minimal:99/96 分。随后,测试者开发Anchored Standard插件:首次请求模拟 Minimal 环境,只开放 shell 和 read 工具,完成首次工具调用后再恢复 Standard 完整工具集,结果连续获得 98/99 分。测试者认为,决定 V4 Pro Agent 能力发挥的关键,可能并非最终拥有多少工具,而是模型首次看到的:System Prompt + Tool Schema + Agent Scaffold。因此,所谓三个 DeepSeek 模型可能实际上是两层因素叠加:一方面是 API 服务环境、部署配置或灰度实例差异;另一方面是模型是否进入接近 RL 训练分布的 Agent 环境。不过,目前该说法尚未得到 DeepSeek 官方确认。官方 API 文档显示,deepseek-v4-pro 对应 DeepSeek-V4-Pro-0813 正式版本,并未公布多模型自动路由机制。目前来看,DeepSeek-V4-Pro 不同表现更可能是模型权重、推理环境和 Agent 框架共同作用的结果,而非简单存在三个隐藏模型。

7天前

DeepSeek 正布局情感 AI 方向,招聘情感智能数据产品经理

比推消息,据智能纪元 AGI 独家获悉,DeepSeek 正在大量招聘情感智能数据产品经理职位,日薪 510 元,负责优化 DeepSeek 模型在情感场景下的能力表现,提升角色扮演与情感交互的真实感与沉浸度,深入挖掘情感场景中的 Badcase 并进行归因分析。 该招聘信息表明 DeepSeek 正在从编程等基础能力向更接近人类语言的情感交互方向拓展,产品定位类似豆包,旨在打造更具“人格化”特征的 AI 模型体系,而非局限于编程场景。此前 DeepSeek 已于 8 月 13 日面向开发者推出 Harness 预览版,据花旗研报及易观数据,当前市场同类产品 WorkBuddy 跨平台 MAU 已突破 2000 万,PC 端月访问量 2097 万次。DeepSeek 尚未就情感 AI 方向的具体产品规划作出说明。

8天前

DeepSeek Harness 成 GitHub 史上增长最快开源项目,约 1 个半小时获 2.2 万星

比推消息,据监测,DeepSeek Harness 刚刚开源 1 个半小时,GitHub Star 已经突破 2.2 万,目前还在快速上涨。它是 DeepSeek 首款 Agent 产品,主打用插件和预设自由组装不同 Agent。这个速度放在 GitHub 历史上也非常夸张。Star History 截至今年 3 月底的公开统计中,最快突破 2 万 Star 的项目是 xAI 的 Grok-1,用了约 1.2 天;DeepSeek-R1 则用了约 5.7 天。Harness 现在仅仅 1 个半小时就已经越过这一门槛。

9天前
Jeff Dean 离职前最后一次对话:我低估了AI,也看清了创业者的唯一生路

Jeff Dean 离职前最后一次对话:我低估了AI,也看清了创业者的唯一生路

来源 | InfoQ编译 | 宇琪 策划 | Tina一年前,Google 首席科学家 Jeff Dean 在 AI Ascent 2025 峰会上预测:到 2026 年,可能出现能够全天候工作、能力接近初级软件工程师的 AI 系统。一年后,也就是 6 天前,他在一期 YC 访谈中承认,自己低估了 AI 的进展速度。模型处理复杂任务的能力,增长得远比他当时预想的更快。那么,在 Jeff Dean 看来,AI 接下来还会以多快的速度向前推进?创业公司又该如何在通用模型不断扩张能力边界的时代生存下来?今天凌晨,这期访谈又有了不同的分量。Jeff Dean 宣布,明天将是自己在 Google 的最后一天。效力 Google 27 年后,这位被誉为硅谷“程序员中的程序员”、深度参与 Google 系统架构和 AI 技术建设的传奇工程师,将与长期合作伙伴 Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 共同创立 Discovery Loop,一家聚焦机器学习、科学和工程前沿研究的公益性公司。Google 将作为创始投资方和云计算合作伙伴继续与他们合作。据 WIRED 披露,这个创业想法其实只是几周前才浮出水面。为了挽留这支核心团队,Alphabet CEO Sundar Pichai 还曾在多次会面中试图说服他们“别摘工牌”。但最终,几人还是决定离开大公司体系,去换取一家初创公司才有的乐趣、速度和自由。截图来自:https://x.com/JeffDean/status/2085035498222002595/photo/1Jeff Dean 在告别信中写道,自己见证了 Google 从一家只有 25 人的公司,成长为拥有 19 万多名员工的科技巨头。如今,Google 已有 13 款产品的用户规模超过 10 亿。从搜索、邮件、翻译和视频,到大规模计算、自动驾驶和 AI 系统,他参与建设的技术几乎贯穿了 Google 的整个发展历程。而促使他们离开的一个重要原因,也恰恰是大公司难以摆脱的惯性。正如 Oriol Vinyals 所说,在大型组织内部,要推动任何激进变化,都必须先克服层层阻力;他们想做点不一样的东西。颇有意思的是,迄今为止,这家新公司甚至还没来得及招人、租办公室,至于谁来当 CEO,团队内部短暂停顿后,大家把目光投向了 Jeff Dean——“我想应该是我吧。”他说。因此,这期发布于 Jeff Dean 离职前夕的访谈,也像是他站在职业生涯转折点上,对 AI 下一阶段的一次集中判断。节目中,他与 YC 合伙人 Diana Hu 讨论了 AI 从“模型为中心”转向“上下文工程”的范式变化、推理硬件正在出现的巨大机会,以及创业者如何在通用模型越来越强、越来越多应用可能被模型直接吞并的时代,找到真正值得坚守的生存空间。本文基于该访谈视频整理,经 InfoQ 编辑。太长不看版Q:去年你说到 2026 年会出现能力接近初级工程师的 AI。一年过去了,这个预测打脸了吗?A:相当准确,但我低估了一件事:模型处理越来越复杂任务的能力,增长速度比我预想的快得多。而且这种能力正在溢出到编码之外的领域,基于 Agent 的系统开始真正崭露头角。Q:对 2027 年的大胆预测是什么?A:深度学习系统将实现全自动的问题分解和自动化实验循环:把问题拆成子问题,自动跑实验,整合结果,得到一个改进后的系统。而且这不只适用于机器学习,任何有可衡量目标的科学和工程领域都能用上。Q:2001 年 Google 把搜索索引装进内存,...

9天前burnking#AI #Jeff Dean #谷歌

DeepSeek 推出代码智能体框架 Harness 公开测试版

比推消息,据金十报道, DeepSeek 推出了其代码智能体框架 Harness 的公开测试版,并同步开放了配套的 NPM 插件生态系统(但 GitHub 仓库仍处于非公开状态)。在产品定位上,DeepSeek Harness 精准对标 OpenAI Codex 及 Anthropic Claude Code,旨在成为一款主打编程和办公场景的 AI 生产力工具。

9天前

DeepSeek Harness 正式上线:首款 Agent 产品,整个 Agent 可实现自行组装

比推消息,据监测,DeepSeek 正式上线首款 Agent 产品 DeepSeek Harness,软件包已经发布至 npm。此前 V4-Flash 的公开 Code Agent 评测,用的就是 Harness 内置的极简模式。它不只是一款类似 Codex 的 Coding Agent。Harness 支持管理项目、长任务、多 Agent、Skill、联网搜索和上下文管理,还允许用户创建不同的Agent 预设。写代码、研究、写作等任务,可以配置不同的工具、提示词和工作方式。更特别的是插件系统。DeepSeek 把Everything is a plugin作为核心设计,模型、工具、提示词、存储、上下文甚至界面都能通过插件替换或组合。内测用户已经做出了长期记忆、界面修改等插件。简单说,Codex 更像一个做好的 Agent,DeepSeek Harness 更像一套组装 Agent 的运行时。用户不只是在选模型,也可以自己决定 Agent 用什么工具、遵守什么规则、怎么工作。

9天前

DeepSeek-V4-Pro 正式版 Agent 能力暴涨,DeepSWE 一次升近 50 分

比推消息,据监测,DeepSeek-V4-Pro-0813 的 Agent 成绩大幅跃升。DeepSeek 官方流出的自测表显示,DeepSWE 从 Preview 版的 12.8 飙到 62.7,一次涨了 49.9 分。CyberGym 也从 52.7 升到 83.3,AutomationBench 从 12.8 升到 31.8。新版已经在多项评测反超 Claude Opus 4.8。Terminal Bench 2.1 达到 87.9 对 85.0,CyberGym 为 83.3 对 78.3,DeepSWE 为 62.7 对 58.0。AutomationBench 甚至以 31.8 超过 Fable 5 的 29.1。离谱的是,模型从 Preview 升到 0813,价格一分钱没涨。V4-Pro API 仍维持每百万 Token 输入 3 元、输出 6 元。不过这批成绩目前还是 DeepSeek 自测,第三方尚未完整复现。尤其 DeepSWE 一次暴涨近 50 分,Agent 评测又很依赖 Harness,实际提升还要等外部测试。

9天前