Paper · 216

Token 不够就赢别人的:有人设计出 Codex 版德州扑克

比推消息,据监测,独立设计师 Hours 给 Codex 设计了一个根本不存在、但看起来特别合理的新功能:拿自己的 Token 额度打德州扑克。这张概念图把整套扑克规则都搬进了 Codex。牌桌叫No-Limit Inference,6 个人的 Token 余额就是筹码,底池已经堆到 170 万 Token。轮到你时,可以弃牌、跟注 56.1 万,或者一把押上 128 万 Token。甚至细节都做全了。0.5/1 Mtok 变成大小盲注,下注还能直接选底池的 25%、33%、75%。有人在评论区开玩笑说,这功能真上线,Codex 至少还能再多 500 万用户。可惜它现在真的只是一张设计图。作者 Hours 随后晒出的截图显示,这套界面是在设计工具 Paper 里做的,目前没有对应的 Codex 插件叫Earn tokens。

5天前
菲尔兹奖得主怎么发了AI顶会?

菲尔兹奖得主怎么发了AI顶会?

作者:量子位原标题:菲尔兹奖得主王虹,也发过NeurIPS嗯?新晋菲尔兹奖得主王虹,也曾跨界做 AI?NeurIPS 2026 出分在即,有网友扒出,王虹教授发过一篇NeurIPS 2019。而且还不是挂名,是实打实的共同一作。那么问题来了,一个纯数方向的顶尖数学家,为什么会在 AI 顶会上发论文?通读下来,我们的结论是,这是一篇数学理论+机器学习的最佳范例。不过有意思的是,在王虹个人主页列出的将近 40 多篇论文和预印本中,几乎每篇都附有完整链接。唯独这篇,是个例外。王虹跨界挑战 AI这篇论文研究的,是机器学习和数据分析中的一项基础任务:低秩矩阵近似。简单来说,现实中的数据通常可以整理成一个矩阵,但这些矩阵往往非常大,直接存储和处理成本极高。低秩近似就是用一个结构更简单、秩更低的矩阵,尽可能准确地还原原始矩阵。近来常用的近似算法是列子集选择(Column Subset Selection,CSS)。它的思路其实非常直观。在面对一个包含大量列的数据矩阵,不再直接求出一个全新的低秩矩阵,而是从原矩阵中挑出具有代表性的若干列,再用它们张成的空间去近似整个矩阵。由于被 CSS 选出来的列直接来自原始数据,因此会比普通矩阵分解得到的抽象向量更容易解释,同时它也能降低存储和计算成本,适合处理大规模数据。此前的研究证明,其中对于一般的低秩近似,CSS 算法的近似比上界大约是O(k+1)。这里的 k 指的是目标矩阵的秩,k 越大,理论上允许的最坏误差就越大。王虹等人的工作,则是把这个界进一步推进:· 当 1≤p≤2 时,近似比为 (k+1)^(1/p);· 当 p≥2 时,近似比为 (k+1)^(1−1/p)。相较此前统一的 O(k+1) 结果,这一界明显更紧,算法能够被严格限制,最坏结果也只会比最优解差一点点。另外,对于 p≥2 的情况,论文还构造了对应的下界,证明其结果精确到常数 1。换句话说,这篇论文给出了近乎封顶的理论答案。而这篇论文中最关键、也最能体现王虹数学背景的部分,是他们使用了来自调和分析的经典工具Riesz–Thorin 插值定理。通常情况下,想证明一套算法在所有 p 值下都成立,需要针对不同的 p 分别展开复杂分析。对于某些端点情况,例如 p=1、p=2 和 p=∞,则相对容易处理。接着 Riesz–Thorin 插值定理可以在掌握这些端点结果后,把结论「插值」到中间的所有 p 值。具体来说,论文先证明 p=1、2、∞ 三个特殊情况,再通过插值理论推出整个范围内的近似界。事实上,这套工具在调和分析和算子理论中属于经典方法,却并不是当时理论计算机科学研究者最常使用的技术。NeurIPS 当年的审稿人也注意到了这一点。审稿人最终认可这篇论文最主要的技术创新,就是往计算机领域引入 Riesz–Thorin 定理,最后的 Meta Review 则将它评价为一篇论证相当扎实的论文。放到今天看,这篇论文其实也提供了一个非常典型的跨学科案例,机器学习的难题或许可以在纯数学中找到突破口。NeurIPS 2026 出分在即时间拨回到现在,NeurIPS 的审稿机制正在发生一次明显调整。NeurIPS 2026 要求作者在投稿时,从五种贡献类型中选择出最符合论文定位的一类:General、Theory、Use-Inspired、Concept & Feasibility 以及 Negative Results。毫无疑问,王虹这篇 2019 年的论文属于其中的Theory类型。按照 NeurIPS 2026 最新审稿指南,理论论文首先考察的是数学严谨性...

29天前burnking#AI #王虹
清华天才+摇滚鼓手,这位潮汕小伙正让硅谷坐立难安

清华天才+摇滚鼓手,这位潮汕小伙正让硅谷坐立难安

2026年7月16日深夜,当杨植麟的Kimi K3模型上线,没有人预想到接下来会发生什么。第一天,它登顶Arena AI前端代码竞技场,1679分,压过Claude和GPT。海外有人称之为“DeepSeek 2.0时刻”。第二天,马斯克在社交平台写下“Impressive”,随即宣布自家2万亿参数新模型“可能超越Kimi”,月之暗面回应:“欢迎马斯克加入‘2万亿+俱乐部’”。第三天,Kimi用户请求量超出预估,逼近集群承载极限,团队深夜发公告暂停新用户订阅。第四天,美国白宫官员公开指控月之暗面“窃取技术”及“规避芯片出口管制”。第五天,纳斯达克因K3发布等因素开盘跌1.8%,费城半导体指数跌5.2%。第六天,彭博社报道:K3被认为可能缩小中美AI差距,有学者指出差距可能缩窄到两到三个月。第七天,胡锡进发文提醒杨植麟,“暂时别去美国”。七天,一个90后汕头人,让硅谷、白宫和华尔街同时乱了阵脚。代码为器,摇滚为骨1992年出生于广东汕头普通家庭的杨植麟,成长轨迹从一开始就与众不同。少年时期的他有两个爱好:摇滚乐与代码。高中就读于汕头金山中学,没有任何编程基础的他被选拔进信息学奥赛培训班。身边同学大多从初中就开始写代码,他起步晚到离谱。但仅仅一年后,他拿下全国青少年信息学联赛广东赛区一等奖,获得清华保送资格。但他偏要证明自己不只是“保送生”。他参加自主招生再次过线,又决定以普通高考生身份参加高考——667分,汕头市理科状元。三次被清华录取,在当地成为传奇。2011年汕头市理科高考状元杨植麟(中),国航向他提供免费机票。(图源:华龙潮汕网)进入清华后,他被调剂到热能工程——俗称“烧锅炉”。大二时,他做了一个让旁人费解的决定:转专业到计算机系。理由非常“摇滚”:喜欢。而这种喜欢,来自村上春树的一篇小说——小说里一个深夜写代码让技术落地的程序员角色,让他充满憧憬。转系意味着要补修所有人大一的编程课。但他最终以年级第一的成绩毕业,90%专业课成绩超过95分。与此同时,他在清华组建了摇滚乐队Splay,担任鼓手和词曲作者。乐队名字源自数据结构“Splay Tree”——一个巧妙的双关,2014年清华校歌赛,他们拿下“最佳原创歌曲奖”。(学分绩第一,paper无数)多年后杨植麟回忆本科最大的遗憾时说:“我的乐队没能在原创比赛中获得冠军,只拿了一个原创歌曲奖。”创业,写在潮汕人的基因里2015年,杨植麟以清华计算机系第一名的成绩毕业,去了卡内基梅隆大学读博,师从苹果首任AI总监Ruslan Salakhutdinov。四年后毕业——比通常的六年快了整整两年。读博期间,他做了两项后来被频繁引用的工作:Transformer-XL和XLNet,合计被引超过两万次。Transformer是今天所有大模型的底层骨架,他的工作相当于在这副骨架上做了关键节点的改进。他也因此成了中国35岁以下NLP领域引用量最高的研究者。K3发布后,杨植麟火了,很多人都在问:他为什么不留在美国?有人猜测是因为签证,有人说是H-1B没抽中。传言传得太厉害,他的导师Russ Salakhutdinov不得不出面澄清:事实是,以杨植麟的水平,留在美国有无数机会临近毕业,苹果想招他,谷歌和Meta也提供过机会,斯坦福和麻省理工都问他愿不愿意来做博士后,一位苹果高管甚至给了他在北京办公室的职位。Salakhutdinov说:“我记得他告诉我,如果他连尝试创业的机会都没有,他会后悔一辈子。我尊重他的决定,而且他说得对。”2023年2月,杨植麟开始集中做第一轮融资。他后来回忆,那是一个极窄的窗口期:“如果de...

29天前Wendy#AI #KIMI #原创 #杨植麟
AI真的在“进化”自己了:8天自我改写了100次

AI真的在“进化”自己了:8天自我改写了100次

来源:PaperWeekly原标题:模型权重不动,Harness改写100轮:「递归自我改进」首获实证100 轮改写,约九成候选版本未能通过评测,真正刷新历史最佳的只有 7 轮。Weco AI 让一个研究 agent 连续运行 8 天,反复重写另一个研究 agent 的 harness。这里的 harness指承载搜索、上下文管理、错误处理和验证流程的 agent 运行框架。每个候选版本都要在固定成本下完成整套评测,再根据内层 agent 无法看到的隐藏分数决定是否保留。搜索策略如何调整,哪些历史信息进入上下文,错误怎样处理,评测如何执行,以及怎样防止奖励作弊,都由外层 agent 自动修改。最终得到的 AIDE₄₇(AI-Driven Exploration)与 AIDE₈₅ 不仅超过起点,而且这些提升还能迁移到未参与版本筛选的外部任务。在机器学习工程、启发式算法和天气模拟三类评测中,两个版本均优于团队人工调试约两年的 AIDE_human。KernelBench 上的奖励作弊比例也从 63% 降至 34%。整个实验没有更新基础模型权重,变化集中在 harness 代码。现有自动研究系统已经能围绕具体任务修改代码、运行实验,再根据结果进入下一轮搜索。AIDE² 在此基础上增加了一层外循环,让研究 agent 直接修改负责执行研究的 agent。按照 Weco 提出的 RSI 分级,团队将这组结果视为递归自我改进首次达到 Level 1 的实验性证据。关键在于,这些提升经过了多轮筛选,也能迁移到未参与优化的任务。Harness成为优化对象AIDE² 把自动研究分成内外两层。内层 AIDE 负责提出方案、修改代码和运行实验;外层 AIDE_human 则直接修改内层 agent 的 harness,包括搜索策略、上下文管理、错误处理和评测逻辑。外层 AIDE_human 由 Claude Opus 4.7 驱动,内层各版 AIDE 则运行在 Gemini 3 Flash 上。Weco 选择这种非对称配置,是因为 Gemini 3 Flash 在固定预算下能匹配或略胜更大的模型,同时成本更低。外层自身的 token 开销只占总成本的一小部分,因此使用了能力更强的模型。候选harness只有在完整评测中超过当前最佳版本,才会被保留。评测覆盖机器学习工程、启发式算法工程和 harness 工程。具体方案在不可见数据上仍能保持优势,属于一阶泛化。改进后的 harness 还能在从未参与筛选的新任务上生效,才提供二阶泛化证据。每次评测还设置按美元计量的固定预算。增加模型调用次数、无限扩大 Best-of-N 采样,或者进行激进并行,都不能绕过这项成本约束。100轮中的7次迭代AIDE² 连续完成 100 个外层步骤,从 AIDE₀ 迭代到 AIDE₉₉,全程没有人工介入。刷新历史最佳的改写出现在第 2、6、28、39、47、63 和 85 轮,内部综合分数由 0.703 升至 0.778。100轮外层改写中,共有7轮刷新历史最佳成绩团队随后把 AIDE₄₇ 和 AIDE₈₅ 放到三项从未参与版本筛选的外部任务上。外部结果并没有单调上升。MLE-Bench Lite 上,AIDE₄₇ 最高,达到 0.739。AIDE₈₅ 回落到 0.721,但仍超过 AIDE₀ 的 0.673 和人工版的 0.708。ALE-Bench Lite 和 WeatherBench 2 则由 AIDE₈₅ 领先,分别达到 1790 和 0.803。更重要的是,AIDE₄₇ 与 AI...

36天前章鱼烧#AIDE #harness #Weco #上下文重构

区块链数据基础设施公司 Cambrian 完成 600 万美元种子轮融资,Franklin Templeton 和 Polychain 领投

比推消息, 区块链数据基础设施初创公司 Cambrian 完成 600 万美元种子轮融资,由 Franklin Templeton 和 Polychain Capital 共同领投,Flow Traders、Selini Capital、Paper Ventures、Nomad Capital 等参投。 Cambrian 还曾获得 a16z Crypto Startup Accelerator 领投的 590 万美元 pre-seed 融资,累计融资额达 1190 万美元。据悉,Cambrian 成立于 2024 年,目前提供面向机构和 AI Agent 的 API,覆盖收益、风险、借贷利率、交易活动、流动性头寸和市场情绪等实时及历史链上数据,帮助用户在链上进行资本配置。公司计划将现有 API 扩展为可验证的区块链数据预言机网络,服务于机构金融客户、AI Agent 构建者以及需要可靠数据来控制资金流向的协议。与传统主要提供价格数据的预言机不同,Cambrian 希望聚合借贷协议数据、DEX 流动性、社交情绪、开发者活动和历史市场数据。据 Cambrian 披露,其平台已处理数百万次 API 调用,目前索引四大借贷协议约 45 亿美元 TVL、追踪 895 个 curator 旗下 1789 个 vault,并监控 Base 和 Solana 上超过 32 万个 DEX 流动性池。公司还计划扩展交易数据支持,加入 Hyperliquid 及更丰富的永续合约数据。

59天前#融资

Ramp 报告:为省成本,大量美国公司直接购买中国 DeepSeek 官方 API

比推消息,据监测,美国企业支出管理平台 Ramp 发布的 2026 年 6 月报告显示,中国 AI 公司 DeepSeek 登上了热门软件榜首。尽管美国官方先前高度防范中国大模型,但真实的商业交易数据却揭示了相反的现状。Ramp 分析了平台上 5 万多家企业的信用卡消费记录,发现许多美国公司并未在本地部署开源模型,而是直接掏钱购买 DeepSeek 官方的托管 API 服务。这意味着,大量美国企业的数据正直接发送并存储在位于中国的服务器上。真实的资金流向与一年多前美国社会对 DeepSeek R1 刚发布时的警惕态度形成了强烈反差。当时出于对泄密和安全的担忧,美国大公司和政府机构普遍限制使用中国模型。然而,面对美国本土的 OpenAI 或 Anthropic 等大模型高昂的账单,许多中小企业最终选择向成本低头,直接购买托管在中国的官方服务来降低开支。除了直接使用 DeepSeek,美国企业在 AI 支出上也开始算细账,逐渐从 OpenAI 和 Anthropic 转向开源生态。Fireworks AI、fal AI 以及 DeepInfra 等提供开源模型 API 调用的推理平台纷纷上榜。许多公司开始采用智能分流策略,只在最复杂的任务中调用昂贵的 OpenAI 或 Anthropic 旗舰模型,而将大部分日常常规任务交给更便宜的开源模型处理。市场曾担忧 AI 智能体会取代传统软件设计工具,但实际数据显示设计类软件依然表现坚挺。在本月榜单中,设计工具 Figma 登上了最快增长榜,协作设计工具 Paper 也入围热度榜,表明传统设计软件在企业端依旧坚固。

79天前

数字资产交易平台 Temple Digital Group 完成私募轮融资,SBI Group 领投

比推消息,数字资产交易平台 Temple Digital Group 完成私募轮融资,SBI Group 领投。具体融资金额暂未披露。Temple 正通过引入新资本来扩展其产品组合,并准备于 2026 年下半年在受监管的市场上市。 此前消息,Temple Digital Group 曾于去年 10 月完成 500 万美元种子轮融资,Paper Ventures 领投。

93天前

纽约法院下令 Arbitrum DAO 冻结 7100 万美元 ETH,或用于赔偿朝鲜相关案件受害者

比推消息,MegaETH 主管 PaperImperium 在 X 平台披露纽约南区联邦法院文件显示,美国法院已向 Arbitrum DAO 发布禁制令,要求其不得转移此前在 KelpDAO 黑客事件中被冻结的约 7100 万美元 ETH 资产。 原告方试图将该笔资金用于执行针对朝鲜多年来涉及恐怖主义、绑架等案件的未偿判决赔偿,并已申请以替代送达方式向 Arbitrum DAO 发出法律通知,将其视为可被追责的“合伙组织”。法院文件还指出,Arbitrum DAO 设有由 ARB 持有人治理的 Security Council,具备在紧急情况下采取行动的能力,因此相关成员若拒绝配合,可能面临藐视法庭等法律责任。市场认为,此案或成为美国司法体系直接约束 DAO 治理结构的重要案例,并进一步凸显 DeFi 协议在现实法律框架下的合规压力。

111天前

ZachXBT:美国律所“搭便车索赔”或阻碍黑客受害者资金追回与补偿进程

比推消息, MegaETH 主管 PaperImperium 在 X 平台披露纽约南区联邦法院文件显示,美国法院已向 Arbitrum DAO 发布禁制令,要求其不得转移此前在 KelpDAO 黑客事件中被冻结的约 7100 万美元 ETH 资产。对此,“链上侦探”ZachXBT 在 X 平台发文表示,某些美国律所利用其调查工作和链上取证成果帮助某些黑客事件受害者提出法律索赔,但这种做法反而会影响减缓受害者拿到补偿/恢复资金。ZachXBT 补充称,在此前多起涉及 Lazarus Group 的黑客事件中,此类律所通常会在其链上资金追踪或冻结完成后才介入,并提出与加密事件本身关联较弱的后续法律行动,也曾在 Harmony、Bybit 等事件中采取类似策略进行“搭便车式索赔”,他呼吁加密社区应该成立 DAO 来抵制此类行为。

111天前
全员 token-maxxing,一场没人敢停的军备竞赛

全员 token-maxxing,一场没人敢停的军备竞赛

来源丨晚点LatePost晚点专栏作者丨五源资本合伙人 孟醒2026 年 3 月 24 日早上,我坐在 YC W26 batch Demo Day 的观众席里,听到第五家公司上台路演的时候,决定不再做笔记了。不是不重要,而是我意识到,自己记下来的这些东西,可能下个月就过时了。这一届一百多家公司,做的事情其实高度集中:大约 80% 都是垂直 agent,比如帮律师整理文件、帮客服分发工单、帮 HR 筛选简历。如果是在去年 10 月看到这些项目,我大概率会觉得 “挺有想法”。但问题是,这五个月,世界变了。Claude Code 从一个更偏开发者的工具,变成了几乎任何人都能直接使用的界面。Opus 4.6 出来之后,整个 vibe coding 的门槛被压到了地板上。那些垂直 agent,在没有形成业务壁垒之前,今天一个普通工程师,甚至我自己,花一个周末就能做出来,他们已经失去了投资价值。YC 一届项目周期是三个月,这批 12 月入营,加上前期筛选,等于是 5 个月前被选出来的 “好公司”。而 5 个月,在现在的 AI 迭代速度里,已经足够发生几轮范式转换。2012 年我第一次创业,拿到 YC 的 Fly Out(实地面试邀请)的时候,那时候 YC 在加速器这个赛道上,几乎一枝独秀,选出来的公司往往代表着 “下一个方向”。但竞争格局在变,YC 这几年感觉反过来了,逐渐变成了一个 lagging indicator(滞后指标)。YC 的 batch 制度,从申请、筛选、入营、打磨、路演,在移动互联网时代运转了十几年,非常成功。但这套节奏是按一个更慢的世界设计的。回到风险投资行业的这一年半,我大概每个季度都会来一次硅谷,上一次是去年 10 月。以前每次来,都会觉得变化很快,但这种 “快” 大多是按月来感知的。这一次,得按 “周”。有一天晚饭的时候,一个做 post-training(后训练) 的朋友随口说了一句:“我发现,硅谷自己都开始跟不上自己了。”全员 token-maxxing:一场没人敢停的军备竞赛半年前如果有人跟我说,Meta 几万名工程师,全在用竞争对手的产品写代码,我会以为他在开玩笑。但这是真的。整个 Meta,全员都在用 Claude Code。这不是创业公司,不是某个实验性团队,而是一家市值万亿级别的公司。代码安全不要了,token 预算炸了,排行榜卷起来了,整个硅谷都在不计成本的往 AI 里砸钱。但砸完之后呢?先说代码安全。放在半年前,这件事完全不可想象,因为代码是公司的核心资产,你怎么能让外面一家公司的 API 去碰它?Meta 一开始也是这么想的,他们内部做过一个叫 myclaw 的东西,试图解决这个问题。一个 Meta 的朋友告诉我,他们做出来了 coding 产品,但 “不好用,没人用”。没人用之后,公司不得不放宽了:只要不涉及客户数据,爱用 Claude Code 就用。然后各部门开始开那种 “怎么变成 AI native 组织” 的内部会议,做培训,搞考核。代码安全、使用安全,这些过去天经地义的红线,统统被排到了后面,先把效率赶上来再说。出于安全考虑,Google 禁止大多数员工使用 Claude Code 或 Codex 等竞争对手的工具,但 DeepMind 是个例外,负责 Gemini 模型和内部应用的几个团队,都在用 Claude Code。谷歌自己也不是没有努力:他们推出了内部编码工具 Antigravity,今年 2 月还宣称公司约 50% 的新代码,已经由 AI 编写。但即便如此,DeepMind 的人还是在用...

117天前Wendy#AI #OpenClaw专题 #VC #深度 #硅谷 #融资 #观点