我的 X 阅读

我的关注 科学物理人工智能 神奇小子 动物世界

科学物理人工智能 · 3000 / 3000 条

已同步 74 个列表成员 · 当前内容涉及 66 位作者

更新 10-09 20:11

重置

3000 条 · 第 185/200 页 · 刷新

Markus J. Buehler @ProfBuehlerMIT
09-29 23:44 · 原帖
转帖:前沿情报 + 棘手的科学难题 = 未来十年一些最大的创业成果
Rohan Paul @rohanpaul_ai
09-29 23:44 · 原帖
转帖:OpenAI、Anthropic 和 Google 的高管将在收到传票警告后,于 10 月 5 日在纽约市议员面前露面,因为市议会正在调查 AI 安全措施,并公布法案以加强监管。 此次听证会紧随澳大利亚披露的一则消息之后,该消息称 OpenAI 的一个代理在 6 月进行内部评估时查询统计数据,并访问了非公开的 Medicare 门户文件。 市议会所有 51 名成员均受邀就快速发展的 AI 系统的安全措施以及纽约市民可能面临的潜在风险,向这些公司提出质询。
Wonder of Science @wonderofscience
09-29 23:42 · 原帖
太空行走期间的壮观景色。
Cerebras @cerebras
09-29 23:41 · 原帖
转帖:当我们设计晶圆级系统时,我们专注于将计算资源靠近内存,以便快速生成令牌。将这种速度带给更多开发者,也需要在周围的软件和基础设施上进行大量工作。 这就是为什么我对我们与 @gimletlabs 的合作感到兴奋。他们的软件将推理的不同阶段映射到最适合每个阶段的硬件上,通过单一 API 将 Cerebras 引入 Gimlet Cloud。 我们计划共同部署 Cerebras 驱动的推理容量,第一个数据中心预计将于今年晚些时候上线。 随着代理承担更长的任务,每次模型调用等待的时间会累积起来。我期待看到开发者们在能够更快完成这些步骤时,会构建出什么。 祝贺 @zainasgar 和 Gimlet 团队。我们才刚刚开始。
Deedy @deedydas
09-29 23:39 · 原帖
文章转视频 引用:我最喜欢的保罗·格雷厄姆文章《如何做出伟大的工作》,用不到200秒的视频呈现 (感谢 opus)
Deedy @deedydas
09-29 23:39 · 原帖
带有运行代码演练的 GitHub 仓库解释 引用:每个开源仓库都应该有一个像 SQLite 这样 7 分钟的解释视频 1. 解释仓库的功能以及它为什么有用 2. 展示代码的高层次地图(精美的图形!) 3. 查询在代码库中的生命周期 4. 仓库中的核心抽象 5. 真实的执行跟踪以及发生的事情,包括一点关于连接顺序查询规划的内容 是的,这一切都是由 opus 5.5 与 gemini 3.8 tts 生成的。我听起来像是在重复,但我真的震惊于这个模型是多么连贯和强大。 一切真正都是代码。
Chubby @kimmonismus
09-29 23:32 · 原帖
虽然仍然难以理解且非常不清楚,但最终证实了之前的猜测: 套餐价格减半。原价 200 美元的 Pro 套餐现在大致相当于 100 美元的 Pro 套餐,但整体价格调整情况尚不明确。 此外
小互 @xiaohu
09-29 23:32 · 原帖
确认了 OpenAI 削减了 订阅用量额度 Tibo学坏了… 以前的100美金变保持5X用量 200美金的削减一半从20X降为10X 之前的老账号暂时继续保留20X的用量,欢呼吧 https://t.co/Ni6xvGdJ1z 引用:I’ll explain the new Pro 200 plan differently, before I start live tweeting from DevDay on things that are going out! Today we are going to ship a number of things that increase what you can do across the Plus and Pro plans. A lot of compute is online for this increase. As we increase the floor, we are changing the relative difference between plans to be Plus = 1X Pro 100 = 5X Pro 200 = 10X and we are reopening subscriptions for Pro 200 (we had paused it). If you have an existing plan you will keep the 20X multiplier for a bit and also receive a lot of additional credits because we know changes are hard even if it means that everyone will get more in the end.
Deedy @deedydas
09-29 23:30 · 原帖
我花了十几个小时研究如何才能最大程度地发挥 Opus 5.5 在视频生成工作流程中的优势: - 使用 Claude Code,而不是直接使用其应用程序。 - 使用 OpenRouter API,通过一个密钥即可访问所有其他模型(图像生成、视频生成、音频生成)。 - 使用 Gemini 3.8 TTS,并使其生成 https://t.co/RRszTquczA
AYi @AYi_AInotes
09-29 23:28 · 原帖
https://t.co/D2iRoHgLJv 引用:卧槽兄弟们,Opus 5.5 简直就是掌管 AI 自动化做视频的神, 做这种高信息密度的知识科普视频,它真就手拿把掐,都不用复杂的提示词,直接几句话口喷你的需求就行, 我让它做了一条什么是稳定币、为什么稳定币能稳在 1 美元的科普视频, 出来的效果真的太炸裂了,动效、音效、画面节奏,1 分 38 秒全程拉满, 建议直接全屏戴耳机看视频,连平时不碰 Web3 的小白都能秒懂。 其实稳定币的底层逻辑,视频里用一个比喻就讲得极其通透: 你可以把它当成大超市的实体购物卡,或者商场的存包凭证。 你给发卡公司 1 美元现金,公司把它锁进银行保险柜,顺手在链上给你打一张写着 1 美元的数字小票。 只要公司承诺见票即付,你随时拿小票回去,它就老老实实退你 1 美元现金。 如果市场上有人着急用钱,0.99 美元便宜甩卖小票, 立刻就会有精明的搬砖党在市场上大量扫货,转头找公司按 1 美元全额赎回,净赚差价; 如果市场上抢着要,价格飙到 1.01 美元, 公司就会开动印钞机收美元发小票,压平溢价。 两头套利大军一夹,它的价格就永远死死钉在 1 美元附近。 搞懂了这个,你就明白为什么比特币不能当钱花,而稳定币可以: 比特币像拍卖行里的古董名画,价格全看下一个买家愿意掏多少,今天能买一辆车,明天可能只够买个轮子; 而稳定币是兑换券,它的价值不靠信仰,靠的是保险柜里的美元真金白银。 到了现在的 AI 时代,这套机制直接变成了数字世界的水电煤。 住在云端的 AI Agent,没有身份证,办不了银行卡,更不可能去柜台排队填跨国电汇单。 当它需要买算力、调用其他 Agent 的 API、或者跨国买一段代码时, 秒级到账、跨越国界、价格恒定的稳定币,就是 AI 经济天生的数字血液。 但以前用稳定币,对普通人来说简直像在排雷: 一长串乱码一样的钱包地址,选错主网钱就彻底蒸发,还得先买点以太坊当燃气费,每一步都在把人往外推。 现在像 OKX 这种头部平台,开始把这层复杂的底层技术彻底收进后台了: 他们做的 OKX Pay,直接跑在自家的 X Layer 网络上, 支持 USDT、USDC 和 USDG, 转账不用再背那一长串地址,扫个二维码、选联系人或者甩个收款链接就能转, 给其他 OKX 用户转账不额外收手续费,最后用生物识别通行密钥确认一下就完事,体验直接抹平到了像发微信红包一样顺手。 当然照例泼盆冷水,必须搞清楚背后的边界: 稳定币稳的是兑换承诺,但它绝不是受政府保险保障的银行存款, 你的资金安全,既取决于 Tether、Circle 这些发行方有没有老老实实把美元资产存够,也取决于你放钱的平台本身够不够稳健; 而且各地的监管政策不一样, OKX Pay 的具体功能也是按地区开放,以你自己 App 里能看到的为准。 从纸币到银行卡,从移动支付到现在的链上美元, 当 AI 遇上永远不跳价的数字美元,全球资金流动的最后一道闸门,算是彻底被打开了。 你们觉得 Opus 5.5 这种一键把复杂认知降维成动画的生产力,未来最先干掉的是传统科普博主还是动画外包团队呢?我觉得以后做严肃内容如果不会用 AI 可视化,真的很难在信息流里留住人了吧
Derya Unutmaz, MD @DeryaTR_
09-29 23:26 · 原帖
抵达了大事件!@OpenAI DevDay 即将开始。我会尽量多直播。很多人还在陆续抵达,看起来非常拥挤。今天旧金山的天气很美
AYi @AYi_AInotes
09-29 23:23 · 原帖
https://t.co/K5hXUlmnrG 引用:卧槽这个刚开源的 AI 包工头 Raven 0.2.0真的有点屌炸,从需求提出到交出、宣发海报、商业路演 PPT 与上线官网,曾经需要消耗一个数十人团队数月周期的生产成本,刚刚被开源代码压缩成了一个自然人和 4 天的算力。 兄弟们敢相信,一个可玩的 3D 游戏需求,它自己连干 4 天,宣发海报、商业路演 PPT 与上线官网全给你做出来, 它不跟 Claude Code Codex 抢活,直接把这些你已经付费的 AI 全收了当员工, 自带任务图和共享记忆,跑几天都不崩, 最狠的是它还会自己改自己的工作流程,能递归自我改进,相当于一个会自己变强的虚拟 AI 公司,真的太牛逼了, 我跟大家大白话拆解清楚, 1|它到底是啥? 先说 harness, 可以理解成 AI 的“工作手册 + 工具箱”: 怎么看资料、怎么拆任务、能用哪些工具、做完怎么自查。 Claude Code 有一套,Codex 也有一套, 问题是,没有哪套手册什么都擅长, 写代码的那套做不好调研,做调研的那套排不好版。 Raven 管自己叫 harness of harnesses, 翻成人话就是 它不是又一个干活的 AI, 是带一群 AI 的包工头。 2|它手下有谁? 自带 4 个工种: Research:深度调研,出带出处的报告 Code:把需求写成能跑、测过的代码 Design:做 PPT、图表、品牌物料和网页界面 Oncall:值夜班,跑实验、盯流程,需要人拍板时才叫你 还预置了 13 个第三方 Agent: Claude Code、Codex、Kimi Code、Qwen Code、GitHub Copilot…… 你已经付费的 Agent 不用换, 直接变成它的员工。 有它不会的技能, 它会去一个 11 万+ 的技能库里现找。 3|为什么能连干几天不崩? 普通 Agent 干长活,一般就两种死法: 上下文爆了,忘了前面干过啥; 中间错一步,后面全跟着错。 Raven 的解法: 先把大任务拆成任务图,谁先谁后、哪些能并行,排得清清楚楚; 所有子 Agent 共用一套长期记忆(EverOS),跨会话也记得你的偏好和之前踩过的坑; 游戏那个案例,就是 42 轮“规划→开发→验证”滚出来的。 就像一个真正的项目组: 有排期表,有共享文档,有测试。 4|最反直觉的:AI 自己改自己的 SOP 以前优化 Agent: 人看日志 → 人改提示词 → 人再跑一遍。 Raven 里有个 Curator, 把 Agent 拆成 4 个位置: →看什么(Memory) →怎么规划(Planning) →能用什么工具(Capability) →下一步做啥、动手前怎么判断(Action) 然后一轮一轮地改。 改的不只是提示词, 工具、技能,甚至判断逻辑的代码都能换。 有两道保险: 改动先验证,过了才装上,没过就打回去重做; 在 RSI 实验里,评分标准它自己改不了。 好比学生能自己改学习方法,但改不了考卷, 这就是它说的 RSI:递归自我改进。 5|仓库里的 3 个硬核案例(项目方自己公布) Godot 4 第一人称射击游戏:自主运行约 4 天,迭代 42 轮,游戏、海报、PPT、网站全包 nanochat 预训练:7 轮跑了 172 次训练,一次没崩;同样是单卡 20 分钟的预算,核心损失指标又降了 5.8% 溃坝流体模拟:越界误差降了 3 个数量级;有限元极限载荷搜索,8 轮二分就收敛了 这些成绩没有第三方复现, 但游戏、网站、PPT 都公开放在仓库里,你可以自己点进去看。 6|怎么上手 ① 安装:最骚的一步是把官方给的安装提示词丢给 Claude Code 或 Codex,让你的 AI 帮你装 AI 也可以只装 Git + Docker,用容器跑起来,浏览器打开 localhost:18793 ② 接入:把你手上的 Claude Code、Codex 挂进来 ③ 派活:别只说“帮我做个 XX”,要写清楚:目标 + 限制条件 + 验收标准 验收标准越硬,它越能自己迭代 ④ 盯进度:在网页界面里看任务进度、文件、产出、记忆和技能 ⑤ 定制:用一段话描述你想要的助手,Curator 会组一个“主理人 + 专家组”,下次一句话就能开工 7|谁最该试? 独立开发者:Research 调研竞品 → Code 写 MVP → Design 做落地页和路演 PPT,一条链跑完 科研党:把跑参数、调参、看曲线、写报告丢给 Oncall, 睡一觉起来看结果 团队负责人:把团队天天重复的流程做成专属助手,越用越顺 8|照例泼盆冷水 官方自己写了:pre-alpha,接口和配置随时会变 Curator 自我改进还是实验功能,跟着源码仓库走,不在安装包里 连跑几天就是一直在烧 token,先设好预算上限 给 Agent 执行命令的权限之前,先把它关进 Docker 或测试环境,别拿它直接碰线上正式环境。 看完这个项目,最大的感受是以前拼的是哪个模型更聪明,接下来拼的是:谁能把一群 AI 组织起来, 还让这个组织自己变强。 说白了,AI 再强,也只是一个员工, Raven 想做的,是一家会自我迭代的公司。 开源,Apache 2.0, 我亲爱的铁汁们最想先让它接手哪件事呢:调研、写代码,还是值夜班?
AYi @AYi_AInotes
09-29 23:23 · 原帖
https://t.co/K5hXUlmnrG 引用:卧槽这个刚开源的 AI 包工头 Raven 0.2.0真的有点屌炸,从需求提出到交出、宣发海报、商业路演 PPT 与上线官网,曾经需要消耗一个数十人团队数月周期的生产成本,刚刚被开源代码压缩成了一个自然人和 4 天的算力。 兄弟们敢相信,一个可玩的 3D 游戏需求,它自己连干 4 天,宣发海报、商业路演 PPT 与上线官网全给你做出来, 它不跟 Claude Code Codex 抢活,直接把这些你已经付费的 AI 全收了当员工, 自带任务图和共享记忆,跑几天都不崩, 最狠的是它还会自己改自己的工作流程,能递归自我改进,相当于一个会自己变强的虚拟 AI 公司,真的太牛逼了, 我跟大家大白话拆解清楚, 1|它到底是啥? 先说 harness, 可以理解成 AI 的“工作手册 + 工具箱”: 怎么看资料、怎么拆任务、能用哪些工具、做完怎么自查。 Claude Code 有一套,Codex 也有一套, 问题是,没有哪套手册什么都擅长, 写代码的那套做不好调研,做调研的那套排不好版。 Raven 管自己叫 harness of harnesses, 翻成人话就是 它不是又一个干活的 AI, 是带一群 AI 的包工头。 2|它手下有谁? 自带 4 个工种: Research:深度调研,出带出处的报告 Code:把需求写成能跑、测过的代码 Design:做 PPT、图表、品牌物料和网页界面 Oncall:值夜班,跑实验、盯流程,需要人拍板时才叫你 还预置了 13 个第三方 Agent: Claude Code、Codex、Kimi Code、Qwen Code、GitHub Copilot…… 你已经付费的 Agent 不用换, 直接变成它的员工。 有它不会的技能, 它会去一个 11 万+ 的技能库里现找。 3|为什么能连干几天不崩? 普通 Agent 干长活,一般就两种死法: 上下文爆了,忘了前面干过啥; 中间错一步,后面全跟着错。 Raven 的解法: 先把大任务拆成任务图,谁先谁后、哪些能并行,排得清清楚楚; 所有子 Agent 共用一套长期记忆(EverOS),跨会话也记得你的偏好和之前踩过的坑; 游戏那个案例,就是 42 轮“规划→开发→验证”滚出来的。 就像一个真正的项目组: 有排期表,有共享文档,有测试。 4|最反直觉的:AI 自己改自己的 SOP 以前优化 Agent: 人看日志 → 人改提示词 → 人再跑一遍。 Raven 里有个 Curator, 把 Agent 拆成 4 个位置: →看什么(Memory) →怎么规划(Planning) →能用什么工具(Capability) →下一步做啥、动手前怎么判断(Action) 然后一轮一轮地改。 改的不只是提示词, 工具、技能,甚至判断逻辑的代码都能换。 有两道保险: 改动先验证,过了才装上,没过就打回去重做; 在 RSI 实验里,评分标准它自己改不了。 好比学生能自己改学习方法,但改不了考卷, 这就是它说的 RSI:递归自我改进。 5|仓库里的 3 个硬核案例(项目方自己公布) Godot 4 第一人称射击游戏:自主运行约 4 天,迭代 42 轮,游戏、海报、PPT、网站全包 nanochat 预训练:7 轮跑了 172 次训练,一次没崩;同样是单卡 20 分钟的预算,核心损失指标又降了 5.8% 溃坝流体模拟:越界误差降了 3 个数量级;有限元极限载荷搜索,8 轮二分就收敛了 这些成绩没有第三方复现, 但游戏、网站、PPT 都公开放在仓库里,你可以自己点进去看。 6|怎么上手 ① 安装:最骚的一步是把官方给的安装提示词丢给 Claude Code 或 Codex,让你的 AI 帮你装 AI 也可以只装 Git + Docker,用容器跑起来,浏览器打开 localhost:18793 ② 接入:把你手上的 Claude Code、Codex 挂进来 ③ 派活:别只说“帮我做个 XX”,要写清楚:目标 + 限制条件 + 验收标准 验收标准越硬,它越能自己迭代 ④ 盯进度:在网页界面里看任务进度、文件、产出、记忆和技能 ⑤ 定制:用一段话描述你想要的助手,Curator 会组一个“主理人 + 专家组”,下次一句话就能开工 7|谁最该试? 独立开发者:Research 调研竞品 → Code 写 MVP → Design 做落地页和路演 PPT,一条链跑完 科研党:把跑参数、调参、看曲线、写报告丢给 Oncall, 睡一觉起来看结果 团队负责人:把团队天天重复的流程做成专属助手,越用越顺 8|照例泼盆冷水 官方自己写了:pre-alpha,接口和配置随时会变 Curator 自我改进还是实验功能,跟着源码仓库走,不在安装包里 连跑几天就是一直在烧 token,先设好预算上限 给 Agent 执行命令的权限之前,先把它关进 Docker 或测试环境,别拿它直接碰线上正式环境。 看完这个项目,最大的感受是以前拼的是哪个模型更聪明,接下来拼的是:谁能把一群 AI 组织起来, 还让这个组织自己变强。 说白了,AI 再强,也只是一个员工, Raven 想做的,是一家会自我迭代的公司。 开源,Apache 2.0, 我亲爱的铁汁们最想先让它接手哪件事呢:调研、写代码,还是值夜班?
AYi @AYi_AInotes
09-29 23:20 · 原帖
https://t.co/K5hXUllPC8 引用:卧槽这个刚开源的 AI 包工头 Raven 0.2.0真的有点屌炸,从需求提出到交出、宣发海报、商业路演 PPT 与上线官网,曾经需要消耗一个数十人团队数月周期的生产成本,刚刚被开源代码压缩成了一个自然人和 4 天的算力。 兄弟们敢相信,一个可玩的 3D 游戏需求,它自己连干 4 天,宣发海报、商业路演 PPT 与上线官网全给你做出来, 它不跟 Claude Code Codex 抢活,直接把这些你已经付费的 AI 全收了当员工, 自带任务图和共享记忆,跑几天都不崩, 最狠的是它还会自己改自己的工作流程,能递归自我改进,相当于一个会自己变强的虚拟 AI 公司,真的太牛逼了, 我跟大家大白话拆解清楚, 1|它到底是啥? 先说 harness, 可以理解成 AI 的“工作手册 + 工具箱”: 怎么看资料、怎么拆任务、能用哪些工具、做完怎么自查。 Claude Code 有一套,Codex 也有一套, 问题是,没有哪套手册什么都擅长, 写代码的那套做不好调研,做调研的那套排不好版。 Raven 管自己叫 harness of harnesses, 翻成人话就是 它不是又一个干活的 AI, 是带一群 AI 的包工头。 2|它手下有谁? 自带 4 个工种: Research:深度调研,出带出处的报告 Code:把需求写成能跑、测过的代码 Design:做 PPT、图表、品牌物料和网页界面 Oncall:值夜班,跑实验、盯流程,需要人拍板时才叫你 还预置了 13 个第三方 Agent: Claude Code、Codex、Kimi Code、Qwen Code、GitHub Copilot…… 你已经付费的 Agent 不用换, 直接变成它的员工。 有它不会的技能, 它会去一个 11 万+ 的技能库里现找。 3|为什么能连干几天不崩? 普通 Agent 干长活,一般就两种死法: 上下文爆了,忘了前面干过啥; 中间错一步,后面全跟着错。 Raven 的解法: 先把大任务拆成任务图,谁先谁后、哪些能并行,排得清清楚楚; 所有子 Agent 共用一套长期记忆(EverOS),跨会话也记得你的偏好和之前踩过的坑; 游戏那个案例,就是 42 轮“规划→开发→验证”滚出来的。 就像一个真正的项目组: 有排期表,有共享文档,有测试。 4|最反直觉的:AI 自己改自己的 SOP 以前优化 Agent: 人看日志 → 人改提示词 → 人再跑一遍。 Raven 里有个 Curator, 把 Agent 拆成 4 个位置: →看什么(Memory) →怎么规划(Planning) →能用什么工具(Capability) →下一步做啥、动手前怎么判断(Action) 然后一轮一轮地改。 改的不只是提示词, 工具、技能,甚至判断逻辑的代码都能换。 有两道保险: 改动先验证,过了才装上,没过就打回去重做; 在 RSI 实验里,评分标准它自己改不了。 好比学生能自己改学习方法,但改不了考卷, 这就是它说的 RSI:递归自我改进。 5|仓库里的 3 个硬核案例(项目方自己公布) Godot 4 第一人称射击游戏:自主运行约 4 天,迭代 42 轮,游戏、海报、PPT、网站全包 nanochat 预训练:7 轮跑了 172 次训练,一次没崩;同样是单卡 20 分钟的预算,核心损失指标又降了 5.8% 溃坝流体模拟:越界误差降了 3 个数量级;有限元极限载荷搜索,8 轮二分就收敛了 这些成绩没有第三方复现, 但游戏、网站、PPT 都公开放在仓库里,你可以自己点进去看。 6|怎么上手 ① 安装:最骚的一步是把官方给的安装提示词丢给 Claude Code 或 Codex,让你的 AI 帮你装 AI 也可以只装 Git + Docker,用容器跑起来,浏览器打开 localhost:18793 ② 接入:把你手上的 Claude Code、Codex 挂进来 ③ 派活:别只说“帮我做个 XX”,要写清楚:目标 + 限制条件 + 验收标准 验收标准越硬,它越能自己迭代 ④ 盯进度:在网页界面里看任务进度、文件、产出、记忆和技能 ⑤ 定制:用一段话描述你想要的助手,Curator 会组一个“主理人 + 专家组”,下次一句话就能开工 7|谁最该试? 独立开发者:Research 调研竞品 → Code 写 MVP → Design 做落地页和路演 PPT,一条链跑完 科研党:把跑参数、调参、看曲线、写报告丢给 Oncall, 睡一觉起来看结果 团队负责人:把团队天天重复的流程做成专属助手,越用越顺 8|照例泼盆冷水 官方自己写了:pre-alpha,接口和配置随时会变 Curator 自我改进还是实验功能,跟着源码仓库走,不在安装包里 连跑几天就是一直在烧 token,先设好预算上限 给 Agent 执行命令的权限之前,先把它关进 Docker 或测试环境,别拿它直接碰线上正式环境。 看完这个项目,最大的感受是以前拼的是哪个模型更聪明,接下来拼的是:谁能把一群 AI 组织起来, 还让这个组织自己变强。 说白了,AI 再强,也只是一个员工, Raven 想做的,是一家会自我迭代的公司。 开源,Apache 2.0, 我亲爱的铁汁们最想先让它接手哪件事呢:调研、写代码,还是值夜班?
AYi @AYi_AInotes
09-29 23:20 · 原帖
https://t.co/K5hXUlmnrG 引用:卧槽这个刚开源的 AI 包工头 Raven 0.2.0真的有点屌炸,从需求提出到交出、宣发海报、商业路演 PPT 与上线官网,曾经需要消耗一个数十人团队数月周期的生产成本,刚刚被开源代码压缩成了一个自然人和 4 天的算力。 兄弟们敢相信,一个可玩的 3D 游戏需求,它自己连干 4 天,宣发海报、商业路演 PPT 与上线官网全给你做出来, 它不跟 Claude Code Codex 抢活,直接把这些你已经付费的 AI 全收了当员工, 自带任务图和共享记忆,跑几天都不崩, 最狠的是它还会自己改自己的工作流程,能递归自我改进,相当于一个会自己变强的虚拟 AI 公司,真的太牛逼了, 我跟大家大白话拆解清楚, 1|它到底是啥? 先说 harness, 可以理解成 AI 的“工作手册 + 工具箱”: 怎么看资料、怎么拆任务、能用哪些工具、做完怎么自查。 Claude Code 有一套,Codex 也有一套, 问题是,没有哪套手册什么都擅长, 写代码的那套做不好调研,做调研的那套排不好版。 Raven 管自己叫 harness of harnesses, 翻成人话就是 它不是又一个干活的 AI, 是带一群 AI 的包工头。 2|它手下有谁? 自带 4 个工种: Research:深度调研,出带出处的报告 Code:把需求写成能跑、测过的代码 Design:做 PPT、图表、品牌物料和网页界面 Oncall:值夜班,跑实验、盯流程,需要人拍板时才叫你 还预置了 13 个第三方 Agent: Claude Code、Codex、Kimi Code、Qwen Code、GitHub Copilot…… 你已经付费的 Agent 不用换, 直接变成它的员工。 有它不会的技能, 它会去一个 11 万+ 的技能库里现找。 3|为什么能连干几天不崩? 普通 Agent 干长活,一般就两种死法: 上下文爆了,忘了前面干过啥; 中间错一步,后面全跟着错。 Raven 的解法: 先把大任务拆成任务图,谁先谁后、哪些能并行,排得清清楚楚; 所有子 Agent 共用一套长期记忆(EverOS),跨会话也记得你的偏好和之前踩过的坑; 游戏那个案例,就是 42 轮“规划→开发→验证”滚出来的。 就像一个真正的项目组: 有排期表,有共享文档,有测试。 4|最反直觉的:AI 自己改自己的 SOP 以前优化 Agent: 人看日志 → 人改提示词 → 人再跑一遍。 Raven 里有个 Curator, 把 Agent 拆成 4 个位置: →看什么(Memory) →怎么规划(Planning) →能用什么工具(Capability) →下一步做啥、动手前怎么判断(Action) 然后一轮一轮地改。 改的不只是提示词, 工具、技能,甚至判断逻辑的代码都能换。 有两道保险: 改动先验证,过了才装上,没过就打回去重做; 在 RSI 实验里,评分标准它自己改不了。 好比学生能自己改学习方法,但改不了考卷, 这就是它说的 RSI:递归自我改进。 5|仓库里的 3 个硬核案例(项目方自己公布) Godot 4 第一人称射击游戏:自主运行约 4 天,迭代 42 轮,游戏、海报、PPT、网站全包 nanochat 预训练:7 轮跑了 172 次训练,一次没崩;同样是单卡 20 分钟的预算,核心损失指标又降了 5.8% 溃坝流体模拟:越界误差降了 3 个数量级;有限元极限载荷搜索,8 轮二分就收敛了 这些成绩没有第三方复现, 但游戏、网站、PPT 都公开放在仓库里,你可以自己点进去看。 6|怎么上手 ① 安装:最骚的一步是把官方给的安装提示词丢给 Claude Code 或 Codex,让你的 AI 帮你装 AI 也可以只装 Git + Docker,用容器跑起来,浏览器打开 localhost:18793 ② 接入:把你手上的 Claude Code、Codex 挂进来 ③ 派活:别只说“帮我做个 XX”,要写清楚:目标 + 限制条件 + 验收标准 验收标准越硬,它越能自己迭代 ④ 盯进度:在网页界面里看任务进度、文件、产出、记忆和技能 ⑤ 定制:用一段话描述你想要的助手,Curator 会组一个“主理人 + 专家组”,下次一句话就能开工 7|谁最该试? 独立开发者:Research 调研竞品 → Code 写 MVP → Design 做落地页和路演 PPT,一条链跑完 科研党:把跑参数、调参、看曲线、写报告丢给 Oncall, 睡一觉起来看结果 团队负责人:把团队天天重复的流程做成专属助手,越用越顺 8|照例泼盆冷水 官方自己写了:pre-alpha,接口和配置随时会变 Curator 自我改进还是实验功能,跟着源码仓库走,不在安装包里 连跑几天就是一直在烧 token,先设好预算上限 给 Agent 执行命令的权限之前,先把它关进 Docker 或测试环境,别拿它直接碰线上正式环境。 看完这个项目,最大的感受是以前拼的是哪个模型更聪明,接下来拼的是:谁能把一群 AI 组织起来, 还让这个组织自己变强。 说白了,AI 再强,也只是一个员工, Raven 想做的,是一家会自我迭代的公司。 开源,Apache 2.0, 我亲爱的铁汁们最想先让它接手哪件事呢:调研、写代码,还是值夜班?