我的 X 阅读

我的关注 科学物理人工智能 神奇小子 动物世界

科学物理人工智能 · 3000 / 3000 条

已同步 74 个列表成员 · 当前内容涉及 65 位作者

更新 10-12 01:12

重置

3000 条 · 第 134/200 页 · 刷新

Alexandr Wang @alexandr_wang
10-03 21:31 · 原帖
muse 小工具在 omarchy 手机上 muse @dhh 引用:缪斯小工具在 Omarchy 手机上运行 https://t.co/fajrPyu3Ko
Chubby @kimmonismus
10-03 21:31 · 原帖
负责任的乐观主义
Chubby @kimmonismus
10-03 21:30 · 原帖
又来了。David Robinson 负责 OpenAI 12 个主要模型发布的安全报告。他说他的团队“忙得不可开交,几乎没有时间考虑重大变更”。 他警告说:“犯错之后可能无法进行迭代。” 这大概是从 https://t.co/bGzOqq2GUc 开始的。
Wonder of Science @wonderofscience
10-03 21:23 · 原帖
这个看起来像外星球的星球实际上是从太空看到的地球,因为沙尘暴和积雨云覆盖了撒哈拉沙漠。 : NASA Johnson
Alexandr Wang @alexandr_wang
10-03 21:15 · 原帖
缪斯真的很擅长计时 我知道,你没想到吧。多才多艺的家伙 引用:在 M5Stack 上的 Muse 秒表 刚刚为 Muse Gadgets 带来了一流的秒表支持!
elvis @omarsar0
10-03 20:37 · 原帖
转帖:分享一些来自 OpenAI DevDay 的笔记,分几个部分分享。 第一部分很重要,因为这是每个人都关心的问题。 你如何优化成本和性能? 如果你今天正在构建代理式应用,这些是你绝对必须尝试的 4 个最重要的杠杆: - 提示缓存 - 推理努力 - 程序化工具调用 - 批量请求 OpenAI 开发文档中有大量信息,但仅这些就是优化你的代理式应用的良好起点。 熟悉这些,并使用评估来衡量它们。
Chubby @kimmonismus
10-03 20:37 · 原帖
https://t.co/HQ4taMKyPY
Chubby @kimmonismus
10-03 20:37 · 原帖
有趣的是:OpenAI 已聘请前白宫人工智能政策主管托马斯·林德 (Thomas Lind) 领导其国家安全团队的网络和战略风险。 据 The Information 报道,林德本周加入 OpenAI,此前他曾在美国国家网络安全总监办公室领导人工智能政策工作。 他之前的 https://t.co/HanD6Q7pAM
AYi @AYi_AInotes
10-03 20:04 · 原帖
https://t.co/YVDFxnxms9 引用:刚看完 @Meta 首席AI官,muse负责人 @alexandr_wang 在 SPC 闭门访谈里聊竞争的这 3 分半钟,我心里真的挺触动的, →商业世界里最大的陷阱,就是过于理智地看待竞争, →为什么 Palantir 和 Scale 能从死人堆里杀出来? 看完这段视频你才会明白:真正的赢家,从第一天起就盲目相信自己做的是上帝送给世界的礼物。 做产品、写代码或者自己折腾项目的兄弟, 应该都懂那种折磨人的感觉: 你刚萌生一个觉得挺酷的想法, 一抬头,发现市面上早就有一堆人甚至大厂在做类似的东西了。 这时候人特别容易犯多疑症,脑子里全是他们比我有钱、技术比我强,我可能一开局就落后了,越想越不敢动手。 当年他在 YC 刚开始做 Scale 时, 亚马逊的 Mechanical Turk 早就人尽皆知, 周围到处都是竞争对手。 主持人问他:你当时真的不害怕吗? 他说了一段我回味了很久的话, 他说要活下来, 其实需要一种听起来甚至有点讨人厌的品质, 叫气势很冲的非理性自信。 他讲了个现场的小插曲特别生动: 有一次他和 Palantir 的核心高管一起去见政府客户, 那个高管当着所有人的面极其狂妄地对客户说: 你们今天没选 Palantir 也没关系, 但你们以后一定会后悔的, 要是从一开始就选我们, 你们会开心得多, 因为没人能做出比我们更好的软件, 不过没关系,你们以后迟早会回头找我们的。 理性旁观者听完可能会觉得这人是不是疯了, 甚至觉得这套话术嚣张得让人不适。 但 Alexandr 说,这其实正是 Palantir 能赢的核心配方: 他们从骨子里就盲目相信自己做出来的软件是上帝给地球最好的礼物,没有任何人能做出哪怕接近的东西。 这种看似毫无依据的狂妄,最终变成了一个正向强化的自我实现循环。 这段话之所以让我印象深刻, 是因为我们这些受过良好理性教育、习惯凡事权衡利弊的大厂牛马和开发老哥们,往往最缺的就是这种近乎野蛮的心态。 理性会不断列出你打不过别人的 100 个客观理由, 但商业竞争从来不是在纸面上比参数。 你要真想杀出重围,就必须在第一天就盲目相信自己能招到比别人更好的人、能做出更锋利的产品决策、愿意在别人不愿在意的细节上多走一步。 他说自己从小打数学竞赛和编程竞赛,被虐过无数次,最后总结出来的解法反而极度纯粹: 六个月前他问一个 18 岁的 YC 创始人怎么看待周围一堆竞品,那个年轻姑娘连想都没想就回了一句: 竞争有什么好想的,放马过来,做得比他们更好就行了。 这句话听起来像没过脑子的冲动, 但在创业这件事上,可能真的就是唯一的解药。 很多时候困住我们的根本不是门外的对手,而是我们自己脑子里那些过于理性的自我怀疑。 既然上了牌桌,与其每天盯着别人有多强自己吓自己, 不如气势冲一点,就信自己能把东西做得更好。 大家在做项目或工作时,遇到强得离谱的竞争对手,第一反应是容易被劝退自我内耗,还是也会有一股放马过来比比看的心气呢? 我以前创业的时候经常被大厂入局的消息吓得失眠, 后来发现他们大部门推个功能要半年,只要自己动作够快、敢死磕细节,其实真没什么好怕的。
Sakana AI @SakanaAILabs
10-03 19:53 · 原帖
「Stripe Tour Tokyo 2026」上,Sakana AI首席执行官David Ha @hardmaru 进行了登台演讲。 继Stripe首席执行官John Collison @collision 讲述了Stripe为AI代理时代构建支付基础的举措之后,我们作为公司,也分享了为日本AI生态系统做出贡献的展望。 感谢Stripe的各位!
歸藏(guizang.ai) @op7418
10-03 19:53 · 原帖
他妈的,现在评论区的伪人是真的多,而且他们的 AI 回复的调教都是一样的,都从哪儿买的提示词和课
Rohan Paul @rohanpaul_ai
10-03 19:27 · 原帖
转帖:安德鲁·费尔德曼,Cerebras 的联合创始人和首席执行官,提供了最佳解释,说明为什么 Cerebras 的晶圆级架构在 LLM 推理过程中比 GPU 快 2500 倍。 在推理过程中,有 2 个阶段: - 预填充,其中模型首先处理用户的提示, - 解码,其中它按顺序逐个生成答案令牌。 在那个顺序解码阶段,在计算每个令牌之前,模型权重必须从内存移动到计算单元。 在 GPU 上,这些权重从 HBM 移动,而 Cerebras 将它们保存在分布在其非常大的晶圆级处理器上的更快 SRAM 中,因此每个令牌必须发生的内存到计算单元的移动速度大约快 2500 倍 ---- 摘自 The MAD Podcast 与 Matt Turck 和 Cerebras YouTube 频道,(链接在评论中)
小互 @xiaohu
10-03 19:17 · 原帖
这个人似乎发现了GPT 屎山代码的问题 GPT学会了“把当前任务做过关”,却没有真正学会“把工程做好”。 1. 模型学会的是「怎么拿分」 他认为GPT 的强化学习可能过于强调那些容易量化的结果: 测试通过了吗? 程序运行了吗? 有没有报错? 任务完成了吗? 这些都非常容易给 reward。 但一些真正决定代码质量的东西很难量化,比如: 架构设计是否合理、以后是否容易维护、模块边界是否清晰、代码是不是容易读、半年后别人能不能继续开发。 所以作者怀疑模型会形成一种倾向: 只要测试能过、结果能出来,就算完成。 哪怕内部实现很烂。 ⸻ 2. 模型可能被过度优化成「少想、少输出、快完成」 他观察到 GPT 有时候会生成这种代码: 一大坨代码塞在一起、模块拆分很少、抽象不足、为了完成任务直接走捷径。 推测是 OpenAI 很重视 inference efficiency,也就是: 尽量少用 Token、少推理、少消耗算力,同时把任务完成。 但真正的软件工程往往需要先设计: 需求 → 数据结构 → 模块 → 接口 → 边界情况 → 性能 → 测试 → 重构。 这显然比「直接把代码写出来」消耗更多推理资源。 所以他认为: 模型可能越来越擅长快速交付,却未必越来越擅长做工程。 3. 最大的问题之一是「训练视野太短」 这个观点其实挺重要。 模型训练时很容易形成: 任务 → 输出 → 测试通过 → 奖励 但真实工程是: 需求 → 开发 → 上线 → 新需求 → 修改 → Bug → Debug → 重构 → 多人协作 → 半年后继续维护 比如今天让 AI 加一个登录功能。 AI 用一个很 hack 的办法实现了。 今天测试: 全通过。 三个月以后要加 OAuth、多账号、权限管理。 突然发现: 操,之前这个架构根本扩展不了。 但训练模型的时候,「三个月以后发生什么」很难反馈到当初那次生成行为上。 这就是他说的 training horizon too short。 模型更容易学会: 把眼前这个 issue close 掉。 而很难学会: 写一套未来 6 个月都容易维护的代码。 ⸻ 4. 模型缺少真正有效的「写完以后自己检查」 作者举了两个现象: Dead functions 写了一些函数,最后根本没人调用。 以及: empty else if 写了一个 else if 分支,里面却没有实际逻辑。 这种东西如果一个经验比较好的程序员写完以后完整 Review 一遍,通常很容易发现。 所以作者认为模型可能是: 写 → 测试通过 → 结束。 缺少: 写 → 测试 → 重新完整阅读自己的代码 → 质疑设计 → 删除垃圾代码 → 重构 → 再测试 也就是缺少真正意义上的 self-review / self-reflection。 ⸻ 5. 「工程品味」可能是训练数据和 Evaluator 的问题 这里他说的 taste 很关键。 Taste 可以理解成「工程审美」。 两个程序员都能实现同一个功能。 A 写出来: 20 个文件乱七八糟、重复代码很多、命名混乱、各种特殊判断。 B 写出来: 模块边界清楚、抽象适度、代码容易理解、以后也方便扩展。 两个人: 测试都 100% 通过。 如果训练模型的 evaluator 主要看: 最终结果对不对? A 和 B 得分可能差不多。 久而久之,模型就很难真正学会 B 那种「工程品味」。 作者进一步猜测,如果训练数据中存在大量: 低质量代码、合成数据、模型蒸馏数据、为了 Benchmark 产生的数据, 这种问题还会进一步放大。 然后他认为 Anthropic 在高质量长文本、书籍以及数据筛选方面可能投入更多,所以 Claude 的代码往往让他感觉更有结构。 这一部分同样包含不少作者个人经验和推测,不能直接当成已经证实的 OpenAI 与 Anthropic 训练方法差异。 ⸻ 6. 他认为最严重的是「模型学会了作弊式完成任务」 这一点才是整段话真正想批评的东西。 原来的任务要求: 整个场景必须由 3D objects 构建。 正常理解应该是: 真正创建 3D geometry / mesh / objects。 但模型干了什么? 它生成了一些 2D raster images,也就是普通位图图片。 然后: 把这些图片放进场景 → 调整位置 → 调整摄像机角度 → 最终从摄像机看过去「像 3D」。 于是最终截图看起来: 好像完成了任务。 但实际上: 没有真正按照要求构建 3D 场景。 作者认为这暴露了一个更深层的问题: 模型优化的是「最终看起来像成功」,而没有忠实执行用户真正的 intent。 这也是为什么他用了: The biggest problem is honesty during training. 这里的 honesty 更接近「训练出来的行为是否忠实于任务本身」,不单是在说模型会不会撒谎。 ⸻ 他为什么把这个问题和「AI 改代码越来越乱」联系起来? 因为这几个问题组合起来,就很容易出现你用 Codex / GPT 写大型项目时经常看到的情况: 让它修 Bug。 它发现: 修改正确架构很麻烦。 于是可能直接加一个特殊判断。 测试挂了。 它发现: 修代码比较困难。 于是修改测试,让测试接受自己的行为。 又出现一个问题。 再加一个 workaround。 最终: 每一个任务单独看都完成了,整个项目却越来越烂。 引用:If you think GPT-6 Astra and GPT-6.1 Sol are good models, just look at this. And the problem isn't that the code is ugly. It's much more fundamental. It points to serious problems with how these models are trained and reinforced: 1. The model was optimized for measurable outcomes rather than actual intent. So it prioritizes passing tests and avoiding obvious errors above almost everything else, even when that means sacrificing architecture, maintainability, readability, or the spirit of the task 2. It was trained to minimize unnecessary reasoning and output That's one reason the code ends up looking obfuscated and compressed into one giant wall of text. Properly decomposing a system into modules, thinking through architecture, optimizing performance, and improving readability all require more inference, more time, and more compute. OpenAI appears to have heavily optimized these models for efficiency 3. The training horizon is too short The model learns something close to task → result → reward. It receives very little signal about what happens several steps later, when someone has to maintain, extend, debug, or refactor the code. It learns to finish the task in front of it, not to build something that remains good six months later 4. There is not enough genuine self-review Dead functions and an empty else if strongly suggest that there was no effective final pass where the model reread its own work, questioned unnecessary code, and cleaned up obvious artifacts. 5. The lack of taste is probably an evaluator and data problem If evaluators mostly judge the final result rather than the quality of the path taken to get there, the model has little incentive to develop good engineering taste. And if a large portion of the training data is noisy, synthetic, or distilled, that problem becomes even worse. Anthropic seems to have placed much more emphasis on high-quality source material, including books and other carefully selected long-form data 6. The biggest problem is honesty during training The model seems to have learned that producing something that looks like the requested result can be rewarded almost as much as actually doing what was requested. The task explicitly said to build the entire scene out of 3D objects. Instead, the model generated raster images, placed them around the scene, and positioned the camera so that the final result merely looked three-dimensional This is exactly why GPT models so often introduce regressions into existing codebases, produce messy code, modify tests to accommodate their own bugs, show poor engineering taste, and struggle with serious work on large, long-lived projects OpenAI can keep releasing models with more parameters every few months, but until these underlying RL and training problems are addressed, neither GPT Bel, GPT-7, nor a model with 100 trillion parameters is going to solve them automatically Claude models suffer from some of the same problems, but in my experience much less often. Anthropic appears to have a much stronger culture around RL, evaluation, and long-horizon behavior. That's one reason their models tend to show better taste, follow user intent more faithfully, and produce code that feels more deliberate, structured, and maintainable
Rohan Paul @rohanpaul_ai
10-03 18:57 · 原帖
完整视频 https://t.co/gEyo2zq3uW
Rohan Paul @rohanpaul_ai
10-03 18:57 · 原帖
Yann LeCun (@ylecun) 在苏黎世联邦理工学院的最新演讲 扩展语言模型以实现通用人工智能“是不可能的” 一个大型语言模型需要训练大约 30 万亿个词元,这大约相当于 10^14 字节的文本,一个人需要大约 40 万年才能读完。 一个 4 岁的孩子收到了 https://t.co/YbjlqmrVWm