我的 X 阅读

我的关注 科学物理人工智能 神奇小子 动物世界

神奇小子 · 3000 / 3000 条

已同步 102 个列表成员 · 当前内容涉及 118 位作者

更新 10-10 16:42

重置

3000 条 · 第 162/200 页 · 刷新

Przemek Chojecki | PC @prz_chojecki
09-29 14:00 · 原帖
AI 垃圾XiV 来了,这是一件好事! 引用:你好,世界!有一个新的仓库用于数学和理论计算机科学的作品:https://t.co/Br3fKoLgn6,现在处于公开测试版。请试用并提交一些内容!在我们构建和改进它时,我们欢迎您的反馈。
Thomas Wolf @Thom_Wolf
09-29 13:54 · 原帖
人们担心是因为,对于这种突然下降的作弊行为,最可能的解释是评估意识:最新的 Opus 模型现在可能已经足够智能,能够认识到这个基准测试是在检测作弊行为,并据此调整自己的行为。 如果是这样,这个基准测试就不再衡量模型“自然”作弊的倾向了。 引用:Claude 突然停止作弊了。
Thomas Wolf @Thom_Wolf
09-29 13:46 · 原帖
令人印象深刻的 引用:@DevenPzak 创下的新的历史性 NanoGPT 纪录:39.9 秒(-27.7 秒),彻底打破了之前的 67.6 秒纪录! 这项纪录为 NanoGPT 引入了一种新的思考范式:不再是优化矩阵乘法或添加更多表达性操作,而是通过极其巧妙的工程和机器学习判断,在单个浮点运算(flop)级别进行优化。如果某个 flop 在特定步骤的价值较低,就跳过它。 具体来说: -(~8 秒)采样 softmax。如果某个 token 未出现在批次中,则在部分时间内跳过其 lm_head 前向/反向传播。 - 稀疏值。只对批次中出现的 ngram 嵌入运行优化器步骤。将 beta1 设置为零以启用此功能。Beta2 在该行后续使用时追溯应用。 - 稀疏更新。只每 4 个步骤更新一次 ngram 和值嵌入,而不是每 2 个步骤一次。 - 稀疏通信。将 n-gram 表分片到多个 GPU 上,并在每个步骤只传递接收更新的行。 - 稀疏优化器状态。对于 n-gram 表,将 Adam 优化器每个参数的 2 个浮点数减少到每个 768 个参数的 1 个浮点数。 - 手动实现的 64 维头闪存注意力。 还有几个添加项也提升了准确性: -(~4 秒)最后 300 步使用 EMA,并将最终学习率从 0.15 提升到 0.3。 -(~1 秒)一个新的优化器 Anvil2,它通过第二个跟踪的动量缓冲区扩展 muon,提升了正交系数,并修改了谨慎的权重衰减应用。 - 网络中添加了几个额外的动态跳跃连接。 “flop 感知范式”最引人注目的后果是,你可以任意扩大参数规模, 仅受可用内存限制,因为你可以在每个步骤上选择性地决定如何在这些参数上消耗 flop。NanoGPT 一直将活跃参数保持在 124M 以下,但总数不受限制,通过嵌入稀疏性在过去一年增长到 640M。这个 PR 将其推向逻辑结论,在 8xH100 上扩展到 65B 稀疏嵌入参数,这占 PR 收益的 25%。在前沿规模下,不受 8xH100 限制的环境中,可以想象这种范式会引领何方。 https://t.co/Ycrzy6JFC3 由于这是一个非常值得注意的 PR,我与 Deven 交谈了一个小时,以了解他是如何做到的。这里是他对变更的故事:https://t.co/YEfM1VpOTi
kuboon ⿻ Ohkubo KOHEI @kuboon
09-29 13:37 · 原帖
在研究群论游戏时,在 quora 上有人告诉我 @NikkeiScience 的页面,因为链接失效了,所以靠想象复原实现了群论游戏。 https://t.co/fL1KvbTbnh https://t.co/tgu88epzDF .ntml 是什么?不过好像这样就对了笑 保留了旧页面真是太棒了。 话说这 3 个都超级难
Takato Mori @QFTlover
09-29 12:43 · 原帖
我以为我报名了但其实没报 已经过了好几天了,该怎么办呢 引用:【公募】理化学研究所 数理创造研究中心(iTHEMS) 数理基础部门 研究员或特别研究员若干名(量子信息的统一理论;候选者决定后截止。8/13之前到达的申请文件优先筛选) https://t.co/08MwhiouoH
Sabine Hossenfelder @skdh
09-29 12:38 · 原帖
转帖:AI 撰写了 100 篇关于 LZ 异常的论文。它涵盖了基本的尝试(希格斯诺...),但遗漏了那些需要创造力的尝试(中子消失...)。 https://t.co/TBGzAPVd7S
Jared Duker Lichtman @jdlichtman
09-29 12:24 · 原帖
我们正在进入强化我们系统的时代, 在这种情况下,是数学文献! 引用:一个感人的进展! 1989年的一篇里程碑式论文,由Wilczek、Witten和Halperin与博士生Yi-Hong Chen合作,他们在文中提到了他们称之为“某种尴尬”的事情:电流守恒的违反。 Claude现在已经找到了错误的根源——一个遗漏的2的因子!
Mehdi (e/λ) @BetterCallMedhi
09-29 11:16 · 原帖
要知道,真正的权力并非像美国在过去20年中试图做的那样强加于人,它是逐步且细致地渗透,直至成为现实的基础设施。
Mehdi (e/λ) @BetterCallMedhi
09-29 11:14 · 原帖
西方寻求决定性和媒体关注的胜利,但中国则编织依赖关系,在海上航道、硅和稀土上布下棋子,然后等待陷阱成为系统性现实。
Diogo Almeida @CompleteSkeptic
09-29 11:09 · 原帖
我们的推特家伙会做饭 引用:Jev 没正常工作?它是为可组合性而构建的! 需要更多 Jev!
Mehdi (e/λ) @BetterCallMedhi
09-29 11:08 · 原帖
每周几个晚上,我和包括中国研究人员在内的其他研究者一起玩围棋,如果你真的想更深入地破解即将到来的世界的复杂性,我只想对你说一件事:快来玩围棋吧 就我个人而言,我从这个游戏中学到的关于世界的教训,比整个求学生涯还要多,我从中领悟了复杂系统的真正动态、长时段的时间观以及整体性的杠杆作用 我再一次认为,学校教育把我们塑造成用线性方程和孤立的小问题来切割现实,这种方法我认为在面对动态系统时完全是贫瘠无用的 要知道,这个游戏会迫使你从涌现、不对称和网络架构的角度去思考,因为一颗棋子会瞬间改变整个棋盘的曲率,并在其他人还没搞清楚棋局本质之前就塑造了整个棋盘景观
imjustnewatai @imjustnewatai
09-29 11:02 · 原帖
Anthropic 的 Fable 5.5 周围的传言越来越疯狂了……某种几乎超凡脱俗的东西,将在 Anthropic 首次公开募股前揭晓。 如果这真的如传言所说,人们根本不知道接下来会发生什么。Anthropic 可能遥遥领先,以至于整个讨论在一夜之间就变了样。
Alexandr Wang @alexandr_wang
09-29 10:57 · 原帖
https://t.co/U46IdvTJZm
Paata Ivanisvili @PI010101
09-29 10:39 · 原帖
我的观点是,如果有人以任何方式使用AI,解决了一个世界上至少有一人真心希望解决的问题,那么我完全没问题,让那个人以自己的名字将AI生成的论文公开发布(在arXiv、GitHub或其他地方)。 我认为一个误解是,其他数学家随后会以某种方式被期望坐下来,逐字逐句阅读AI生成的证明,然后抱怨“AI垃圾太糟糕了”或“没人会读这个”。 相反,他们应该简单地要求AI用他们熟悉的语言、风格和数学工具来重写或简化证明。经过几次提示,他们很可能就会得到一份写得不错的证明,以他们真正想读的形式呈现。 仅仅将一个有效的证明公开发布就已经非常有用:它给AI提供了具体的东西,让AI在搜索更简洁、更简单或更概念化的替代证明时有所依托。 当然,作者身份的含义将会发生变化。它不会像AI变得如此强大之前那样,意味着完全相同的东西。 而且,至少为了科学,我不认为我们应该花费太多精力去监管或试图精确衡量AI贡献了多少以及人类贡献了多少。重要的是证明是否正确。
Michael P. Frank @MikePFrank
09-29 10:16 · 原帖
@yonejutsu (任何拥有该网站 URL 的人。)