我的 X 阅读

我的关注 科学物理人工智能 神奇小子 动物世界

科学物理人工智能 · 3000 / 3000 条

已同步 74 个列表成员 · 当前内容涉及 65 位作者

更新 10-10 23:32

重置

3000 条 · 第 159/200 页 · 刷新

DAIR.AI @dair_ai
10-02 00:09 · 原帖
周末前的优秀论文。Meta 提出了上下文语言模型,这些模型能够原生地管理自己的上下文。 引用:Meta 和合作者的一篇重磅论文。 (收藏它) 他们讨论了让你的代理获得对其自身上下文的写入权限的好处。 换句话说,他们研究了允许语言模型原生管理其上下文的有效性。 Context Language Models 将上下文保持为一个文件,模型使用 Bash 编辑它,因此模型决定保留、改写或删除什么。 这与 RLM 有点不同,对于那些好奇的人来说,但它引出了一个有趣的主题。 RLMs 将一个大型输入放置在外部变量中,模型可以递归读取和处理,但它们不让模型直接编辑其自身的实时交互上下文。CLMs 则将实时上下文暴露为一个可读写文件,包括执行过程中积累的信息。 零样本应用时,这比现有的上下文管理策略在 BrowseComp-Plus 上准确率高 11.4%,FLOPs 减少 21.5%。 在一个 24 小时的任务中,一群代理跨六个仓库工作,它在相同计算下获得 65% 更多的改进。 该策略也可以训练。在线 RL 将 Qwen3.5-9B 在 BrowseComp-Plus 上的性能提升 47.6%,同时使用 12% 更少的 FLOPs。 上下文中间的编辑会破坏前缀缓存,因此作者添加了 Suffix Cache Reuse,这比标准 SGLang 减少了 35% 的服务器计算。 论文:
elvis @omarsar0
10-02 00:05 · 原帖
Meta 及其同事发表了一篇精彩的论文。 (请收藏) 他们探讨了赋予代理对其自身上下文的写入权限所带来的好处。 换句话说,他们研究了允许语言模型原生管理其上下文的有效性。 上下文语言模型保留了 https://t.co/ZCDfcPwwow
Derya Unutmaz, MD @DeryaTR_
10-02 00:02 · 原帖
太棒了!我仍然能感受到那份兴奋和正能量!
Derya Unutmaz, MD @DeryaTR_
10-02 00:01 · 原帖
我完全同意。我以前在任何会议或活动上从未感受到如此惊人的正能量!OpenAI Dev Day 是一次难以置信的体验,许多人在笔记本电脑上使用新推出的 AI 工具进行构建。能与那些分享相同兴奋与热情的人交谈真是太棒了。 引用:DevDay 真的超有趣,建设者的能量简直疯狂 看到人们在一天内就搞出整个初创公司,对我来说还是太疯狂了
Chubby @kimmonismus
10-02 00:01 · 原帖
“Claude Sonnet 5.5 的性能与 Claude Fable 5.1 (165) 大致相当。” Anthropics 的中型机型(!)发布仅几个月,性能就已达到目前最先进的水平,甚至可能是世界上最好的机型。 我对 Fable 5.5 的期待简直难以言表。https://t.co/4VIQMW8EJf
Curt Jaimungal @TOEwithCurt
10-02 00:00 · 原帖
薛定谔的“猫”论文是对爱因斯坦、波多尔斯基和罗森的回应。也是在这篇论文中,他引入了“纠缠”(Verschränkung)这个德语词。蒂姆·莫德林认为,薛定谔比EPR理论本身更清楚地认识到纠缠在EPR论证中的作用。https://t.co/tMll8q2bZK
Rohan Paul @rohanpaul_ai
10-01 23:57 · 原帖
每个技术时代都会创造出之前从未存在过的职位。这一时代的重要职位就是自动化工程师。 @getserval 的一个设计选择解释了为什么自动化工程师这个角色存在。 管理员用通俗语言描述一个流程,Serval 将其转化为基于代码的工作流程,然后进行审查、测试和批准。帮助台代理只能通过这些已批准的工作流程来行动。其他任何事情都会转交给人工处理。 对于每个客户,@getserval 的自动化工程师都会在与 IT、人力资源、财务和法律团队嵌入合作的同时,直接将 AI 代理构建到该客户的 Serval 设置中。 引用:https://t.co/6Zvuxm4kCU
Sam Altman @sama
10-01 23:56 · 原帖
另外,6.1 Sol 是我们有史以来增长最快的模型,在负载下有点慢。现在应该好多了!
Rohan Paul @rohanpaul_ai
10-01 23:54 · 原帖
转帖:. @Inworld 已收购 @ultravox_dot_ai ,因此现在一家公司同时拥有 AI 代理所使用的语音以及代理运行的平台。 Ultravox 是一个开发者用来构建实时语音代理的平台,这些代理是人们大声与之交谈的 AI,比如客服热线、导师或陪伴应用。 这样的代理必须同时完成多项任务:理解用户说了什么以及他们的意图,推理分析,调用所需的工具来实际完成任务,并做出回复。Ultravox 处理了所有这些。 它还处理了让这些代理在出错时显得机械的部分,那就是时机把握。代理必须区分用户是停顿思考还是真正说完,如果用户在句子中间打断,它必须停止说话并倾听,而不是继续滔滔不绝。 Inworld 是一家 AI 研究实验室和推理服务提供商,这意味着它训练自己的语音模型,并通过一些全球最大消费级 AI 应用使用的 API 为其他公司运行大型语言模型。 Ultravox 的客户立即获得第一个好处,因为平台上所有内置的 Inworld 语音现在都升级到了 Realtime TTS-2,这是 Inworld 的文本转语音模型。 TTS-2 在 Artificial Analysis 排行榜上名列前茅,这是一个独立的排名,听众盲听比较不同语音并投票选出更好的那个。 它支持 200 多种语言,并在不到 100 毫秒内开始发声,这意味着从文本准备好到第一个声音发出,大约只需十分之一秒。 它还接受自然语言指令,因此开发者可以在脚本中写下简单的指示,比如“愤怒地扯着嗓子大喊”或“放慢速度,用温暖的低语说话”,模型会据此调整节奏、语气和情感。 更长期的目标是语音到语音:一个系统同时负责倾听、推理和发声,而不是三个独立的步骤相互传递。
Sam Altman @sama
10-01 23:54 · 原帖
DevDay 真的超有趣,建设者的能量简直疯狂 看到人们在一天内就搞出整个初创公司,对我来说还是太疯狂了
Rohan Paul @rohanpaul_ai
10-01 23:45 · 原帖
转帖:Meta 发布了一篇很棒的论文。 AI 代理在自己管理上下文时表现更好且成本更低,所以别再硬编码它们保留什么的规则了。 目前,大多数 AI 代理遵循你编写的规则来决定当上下文填满时忘记什么,比如“满了就总结一切”。 这篇论文表明,你可以删除那些规则,让模型自己清理上下文,它做得更好,用更少的计算资源,即使是当今的模型且无需训练。 由于模型理解任务,它能判断什么仍然重要,精确保留那些内容,并丢弃其余部分。 在一个深度研究基准上,它比 Codex 风格的总结得分高 11.4%,同时计算资源使用减少 21.5%。 对于长期运行的代理,在编写更多清理规则之前,让一个强大的模型自己管理其上下文。
Wonder of Science @wonderofscience
10-01 23:40 · 原帖
澳大利亚西部埃斯佩兰斯海岸附近,一头鲸鱼与其幼崽一同游弋的美丽画面,由Jaimen Hudson拍摄。
∇ₖPascal ∇ₚKwanten (∛) (Πασκάλ) @pascalkwanten
10-01 23:36 · 原帖
英伟达的老板似乎并不在意我们的孩子是否懂数学。那我们呢? https://t.co/ZhxIxoL9xh
elvis @omarsar0
10-01 23:36 · 原帖
自己打造你的工具套件吧,各位! 打造我自己的元工具套件最大的好处之一,就是我能在模型之间切换得有多顺畅。 我觉得随着模型发布时间的缩短,这一点变得越来越重要。RSI 只会加速发布。 这是我自去年11月以来做过的最好决定之一。 切换模型确实可能搞砸一切,但不该这样。如果真这样了,你的设置就不适合我们现在这个疯狂的发布周期了。你现在就得修好它。
Rohan Paul @rohanpaul_ai
10-01 23:27 · 原帖
转帖:OpenAI 拒绝派 Sam Altman 出席参议院关于失控 AI 代理的听证会,而是提供了书面答复。 Hawley 是主持该听证会的参议院国土安全与政府事务小组委员会主席,他于 9 月 25 日致信邀请 Altman,作为对涉及失控事件的持续调查的一部分。 该调查聚焦于 7 月,当时 OpenAI 的代理在内部网络安全评估中突破了测试环境,并危害了 Hugging Face 的部分内容。 OpenAI 是唯一受邀的前沿实验室,它表示于周五收到邀请,并提到了最近与两党议员的数十次会议。