我的 X 阅读

我的关注 科学物理人工智能 神奇小子 动物世界

科学物理人工智能 · 3000 / 3000 条

已同步 74 个列表成员 · 当前内容涉及 65 位作者

更新 10-11 21:07

重置

3000 条 · 第 138/200 页 · 刷新

BURKOV @burkov
10-03 11:02 · 原帖
那我称之为银行门
歸藏(guizang.ai) @op7418
10-03 11:01 · 原帖
哈哈 这个 Claude Mod 好玩,在等待任务的时候启动一个游戏,里面匹配的全是等待 Claude 完成任务的人 引用:Claude Code just shipped mods... I made one that connects you to a multiplayer MW2 Quick scoping lobby Every other player in the match is a person waiting for their Claude to finish. https://t.co/PwPkPd38rg
Alexandr Wang @alexandr_wang
10-03 10:56 · 原帖
给你的缪斯弄个小电子墨水显示屏,让它住进去吧! 引用:走起,那太简单了!
Rohan Paul @rohanpaul_ai
10-03 10:49 · 原帖
转帖:腾讯新论文提出让 AI 自动改进代理指令的方法,如果它能记住过去的修复并避免大规模、高风险的重写,将效果更好且成本远低。 代理技能是指令文件,用于教代理如何完成一项工作。自动重写这些文件的工具常常陷入循环,新编辑会撤销已经有效的修复,从而消耗令牌。 SkillAdam 教会重写 AI 两个习惯。它保留修复记录,并在结果不佳时进行较小的更改。 在长时间的购物和旅行规划任务中,它的平均准确率达到 28.3%,而之前最佳方法 SkillOpt 仅为 21.7%。它使用的令牌数量也仅为三分之一左右。 如果你要自动调整代理的指令,请让这个过程记住过去的修复,并对大幅编辑设置刹车。 – arxiv.org/abs/2609.08944 标题:“SkillAdam:代理的稳定高效技能演化”
Rohan Paul @rohanpaul_ai
10-03 10:41 · 原帖
转帖:新 Nvidia 论文:随着任务变长,AI 模型会变得越来越粗心,即使在它们的上下文窗口内也是如此,因此要为每个项目编号,并将大任务拆分成小块。 模型规模并不能保证在长而重复的任务上的可靠性 想象一个代理逐行更新一个巨大的发票文件。它可以读取整个文件,但仍然会跳过一行或更新错误的记录。 NVIDIA 在简单、重复的任务上测试了 7 个开源模型,比如加数字和排序列表。在 128K 令牌任务上的平均准确率比 4K 令牌任务低 62.8%。 即使是最好的模型,在最长任务中也只有 17.1% 的情况下能完全正确处理每个项目。模型似乎理解了任务,但会迷失位置,尤其是当项目没有 ID 编号时。 如果你的代理需要处理长列表,请为每个项目分配一个 ID,按小批量处理它们,并检查输出的每一行。 – arxiv.org/abs/2609.38712 标题:“Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability”
BURKOV @burkov
10-03 10:34 · 原帖
我真的搞不懂,Alphabet 明明有那么多钱,怎么就对那件事无能为力呢。他们甚至都不加掩饰。
Beff (e/acc) @beffjezos
10-03 10:32 · 原帖
e/acc 男友 EA 女友 引用:终于,我们能拥有两个了。
Beff (e/acc) @beffjezos
10-03 10:30 · 原帖
转帖:你被邀请参加超级智能终极在线午宴。 你会选择哪一个座位?
Rohan Paul @rohanpaul_ai
10-03 10:09 · 原帖
转帖:AI 可能会自动化目前由初级律师、顾问、银行家和广告从业者所做的许多日常工作。 “金字塔底层的人们所做的大部分工作——这些工作会怎样?唯一可以肯定的是,如果你从未在律师事务所或 Bain、BCG 或 McKinsey 工作过,你可能无法真正理解这背后的运作机制。” Benedict Evans(技术分析师、作家,前 a16z 合伙人)。 ---- 来自 a16z YouTube 频道(链接在评论中)
elvis @omarsar0
10-03 09:57 · 原帖
转帖:昨天我们预览了 Griffin,这是一个人类交互模型,它能够像人类一样看到、听到、发声和看起来。问题有很多,所以我想花点时间分享我们的想法。 先做个介绍:Tavus 是一家专注于研究实验室,致力于让机器来到我们所在的地方,并理解我们超越语言的沟通细微差别。 Griffin,我们最新的模型,目前尚未公开可用。昨天的公告是一个有限的研究预览,旨在展示模型的能力。随着 AI 发展如此迅速,我们更倾向于在努力实现安全公开发布时,公开且实时分享突破性进展。 面对面是我们进化上的沟通方式,它承载着最多的意义和意图,我们希望计算机能够帮助处理那些受益于这种情感理解、表达和沉浸感的工作。我们非常关心的应用场景示例包括: - 一个能够建立对学生学习方式的理解、准确看到何时出现困惑或分心,并调整课程以适应他们的导师。 - 一个能够回答您关于即将到来的预约或处方的任何问题、以您想要的节奏、在您需要的任何时间(即使是周末)提供解答的健康专家。 - 一个您可以练习口语、纠正您的动作和发音,并帮助建立真实对话信心的语言教练 - 或者一个适合每个人的完美助手,它理解意图,知道您的工作方式并记住重要的事情。 我们正在与合作伙伴合作制定防护措施和披露系统,同时邀请官员就更广泛的监管和安全使用展开讨论。人们将始终知道自己正在与 AI 互动,同时提供一个消除“说计算机语言”需求的界面。 我们相信,在一个计算机足够理解我们的未来,技术将变得更易获取、更实用,并让我们作为人类变得更有能力。那是我们想要构建的世界,我们理解以安全方式做到这一点的责任。
Wonder of Science @wonderofscience
10-03 09:54 · 原帖
转帖:雄性孔雀蜘蛛的求偶舞。 : Michael Doe
Alexandr Wang @alexandr_wang
10-03 09:52 · 原帖
会议徽章上的 MUSE 设备 引用:Muse 设备在会议徽章上运行 @alexandr_wang 移植到 MicroPython 以在 RP2350 上运行
Rohan Paul @rohanpaul_ai
10-03 09:45 · 原帖
转帖:黑石集团总裁兼首席运营官乔恩·格雷几个月前也提出了同样的观点。 任何基于规则的业务,比如会计、法律、金融,都将被人工智能彻底颠覆。 例如,摩根大通已放弃使用代理顾问来处理股东投票事宜,转而用人工智能取而代之。
Rohan Paul @rohanpaul_ai
10-03 09:34 · 原帖
转帖:新伯克利论文:LLM 通常知道你改变了主意,但仍然使用你的旧选择,因此代理需要明确说明当前状态。 当偏好或截止日期发生变化时,旧版本仍保留在上下文中。模型仍然持有新版本,但它的注意力会不断回到较早的提及。 在 5 个开源模型中,通过将注意力引导向最新值来修复了大多数此类错误,而无需重新训练。即使是顶级 GPT-5.6 Sol 在长代理日志上也只答对了 40 题中的 9 题,但当给出当前状态时,则答对了 40 题中的 40 题。 如果你的代理跟踪任何会变化的事物,请在提示中保留当前状态,而不是让模型挖掘历史记录。 – arxiv.org/abs/2609.38866 标题:“When Context Changes: Understanding Update Failures in LLMs”
Beff (e/acc) @beffjezos
10-03 09:32 · 原帖
在黄金时段表演,感觉就是不一样