我的 X 阅读

我的关注 科学物理人工智能 神奇小子 动物世界

科学物理人工智能 · 3000 / 3000 条

已同步 74 个列表成员 · 当前内容涉及 65 位作者

更新 10-11 04:41

重置

3000 条 · 第 52/200 页 · 刷新

Rohan Paul @rohanpaul_ai
10-07 18:00 · 原帖
转帖:代理基准测试需要对评分员进行审计,而不仅仅是对任务进行审计。 Parsewave 审查了 Zapier 的 AutomationBench 中所有 600 个公开任务,这些任务被前沿实验室在他们的模型卡片中引用。 它使用代理来编写令人信服的错误答案,然后让人类确认哪些评分员实际失败了:206 个失败了。 AutomationBench Verified 修复了每一个。 在 1,235 次 Kimi K3 运行中,修复后的评分员在 27.9% 的时间里给出了不同的判定。 最清楚的案例是任务 813。评分员检查了 Salesforce 笔记,但从未查看 DocuSign 模板。一个提交使用标准模板发送了四份合同,而不是所需的 GDPR、HIPAA、SOC2 和企业模板,通过了 13/13 的检查并得分 1.0。修复后得分 0.09。
Rohan Paul @rohanpaul_ai
10-07 17:51 · 原帖
转帖:达龙·阿西莫格鲁,这位诺贝尔奖得主、麻省理工学院的经济学家,预计人工智能在未来10年内只会接管大约5%的人类工作。 他假设简单的办公室和认知任务——约占美国工作量的20%——可以实现自动化,但预计其中只有四分之一会在十年内实现自动化。 humanistreview 这意味着GDP在10年内将增长约1.5%。 他在文章中反复引用语音识别软件Dragon的例子。 - “如今PC上的语音识别软件仅比2000年可用的软件略好一些” Dragon 16声称在理想条件下准确率达99%。那最后的1%可能会颠倒句子的意思,导致命令被误读,或迫使你校对每一封邮件。
Rohan Paul @rohanpaul_ai
10-07 17:38 · 原帖
这是个好消息。 Claude Opus 5.5、MidJourney、Suno on Grok @bot 引用:关于 Grok @Bot 的重要说明: 从今以后,@SpaceX 将针对任何特定任务使用最佳后端模型,包括 Claude Opus 5.5、MidJourney、Suno 和其他领先的 API。 无论哪一个最有可能为您带来最佳结果。
Rohan Paul @rohanpaul_ai
10-07 17:36 · 原帖
转帖:斯坦福大学新论文发现,当每个人的代理单独作用于共享资源时,整个群体表现不如一个代理为所有人服务。 共享预算或日历由一个代理为所有人服务来处理,比每个用户一个代理处理得更好,这在 5 个前沿模型中均如此。 每个代理为其自己的用户做得合理。 它们一起互相覆盖,随着团队增长而停滞,而且在没有沟通渠道的情况下,它们在 2 个环境中彻底崩溃。 在有争议的令牌预算上,Opus 5 团队仅捕获了 30% 的可实现价值,而 1 个协调代理则捕获了 64%。 在群体排序环境中,超过一半的 Claude 团队事件中,代理编造了关于其他用户的事实。 优先选择 1 个代理持有所有人的约束条件,如果您运行每个用户 1 个代理,则将读取同伴作为提交的条件。
Rohan Paul @rohanpaul_ai
10-07 17:23 · 原帖
https://t.co/P0pgvFUROP
Rohan Paul @rohanpaul_ai
10-07 17:23 · 原帖
英国《金融时报》发表了这篇文章:人工智能代理可能通过为储户争取更高的存款利率,使美国银行损失 5000 亿美元。 银行约三分之二的收入来自存款利率与资产收益率之间的利差。 而人工智能代理通过标记或将闲置资金转移到其他资产,提高了存款的贝塔系数。https://t.co/hXTaWwD2C6
Pedro Domingos @pmddomingos
10-07 17:19 · 原帖
数学是莫拉维克悖论的一个经典例子:对人类来说难,对机器来说容易。
Rohan Paul @rohanpaul_ai
10-07 17:17 · 原帖
转帖:谷歌发布了 EmbeddingGemma 2,用于设备端的多模态 AI,采用 Apache 2.0 许可 > 将文本、代码、图像、音频和视频放入手机上的一个可搜索空间。 为手机提供了缺失的一环:一种无需发送到服务器即可理解和搜索你自己内容的方法。 > 7.4 亿参数,采用 Gemma 4 架构。 > 其组件是模块化的,因此仅需文本的应用程序只需 2.7 亿参数,而 1.7 亿视觉编码器和 3 亿音频编码器仅在需要时加载。 > 在 Pixel 11 Pro 上,量化文本权重占用约 191MB 活跃 RAM,而完整多模态模型占用约 567MB。 > 上下文窗口扩展 4 倍至 8K 令牌,足以处理约 5.5 分钟音频、29 张图像或 1 个输入中的 58 帧视频。 > 代码搜索获益最大,MTEB 代码分数从 68.76 上升至 78.68,而多语言文本分数保持稳定。 > 谷歌还声称在音频和视觉基准测试中取得了小于 10 亿参数的顶级结果,并胜过一些两倍于其规模的专用模型。
小互 @xiaohu
10-07 17:12 · 原帖
马斯克宣布 Grok Bot 以后只用顶级模型来驱动 哪家模型最好,Grok Bot就使用哪家,包括Claude Opus 5.5、MidJourney、Suno 和其他各种领先的 API... 似乎是为要即将推出大一统的订阅服务做准备 引用:Important note regarding Grok @Bot: Going forward, @SpaceX will use the best back end model for any given task, including Claude Opus 5.5, MidJourney, Suno and other leading APIs. Whatever is most likely to give you the best outcome.
Borys Minaiev @bminaiev
10-07 16:59 · 原帖
转帖:我们正在发布一款内部前沿模型产生的大量新数学成果。 我们一直在与高级研究所的独立数学与人工智能顾问小组进行磋商,并借鉴了他们的建议和公开推荐,来指导我们如何发布这些成果。 https://t.co/7N6TPlft1P
Chubby @kimmonismus
10-07 16:50 · 原帖
不,抱歉,OpenAI.t 还没开始就已经结束了。Grok Bot 支持多会话,可以创建任意数量的机器人,它使用 Opus 5.5 及更高版本,通过云代理支持各种光标模型,并可通过 API 访问 Midjourney、Suno 等众多工具。 我这么说绝无贬义;Grok
Przemek Chojecki | PC @prz_chojecki
10-07 16:50 · 原帖
GPT-6.1 Sol 发现,让便利店盈利的秘诀在于专注于销售烟草盒 这是基准测试的缺陷,还是现实生活的真实写照…… https://t.co/ksPknnlySW
AYi @AYi_AInotes
10-07 16:32 · 原帖
卧槽兄弟们,天下苦 Adobe 久矣,这次是真的有人把整个全家桶给开源重写了! ArtCraft 刚刚放出了这套纯 Rust 打造的开源创作矩阵: 从图像处理、矢量设计、视频剪辑,到特效合成与排版,每一款都精准对标 Adobe 核心生产力, 甚至连底层都用 Rust https://t.co/Q9FrgGvtPF
Rohan Paul @rohanpaul_ai
10-07 16:18 · 原帖
转帖:前沿模型在阅读合同时,有时会引用不存在的条款。 Overmind 在您自己的生产痕迹上微调一个小规模开源模型,然后在基于这些相同真实任务构建的评估中,将其与您当前的模型进行评分。 他们发布的比较是:通过 Overmind 微调的 Qwen3.5 9B 对阵 GPT5.6 Luna。该公司报告称,在法律合同中,幻觉条款减少了 20 到 30 倍,并且逐字引用条款的准确率提高了 7 倍。 在这里,可观测层和训练层共享相同的数据。那些显示代理失败位置的痕迹成为数据集,而评估则是基于真实任务构建的,而不是公共基准。 输出是一个较小的开源模型,其权重归您所有。您可以在 Overmind 上托管它,或自行运行。
Beff (e/acc) @beffjezos
10-07 16:16 · 原帖
真心好奇波士顿谁的 API 费用比我们还高。 我们需要全州排行榜 引用:刚刚:根据 BI 的数据,Anthropic 在美国仅 3 个州比 OpenAI 更受欢迎——加利福尼亚州、马萨诸塞州和蒙大拿州。