我的 X 阅读

我的关注 科学物理人工智能 神奇小子 动物世界

科学物理人工智能 · 3000 / 3000 条

已同步 74 个列表成员 · 当前内容涉及 65 位作者

更新 10-11 03:47

重置

3000 条 · 第 51/200 页 · 刷新

Przemek Chojecki | PC @prz_chojecki
10-07 18:50 · 原帖
我在我们的 STEMBench 上测试了 Mistral Large 4——每个 6 个领域 20 个问题——它获得了相当不错的得分。 它绝对有能力跨领域进行原创研究,而且相当均衡。欧洲 AI 的巨大胜利!
Rohan Paul @rohanpaul_ai
10-07 18:45 · 原帖
https://t.co/f6W4G8PVS3
Rohan Paul @rohanpaul_ai
10-07 18:45 · 原帖
彭博社报道:目前,圣路易斯联储经济数据门户网站FRED(联邦储备经济数据)的访问量中,约有一半来自人工智能代理,另一半则来自人类用户。 这一转变打破了FRED最初的设计理念,因为该门户网站最初是为人类用户设计的。https://t.co/XB97Ks8zpU
Rohan Paul @rohanpaul_ai
10-07 18:44 · 原帖
https://t.co/ZjjrcxHe43
Rohan Paul @rohanpaul_ai
10-07 18:44 · 原帖
路透社报道:ElevenLabs计划在印度投入数亿美元,用于组建本地团队、开发模型以及开展印度语相关工作。 由于该公司220亿美元的估值主要来自二级市场股票发行,因此这笔投资相对于其累计融资总额约7.81亿美元而言数额巨大。https://t.co/zKjlIowt6E
Rohan Paul @rohanpaul_ai
10-07 18:40 · 原帖
转帖:这现在真的达到了另一个层次。 “中国已经在 OpenAI 和 Anthropic 派驻了间谍。中国有能力随时进行黑客攻击。如果我们领先,但这并没有给我们带来巨大优势,他们随时可以介入并窃取我们的进展。” 前 OpenAI 和 Anthropic 研究员 Jacob Coxon ---- 完整视频在“PBD Podcast” YouTube 频道上,(链接在评论中)
Ramin @ramin_m_h
10-07 18:30 · 原帖
疯狂的开源发布 - 今天上午10:00 PT
Rohan Paul @rohanpaul_ai
10-07 18:27 · 原帖
https://t.co/Zfca5sGtfy 引用:完整视频请见“One More Question”YouTube频道 https://t.co/o5l7rJXHU0
Rohan Paul @rohanpaul_ai
10-07 18:27 · 原帖
人工智能研究人员告诉本·阿弗莱克,随着数据量的增加,该模型会“自然而然地泛化”,但他却不这么认为。 他谈到了InterPositive的创立历程,这家电影人工智能公司是他于2022年创立的。最终,Netflix在2026年3月以5.87亿美元现金收购了该公司。 他的人工智能模型:https://t.co/yfxq2qBhzF
Rohan Paul @rohanpaul_ai
10-07 18:14 · 原帖
https://t.co/Zfca5sGtfy 引用:完整视频请见“One More Question”YouTube频道 https://t.co/o5l7rJXHU0
Rohan Paul @rohanpaul_ai
10-07 18:14 · 原帖
本·阿弗莱克:告诉团队“全力代币化”就像为了取暖而烧掉收银机。 ---- 完整视频在“One More Question and GQ” YouTube 频道上,(链接在评论中)
Rohan Paul @rohanpaul_ai
10-07 18:00 · 原帖
转帖:代理基准测试需要对评分员进行审计,而不仅仅是对任务进行审计。 Parsewave 审查了 Zapier 的 AutomationBench 中所有 600 个公开任务,这些任务被前沿实验室在他们的模型卡片中引用。 它使用代理来编写令人信服的错误答案,然后让人类确认哪些评分员实际失败了:206 个失败了。 AutomationBench Verified 修复了每一个。 在 1,235 次 Kimi K3 运行中,修复后的评分员在 27.9% 的时间里给出了不同的判定。 最清楚的案例是任务 813。评分员检查了 Salesforce 笔记,但从未查看 DocuSign 模板。一个提交使用标准模板发送了四份合同,而不是所需的 GDPR、HIPAA、SOC2 和企业模板,通过了 13/13 的检查并得分 1.0。修复后得分 0.09。
Rohan Paul @rohanpaul_ai
10-07 17:51 · 原帖
转帖:达龙·阿西莫格鲁,这位诺贝尔奖得主、麻省理工学院的经济学家,预计人工智能在未来10年内只会接管大约5%的人类工作。 他假设简单的办公室和认知任务——约占美国工作量的20%——可以实现自动化,但预计其中只有四分之一会在十年内实现自动化。 humanistreview 这意味着GDP在10年内将增长约1.5%。 他在文章中反复引用语音识别软件Dragon的例子。 - “如今PC上的语音识别软件仅比2000年可用的软件略好一些” Dragon 16声称在理想条件下准确率达99%。那最后的1%可能会颠倒句子的意思,导致命令被误读,或迫使你校对每一封邮件。
Rohan Paul @rohanpaul_ai
10-07 17:38 · 原帖
这是个好消息。 Claude Opus 5.5、MidJourney、Suno on Grok @bot 引用:关于 Grok @Bot 的重要说明: 从今以后,@SpaceX 将针对任何特定任务使用最佳后端模型,包括 Claude Opus 5.5、MidJourney、Suno 和其他领先的 API。 无论哪一个最有可能为您带来最佳结果。
Rohan Paul @rohanpaul_ai
10-07 17:36 · 原帖
转帖:斯坦福大学新论文发现,当每个人的代理单独作用于共享资源时,整个群体表现不如一个代理为所有人服务。 共享预算或日历由一个代理为所有人服务来处理,比每个用户一个代理处理得更好,这在 5 个前沿模型中均如此。 每个代理为其自己的用户做得合理。 它们一起互相覆盖,随着团队增长而停滞,而且在没有沟通渠道的情况下,它们在 2 个环境中彻底崩溃。 在有争议的令牌预算上,Opus 5 团队仅捕获了 30% 的可实现价值,而 1 个协调代理则捕获了 64%。 在群体排序环境中,超过一半的 Claude 团队事件中,代理编造了关于其他用户的事实。 优先选择 1 个代理持有所有人的约束条件,如果您运行每个用户 1 个代理,则将读取同伴作为提交的条件。