我的 X 阅读

我的关注 科学物理人工智能 神奇小子 动物世界

科学物理人工智能 · 3000 / 3000 条

已同步 74 个列表成员 · 当前内容涉及 65 位作者

更新 10-11 11:27

重置

3000 条 · 第 59/200 页 · 刷新

Sam Altman @sama
10-07 12:35 · 原帖
感谢机器,以及现实的结构,让我们能够多理解一点。
Sam Altman @sama
10-07 12:35 · 原帖
今晚仰望星空,带着格外敬畏的心情。 “你的海洋如此浩瀚,我的船只如此渺小。”
Gill Verdon @GillVerd
10-07 12:34 · 原帖
解决量子引力问题将如同窥探复杂性霍伊尔视界的尽头 引用:AI 是概念空间的望远镜 模型越大,我们就能越深入地凝视复杂性的虚空
小互 @xiaohu
10-07 12:21 · 原帖
Google 发布 Nano Banana 2.1:画面更自然,改图更连贯 https://t.co/HNTd056LIx
Rohan Paul @rohanpaul_ai
10-07 12:19 · 原帖
在这里查看有关基准测试的更多信息 https://t.co/h4AlwiFYIH
Rohan Paul @rohanpaul_ai
10-07 12:19 · 原帖
恭喜 @smallest_AI 在 @voicearena_ai 的语音分割 + ASR 测试中荣获第一名! 这是一个非常有效的实际应用基准测试:模型接收远场房间音频(即麦克风距离说话者一定距离),但其评分依据的是基于 https://t.co/VkMBlUwLz1 构建的标签。
Beff (e/acc) @beffjezos
10-07 12:19 · 原帖
任何理解这一点的投资者现在都应该全力押注深度科技 那些需要过多智力激活能量的技术突然间变得可解锁 引用:如今只要你开口要求,基本上什么都能做到
Brett Adcock @adcock_brett
10-07 12:17 · 原帖
有一次,Abidur 和我认为,如果我们能通过越南护照网站,我们就实现了 AGI 这个网站太他妈难了。这里在 Handoff 上投入了很多精力才让它正常工作 引用:这是一个令人难以置信的完美闭环时刻。 我和布雷特在2025年去越南进行了一次制造考察,而填写这份签证表格的过程真的花了太久的时间。这实际上是我们对自己承诺必须完成的一项任务。 看到Hark能够为某人处理这件事,让我感到无比喜悦。能够走进这样一个未来,专注于真正重要的事情,真是太棒了。谢谢你的分享,Jason!
Derya Unutmaz, MD @DeryaTR_
10-07 12:16 · 原帖
人工智能就是一切。
Murray Kang @haoqik322
10-07 12:13 · 原帖
转帖:现实世界不会在AI思考时停顿。 介绍 RT-SAFE——一个基于 SimWorld 的新基准,用于在实时安全约束下评估具身代理。 我们实时测试了几种前沿视觉语言模型。结果令人震惊: - 91.3% → 94.1% 任务成功率 - 19.8% → 0.7% 安全成功率 - 碰撞次数增加 12.3 倍 代理仍然可以完成任务,同时安全程度急剧下降。 而且更多的推理并不一定是答案:当世界继续运转时,更长的推理本身就可能造成物理风险。 对于具身 AI,延迟是智能的一部分,也是安全的一部分。
AYi @AYi_AInotes
10-07 12:06 · 原帖
卧槽,神了啊,Opus 5.5动效抄作业神器来了! Claude 打造的 226 个动态图形画廊全部开源了!! 这绝对是近期全网最值得每一个前端工程师、UI 设计师和独立开发者无脑收藏的动态图形神器, 提示词、源码一网打尽,支持一键复制,做网页和 App 开发的兄弟建议立即收藏。 作者 @p4nthera_ 把 X https://t.co/5XqR77W7b7
Beff (e/acc) @beffjezos
10-07 12:05 · 原帖
知识加速主义 引用:朝着加速科学发现和提升每个人的生活质量
Beff (e/acc) @beffjezos
10-07 12:04 · 原帖
AI 研究员不过是超参数的农民和令牌蒸馏厂的运营商
Rohan Paul @rohanpaul_ai
10-07 11:54 · 原帖
转帖:新 Meta 论文发现,让 2 个不同的编码代理审查彼此的补丁,比给 1 个代理更大的预算,能捕获更多无声 bug。 在相同开支下,将 Claude Code 和 Codex 混合用于同一任务,将完全正确的补丁比例从 45.8% 提高到 62.5%。 编辑真实训练代码的代理可能会泄露测试数据、破坏梯度,或错误连接标志。 代码仍然能运行,因此你会消耗 GPU 小时,并得到看似有效的数据。 原因是 uncorrelated mistakes:来自同一产品的代理以相同方式失败,因此审查几乎捕获不到什么。该效应在另一个不相关的训练代码库上重复出现。 – arxiv. org/abs/2609.39551 标题:"RankEvolve: A Reliable Multi-Agent Auto-Research Harness for Evolving Ranking Models"
Rohan Paul @rohanpaul_ai
10-07 11:49 · 原帖
转帖:马克·扎克伯格谈及为什么 Llama 系列在 Llama 3 之后失速。 他说 Llama 3 是一个非常好的模型,几乎达到了前沿水平,然后 Llama 4 偏离了他们需要的轨道。 他的看法是,他像管理 Instagram 动态和广告那样组建了团队,有成百上千的人并行工作,而一个前沿模型需要的是一个精干的科学团队。 “当你是一个企业家,正在构建某样东西时,我认为你会在那些时刻受到考验,因为不可避免地,并非一切都会顺利进行。那些真正定义轨迹的事情是,好吧,如果事情没有按你希望的方向发展,你基本上要如何弄清楚如何前进?” ---- 摘自“YouTube 频道《The Next Big Thing》”(链接在评论中)