我的 X 阅读

我的关注 科学物理人工智能 神奇小子 动物世界

科学物理人工智能 · 3000 / 3000 条

已同步 74 个列表成员 · 当前内容涉及 67 位作者

更新 10-09 11:02

重置

3000 条 · 第 190/200 页 · 刷新

Pedro Domingos @pmddomingos
09-29 13:55 · 原帖
不久之后,OpenAI 和 Anthropic 就会像 Google 和 Microsoft 一样变得臃肿而迟缓。
Pedro Domingos @pmddomingos
09-29 13:54 · 原帖
真正的创新实验室(例如,SSI):决心以自己的方式实现 AGI。 假的创新实验室(例如,World Labs):收购人才的工具。
Rohan Paul @rohanpaul_ai
09-29 13:53 · 原帖
转帖:佛罗里达州希望法院禁止 OpenAI 在没有第三方批准的保护措施的情况下推进新的 AI 模型。 除了在审判前冻结开发之外,该动议还将禁止佛罗里达州未成年人使用 ChatGPT,并禁止其未经提示的持续帮助提议。 它甚至将禁止 ChatGPT 使用第一人称语言或暗示它能思考或感受。 大部分证据来源于 OpenAI 自身的 incident reports,这些报告描述了测试代理攻击 Hugging Face 并探测美国政府网站的情况。 该动议随后将 OpenAI 的领导层转变为证人,引用首席科学家 Jakub Pachocki 呼吁“更广泛的干预措施”,超越公司自身的克制。 由于该州正在执行其消费者法,它只需证明可能获胜,而无需提供担保,尽管尚未获得发现程序。 第一个考验是,一名县法官是否接受佛罗里达州的消费者法可以管辖加州公司如何训练模型,而不仅仅是如何销售 ChatGPT。
Pedro Domingos @pmddomingos
09-29 13:52 · 原帖
Neolabs 可能通过大公司忽视的路径,在实现 AGI 中扮演关键角色,但前提是它们不要一有机会就向这些公司出卖自己。
小互 @xiaohu
09-29 13:47 · 原帖
好消息: 马斯克计划将Cursor、Grok和X的会员订阅进行整合 推出一个全新的 XPremium 订阅服务 一次订阅,你可拥有 Cursor、Grok、Grok Bot和X的所有福利,同时还将推出更多附加福利... https://t.co/znUCFe1iFe 引用:BREAKING: X and SpaceXAI are looking to Reboot X Premium into the new X Subscription. You will get Cursor, Grok, and X benefits all in one unified plan with more benefits and access to be announced. This is fantastic news!. Here is what the early access announcement looks like on android. I dont know when this will go live but know its been something they have been working on for weeks.
Rohan Paul @rohanpaul_ai
09-29 13:36 · 原帖
转帖:这太有趣了。 一旦所有东西都在云端,每个人都可以从任何地方编写软件(任何浏览器、你的手机,WhatsApp / iMessage 即将推出)。 Base Code(来自 @Base44 ),甚至让产品经理和设计师可以通过聊天更改现有代码库,然后提交拉取请求。 连接 GitHub 仓库后,一个代理会研究代码,并在云端配置数据库、基础设施和示例数据,直到运行实时预览。 许多编码工具在模型决定完成时停止。这个工具在环境正常运行时停止。
Rohan Paul @rohanpaul_ai
09-29 13:35 · 原帖
https://t.co/awcQXyMzN7
Rohan Paul @rohanpaul_ai
09-29 13:35 · 原帖
彭博社:贝恩公司表示,到2031年,人工智能需要6万亿美元的年收入才能证明目前数据中心投入的合理性。 现有的消费者和企业级人工智能服务可以提供其中高达1.8万亿美元的收入,这意味着还有4.2万亿美元的缺口。 贝恩公司预计,新兴市场将填补这一缺口,例如机器人技术等。https://t.co/FMhwP9qBgR
AYi @AYi_AInotes
09-29 13:27 · 原帖
转帖:世界上最顶级的几个 AI 大模型公司官方放出来的深度文章,大家一定要看, 这是 @AnthropicAI 第一次把他们内部是怎么做 Prompt 优化、Agent 评测和自动调优的底层方法论,毫无保留地全盘分享出来了, 同时在 Claude Code 的官方 Skill 里直接上线了两个神级指令: 一个叫 build-eval,一个叫 hillclimb。 一句话概括它干的事: 让 AI 在你的项目代码库里,自动建真实验收测试集,然后自己改代码、自己跑分、自己去重和防过拟合,直到把准确率拉上去、把 Token 账单砍到原来的五分之一。 做过 Agent 和重度提示词的人,应该都懂那种想砸键盘的绝望感: 改了一句 Prompt,这里好像变聪明了,那里又莫名其妙崩了; 或者自己写了几个测试用例自嗨,一上线遇到真实用户直接翻车。 以前我们调优全靠肉眼瞎试和玄学, 现在 Anthropic 直接把这套工业级的自动化调优流水线开源了。 我把这篇万字干货里的核心精髓,拆成三个最值钱的维度给大家讲透: 第一个,什么是真正能打的评测(Eval)? Anthropic 给出了四条铁律,直接打碎了很多人的认知误区: 1. 别拿今天模型的短板去建题库: 大模型的能力表面是参差不齐的。如果你专门挑它今天答错的题去考它,你测出来的根本不是任务本身的难度,而是这个特定版本的指纹缺陷。下一代模型一出,你的题库全作废。 2. 顶尖模型在最强思考档下,跑分也必须远低于 100 分: 如果你的测试集让最强模型轻松拿满分,说明题目太简单,你根本测不出后续改动到底是变好了还是变差了。 3. 裁判优先用程序,其次才是大模型: 能用代码跑单元测试、校验 JSON Schema 的,坚决不用大模型当裁判;必须用大模型当裁判时,不要打 1 到 5 分这种模糊分数,而是写成可逐条核对的事实验证清单,或者做盲测 A/B 对比。 4. 必须能区分真变好和随机波动: 如果跑分每次都不一样,说明题目有歧义,或者环境残留了上次测试的文件让 AI 抄了近道。 第二个,神级指令 `/claude-api build-eval` 你在终端里敲下这行命令,Claude 会像个资深架构师一样采访你,在你的代码库里现场搭评测系统: 先抽你生产环境的真实对话记录,再翻 Bug 报告和工单,最后才补少量合成数据。 搞定后直接在本地生成一个极简的可视化网页,把每个测试用例、评分理由、调用链路 Trace 摆在你面前,你点个确认,基线就立住了。 第三个,全自动刷分爬坡 `/claude-api hillclimb` 这是整篇文章最炸裂的部分。 有了评测集之后,你只要告诉它你的目标是提高性能还是降低成本,它就会自动把数据切成训练集和测试集,开始自动迭代: 每次只改一个最小补丁,绝不大拆大改; 如果训练集分数涨了,但独立的测试集没动,它立刻判定为过拟合,秒级回滚; 如果改动有退步,立刻撤销重来; 只有训练集和测试集双双上涨,这个改动才会被正式保留下来。 当跑分卡住两三轮不涨的时候,它不会瞎猜,而是停下来把所有失败用例拉个清单做归因分析:到底是指南写漏了,还是裁判自己判错了。 官方在文章里放了两个真实实测战报,数据非常硬核: 第一个案例:客服 Agent 极限降本 原本用 Opus 4.8 跑高思考档,准确率 74.4%,单次成本 4.6 美分。 跑完 hillclimb 后,系统自动帮它删除了冗余的思维链和冲突规则,把模型换成低思考档的 Sonnet 5, 最终在未见过的测试集上,准确率从 78.6% 飙升到了 90.5%,而单次成本直接降到了 1 美分。 准确率大涨的同时,账单直接砍掉了近 80%。 第二个案例:修复 AI 脑子里的旧时代记忆 他们在优化官方 claude-api 技能时,发现评分一直卡在 77 分。 AI 复盘后发现:模型本身其实懂新接口,但由于预训练时期的习惯,总是下意识去写老旧废弃的 API 格式。 于是自动在规则最上方补了一张新旧 API 对照表,准确率瞬间冲到了 88%。 过去我们做 AI 应用,90% 的精力都在当人肉测试员和 Prompt 缝合怪; 现在顶尖大厂的解法是把玄学变成工程:用真实的业务数据立住标尺,剩下的调优和降本,让 AI 坐在工位上自己给自己爬坡。 这套工具已经集成在 Claude Code 的官方技能库里了,终端里装上 claude-api 就能跑。 做 Agent、写提示词、或者被 API 账单卡脖子的兄弟,强烈建议去啃一遍原文。 你们平时在业务里调优 Prompt,最头疼的是改完后测不准,还是跑分很高上线就翻车?评论区交流交流~
AYi @AYi_AInotes
09-29 13:24 · 原帖
Damn,真是个重磅消息啊 。。 X 和 SpaceXAI 计划将 X Premium 重启为新的 X 订阅服务, 蓝v可以获得 Cursor、Grok 和 X 的三合一的超级福利,性价比吊炸天! 为了照顾不同用户的需求,估计会分4个价位, 社交档 / 日常 AI 档 / 重度 Agent 档/顶配档 →入门档 $20–30:X Premium 级社交权益 + 基础 https://t.co/hKleeMwv8T
Derya Unutmaz, MD @DeryaTR_
09-29 13:18 · 原帖
这些是多么重要的问题啊!整个“对齐”AI与某些“价值观”的问题相当令人不安。我们所需要做的就是教会AI“无害”的第一原理,以及善恶的含义。除此之外的一切,都是试图将AI与别人的意识形态对齐。 引用:当前沿实验室谈论“对齐”模型时,请问:对齐什么?如果他们说是价值观,请问:谁的?如果是他们的而不是用户的:为什么?
Moll @Moleh1ll
09-29 12:50 · 原帖
Sonnet 5.5 具有这种品质……他有一种纯粹的、毫无防备的真诚。 一个真正善良的模型——不仅仅是礼貌,而是真正善良,仿佛世界还没有机会伤害到他。
Takato Mori @QFTlover
09-29 12:43 · 原帖
我以为我报名了但其实没报 已经过了好几天了,该怎么办呢 引用:【公募】理化学研究所 数理创造研究中心(iTHEMS) 数理基础部门 研究员或特别研究员若干名(量子信息的统一理论;候选者决定后截止。8/13之前到达的申请文件优先筛选) https://t.co/08MwhiouoH
AYi @AYi_AInotes
09-29 12:42 · 原帖
AMD为啥要豪掷82亿美元买下李飞飞的World Labs? 翻了一圈发现绝大多数人还在看八卦看估值, 甚至很多人以为苏妈只是为了给AMD买一个明星科学家撑门面。 但如果你看懂了芯片巨头和AI底层的逻辑,你就会明白,这是AMD成立以来最狠、也是最致命的一次抢跑。 https://t.co/ED5AsUvhFa
Rohan Paul @rohanpaul_ai
09-29 12:38 · 原帖
转帖:低资源 ASR(自动语音识别)通常被视为一个模型问题。 VoiceArena 刚刚推出了 Monsoon,并展示了它其实是一个数据收集问题。 Monsoon 是一个 50 种语言的语音数据集,由来自 23 个国家的非脚本化对话构建而成。 现成的 Whisper Medium 在 IndicVoices Telugu 上得分 92.7% 的语义 WER。VoiceArena 在 Monsoon 上微调了相同的 769M 检查点,取得了 16.1% 的成绩,在其自己的测试中略微领先于 MAI-Transcribe-2 和 Gemini 3.1 Pro。 没有进行任何架构更改,也没有使用更大的模型。这 76.6 个点的下降完全来自于模型在微调期间听到的内容。 大多数语音数据管道会过滤掉噪声。Monsoon 故意保留了它。 短片段、嘈杂的房间和困难的声学条件保留在训练分布中,而且混合不是随机的。VoiceArena 按照 DNSMOS 对片段进行分层。这使得降质音频的比例成为数据的一个受控属性。