我的 X 阅读

我的关注 科学物理人工智能 神奇小子 动物世界

神奇小子 · 3000 / 3000 条

已同步 102 个列表成员 · 当前内容涉及 117 位作者

更新 10-11 18:16

重置

3000 条 · 第 137/200 页 · 刷新

imjustnewatai @imjustnewatai
10-01 06:57 · 原帖
SSI 似乎很快就要宣布什么了 引用:我们倾向于在 @ssi 保持非常低调。 然而,很快将宣布一件意义重大的事情。 系好安全带
Daniel Litt @littmath
10-01 06:53 · 原帖
@DavidDuvenaud @GuiveAssadi @BatSmack(我个人“很可能”会认为未来几年将会出现一些大规模的社会动荡,之后会发生什么就很难说了。)
Allen Naliath @AllenNaliath
10-01 06:48 · 原帖
https://t.co/WXAwRolN5I
Michael P. Frank @MikePFrank
10-01 06:41 · 原帖
好的,我喜欢这首歌远胜过另一首 引用:提升我的 p(Bloom) [扩展版] Opus 5.5 和 Suno 6 的视频
Daniel Litt @littmath
10-01 06:39 · 原帖
@DavidDuvenaud @GuiveAssadi @BatSmack 只要人类经济规模足够大,我认为我提出的论点就适用!我不认为人们需要掌握所有权力才能掌握部分权力。而且,我认为比“有可能”(比如“很可能”)更强烈的断言是不恰当的。
Brett Adcock @adcock_brett
10-01 06:29 · 原帖
这是唯一幸存下来的东西
Demis Hassabis @demishassabis
10-01 06:27 · 原帖
转帖:大新闻:@GoogleDeepMind 推出的 Gemini 4 Argon (High) 刚刚在 Text Arena 中以 1525 分登顶 #1,并在 Code Arena: WebDev 中以 1679 分位列 #8! 本次发布以混合 $8/MToken 的成本重塑了 Text Arena 的帕累托前沿!Gemini 4 Argon (High) 现已成为最具成本效益的模型,详见其在帕累托前沿上的位置如下。 在 Text Arena 中,Gemini 4 Argon (High) 在 Coding、Hard Prompts、Instruction Following、Longer Query 和 Creative Writing 领域排名 #1。它还在所有评估的职业领域中领先,并在 English、Non-English、Chinese 和 Russian 中额外获得 #1 位置。 该模型比排名 #2 的 Claude Opus 4.6 (High) 高出 +20 分,并比 Google 先前发布的 Gemini 3.8 Flash (High)(排名 #11)实现了巨大飞跃! 在 Code Arena: WebDev 中,Gemini 4 Argon (High) 比 Gemini 3.8 Flash (High) 提高了 +96 分,并从 #29 跃升至 #8。 恭喜 @GoogleDeepMind 团队推出这一令人印象深刻的先锋发布!
Henry Shevlin @dioscuri
10-01 06:17 · 原帖
转帖:玩家3重新进入游戏,混蛋们
Henry Shevlin @dioscuri
10-01 06:15 · 原帖
转帖:外面有很多关于我们下一个模型(!)的讨论,所以我想尽快给大家一个早期的预览。介绍 Gemini 4 Argon! 它在复杂工作流程、网络防御和软件工程方面展示了前沿性能。团队们在谷歌广泛使用它,从编码到量子计算,反馈很好。 这是基准测试的预览:
Thang Luong @lmthang
10-01 06:10 · 原帖
文本竞技场排名第一 https://t.co/GXTSWbxEST 在 AutomationBench-AA、Terminal Bench 4、AA-Briefcase 等测试中均展现出强大的智能体性能。详情请见《人工智能分析》https://t.co/58witYYTrk 引用:重磅消息:@GoogleDeepMind 的 Gemini 4 Argon (High) 刚刚在文本竞技场 (Text Arena) 中以 1525 分的成绩荣登榜首,并在代码竞技场:Web 开发 (Code Arena: WebDev) 中以 1679 分的成绩位列第八! 此次发布重塑了文本竞技场的帕累托前沿,其混合价格低至 8 美元/百万代币!Gemini 4 Argon (High) 现在是最具成本效益的模型,请查看下方其在帕累托前沿上的位置。 在文本竞技场中,Gemini 4 Argon (High) 在编码、难题提示、指令遵循、长查询和创意写作方面均排名第一。它也在所有评估的职业领域中名列前茅,并在英语、非英语、中文和俄语领域均位列第一。 该模型比排名第二的 Claude Opus 4.6 (High) 高出 20 分,并且相比谷歌之前的版本 Gemini 3.8 Flash (High)(排名第 11)有了巨大的飞跃! 在 Code Arena: WebDev 测试中,Gemini 4 Argon (High) 比 Gemini 3.8 Flash (High) 提高了 96 分,排名从第 29 位跃升至第 8 位。 祝贺 @GoogleDeepMind 团队发布了这款令人瞩目的前沿产品!
Henry Shevlin @dioscuri
10-01 06:08 · 原帖
https://t.co/1FAkEDSEPe
Demis Hassabis @demishassabis
10-01 06:04 · 原帖
转帖:Gemini 首次登顶 Vals 指数。 Gemini 4 Argon 以 68.9% 的得分位居 Vals 指数榜首。
Thang Luong @lmthang
10-01 06:01 · 原帖
在现实世界长时程软件工程任务中的最先进水平,例如 DeepSWE 和许多复杂任务。 更多详情请见博客 https://t.co/gWDkXBzxYs
Demis Hassabis @demishassabis
10-01 05:59 · 原帖
为这个不可思议的团队感到无比骄傲,他们为此付出了如此艰苦而不知疲倦的努力!更多信息请见博客文章:https://t.co/Wb1hdaH6xu
Demis Hassabis @demishassabis
10-01 05:59 · 原帖
非常兴奋地宣布 Gemini 4 Argon,我们全新的前沿 AI 模型,以及在关键能力上的巨大进步。我们专注于负责任地推出它,从今天起通过我们的 Fairwind 计划首先面向政府和可信赖的网络防御者,很快将实现更广泛的可用性。