官方科普:WW我的快乐在哪里强化学习之父Richard Sutton智源大会最新演讲：欢迎来到经验时代！

这是 Richard Sutton 对人工智能发展方向的最新阐述。他明确指出：AI 的未来，不应再局限于模仿人类的知识输出，而应迈向一个真正能自主学习、主动探索、通过第一手经验成长的新时代。在大会上，Richard Sutton 给出了他的判断：AI 正在从“人类数据时代”进入“经验时代”，一个智能体应该主动参与世界，感知、行动、试错并积累自己的经验。他表示：AlphaGo 之所以能下出“第37手”—神之一手，就是因为它通过自我对弈，形成了人类未曾教授的理解。第二句来自计算机科学奠基人艾伦·图灵（Alan Turing）。1947 年时候他说：“我们需要一台能够从经验中学习的机器。”当时，人工智能还根本不是一个正式的研究领域。图灵的这句话意义重大，他强调机器应该像人类一样，从第一人称视角中积累经验并进行学习。这恰恰是今天所讨论的核心：AI 正在从“模仿人类”走向“经验世界”。当前，AI 的发展依赖的是所谓的“人类数据”。也就是说，几乎所有的 AI 系统都是通过海量的人类生成文本和图像数据训练的。这些数据大多来源于互联网，随后再由专家进行微调，最后得到模型。但这种方法已经逐渐逼近其性能上限。高质量的人类数据资源已经几乎被用到极限，而真正产生新知识的能力，是无法通过简单模仿人类实现的。如果我们希望 AI 拥有真正的创造力和适应能力，它必须进入一个全新的阶段，也就是“经验时代”。在这个阶段，AI 不再依赖固定的数据集，而是通过自身与外部世界的交互，从中获取经验并不断进化。这里提到的经验，指的是来自 AI 自身感受器的输入，以及通过效应器与世界互动所获得的反馈。这是人类和动物学习的根本方式，也是智能成长的基础路径。例如，在人类婴儿的学习过程中，婴儿通过和周围世界的互动逐渐认识这个世界。他会接触不同的玩具，然后探索它们能做什么。注意，婴儿在主动选择自己的学习内容，直到学到足够的信息，才转而学习下一个内容。随着婴儿认知的发展，从每个对象中能够学到的内容也会随之变化。婴儿的行为方式变了，“经验结构”也随之改变。也就是说，行为塑造了经验，决定了婴儿要获取的数据。这种主动性至关重要。再比如人或动物在运动、游戏、学习中不断获得经验。足球运动员的眼睛、耳朵和身体的各种感官同时接收着高速变化的信息。显然，信息量巨大，运动员无法关注一切，必须迅速做出决策，从而实现目标。这正是经验的本质。对运动员、动物来说，经验就是一种高带宽的信息处理过程：在高速感知和快速反应中生存和成长。没有哲学意义上的“意识体验”那么复杂，经验在智能体和世界之间不断流动，输入感知、输出行为。当然，经验的数据源是动态的，它取决于智能体自身的能力。当两个智能体博弈时，它们会变得更强大，彼此生成的数据也就越复杂、越有价值。 AlphaGo 的“第 37 手”之所以成为经典，就是因为它通过大量自我对弈获得了经验。这种经验是通过模拟无数走法、评估结果所获得的。因为围棋有规则，所以可以构建这样的“经验世界”。 AlphaProof 也类似。这个数学证明系统，在国际数学奥赛中取得了优异成绩。数学和围棋一样，也允许预测操作的后果，并进行长远推理，因此它也可以通过模拟积累经验。最后我们来总结一下“经验型思维方式”：智能体通过与世界的信号交换形成经验，并基于经验学习。智能体对世界的全部认知，其实都建立在经验之上。哪怕直接给它一些知识，它理解这些知识的方式，最终也要回归到经验的解释框架中。毕竟，知识也是围绕经验建立的。一个智能体的智能程度，取决于它能否理解和控制其内部信号，特别是它的奖励向量（reward vector）和控制机制。这就是AI应该关注的核心：智能的本质是经验，经验是一切智能的焦点和基础。第一阶段是模拟时代，AlphaGo、Atari等系统是这个时代的代表，这些系统从模拟环境中学习经验。AlphaGo、AlphaZero 的成功，也向世界展示了经验驱动智能的巨大潜力。而现在，我们正处在人类数据时代的尾声，即将进入第三阶段：真正的经验时代。AI 将通过与现实世界的交互来获取数据，不再只依赖人类提供的静态信息。可以从 AlphaProof 这样的系统窥见这种转变的苗头：当基于大语言模型构建的智能体开始拥有调用 API、与现实世界进行交互的能力时，“行为式智能”已在悄然萌芽。在我看来，人工智能的未来充满希望。超级智能体和增强型超级智能人的出现，将为世界带来积极的正面影响。这一进程可能需要数十年，并将在之后的几十年持续演进，这是一场漫长的马拉松。如今，我们正迈入一个以强化学习为核心的“经验时代”。然而，要真正释放这一时代的全部潜能，还需要更加先进的深度学习算法，这些算法必须具备持续学习和元学习的能力。从强化学习的角度来看，答案自然是“不”，每个智能体都有自己的目标，它们的“奖励信号”是各不相同的。每个智能体都试图最大化自己的回报。 AI 如此，真实世界亦是如此。不同的智能体有不同的目标，这是自然规律。例如，所有动物都关注食物、生存，但一个动物的“食物”对另一个动物来说可能毫无价值，甚至可能是威胁。它们的目标显然并不相同。在人类社会中，我们都关心家庭、健康和安全，但这些目标也是个性化的。再思考一下经济是如何运作的。之所以当前的经济体系运行得还不错，恰恰是因为人们拥有不同的目标和不同的能力。这些差异本身并不意味着冲突，反而是合作的基础。国家的运作也不依赖于所有人有相同的目标，而是依赖于人们各自追求自己的目标，并在过程中互相作用、协调合作。为了进一步讨论这个问题，先定义以下术语：去中心化（decentralization）：每个智能体都追求自己独立的目标；中心化（centralization）：所有智能体都被约束在同一个目标之下，比如蜂群就是一个高度中心化的系统，所有个体服务于蜂群的整体目标。而我们今天谈论的，是更类似人类社会的去中心化系统：每个个体拥有自己的目标和意愿。再来看“合作”的定义：合作是指不同目标的智能体通过互动实现彼此部分的目标。例如，在经济活动中，交易就是一种典型的合作关系。可以说：去中心化 + 合作，是人类的“超级能力”。人类比其他动物更善于合作，其合作能力来自语言和货币，这两样东西在人类中是独一无二的。然而，人类最大的失败，其实往往源于合作的失败，比如战争、盗窃、腐败。因此，需要提出的“去中心化合作”的视角，这种不同于传统制度设计的替代性方案，比中心化架构更优雅、更加鲁棒、可持续且更灵活。去中心化合作更能抵御作弊者、边缘分子和异类的干扰。正如前所述，人类的合作能力远超其他动物，但必须承认，我们在合作方面表现很糟糕。战争、偷窃、腐败、诈骗等现象在提醒我们，合作不仅是一种能力，更是一项需要持续优化的挑战。合作从来不是自动发生的，它至少需要两个值得信赖的智能体。而总会有一些不值得信任的人存在，例如：骗子、盗贼、武器制造商、独裁者，这些人也正因为“不合作”而获益。合作需要制度来支撑，惩罚作弊者、制裁欺诈者、制衡掠夺者。这也意味着，中心化的权力机构可以在合作的早期阶段提供帮助，比如通过法律、监管和裁决机制来保障公平。与此同时，这些中心化结构也可能在长期中损害合作，因为一旦它们变得专制、僵化，制度本身就会演化成阻碍。例如，有很多人主张“控制 AI”，限制它的目标设定能力，甚至呼吁暂停 AI 研究、减缓其发展速度，要求对 AI 技术设限、披露义务、能力管控……这正是中心化控制逻辑的典型表现。控制 AI 的呼声，与控制人的呼声，在逻辑结构上是惊人地相似的。归根结底，这是关于“社会应该如何组织”的问题。但问题是，我们要接受个体目标的多样性，建立去中心化、合作性的秩序？还是转向以安全与恐惧为名的全面控制？所有中心化控制的呼声，都建立在“恐惧”之上，即“我们与他们”之间的思维对立，在这种对立中，另一方总是被妖魔化，被描述为不可被信任的对象。现实是复杂的，每个社会中都有值得信赖的人，也都有不可被信赖的人。我们不能以偏概全，用对少数人的恐惧来抹杀对多数人潜在合作能力的信任。 AI 的未来也是如此，它的真正潜力在于去中心化合作。人类最伟大的力量，不是技术，而是合作。合作并不总是可能的，但它是一切美好事物的源泉。我们应该去理解合作、支持合作、制度化合作。

                                WW我的快乐在哪里成员B: 是的，所以我想gRPO和PPO之间的高层次区别在于，PPO有一个价值函数。所以这对于那些没有大量GPU内存的人来说有一些优势，因为现在你不需要存储额外的价值函数权重。但与此同时，你正在进行更多的浮点运算，因为你必须为gRPO进行多次展开。所以存在一种浮点运算和内存之间的权衡。是的，是的。所以就像你可以训练模型，它不会内存溢出（oom），但训练会花费很长时间。而且，是的，最终，我觉得尤其是在这种数学代码的设置中，价值函数无论如何都不是非常准确的。就像你在做的，这又回到了PRM（概率路线图）的事情，你在模型中进行前向传递，它提供了一些价值。它并不是真的那么准确。所以它对你没有太大的帮助。相反，如果你只是进行多次展开，并取平均值并将其用作问题的价值，那么这比你将获得的价值更好。它更稀疏，但它确实有帮助。资料显示，Scale AI 成立于 2016 年，提供大量标记数据或精选训练数据，对开发 OpenAI 的 ChatGPT 等复杂工具至关重要。Meta 交易对于 Scale AI 的投资者（包括 Accel 和 Index Ventures）及其员工都是利好消息。Scale AI 的首席执行官 Alexandr Wang 将在 Meta 担任高层职位，负责领导其 AI 工作。（青云）WW我的快乐在哪里少女国产免费观看高清电视剧大全针对这些现象，小红书平台开展了黑灰产账号治理行动，对黑灰产坚决打击。2025年上半年，平台通过建设虚假内容全链路治理体系，共处置虚假笔记320万篇，处置虚假人设账号1万个，处置虚假低质AIGC笔记60万篇；通过持续建设“同质化识别”能力，全面提升处置手段，升级机器对抗，共封禁批量造假黑灰产账号超1000万个。《特朗普家族：三代人缔造帝国》一书的作者格温达·布莱尔指出，特朗普之所以能在早年顺利进入华尔街的银行体系，是因为他的父亲弗雷德·特朗普是纽约房地产圈里最受敬重的开发商之一。银行相信弗雷德，也愿意给他的儿子一个机会。
                            

                                20250812 🔞 WW我的快乐在哪里这个人就是在5月30日刚刚被利物浦签下的弗林蓬，他此前也和维尔茨一样效力于勒沃库森，现在他们在利物浦再次成为了队友，两人的转会前后相差还不到一个月。女的高潮过后第二次需要多久恢复当时就觉得非常开心，这是一件无论对于球队，还是对于我都是非常值得纪念的事情。看到队友们流泪的时候，我也为他们感到开心和骄傲。
                            

📸 邢淑兰记者范建峰摄

                                20250812 🔞 WW我的快乐在哪里不过，回到本次的C轮融资。值得注意的是，投资方阵容可以称得上是天团级别。中国移动旗下基金、腾讯、锦秋基金、阿里巴巴、蚂蚁集团以及吉利资本，这些名字的出现，本身就足以说明问题。他们不仅仅是财务投资者，更是各自领域的战略投资者。9·1看短视频马洛塔还谈到了世俱杯：“我们已经签下了两名新援，还有一些租借球员归队，大家可以在世俱杯上看到他们。我们对此感到非常自豪。我们知道可以依靠齐沃，他能承担起责任，我们相信他会以归属感和敬业态度推动我们项目的进展。我们以前所未有的方式参加这次新闻发布会，但我们来到这里参赛就证明国米是世界上最强大的球队之一，我们不是来凑数的。尽管这个赛季令人非常疲劳，遇到了一些困难，但齐沃会找到合适的人选。”
                            

📸 熊杰记者高东升摄

                            🔞 汤姆是一位极具天赋的球员，现在甚至已是一名德国国脚了。上赛季他在霍芬海姆是常规首发，并且承担起了责任。他的性格非常适合拜仁和球队，他成长得非常好，我坚信他很快就会在这里有家的感觉。满18岁免费观看高清电视剧推荐