2026-04-20浏览次数

星空手机站登录入口官方渠道 - 星空手机站登录入口

发布者:梁慧丽发布时间:2026-04-20浏览次数:10 更多阅读

共同探讨如何通过状态性反思与结构化经验,从“具身科学智能体”到“记忆强化决策”,本次Workshop邀请了来自UCL、上交大与上财的顶尖学者,赋予智能体真正的持续星空手机站登录入口官方渠道与自进化能力。 更多阅读欢迎所有对本次议题感兴趣的老师、同学和业界朋友前来参会,共同探讨未来图景。

10 更多阅读

1

会议时间

2026年3月12日

2

会议地点

星空手机站登录入口官方渠道第三教学楼西段308会议室



Learning by Stateful Reflection 对照阅读



共同探讨如何通过状态性反思与结构化经


Abstract

We study continual experiential learning in Large Language Model (LLM) agents that integrate episodic memory with reinforcement learning. The central mechanism is reflection, where an agent uses past experiences to guide future decisions without modifying model parameters. Building on ideas from case-based reasoning and the Memento framework (Memento-1 and, Memento-2), we model learning as a memory-driven process in which agents store trajectories, cases, and reusable skills and retrieve them to improve decision making in new situations. To formalise this idea, we introduce the Stateful Reflective Decision Process (SRDP), where an agent maintains evolving memory and performs two operations: write, storing outcomes of interactions (policy evaluation), and read, retrieving relevant experiences to guide actions (policy improvement). We show how this read-write reflective learning can be integrated with reinforcement learning through retrieval-augmented policy iteration and prove that, as memory grows and increasingly covers the state space, the resulting policy converges to the optimal solution. This framework provides a principled foundation for memory-based LLM agents capable of continual adaptation during deployment. We will present our recent practical Memento-Skills agent system that is naturally integrated with existing industry scale LLM application.


Bio

Jun Wang is Professor at the Computer Science department, University College London. Prof. Jun Wang is a leading expert in AI, Machine Learning, and Multiagent Systems, with over 200 publications. His research has earned eight Best Paper awards, including SIGIR Test of Time and Honourable Mentions, and has led to widely adopted algorithms used by Ray and CERN for particle discovery. He won the first global real-time bidding contest (2013) and NeurIPS 2020 black-box optimisation challenge, with solutions now deployed in industry. His patents with BT enhance personalisation in recommender systems by dynamically adjusting training data. As co-founder and Chief Scientist of UCL spinout MediaGamma (2013–2020), he led the development of AI-driven audience decision tools, helping the company secure £5.8M in funding before its acquisition in 2020.




具身科学智能体:面向可持续星空手机站登录入口官方渠道的自驱实验室



从“具身科学智能体”到“记忆强化决策


Abstract

并自主搭建了一套双臂移动机器人实验平台。在电Fenton废水降解任务中,系统需要在超过2亿种参数组合的实验空间中寻找最优条件,成为科学智能化的重要前沿方向。然而,以自驱实验室(self-driving lab)为代表的全自动实验室系统在化学合成、材料发现和药物筛选等领域快速兴起,却几乎不具备真正的“持续星空手机站登录入口官方渠道能力”。认知参数在部署后往往被冻结,实验策略依赖人工编写规则,历史实验经验难以沉淀,每当面对新的科学问题时,一个关键瓶颈正在逐渐显现:现有自动化实验室虽然高度自动化,却无法持续成长。为突破这一限制,其核心是一种“可星空手机站登录入口官方渠道性三位一体”(Triad of Learnability)框架,展示了可星空手机站登录入口官方渠道具身驱动的全自动实验室在加速科学发现方面的巨大潜力。将两名研究人员约30天的实验周期压缩至45小时,使实验室从静态自动化工具进化为持续成长的科学有机体。基于这一框架,我们构建了具身科学智能体(Embodied Scientific Agent, ESA),近年来,系统往往需要重新设计流程、重新调参、重新探索。我们将这一现象称为“机构性失忆”(Institutional Amnesia):实验室能够自动执行,ESA仅通过15轮实验便实现了99.7%的降解效率,包括认知可星空手机站登录入口官方渠道性、实验可星空手机站登录入口官方渠道性和具身可星空手机站登录入口官方渠道性三个相互协同的维度。三者协同,我们提出科学发现的第五范式,


Bio

李阳,,,,




MemRL:记忆强化驱动的智能体自进化探索



本次Workshop邀请了来自UCL


Abstract

该系统不仅在 Humanity's Last Exam (HLE) 通用任务上突破了60%的成功率,本报告提出了一种全新的“大脑-记忆”双核智能体架构——MemRL。该架构系统性地将通用推理能力(“大脑”)与后天领域经验(“记忆”)解耦,在冻结大模型参数的基础上,真正赋予智能体“从运行时经验中星空手机站登录入口官方渠道”的能力。实验表明,MemRL能够利用真实环境反馈持续更新记忆内容与效用权重,外挂基于“意图-经验-效用”三元组的结构化经验池。通过引入作用于记忆的非参数化强化星空手机站登录入口官方渠道机制,面对大模型和智能体在持续迭代时面临的微调成本高、灾难性遗忘以及传统RAG方案缺乏最优效用评估等难题,更在预训练知识严重匮乏的国产昇腾平台CANN算子生成任务中达到了80%以上的正确率,为实现低成本的非破坏性持续星空手机站登录入口官方渠道以及构建未来的“专家记忆”交易市场奠定了坚实的技术基础。


Bio

温睦宁,,,,




注意力全局竞争的消解与重建

——大模型长文本高效推理探索



上交大与上财的顶尖学者


Abstract

通过压缩感知训练让模型主动适应推理压缩;架构层,但也带来了随序列长度爆炸的计算与存储开销。现有提效方案——无论是压缩 KV Cache 还是采用线性注意力——都在不同程度上损害了这一关键能力。本次报告围绕"如何在效率约束下保护与重建注意力的全局竞争"这一核心问题,介绍我们在三个层面的工作:表征层,在线性注意力中以 Head 级 Softmax 重建全局竞争。三者统一于"表征—优化—架构"协同进化的研究框架。大模型长文本推理的核心挑战在于:Softmax Attention 的全局竞争机制赋予了模型精准检索的能力,揭示 KV Cache 的键值非对称性并提出无损压缩框架 AsymKV;优化层,


Bio

崔万云,,,,




在线内容平台的博弈论建模与机制设计



赋予智能体真正的持续星空手机站登录入


Abstract

在线内容平台,如抖音、小红书等,并进一步探讨如何通过机制设计优化平台激励,并持续影响用户的信息获取、消费选择与行为决策。传统研究通常将平台问题聚焦于用户兴趣建模与个性化推荐优化,进而对平台内容生态进行有效引导。从而形成多主体互动、持续反馈的动态结构。本报告将从博弈论视角出发,核心目标在于提升推荐的准确性与匹配效率。然而,当前内容平台本质上已演化为一个由平台算法、用户与内容生产者共同构成的复杂生态系统。内容创作者围绕流量与曝光展开策略性竞争,分析推荐平台中内容生产者之间的策略互动与均衡行为,已经深度融入人们的日常生活,平台算法则会进一步影响内容供给与用户兴趣,


Bio

徐韧喆,,,,,


共同探讨未来图景

搜索
您想要找的

继续阅读

若需了解「星空手机站登录入口官方渠道」的上下文,可结合站内栏目与相关篇目交叉阅读。

栏目用于追新,文内链接用于对照细节。这样安排可减少漏读与重复检索。

列表适合快速定位,正文适合核对表述。两者都保留在站内即可形成完整阅读路径。

学术委员会 | 资料中心 | 科学研究 | 合作交流 | 学术会议 | 实验室概况 | 实验室领导

栏目导航

b8 / f7 / 主页

公开资讯滚动更新。建议通过站内栏目继续浏览,核对最新条目。