Microsoft Research Blog
提出了一种新颖的推理时学习框架,无需更新模型即可提升大语言模型在推理、代码和决策中的表现,适用范围广泛。 (score: 0.88)
EvoLib是一个框架,使大语言模型能在推理过程中从自身经验中学习,无需真实标签或外部反馈。它将过去的尝试转化为可复用的技能和反思性见解,并通过整合和动态加权不断优化。这使得AI系统无需更新底层模型就能随时间改进,在数学推理、代码生成和决策任务上优于现有基于记忆的方法。
- EvoLib无需外部反馈或模型更新,实现经验驱动的自监督学习。
- 将原始经验转化为可复用的技能和反思性见解。
- 通过整合和动态加权持续优化知识。
- 学到的技能可跨任务迁移,性能随时间提升。
- 在多个基准上超越现有基于记忆的方法。
- 对随机任务顺序具有鲁棒性,适合实际应用。
self-supervised learning / memory / knowledge evolution / large language models / AI agents / test-time learning / skill acquisition / transfer learning / Microsoft Research
Microsoft Research Blog
为计算机使用智能体提供高保真合成环境套件,实证提升显著,并为训练与评估提供了实用经验。 (score: 0.85)
微软研究院推出Echoverse,这是一个由十二个合成环境组成的套件,用于训练计算机使用智能体。这些环境优先考虑深度和保真度而非数量,重现真实应用行为,并具有可验证的任务。一个9B模型在全部十二个环境上训练后,基础性能几乎翻倍(从36.5%提升到67.1%),与GPT-5.4的差距缩小到14个百分点。关键经验包括高仿真保真度的必要性、针对特定UI能力(如日期选择器和嵌套过滤器)的价值,以及共同演化模型、环境和验证器的益处。强化学习进一步提升了智能体的能力,超越了模仿学习。
- Echoverse提供十二个用于计算机使用智能体的合成环境,注重深度和行为保真度。
- 在全部环境上训练9B模型,基础分数几乎翻倍(从36.5%到67.1%),接近GPT-5.4性能。
- 浅层环境损害智能体性能,而具有连贯状态的深层环境能更好地迁移到真实网站。
- 针对特定UI控件(如日期选择器和嵌套过滤器)的训练能泛化到未见过的布局。
- 环境、任务和验证器与模型共同演化,形成复合改进循环。
- 使用基于数据库的验证器进行强化学习,提升保留性能并减少达成目标的步数。
- 开源四个环境以支持高保真计算机使用环境的研究。
computer-use agents / synthetic environments / Echoverse / reinforcement learning / simulation fidelity / UI controls / co-evolution / Microsoft Research / GPT-5.4 / deep learning / web agents / training data
GitHub Blog
展示了在 Copilot 中使用堆叠会话和拉取请求处理大规模重构、避免范围蔓延的实用工作流程。 (score: 0.78)
Cassidy Williams 讲述了使用 GitHub Copilot 应用现代化一个十年前的 React 应用的经验。最初的一次性 AI 计划因忽略了一个开发分支而失败。Copilot 应用随后自动创建了堆叠会话和拉取请求,使她能够将工作分解为可管理的、链式变更。这一功能帮助避免了庞大的拉取请求,使大规模重构变得高效且无挫败感。
- 作者使用 GitHub Copilot 应用现代化一个十年前的 React 应用。
- 一次性 AI 计划因未考虑开发分支更改而失败。
- Copilot 创建堆叠会话管理范围蔓延。
- 堆叠拉取请求实现依赖变更的链式处理。
- 该工具使大规模重构变得可控且高效。
- 该功能自动分叉工作以避免巨型拉取请求。
- 作者认为体验神奇且高效。
GitHub Copilot / GitHub Copilot app / pull requests / stacked pull requests / stacked sessions / modernization / AI-assisted development / scope creep