GitHub Blog
评估了GitHub Copilot代理框架在多种模型上的表现,展示了具有竞争力的任务解决率和更低的令牌消耗;对于评估多模型策略的AI开发者至关重要。 (score: 0.85)
GitHub Copilot 代理框架为多种 Copilot 体验提供支持。在四种领先模型上的评估表明,它在任务解决率上与模型厂商的框架相当,同时在许多配置下使用更少的令牌。该框架支持 20 多种模型,提供多模型灵活性,使用户能够为每个任务选择最佳模型。在 TerminalBench 2.0 上的运行间方差分析展示了其具有竞争力的性能和成本效率。
- GitHub Copilot 代理框架在基准测试中与模型厂商框架的任务解决率持平。
- 在大多数配置下,它的令牌消耗量低于其他方案。
- 该框架支持 20 多种前沿模型,包括 GPT、Claude、Gemini 和 MAI 系列。
- 多模型架构支持跨模型批评(如 Rubber Duck)以改进结果。
- 运行间方差分析显示其性能稳定且成本高效。
- 用户可以根据不同成本和质量的权衡选择模型。
- 该框架为多个 GitHub Copilot 体验提供支持,包括 CLI、应用程序和代码审查。
agentic AI / benchmarking / GitHub Copilot / token efficiency / multi-model / CLI / code review
Microsoft Research Blog
引入生成式因果测试来解释大脑预测,连接人工智能与神经科学;对可解释人工智能和认知科学领域的研究者具有重要价值。 (score: 0.75)
生成式因果测试(GCT)由微软研究院与合作者开发,将黑箱大脑预测模型转化为简短、可检验的言语解释。GCT利用大语言模型识别驱动脑区反应的短语,然后编写新故事以在功能磁共振成像中激活该区域。实验证实了已知的选择性,区分了相邻的场所处理区域,并发现了对对话、时间等特定概念敏感的前额叶微小区域。该方法连接了预测模型与科学理论,提供了假设生成与检验的闭环途径。
- 基于大语言模型的大脑预测模型虽准确但不可解释。
- GCT将这些模型提炼为简短的语言解释,如‘食物准备’或‘地点名称’。
- 随后大语言模型编写新故事,在功能磁共振成像中激活目标脑区。
- 实验证实了已知的选择性,并发现了新的前额叶微小区域。
- GCT通过精细测试区分了相邻的场所处理区域(RSC、PPA、OPA)。
- 该方法在三位受试者上得到验证,并发表于《自然·神经科学》。
Generative Causal Testing / brain prediction / LLM / neuroscience / fMRI / explainability / Microsoft Research / Nature Neuroscience / language / cortex