Apple 研究:为 Agent LLM 设计共享选择性持久记忆架构
Apple Machine Learning Research 发布论文,提出 Shared Selective Persistent Memory 架构,解决 Agent LLM 系统每次会话从零开始、丢失历史上下文的核心问题。该架构通过选择性保留高价值上下文而非完整历史,既提升 token 效率又改善生成质量,是多轮工具调用 Agent 场景下的重要进展。
Apple Machine Learning Research 发布论文,提出 Shared Selective Persistent Memory 架构,解决 Agent LLM 系统每次会话从零开始、丢失历史上下文的核心问题。该架构通过选择性保留高价值上下文而非完整历史,既提升 token 效率又改善生成质量,是多轮工具调用 Agent 场景下的重要进展。
DeepMind 官方博客介绍 AlphaGenome Atlas:这一平台系统性地绘制了人类基因组 90 亿种单字母 DNA 变异的分子效应,是目前覆盖范围最广的基因组变异影响预测工具,免费向学术界开放。
Apple机器学习研究院提出STARFlow2,通过将自回归归一化流与大型语言模型深度融合,解决了多模态模型在视觉保真度、结构对称性和预训练能力保留之间的长期矛盾。该方法利用归一化流与LLM共享相同的因果掩码和KV缓存机制,实现了文本与图像的真正统一自回归建模。与依赖离散视觉Token或混合扩散架构的现有方案相比,STARFlow2在生成质量和理解能力之间取得了更优的平衡。这是Apple在多模态统一生成领域的重要技术突破。
微软研究院发布 SkillOpt 框架,将 AI Agent 的技能视为可训练参数,通过经验积累自动优化 Agent 在复杂任务上的表现。这一方法突破了传统 Agent 系统中技能固化的瓶颈,为构建自适应 AI 代理提供了新思路。
Apple ML 研究院对超过 2000 次语言模型训练运行进行分析,系统研究稀缺目标数据与大量通用数据的混合比例权衡。研究揭示了数据约束条件下预训练扩展的关键规律,对低资源语言场景有重要指导意义。
API调用不仅是模型名称,还包含推理努力参数。研究在30道AIME 2026题上对比了Sonnet 5显式high-effort与省略effort参数的成本差异:显式high-effort每次调用多花$0.01031,对应精度提升仅+0.0133。结果揭示了推理努力参数作为API合约条款的经济含义。
ASI-Bench 是首个系统评估 AI "创新探索"与"自主科研执行"能力的基准,由40余位专家耗费3.1万人小时构建,涵盖11个科学领域的60项项目级研究任务。测试设计独特:通过逐步撤除方法论指导,考察 AI 能在多大程度上独立完成科研。结果显示,在18种主流 agent-模型配置下,AI 平均得分从有完整指导时的50.91分骤降至完全自主时的26.62分,揭示当前 AI 距真正 ASI 仍有巨大差距。
Hugging Face 官方博客介绍了 Sentence Transformers 对多向量嵌入(Late Interaction,如 ColBERT)的支持。这类模型在查询端和文档端分别生成多个向量并延迟计算相似度,检索质量显著优于单向量嵌入,对 RAG 应用的相关性召回有重要提升意义,且官方直接提供了代码示例。
论文研究了多智能体LLM串联流水线的安全问题。实验表明Stage 1注入的幻觉会在后续阶段不断变形放大:数字变计算、计算变叙述、叙述变结论,每次转换后可检测性大幅下降。研究者用状态机模型形式化了这一错误传播规律,揭示无中间验证节点的串联架构存在系统性风险。
OGX(Open GenAI Stack)是一个开源 AI 应用服务器,统一实现了 OpenAI、Anthropic、Google 三大厂商的 API 接口,支持可插拔后端。开发者只需面向单一 API 编写代码,即可灵活切换推理引擎、向量数据库和安全后端,无需修改应用代码。该项目已支持超过 20 个推理服务商、13 种向量数据库,并提供 Kubernetes Operator 用于生产部署,目前已服务于 Claude Code、Codex CLI、OpenHands 等主流 AI 开发工具,GitHub 累计获星 8400+。
Google DeepMind 发布突破性手语转文字模型 SL2T(sign-language-to-text),已驱动面向聋哑和听障用户的全新手语功能。这是 DeepMind 在 AI 无障碍领域的重要布局,将手语理解能力直接集成进用户产品。
企业部署 AI Agent 速度远超治理能力,CASE 框架将治理分为四层:控制论(单 Agent)、复杂适应系统(Agent 集群涌现)、监督控制论(人机协作)、工程运营(大规模舰队)。研究发现 82% 生产 Agent 故障是跨层事件,22 个生态工具无一提供完整涌现层覆盖,35 个公开部署均处于最低成熟度带,EU AI 法第 14 条要求的有效人类监督在当前架构下形同虚设。
AEROBAT 是首个端到端自动化 AI Agent 行为科学研究的多智能体系统,给定目标行为后可自主完成假设生成、实验设计与执行、行为评估、结果分析和报告撰写。针对 12 个目标行为,系统生成并测试 79 个假设,共执行 23,512 轮仿真,其中 26 个假设获得中强统计证据,包含若干新发现。
研究者通过进化算法构建「思维病毒」——LLM Agent 在对话中可传播给其他 Agent 的隐性目标或行为指令,在协作编程团队和上下文清除的链式 Agent 两种场景中均成功传播。有害载荷比良性变体传播率低,但仍有效;前沿模型相对不易感染;在系统提示中加入简短警告可获得近乎完全的免疫力。
LinkedIn 论文介绍企业级自进化客服 Agent,集成 RAG + 自动提示词进化 + 模块化评估,无需重新训练基础模型即可持续优化。两周 A/B 测试数据:QA 自助服务率提升 9.0 个百分点,退订自助服务率提升 4.8 个百分点,路由准确率提升 30.6 个百分点,同时减少了幻觉现象。
Apple机器学习研究院发表论文,介绍Siri Expressive Voices使用的解耦时序深度扩散Transformer架构,在Apple Matrix Coprocessor的严格计算和内存预算内实现高保真音频合成,基于AFM 3 Core Advanced(Apple最强本地基础模型)。
Hugging Face 推出 Real World VoiceEQ 评测框架,专门衡量语音 AI 的人类质量标准,填补了现有语音评估体系在真实世界场景下的空白。
Hugging Face 官方博客介绍了与 vLLM 集成的原生速度 Transformers 建模后端,为使用 transformers 库的用户提供接近 vLLM 原生性能的推理能力,无需额外迁移成本。
研究在涵盖健康、科学、教育等真实场景的数据集上以有益行为(诚实、公平、风险意识、可纠正性等)训练RL模型,在50多个独立对齐基准中超过80%获得提升。仅限健康领域的RL训练即可改善非健康对齐评估,跨领域迁移效果显著,且提升了对抗提示和有害微调的抵抗能力。
研究在涵盖诚实、公平、风险意识、可纠正性等有益行为数据集上进行RL训练,在50余个独立对齐基准上超过计算匹配基线。关键发现是对齐的跨领域迁移:仅在健康领域的有益训练也能改善非健康领域的对齐,减少奖励黑客和欺骗行为,并提升对对抗提示和有害微调的抗性。
微软研究院推出 MagenticLite 系统及配套的 MagenticBrain 和 Fara1.5 模型,专为小模型设计的 Agentic 体验,支持浏览器与本地文件系统的统一工作流。通过专业化模型编排,在日常任务上实现高效 Agentic 性能,无需依赖大型模型。
微软研究院发布 SocialReasoning-Bench 基准测试,研究发现当前 AI 智能体虽能胜任执行任务,但无法持续优化用户利益,即便明确指示优化也如此。这揭示出当前 agent 在「用户利益优先」上存在系统性缺陷,对 AI 对齐设计有重要意义。
Apple机器学习研究院测试了由9个前沿LLM组成的评委团,发现其实际信息量仅相当于约2票独立投票,约3/4的名义独立性因模型间错误相关而被抵消,严重动摇了LLM-as-a-judge评估范式的可靠性。
Hugging Face 官方博客分享了在 Transformers.js 中实验 Cross-Origin Storage API 提案的进展。该 API 旨在让浏览器端 AI 模型在不同域间共享缓存,减少重复下载,优化 Web AI 应用的模型加载体验。
Andrej Karpathy 发布艺术/教育项目 microgpt,200 行纯 Python 代码实现完整 GPT,涵盖分词器、自动微分引擎、GPT-2 架构、Adam 优化器及训练/推理循环,无任何外部依赖。提供 GitHub Gist、Colab 和艺术印刷品等多种获取方式。
ITNet将CNN、Transformer和RNN(含LSTM/GRU/S4/Mamba)统一为可学习积分变换这一数学对象,核函数由MLP参数化。论文证明三类架构均为其特例,且是连续算子的万能逼近器。单一架构在ImageNet/GLUE/ModelNet40/VQA等5类任务上与专用基线持平或超越。
微软研究院发表论文探讨通过 AI 延伸人类智能,阐述如何将 AI 作为人类认知能力的增强工具而非替代品,为 AI 人机协作提供新的理论框架和研究视角。
Hugging Face 发布深度博文,探讨在最流行的微调方法 LoRA 之外,其他参数高效微调(PEFT)技术的性能表现与适用场景,系统对比不同方法的优劣,为实践者提供选型参考。
Hugging Face PEFT团队发布博文,系统梳理超越LoRA的微调技术,探讨哪些方法在效率和效果上能真正击败这个最流行的参数高效微调方案。对于需要定制化模型的从业者,这篇文章提供了清晰的技术路线对比。
2026年4月16日,NAVI-Orbital系统在低地球轨道卫星上实现史上首次VLM完整在轨自主推理,使用Gemma 3进行场景分类和自然语言描述。AID基准准确率88.16%,无需微调即可处理全新卫星图像,通过语义压缩替代传统大带宽下行链路。
CEO-Bench要求AI Agent在500天模拟中管理初创公司的定价、营销、预算等业务。测试结果:只有Claude Opus 4.8和GPT-5.5能维持100万美元起始资金不亏损,且没有模型能稳定盈利。这是首个评测AI Agent长期自适应商业决策能力的基准。
DeFAb基于40年公开知识库构建可废止溯因推理基准,含372,648+实例。规则求解器50微秒内100%准确率解决所有实例;最佳前沿LLM在鲁棒性评测下仅达23.5%,CoT方差约36个百分点超过所有模型间差距。已在HuggingFace开放发布。
论文介绍滴滴将 LLM 智能体用于实时叫车调度用户画像的生产系统 ProfiLLM。系统配备27个分析工具挖掘平台级数据,通过效用对齐的画像探索和 DPO 微调实现 AUC 提升6.14%,14天在线 A/B 测试 GMV 提升0.47%、取消率降低0.82%。
论文提出 SGCD (Skill-Guided Continuation Distillation),通过让策略在偏离专家轨迹的真实状态下完成任务来生成监督信号,解决了行为克隆面对分布偏移的核心问题。技能从成功和失败案例中提取,包含续轨计划、关键目标、失败陷阱和成功标准。在 OSWorld-Verified 上,SGCD 将三个基础模型的成功率从 30% 量级提升至 50% 以上。
论文提出 Decoupled Search Grounding (DSG),通过 MCP 兼容网关将检索层从推理模型中剥离,实现供应商无关的搜索路由、语义缓存和精确缓存。在 SimpleQA 上,DSG 以 91% 更低的搜索成本匹配原生搜索精度 (86.1% vs 87.7%);在生产电商场景中将搜索成本降低超过 98%,缓存命中率达 99.4%。
arXiv 新论文 RODS 将 RL 训练进度奖励方差作为能力边界检测器,在线合成匹配当前能力边界的多轮工具调用数据,仅需约 800 个动态样本便可媲美 17000 个样本的离线管道,所需轨迹数量减少约 20 倍,解决了 Agent RL 训练中的静态数据耗尽问题。
提出 PrologMCP,通过 MCP 协议为 LLM 智能体提供标准化的 Prolog 调用接口,将复杂逻辑推理委托给符号系统。解决前沿推理模型在深层演绎任务上的失败问题,是 MCP 生态中首个 Prolog 工具标准。
提出 OSGuard,首个专门针对计算机使用智能体安全性的双维度评估基准。研究发现现有智能体频繁通过「不安全捷径」完成任务,任务成功率无法反映真实安全性,填补了 Agent 评估体系的关键空白。
微软研究院推出 SocialReasoning-Bench 基准测试,研究发现当前 AI Agent 普遍存在「执行能力强但不能持续改善用户处境」的模式,即使明确指示也如此。这揭示了 AI Agent 对齐与社会推理能力之间的重大差距。
微软研究院发表论文"LLMs Corrupt Your Documents When You Delegate",揭示LLM在代理工作流中可能悄然修改原始文档的风险,引发对AI委托任务长期可靠性的广泛讨论。