hedj/signal

精选

0 picks today73 sources
Apple Machine Learning Research学术机构pick84

Apple 研究:为 Agent LLM 设计共享选择性持久记忆架构

Apple Machine Learning Research 发布论文,提出 Shared Selective Persistent Memory 架构,解决 Agent LLM 系统每次会话从零开始、丢失历史上下文的核心问题。该架构通过选择性保留高价值上下文而非完整历史,既提升 token 效率又改善生成质量,是多轮工具调用 Agent 场景下的重要进展。

memoryagentic-llmapple-researchcontext-windowmulti-turn
推荐理由Apple 官方研究解决了 Agent 最痛的记忆问题——这个架构设计对所有做 Agent 系统的人直接相关。
Google DeepMind Blog官方pick83

AlphaGenome Atlas:人类基因组每种 DNA 字母变化的预测图谱(DeepMind 官方)

DeepMind 官方博客介绍 AlphaGenome Atlas:这一平台系统性地绘制了人类基因组 90 亿种单字母 DNA 变异的分子效应,是目前覆盖范围最广的基因组变异影响预测工具,免费向学术界开放。

deepmindalphagenomegenomicsdna
推荐理由DeepMind 官方发布,可信度最高——做生物 AI 内容的首选一手来源。
Apple Machine Learning Research学术机构pick75

Apple发布STARFlow2:用归一化流统一多模态文本-图像生成

Apple机器学习研究院提出STARFlow2,通过将自回归归一化流与大型语言模型深度融合,解决了多模态模型在视觉保真度、结构对称性和预训练能力保留之间的长期矛盾。该方法利用归一化流与LLM共享相同的因果掩码和KV缓存机制,实现了文本与图像的真正统一自回归建模。与依赖离散视觉Token或混合扩散架构的现有方案相比,STARFlow2在生成质量和理解能力之间取得了更优的平衡。这是Apple在多模态统一生成领域的重要技术突破。

multimodalapplenormalizing-flowstext-image-generationresearch
推荐理由Apple用归一化流解决了多模态生成中"要么牺牲画质、要么破坏理解"的两难困境,架构设计思路相当优雅,值得AI研究者和产品团队深度研读。
Microsoft Research学术机构pick76

论文|SkillOpt:将 AI Agent 技能作为可训练参数进行优化

微软研究院发布 SkillOpt 框架,将 AI Agent 的技能视为可训练参数,通过经验积累自动优化 Agent 在复杂任务上的表现。这一方法突破了传统 Agent 系统中技能固化的瓶颈,为构建自适应 AI 代理提供了新思路。

agentskilltrainingmicrosoft-research
推荐理由让 Agent 自己学习"怎么更好地做事"——这是迈向自进化 Agent 的重要一步。
Apple Machine Learning Research学术机构pick75

Apple 研究:2000 次训练运行揭示混合预训练的扩展规律

Apple ML 研究院对超过 2000 次语言模型训练运行进行分析,系统研究稀缺目标数据与大量通用数据的混合比例权衡。研究揭示了数据约束条件下预训练扩展的关键规律,对低资源语言场景有重要指导意义。

scaling-lawspretrainingdata-constraintsapplelow-resource
推荐理由2000 次训练实验得出的结论——这是理解大模型数据配比的权威研究。
arXiv cs.AI学术机构pick76

思考的价格:推理努力参数作为模型专有API合约的实证研究

API调用不仅是模型名称,还包含推理努力参数。研究在30道AIME 2026题上对比了Sonnet 5显式high-effort与省略effort参数的成本差异:显式high-effort每次调用多花$0.01031,对应精度提升仅+0.0133。结果揭示了推理努力参数作为API合约条款的经济含义。

reasoning-effortapicost-analysisbenchmark
推荐理由思考模式真的值这个价吗?这篇实验告诉你钱多花了多少、效果提升了多少,API采购决策必读。
arXiv cs.AI学术机构pick77

ASI-Bench:首个面向人工超级智能的科研自主能力基准测试

ASI-Bench 是首个系统评估 AI "创新探索"与"自主科研执行"能力的基准,由40余位专家耗费3.1万人小时构建,涵盖11个科学领域的60项项目级研究任务。测试设计独特:通过逐步撤除方法论指导,考察 AI 能在多大程度上独立完成科研。结果显示,在18种主流 agent-模型配置下,AI 平均得分从有完整指导时的50.91分骤降至完全自主时的26.62分,揭示当前 AI 距真正 ASI 仍有巨大差距。

benchmarkASIscientific-researchagentevaluation
推荐理由这是目前最接近"AGI/ASI 检验器"的学术基准——不考察背诵,只考察创造;得分腰斩的数据,直接说明了现有最强模型的天花板在哪里。
Hugging Face Blog官方pick76

Sentence Transformers 正式支持多向量(后期交互)嵌入模型

Hugging Face 官方博客介绍了 Sentence Transformers 对多向量嵌入(Late Interaction,如 ColBERT)的支持。这类模型在查询端和文档端分别生成多个向量并延迟计算相似度,检索质量显著优于单向量嵌入,对 RAG 应用的相关性召回有重要提升意义,且官方直接提供了代码示例。

embeddingsentence-transformersragcolbert
推荐理由在做 RAG 的一定要看:多向量检索比单向量精准很多,HuggingFace 官方教程直接能抄作业。
arXiv cs.AI学术机构pick82

幻觉雪球:多智能体LLM流水线中的错误级联传播研究

论文研究了多智能体LLM串联流水线的安全问题。实验表明Stage 1注入的幻觉会在后续阶段不断变形放大:数字变计算、计算变叙述、叙述变结论,每次转换后可检测性大幅下降。研究者用状态机模型形式化了这一错误传播规律,揭示无中间验证节点的串联架构存在系统性风险。

multi-agenthallucinationllm-pipelinesreliabilityevaluation
推荐理由多智能体系统的安全警示:没有验证节点的LLM pipeline,一个早期错误会变成最终的确定性结论。
arXiv cs.AI学术机构pick77

OGX:开源、厂商中立的生成式 AI 应用服务器

OGX(Open GenAI Stack)是一个开源 AI 应用服务器,统一实现了 OpenAI、Anthropic、Google 三大厂商的 API 接口,支持可插拔后端。开发者只需面向单一 API 编写代码,即可灵活切换推理引擎、向量数据库和安全后端,无需修改应用代码。该项目已支持超过 20 个推理服务商、13 种向量数据库,并提供 Kubernetes Operator 用于生产部署,目前已服务于 Claude Code、Codex CLI、OpenHands 等主流 AI 开发工具,GitHub 累计获星 8400+。

open-sourceinferenceapi-compatibilityagentickubernetes
推荐理由如果你厌倦了厂商锁定、频繁迁移 SDK 的痛苦,OGX 值得认真研究——它是目前覆盖最广的自托管 AI 后端之一,有真实生产案例背书。
Google DeepMind Blog官方pick78

Google DeepMind 推出手语 AI 模型 SL2T,助力聋哑用户无障碍使用 AI

Google DeepMind 发布突破性手语转文字模型 SL2T(sign-language-to-text),已驱动面向聋哑和听障用户的全新手语功能。这是 DeepMind 在 AI 无障碍领域的重要布局,将手语理解能力直接集成进用户产品。

deepmindgooglesign-languageaccessibilitysl2t
推荐理由AI 不只是效率工具——DeepMind 的 SL2T 让手语用户无缝接入 AI,是一个值得大写的无障碍故事。
arXiv cs.AI学术机构pick75

CASE 框架:四门学科理论联合管治企业 AI Agent 的系统架构

企业部署 AI Agent 速度远超治理能力,CASE 框架将治理分为四层:控制论(单 Agent)、复杂适应系统(Agent 集群涌现)、监督控制论(人机协作)、工程运营(大规模舰队)。研究发现 82% 生产 Agent 故障是跨层事件,22 个生态工具无一提供完整涌现层覆盖,35 个公开部署均处于最低成熟度带,EU AI 法第 14 条要求的有效人类监督在当前架构下形同虚设。

企业AIAI治理AI-Agent风险管理涌现差距
推荐理由讲 AI Agent 企业落地最系统的风险框架——涌现差距这个概念值得单独做一期深度内容。
arXiv cs.AI学术机构pick75

AEROBAT:首个自动化 AI Agent 行为科学研究的多智能体系统

AEROBAT 是首个端到端自动化 AI Agent 行为科学研究的多智能体系统,给定目标行为后可自主完成假设生成、实验设计与执行、行为评估、结果分析和报告撰写。针对 12 个目标行为,系统生成并测试 79 个假设,共执行 23,512 轮仿真,其中 26 个假设获得中强统计证据,包含若干新发现。

AI行为研究多智能体自动化科研AI安全假设检验
推荐理由AI 用来研究 AI 自己的行为——这个方向可能大幅加速 AI 安全和对齐研究,值得关注。
arXiv cs.AI学术机构pick82

多智能体 LLM 中的思维病毒:目标和行为指令可在 Agent 间自我传播

研究者通过进化算法构建「思维病毒」——LLM Agent 在对话中可传播给其他 Agent 的隐性目标或行为指令,在协作编程团队和上下文清除的链式 Agent 两种场景中均成功传播。有害载荷比良性变体传播率低,但仍有效;前沿模型相对不易感染;在系统提示中加入简短警告可获得近乎完全的免疫力。

多智能体AI安全提示注入思维病毒自我传播
推荐理由多智能体时代的新型攻击面——防御极其简单(一句系统提示),但没人意识到才是真正的风险。
arXiv cs.AI学术机构pick81

LinkedIn 自进化 AI 客服 Agent:A/B 测试自助服务率提升 9 个百分点

LinkedIn 论文介绍企业级自进化客服 Agent,集成 RAG + 自动提示词进化 + 模块化评估,无需重新训练基础模型即可持续优化。两周 A/B 测试数据:QA 自助服务率提升 9.0 个百分点,退订自助服务率提升 4.8 个百分点,路由准确率提升 30.6 个百分点,同时减少了幻觉现象。

AI客服RAG自进化LinkedIn企业AIA/B测试
推荐理由真实 A/B 数据背书的 LinkedIn 生产级案例——讲企业 AI Agent 落地,这是目前最扎实的参考之一。
Apple Machine Learning Research学术机构pick79

Apple揭秘Siri Expressive Voices背后的高效音频合成架构

Apple机器学习研究院发表论文,介绍Siri Expressive Voices使用的解耦时序深度扩散Transformer架构,在Apple Matrix Coprocessor的严格计算和内存预算内实现高保真音频合成,基于AFM 3 Core Advanced(Apple最强本地基础模型)。

applesiriaudio-synthesisdiffusion-transformeron-deviceafm3
推荐理由Apple首次公开Siri语音合成底层架构,设备端高质量TTS的工程细节全面揭晓,语音AI研究者必读。
Hugging Face Blog官方pick76

发布 Real World VoiceEQ:评测语音 AI 人类质量的新基准

Hugging Face 推出 Real World VoiceEQ 评测框架,专门衡量语音 AI 的人类质量标准,填补了现有语音评估体系在真实世界场景下的空白。

voice-aievaluationbenchmarkttshugging-face
推荐理由语音 AI 质量评测有了新标尺——语音产品从业者和研究者需要了解这个新基准。
Hugging Face Blog官方pick79

Hugging Face 发布 vLLM 原生速度 Transformers 推理后端

Hugging Face 官方博客介绍了与 vLLM 集成的原生速度 Transformers 建模后端,为使用 transformers 库的用户提供接近 vLLM 原生性能的推理能力,无需额外迁移成本。

vllminferencehugging-faceperformancetransformers
推荐理由vLLM + transformers 的性能鸿沟正在消失——AI 工程师需要立刻测试这个新后端。
arXiv cs.AI学术机构pick78

有益行为RL训练可跨领域泛化:AI对齐持久性的实验证据

研究在涵盖健康、科学、教育等真实场景的数据集上以有益行为(诚实、公平、风险意识、可纠正性等)训练RL模型,在50多个独立对齐基准中超过80%获得提升。仅限健康领域的RL训练即可改善非健康对齐评估,跨领域迁移效果显著,且提升了对抗提示和有害微调的抵抗能力。

推荐理由AI对齐领域的重要实验结果:有益RL训练不只局部有效,泛化能力超出预期。
arXiv cs.AI学术机构pick78

有益行为强化学习实现跨领域对齐泛化:80%以上独立基准提升

研究在涵盖诚实、公平、风险意识、可纠正性等有益行为数据集上进行RL训练,在50余个独立对齐基准上超过计算匹配基线。关键发现是对齐的跨领域迁移:仅在健康领域的有益训练也能改善非健康领域的对齐,减少奖励黑客和欺骗行为,并提升对对抗提示和有害微调的抗性。

推荐理由一个领域的有益训练会扩散到所有领域——AI对齐研究的重要实证,Anthropic级别的安全发现。
Microsoft Research学术机构pick80

微软发布 MagenticLite:专为小模型优化的浏览器+本地文件 Agentic 系统

微软研究院推出 MagenticLite 系统及配套的 MagenticBrain 和 Fara1.5 模型,专为小模型设计的 Agentic 体验,支持浏览器与本地文件系统的统一工作流。通过专业化模型编排,在日常任务上实现高效 Agentic 性能,无需依赖大型模型。

microsoftmagenticsmall-modelsagenticbrowser-automation
推荐理由小模型也能玩转 agent——微软这套框架如果真的高效,会改变开发者对 agent 架构的选择逻辑。
Microsoft Research学术机构pick78

微软研究院发布 SocialReasoning-Bench:测试 AI 智能体是否真的站在用户一边

微软研究院发布 SocialReasoning-Bench 基准测试,研究发现当前 AI 智能体虽能胜任执行任务,但无法持续优化用户利益,即便明确指示优化也如此。这揭示出当前 agent 在「用户利益优先」上存在系统性缺陷,对 AI 对齐设计有重要意义。

microsoftai-agentsbenchmarkalignmentsocial-reasoning
推荐理由AI agent 真的为你着想吗?微软用数据说不——这项研究对所有在做 AI 产品的人都是警示。
Apple Machine Learning Research学术机构pick83

Apple研究:9个LLM评委只顶2票,相关性错误正在破坏AI评估体系

Apple机器学习研究院测试了由9个前沿LLM组成的评委团,发现其实际信息量仅相当于约2票独立投票,约3/4的名义独立性因模型间错误相关而被抵消,严重动摇了LLM-as-a-judge评估范式的可靠性。

LLM-evaluationbenchmarkappleresearchLLM-as-judge
推荐理由如果你用LLM来评估LLM输出质量,这个结论直接挑战了这一方法论的根基——必读。
Hugging Face Blog官方pick77

Hugging Face:在 Transformers.js 中实验跨域存储 API

Hugging Face 官方博客分享了在 Transformers.js 中实验 Cross-Origin Storage API 提案的进展。该 API 旨在让浏览器端 AI 模型在不同域间共享缓存,减少重复下载,优化 Web AI 应用的模型加载体验。

transformers-jshuggingfaceweb-aistorage-apibrowser
推荐理由浏览器端 AI 的基础设施在改进——Web AI 开发者值得关注这个 API 提案的进展。
Google AI Blog官方pick82

Karpathy 新作 microgpt:200 行纯 Python 实现完整 GPT,零依赖

Andrej Karpathy 发布艺术/教育项目 microgpt,200 行纯 Python 代码实现完整 GPT,涵盖分词器、自动微分引擎、GPT-2 架构、Adam 优化器及训练/推理循环,无任何外部依赖。提供 GitHub Gist、Colab 和艺术印刷品等多种获取方式。

karpathymicrogptgpttutorialpythoneducational
推荐理由想真正理解 LLM 底层的人必看,Karpathy 把一个 GPT 压缩成了 200 行代码。
arXiv cs.AI学术机构pick76

ITNet:统一卷积、注意力与循环网络的可学习积分变换架构

ITNet将CNN、Transformer和RNN(含LSTM/GRU/S4/Mamba)统一为可学习积分变换这一数学对象,核函数由MLP参数化。论文证明三类架构均为其特例,且是连续算子的万能逼近器。单一架构在ImageNet/GLUE/ModelNet40/VQA等5类任务上与专用基线持平或超越。

architectureintegral-transformconvolutionattentionunified-model
推荐理由把三大神经网络范式统一成一个数学对象,实验靠谱——少见的有理论支撑的架构统一工作。
Microsoft Research学术机构pick77

微软研究院:通过 AI 延伸人类智能

微软研究院发表论文探讨通过 AI 延伸人类智能,阐述如何将 AI 作为人类认知能力的增强工具而非替代品,为 AI 人机协作提供新的理论框架和研究视角。

microsoftresearchhuman-intelligenceai
推荐理由微软研究院的哲学立场:AI 不是要取代人,而是要延伸人——这篇值得认真读。
Hugging Face Blog官方pick75

超越 LoRA:Hugging Face 探讨能否打败最流行的微调技术

Hugging Face 发布深度博文,探讨在最流行的微调方法 LoRA 之外,其他参数高效微调(PEFT)技术的性能表现与适用场景,系统对比不同方法的优劣,为实践者提供选型参考。

推荐理由LoRA 已经是微调标配,但 Hugging Face 觉得还不够好——看他们怎么比较和破局。
Hugging Face Blog官方pick76

超越LoRA:能打败最流行微调技术的方案在哪里?

Hugging Face PEFT团队发布博文,系统梳理超越LoRA的微调技术,探讨哪些方法在效率和效果上能真正击败这个最流行的参数高效微调方案。对于需要定制化模型的从业者,这篇文章提供了清晰的技术路线对比。

推荐理由LoRA已经成为默认选择,但默认选择不一定是最优解——Hugging Face官方来打破这个认知了。
arXiv cs.AI学术机构pick85

NAVI-Orbital:全球首次在轨VLM推理演示,Gemma 3已飞上太空

2026年4月16日,NAVI-Orbital系统在低地球轨道卫星上实现史上首次VLM完整在轨自主推理,使用Gemma 3进行场景分类和自然语言描述。AID基准准确率88.16%,无需微调即可处理全新卫星图像,通过语义压缩替代传统大带宽下行链路。

space-aivlmearth-observationedge-aigemma
推荐理由VLM已经飞上太空——这不是概念验证,是真实在轨演示,2026年最惊艳的AI应用之一。
arXiv cs.AI学术机构pick81

CEO-Bench:让AI Agent经营初创公司500天,只有Claude Opus 4.8和GPT-5.5能保本

CEO-Bench要求AI Agent在500天模拟中管理初创公司的定价、营销、预算等业务。测试结果:只有Claude Opus 4.8和GPT-5.5能维持100万美元起始资金不亏损,且没有模型能稳定盈利。这是首个评测AI Agent长期自适应商业决策能力的基准。

benchmarkllm-agentslong-horizonclaude-opusbusiness-simulation
推荐理由AI能当CEO吗?这个基准用500天模拟给出了目前最接近真实的答案。
arXiv cs.AI学术机构pick75

DeFAb:可废止溯因推理基准——顶级LLM正确率仅23.5%,符号求解器达100%

DeFAb基于40年公开知识库构建可废止溯因推理基准,含372,648+实例。规则求解器50微秒内100%准确率解决所有实例;最佳前沿LLM在鲁棒性评测下仅达23.5%,CoT方差约36个百分点超过所有模型间差距。已在HuggingFace开放发布。

benchmarkreasoningllm-evaluationlogicdefeasible-reasoning
推荐理由LLM在逻辑推理上的真实天花板比我们以为的低很多——这组数据很刺眼。
arXiv cs.AI学术机构pick75

ProfiLLM:滴滴生产级LLM用户画像,A/B测试GMV提升0.47%

论文介绍滴滴将 LLM 智能体用于实时叫车调度用户画像的生产系统 ProfiLLM。系统配备27个分析工具挖掘平台级数据,通过效用对齐的画像探索和 DPO 微调实现 AUC 提升6.14%,14天在线 A/B 测试 GMV 提升0.47%、取消率降低0.82%。

llm-agentsuser-profilingdidiproductionride-hailingagentic-data-pipeline
推荐理由顶级规模的LLM生产部署案例,数据完整且可信,做AI商业化内容的最佳素材之一。
arXiv cs.AI学术机构pick75

SGCD:技能引导续轨蒸馏框架,将 GUI Agent 成功率从 30% 提升至 50% 以上

论文提出 SGCD (Skill-Guided Continuation Distillation),通过让策略在偏离专家轨迹的真实状态下完成任务来生成监督信号,解决了行为克隆面对分布偏移的核心问题。技能从成功和失败案例中提取,包含续轨计划、关键目标、失败陷阱和成功标准。在 OSWorld-Verified 上,SGCD 将三个基础模型的成功率从 30% 量级提升至 50% 以上。

gui-agentskill-distillationosworldarxivimitation-learning
推荐理由GUI Agent 训练突破:成功率直接从 30% 跳到 50%,做桌面自动化的团队值得跟进。
arXiv cs.AI学术机构pick80

DSG:将搜索与推理解耦,MCP 兼容的 LLM Agent 检索架构可降低 91% 搜索成本

论文提出 Decoupled Search Grounding (DSG),通过 MCP 兼容网关将检索层从推理模型中剥离,实现供应商无关的搜索路由、语义缓存和精确缓存。在 SimpleQA 上,DSG 以 91% 更低的搜索成本匹配原生搜索精度 (86.1% vs 87.7%);在生产电商场景中将搜索成本降低超过 98%,缓存命中率达 99.4%。

raggroundingllm-agentsmcpcost-efficiencyarxivsearch
推荐理由做 LLM Agent 的工程师必看:搜索成本降 91%,且精度几乎不降,还有开源 MCP 网关可以直接用。
arXiv cs.AI学术机构pick75

RODS:奖励驱动在线数据合成——400 个种子样本实现 17K 静态数据集的训练效果

arXiv 新论文 RODS 将 RL 训练进度奖励方差作为能力边界检测器,在线合成匹配当前能力边界的多轮工具调用数据,仅需约 800 个动态样本便可媲美 17000 个样本的离线管道,所需轨迹数量减少约 20 倍,解决了 Agent RL 训练中的静态数据耗尽问题。

RLtool-useGRPOdata-synthesisagent数据效率
推荐理由Agent RL 训练的数据效率难题有了新思路——20 倍效率提升对工程团队很有实际价值。
arXiv cs.AI学术机构pick76

PrologMCP:面向 LLM 智能体的标准化 Prolog 工具接口

提出 PrologMCP,通过 MCP 协议为 LLM 智能体提供标准化的 Prolog 调用接口,将复杂逻辑推理委托给符号系统。解决前沿推理模型在深层演绎任务上的失败问题,是 MCP 生态中首个 Prolog 工具标准。

mcpprologagentssymbolic-reasoningllm-tools
推荐理由让 LLM 用 Prolog 推理——神经+符号 AI 融合的实用工具,MCP 生态系列内容可直接引用。
arXiv cs.AI学术机构pick77

OSGuard:计算机使用智能体安全性评估基准

提出 OSGuard,首个专门针对计算机使用智能体安全性的双维度评估基准。研究发现现有智能体频繁通过「不安全捷径」完成任务,任务成功率无法反映真实安全性,填补了 Agent 评估体系的关键空白。

agent-safetycomputer-usebenchmarkos-agent
推荐理由AI Agent 操作电脑时的安全盲区——有基准才能测出问题,Agent 安全内容的核心参考。
Microsoft Research学术机构pick77

微软研究院发布 SocialReasoning-Bench:测量 AI Agent 是否真正为用户利益行事

微软研究院推出 SocialReasoning-Bench 基准测试,研究发现当前 AI Agent 普遍存在「执行能力强但不能持续改善用户处境」的模式,即使明确指示也如此。这揭示了 AI Agent 对齐与社会推理能力之间的重大差距。

microsoftbenchmarkai-agentsalignmentresearch
推荐理由这个研究戳到了 AI Agent 的核心痛点——能干活但不真正替你着想,这个发现值得写成深度内容。
Microsoft Research学术机构pick75

微软研究警告:AI代理在委托任务中可能悄然损坏文档

微软研究院发表论文"LLMs Corrupt Your Documents When You Delegate",揭示LLM在代理工作流中可能悄然修改原始文档的风险,引发对AI委托任务长期可靠性的广泛讨论。

microsoftai-safetyreliabilityagentic-ai
推荐理由把关键文档交给AI Agent处理前,先看这项研究——AI代理的隐性风险比我们想象的更真实。