🔬 找论文的方法论
Provider: Brave (广覆盖) + Tavily (AI优化) + 多provider交叉验证
关键词组合: "agent compression" / "agent"+"KV cache"+"pruning"+"context" / "trajectory compression" / "skill compression" / "multi-agent"+"pruning"
时间范围: 最近半年 2025-12 ~ 2026-05,重点 2026 年新论文
策略: 核心关键词出发 → 逐步扩展子方向 → 追踪引用和被引用
💡 核心洞察
⭐ Missing Diagonal
20+ 系统都在固定压缩级别运作,无自适应跨级压缩。这是 Experience Compression Spectrum (2604.15877) 发现的核心 gap——memory 系统和 skills 系统各自运作,从不交换解法。
🔗 社区割裂
Memory 和 Skills 两个社区互相不引用(cross-citation < 1%)。两个社区解决的是同一个子问题,但解决方案从不共享。
📊 Retrieval > Write
诊断研究 (2603.02473) 发现:检索方法主导准确率(跨度 20pts),写策略(chunk/summarize/extract)仅 3-8pts 差异。先提升检索质量比改写策略更重要。
🎯 Less is More
SkillReducer (2603.29919) 发现:删除非必要内容反而提升性能 +2.8%。55,315 个 skills 的实证研究表明 over-informative 才是问题,less-is-more 减少注意力分散。
⚡ Speculative 爆发
PASTE / SpecHop / Speculative Actions / SpecBound — 多个工作同时探索投机型执行。核心洞察:agent 虽然语义多样,但应用层控制流稳定 + 工具间参数传递可预测。
🧠 记忆分层成主流
STM/MTM/LTM 三层 (LightMem) 或 I/O-Cache-Memory 三层 (MemTier) 架构成为共识。关键问题:各层之间如何路由?检索权重如何学习?
📂 各方向概览
📦 1. 轨迹压缩 4篇
核心问题:agent 多轮交互产生的历史轨迹越来越长,里面充满无用、过期、冗余的信息。轨迹压缩在推理时识别并删掉这些垃圾。
💾 2. 计划/上下文缓存 3篇
核心问题:相同/相似任务的计划可以被复用,不需要每次都从头推理。用缓存跨越任务复用结构化计划模板。
🧠 3. 记忆压缩 7篇
核心问题:agent 的外部记忆(外部知识库、向量库)随时间爆炸,检索质量和延迟都成问题。记忆压缩研究如何组织、压缩、检索长期记忆。
🔗 4. 多智能体通信剪枝 4篇
核心问题:多个 agent 协作时,agent 之间的通信消息太多,很多是冗余的。通信图剪枝减少消息量同时保持协作质量。
🛠️ 5. 技能/提示压缩 5篇
核心问题:agent 的 skill(预包装的指令集)内容太长,每个 token 都消耗成本和注意力。压缩 skill 描述和 body,去除非必要内容。
⚖️ 6. 模型压缩对 Agent 影响 4篇
核心问题:量化/pruning 对 agent 能力的影响是否和对普通 LLM 一样?planning 和 tool use 哪个更受影响?4-bit 量化 agent 还能用吗?
💨 7. KV Cache 优化 7篇
核心问题:agent 推理过程中 KV cache 爆炸性增长,内存不够。KV cache 压缩/管理/持久化研究如何在有限内存下高效服务 agent。
⚡ 8. 推理加速 (Speculative) 7篇
核心问题:agent 的 LLM-tool 循环是串行的,每步都要等工具执行完成。投机型执行让工具和 LLM 并行,隐藏延迟。
📚 9. Agent Memory 系统综述 2篇
核心问题:从系统角度梳理 agent 记忆的设计、实现、评估方式。write-manage-read 循环如何与感知和行动耦合。
🌟 10. Experience Compression 综述 4篇
核心问题:memory / skills / rules 本质上都是"压缩经验"的不同形式。它们在同一个压缩轴上处于不同位置,自适应跨级压缩是 open challenge。
💻 11. Coding Agent 特化压缩 3篇
核心问题:coding agent 的上下文主要是代码文件,代码有独特的语义结构(函数边界、依赖关系),通用压缩方法破坏语法/逻辑结构。
🏗️ 12. System Co-Design 4篇
核心问题:算法和系统需要协同设计才能高效服务 agent 工作负载。单独优化某一块(调度/caching/compression)不够,需要整体考虑。
🔍 13. 检索/RAG 压缩 2篇
核心问题:RAG 场景下检索回来的 context 太多太杂,需要剪枝。多语言场景的零成本上下文压缩也在探索。
📦 方向1 · 轨迹压缩 (Trajectory Compression)
做什么方向: agent 在多轮交互中产生的对话历史、行动轨迹越来越长。这些轨迹里充斥着无用(useless)、冗余(redundant)、过期(expired)的信息。轨迹压缩在推理时(inference-time)检测并删除这些垃圾,不需要重新训练。
📅 2025-09 · 📖 13 citations · 微软系?
这篇论文做什么: 在 coding agent 的轨迹中,系统性地识别三类垃圾:无用的信息(agent 执行中产生但对下一步没价值的)、冗余的信息(重复说过的事实/代码)、过期的信息(已经被环境改变的旧状态)。然后在推理时自动删除这些垃圾,不影响 agent 表现。
📊 token 减少 39.9-59.7%,计算成本降低 21.1-35.9%,同时保持相同任务成功率
trajectory reduction
inference-time
agent waste detection
context pruning
📅 2025-10 · 📖 33 citations · 🔗 Microsoft github
这篇论文做什么: 微软出品。核心方法叫"compression guideline optimization"——给定一对轨迹(全上下文成功但压缩后失败),用强 LLM 分析失败原因,然后更新压缩指南(用自然语言描述的优化规则)。关键创新是 distillation:用这个流程优化后的压缩 LLM 可以蒸馏到小模型,降低额外开销。
📊 peak token 减少 26-54%,蒸馏到小模型后小模型性能提升 up to 46%
compression guideline optimization
failure-driven
distillation
natural language space
📅 2026-05 (很新)
这篇论文做什么: 解决 compaction(压缩轨迹为 summary)的一个根本问题——compactor 不知道 agent 之后需要什么信息,导致 summary 可能遗漏关键信息。作者的核心洞察:把 compaction 改成异步的,让 compactor 和 agent 在原始上下文上并行运行,agent 的下一步推理作为"验证信号"来判断 summary 质量。类似乐观并发控制——先生成 candidate summary,然后并行验证。
📊 异步 compaction 解决 structural validation gap,保留 agent forward intent
asynchronous compaction
parallel compression
judge validation
trajectory-grounded
📅 2026-05 (很新)
这篇论文做什么: 研究 compaction 的系统层面问题:传统 compaction 是同步的(block 所有 reads),对交互式 agent 不可接受。Parallel Context Compaction 用 block-based 设计,让 operator 能细粒度控制 summary 的体积(通过 block count),而不是靠 prompt 指令(效果不稳定)。4个 backbone(8B-120B),从 2k 到 96k token 输入测试。
📊 96k token 输入 → ~3× 输出(vs 线性增长),细粒度 block-level volume 控制
parallel compaction
block-based
volume control
serving
---
💾 方向2 · 计划/上下文缓存 (Plan & Context Caching)
做什么方向: 跨任务复用已经推理好的计划或上下文。相同/相似任务不需要每次都从头推理,可以直接匹配并复用历史计划模板。
📅 2025-06 · 📖 11 citations
这篇论文做什么: 提出"测试时计划"的概念:在测试时从已完成的 agent 执行中提取结构化的计划模板,用 keyword matching 匹配新请求,找到相似缓存计划后用轻量模型做 adaptation。核心区别于传统 semantic caching——提取的是 plan templates(规划结构)而不是 chatbot responses(聊天回复)。
📊 cost 降低 50.31%,latency 降低 27.28%,保持 96.67% 性能
plan template
test-time memory
keyword matching
lightweight adaptation
📅 2025-09
这篇论文做什么: 针对 agent 调用工具时的跨区域延迟问题。工具调用的结果如果是确定性的(相同输入 → 相同输出),可以跨区域语义缓存。语义相似但不完全相同的请求也能命中缓存(通过语义匹配而非精确匹配)。减少跨区域网络延迟。
📊 吞吐量提升 3.6×,hit rate >85%
semantic-aware cache
cross-region
tool access
latency
📅 2026-05
这篇论文做什么: 结合两个思路:① Agent Workflow Memory 提取和复用工作流模式(recurring sequences of tool calls) ② 时序语义缓存加速工具访问。工作流模式提取把常见的工具调用序列打包成一个元操作来复用。
📊 workflow pattern extraction + semantic cache 联合优化
workflow pattern
temporal semantic cache
tool call sequence
---
🧠 方向3 · 记忆压缩 (Memory Compression)
做什么方向: agent 的外部记忆(knowledge base、vector store、graph 等)随交互爆炸性增长。记忆压缩研究如何组织(organization)、压缩(compression)、检索(retrieval)长期记忆,涉及 write/read/manage 的完整循环。
📅 2026-04 · 🏷️ 核心综述论文
这篇论文做什么: 这篇是半年里最重要的论文之一。它把 memory / skills / rules 统一在同一个"压缩轴"上:episodic memory 压缩 5-20×,procedural skills 压缩 50-500×,declarative rules 压缩 1000×+。分析了 20+ 系统后发现三个关键发现:① 所有系统都在固定压缩级别运作,没有自适应跨级压缩(missing diagonal)② memory 和 skills 两个社区互不引用(<1% cross-citation)③ 知识生命周期管理基本被忽视。
📊 揭示 missing diagonal(无自适应跨级压缩),统一 memory/skills/rules 框架
unifying framework
missing diagonal
memory-skills-rules spectrum
cross-community citation
📅 2026-03
这篇论文做什么: 用 3×3 研究框架诊断 agent 记忆瓶颈:3种写策略(raw chunks / Mem0-style fact extraction / MemGPT-style summarization) × 3种检索方法(cosine / BM25 / hybrid reranking)。结论:检索方法是主导因素(准确率跨度 20pts),写策略差异仅 3-8pts。这意味着:与其优化怎么写,不如先优化怎么检索。
📊 检索方法主导:准确率跨度 20pts (57.1%-77.2%);写策略仅 3-8pts
write strategy
retrieval method
BM25
hybrid reranking
📅 2026-04 · 🏷️ ACL Findings
这篇论文做什么: 工业级流视频 agent 的记忆压缩。核心:memory graph 结构。对孤立节点用 edge-free minmax sampling,对连接节点用 edge-aware weight pruning 来删除冗余节点。同时引入 time-decay retrieval 机制消除压缩带来的性能下降。
📊 70% 压缩下,memory retrieval 提速 1.87×,精度提升 1.0%
memory graph
minmax sampling
edge-aware pruning
video agent
📅 2026-04
这篇论文做什么: 提出 STM/MTM/LTM 三层记忆架构:STM 是短期对话上下文,MTM 是可重用的交互摘要,LTM 是整合后的知识。关键:用 Small Language Model (SLM) 驱动记忆管理,降低在线开销。检索用两阶段:向量粗召回 + 语义重排。固定检索预算,在 bounded compute 下高效调用记忆。
📊 LoCoMo 上 F1 提升 ~2.5,检索 83ms,E2E 581ms
STM/MTM/LTM三层
SLM-driven
vector召回
fixed retrieval budget
📅 2026-05 · 🔧 OpenClaw 原生设计
这篇论文做什么: OpenClaw agent runtime 原生设计的记忆架构。tripartite 设计:episodic JSONL store(事件记忆)+ 五信号加权检索引擎 + 异步 consolidation daemon(后台把 episodic facts 提升到 semantic tier)。亮点:诊断了 PPO 适配在 raw-BM25 主导时会失败的问题。
📊 Acc=0.382, F1=0.412 (Qwen2.5-7B, 6GB GPU),无检索→38%(5%→38%)
tripartite memory
episodic JSONL
five-signal retrieval
PPO adaptation
📅 2026-04
这篇论文做什么: 反转记忆管道设计:同一个 LLM 既做推理又管理记忆。提出 Context Tree(层级知识组织:Domain > Topic > Subtopic > Entry)+ Adaptive Knowledge Lifecycle(重要性评分 + 成熟度层 + 近因衰减)。零外部基础设施(无向量库、无图库、无 embedding 服务),所有知识存为人类可读的 markdown 文件。
📊 LoCoMo SOTA,LongMemEval 有竞争力,零外部 infra
Context Tree
LLM-curated
agent-native
zero external infra
📅 2026-04
这篇论文做什么: 三层目录组织记忆,以用户中心上下文相关性驱动。primary cache 耦合近期关键记忆和用户 profile;secondary 是高优先级层;global archive 是完整交互历史。目标是让 agent 在长期对话中保持一致的 user awareness,避免认知断层。
📊 用户中心相关性驱动三层目录,personalized user profile coupling
user-centric relevance
primary cache
personalized agent
global archive
---
🔗 方向4 · 多智能体通信剪枝 (Multi-Agent Topology)
做什么方向: 多个 agent 协作时,agent 间通信消息太多,很多是冗余的。通信图剪枝研究如何动态决定哪些 agent 需要通信、消息如何压缩,减少通信开销同时保持协作质量。
📅 2025-03 · 🔗 GitHub
这篇论文做什么: 动态消除(dropout)不必要的 agent 参与通信。每个 agent 有角色分配,但不是每轮都需要所有 agent 参与。动态决定哪些 agent 角色在本轮应该激活,哪些可以跳过。减少多轮交互中的通信图边数量。
📊 prompt token 减少 21.6%,completion token 减少 18.4%
dynamic agent elimination
role allocation
communication graph pruning
multi-round
📅 2025-11
这篇论文做什么: 针对多模态多 agent RAG 场景的层级通信图剪枝。不同于固定拓扑的 multi-agent RAG,M3Prune 动态决定哪些边连接可以剪掉(不必要的跨 agent 通信),提升响应一致性。
📊 动态剪枝边连接,提升响应一致性
hierarchical graph pruning
multi-modal mRAG
dynamic edge pruning
📅 2026-03
这篇论文做什么: 用 Information Bottleneck (IB) 优化生成通信拓扑。IB 的核心是最小化消息熵——在压缩消息和保留信息之间找平衡。同时动态剪枝冗余消息。GUARDIAN 等工作已用 IB 压缩时间交互图来减轻幻觉和错误传播。
📊 IB 优化通信效率,最小化消息熵 + 动态剪枝
Information Bottleneck
message compression
topology generation
entropy minimization
📅 2026-03
这篇论文做什么: position paper,视角非常独特:把多 agent 记忆当作计算机架构问题来看。区分 shared vs distributed memory paradigm,提出三层记忆层次(I/O、cache、memory)。指出两个关键 protocol gaps:① 跨 agent 的 cache sharing ② 结构化记忆访问控制。最迫切的开放挑战:多 agent 记忆一致性。
📊 I/O-Cache-Memory 三层,cache sharing 是关键挑战,memory consistency 是 open problem
shared memory
cache sharing
memory consistency
architecture perspective
---
🛠️ 方向5 · 技能/提示压缩 (Skill/Prompt Compression)
做什么方向: coding agent 依赖 skills(预包装的指令集)来扩展能力,但 skill 内容太长,每个 token 都消耗成本和注意力。技能压缩研究如何精简 skill 描述和 body,去除非必要内容而不损失功能。
📅 2026-03 · 🔥 重要
这篇论文做什么: 对 55,315 个公开可用的 skills 做大规模实证研究,发现系统性低效:26.4% 缺少路由描述,body 超过 60% 是非可操作的。Stage 1 用 delta-debugging 做路由压缩(48%),Stage 2 用 taxonomy-driven classification + progressive disclosure 做 body 压缩(39%)。核心发现:删除非必要内容 → less-is-more → 性能反而提升 2.8%。
📊 description 压缩 48%,body 压缩 39%,性能提升 2.8%(less-is-more 效应)
less-is-more
progressive disclosure
taxonomy-driven
delta-debugging
📅 2026-05
这篇论文做什么: 将 ML 中 gradient descent 的概念迁移到 skill 优化。把 skill 的迭代改进类比为参数优化:每次 skill 调用产生 feedback,用 feedback 驱动 skill 参数的"梯度下降"式更新。skill 不再是静态的,而是可以持续优化的。
📊 像梯度下降一样迭代优化 skill,continuous skill refinement
gradient descent analogy
iterative optimization
skill refinement
📅 2026-05
这篇论文做什么: 联合优化 skill 的内部化(skill internalization——模型学会skill)和利用(utilization——在任务中使用skill)。目标是提升OOD(分布外)泛化能力,解决 skill 在未见任务上的泛化问题。
📊 联合优化内化+利用,OOD 泛化能力提升
internalization
OOD generalization
joint optimization
---
⚖️ 方向6 · 模型压缩对 Agent 能力影响
做什么方向: 量化/pruning 等模型压缩技术对 agent 能力的影响是否和对普通 LLM 一样?planning 和 tool use 哪个更受影响?4-bit 量化后 agent 还能用吗?这方向研究压缩和 agent 能力的关系。
📅 2025-05 · 📖 20 citations · 🔗 GitHub
这篇论文做什么: 评估压缩对 agent 能力的影响。发现:4-bit 量化下,planning 和 tool use 能力仅降 1-3%(可接受),但在真实应用场景(需要长程推理)下降 10-15%。关键是:planning 需要长上下文和复杂推理链,压缩在这里影响最大。工具调用本身受影响较小。
📊 4-bit 量化:planning/tool use ⬇️ 1-3%,真实应用 ⬇️ 10-15%
quantization impact
agentic capability
4-bit LLM
long-context reasoning
📅 2026-01
这篇论文做什么: 用 LLM agent 做自适应剪枝决策。结合 Wanda-inspired(权重-激活度量)+ 梯度重要性分数,用 LLM 的 self-reflection 能力迭代优化剪枝策略。核心洞察:不同层对剪枝的敏感性不同,需要 context-aware 的自适应决策。
📊 LLM agent 驱动的剪枝策略搜索,迭代优化 layer-wise sensitivity profile
LLM-driven pruning
self-reflection
layer-wise sensitivity
adaptive compression
---
💨 方向7 · KV Cache 优化 (KV Cache Optimization)
做什么方向: agent 推理过程中 KV cache 爆炸性增长,内存很快不够用。KV cache 压缩/管理/持久化研究如何在有限内存下高效服务 agent,涉及训练式/无训练式、层级敏感性、LRM 驱动等多种方法。
📅 2026-03 · 🔗 GitHub
这篇论文做什么: 针对 agentic workflow 的服务端优化。三个核心组件:① cache reuse(跨请求复用 KV cache)② query plan execution(查询计划执行优化)③ stateful operator scheduling(有状态算子调度)。系统级协同优化端到端 agent serving。
📊 端到端加速 1.56×
agentic workflow serving
cache reuse
query plan
stateful scheduling
📅 2026-02
这篇论文做什么: 核心洞察:现有 KV cache 压缩启发式方法(基于 perplexity/layer importance)无法有效支持多步推理模型。SideQuest 的解决方案:用 Large Reasoning Model (LRM) 本身来推理 KV cache 中 token 的有用性,自己决定保留/删除哪些 token。为了防止管理过程的 token 污染模型的记忆,把 KV 压缩做成辅助任务和主推理任务并行运行。训练仅需 215 个样本。
📊 peak token ⬇️ 65%,仅 215 样本训练,minimal accuracy degradation
LRM-driven
auxiliary task
parallel compression
reasoning model
📅 2026-04
这篇论文做什么: 多 agent 场景下,agent 间有大量重复计算(处理相同文档/上下文)。Collective KV cache sharing 在多个 agent 之间共享 KV state,减少重复计算。不同 agent 处理相同 prompt 时复用 KV cache。
📊 集体 KV cache 共享,减少多 agent 间重复计算
collective KV sharing
multi-agent serving
KV movement
📅 2026-03
这篇论文做什么: 把 KV cache 以 Q4 格式持久化到磁盘(safetensors 格式),在 Apple M4 Pro 10.2GB 缓存预算下可容纳更多 agent。三个组件:① block pool(每个 agent 的隔离 Q4 KV cache)② BatchQuantizedKVCache(并发推理多个 agent 的量化 cache)③ cross-phase context injection(跨对话阶段累积注意力状态而不重计算)。
📊 TTFT ⬇️ up to 136× (Gemma),perplexity 仅 -0.7%~+3.0%(Q4 量化代价可接受)
Q4 KV cache
edge device
persistent cache
safetensors
📅 2026-03
这篇论文做什么: GUI agent 场景的无训练 KV cache 压缩。核心:spatio-trajectory KV cache 压缩——利用 GUI agent 操作的空间轨迹信息(UI 结构、点击路径)来指导压缩。component-centric simplification 保留关键 UI 组件和交互状态。
📊 spatio-trajectory KV 压缩,component-centric simplification,无训练
GUI agent
training-free
spatio-trajectory
UI structure
📅 2026-02
这篇论文做什么: 残差驱动 KV 压缩。基于两个发现:① token 间存在长期相似性(相隔较远的 token 仍有语义相似性)② 可以用残差表示来压缩 KV cache。存储 KV 的残差而非原始值,在恢复时用残差重建。
📊 利用 inter-token 长期相似性 + 残差压缩减少 KV cache 体积
residual-based
inter-token similarity
delta compression
long-range
---
⚡ 方向8 · 推理加速 (Inference Acceleration - Speculative)
做什么方向: agent 的 LLM-tool 循环是严格串行的——每步都要等外部工具执行完成才能继续。投机型执行(speculative execution)让工具和 LLM 并行工作,隐藏工具延迟。这是半年里最热的方向之一。
📅 2026-03
这篇论文做什么: 核心洞察:agent 虽然请求语义多样,但应用层控制流稳定(recurring tool-call sequences)且工具间参数传递可预测(parameter passing between tools)。PASTE 利用这两个性质投机型执行工具:先用"猜测模型"预测下一个工具调用并提前执行,确认后再执行真正的 LLM 生成步骤。
📊 任务完成时间 ⬇️ 48.5%,工具吞吐量 ↑ 1.8×
speculative tool execution
control flow pattern
latency hiding
parallel processing
📅 2025-10 · 🔥 重要
这篇论文做什么: 类比 CPU 的 speculative execution 和 LLM inference 的 speculative decoding,提出了 Speculative Actions:用更快的模型预测可能的未来动作并提前并行执行,只有预测匹配时才 commit。评估跨游戏、电商、网页搜索三个环境。55% next-action 预测准确率 → 最多 20% 延迟降低。
📊 跨域 55% next-action 预测准确率,最多 20% 延迟降低,无损加速
speculative actions
lossless
faster model prediction
CPU speculation analogy
📅 2026-05 · 🔗 GitHub
这篇论文做什么: 针对多跳检索工具使用场景的理论 + 实践工作。核心:characterize 最优可达延迟增益的理论框架(lossless speculation)。关键参数:speculator 相对延迟 / 工具调用时间占比。多跳场景的 speculation 比单跳更复杂,因为每跳的输出决定下一跳的输入。
📊 多跳检索延迟 ⬇️ up to 40%,接近理论最优
continuous speculation
multi-hop retrieval
theoretical framework
lossless
📅 2026-05
这篇论文做什么: 解决实时交互场景下的 agent 延迟问题。提出两个方法:① Asynchronous I/O——把 agent 推理-行动线程和等待外部信息解耦,实现重叠处理② Speculative Tool Calling——当 agent 不确定是否收到完整信息时,提前执行可能的工具调用。额外的 clock-based training 让小模型也能处理流式输入。
📊 异步 I/O + speculative tool calling 实现实时交互
asynchronous I/O
speculative tool calling
real-time
clock-based training
📅 2026-01
这篇论文做什么: 把重复的 tool call 序列打包成 meta-tool(确定性组合工具),减少 LLM 调用次数。分析工作流 traces 发现 recurring sequences of tool calls → 转换成元工具调用。在两个 agentic AI benchmarks 评估,LLM 调用减少 11.9%,任务成功率提升 4.2%。
📊 LLM 调用 ⬇️ 11.9%,任务成功率 ↑ 4.2%
meta-tools
redundant pattern discovery
workflow optimization
LLM call reduction
---
📚 方向9 · Agent Memory 系统综述
做什么方向: 系统性地梳理 agent 记忆的设计、实现和评估方式。把记忆建模为 write-manage-read 循环,介绍五类机制并分析 recent benchmarks 的变化趋势。
📅 2026-03 · 📖 12 citations · 1136 references
这篇论文做什么: 全面综述 agent 记忆(2022-2026.03)。把 agent 记忆形式化为 write-manage-read 循环,紧耦合感知和行动。三维 taxonomy:temporal scope(时间跨度)× representational substrate(表征基质)× control policy(控制策略)。五类机制:context-resident compression / RAG / reflective / hierarchical / policy-learned。评估从静态 recall benchmarks → 多会话 agentic tests。
📊 五类机制分类:compression / RAG / reflective / hierarchical / policy-learned
write-manage-read loop
taxonomy
policy-learned
hierarchical virtual context
📅 2026-03
这篇论文做什么: 记忆治理(memory governance)的系统研究。核心问题:记忆如何随时间演变,以及如何管理这个演变。structuring 对 retrieval effectiveness 的影响是关键发现——结构化的记忆比非结构化检索效果更好。同时探讨 temporal decay(时间衰减)、contradiction handling(矛盾处理)等挑战。
📊 structuring 是 retrieval effectiveness 的关键因素,temporal decay 管理重要
memory governance
temporal decay
structuring
contradiction handling
---
💻 方向11 · Coding Agent 特化压缩
做什么方向: coding agent 的上下文主要是代码文件,代码有独特的语义结构(函数边界、依赖关系)。通用压缩方法(PPL-based)破坏语法/逻辑结构。coding agent 特化压缩研究如何理解代码结构来做智能剪枝。
📅 2026-01 · 🔗 GitHub
这篇论文做什么: 灵感来自人类程序员在开发调试时的"选择性浏览"(selectively skim)。给定任务目标(如"关注错误处理"),用 0.6B 参数的轻量 neural skimmer 动态选择相关行。关键:task-aware——不仅看代码本身,还看当前任务目标。训练后模型根据任务动态调整 pruning 策略。
📊 agent 任务 token ⬇️ 23-54%(甚至成功率提升),单轮任务 14.84× 压缩
0.6B neural skimmer
task-aware pruning
selectively skim
self-adaptive
📅 2026-05
这篇论文做什么: 发现现有单目标 pruner 的瓶颈:单个 CRF transition prior 必须同时服务异质保留模式(连续语义跨度和稀疏结构支持行)。LaMR 把代码相关性分解为两个维度:semantic evidence(语义证据)+ dependency support(依赖支持),每个维度用独立的 CRF + transition dynamics。MoE gating network 根据 query 动态加权两个维度的 emission。
📊 多轮任务节省 31% tokens,单轮 Exact Match +3.5
multi-rubric CRF
semantic evidence
dependency support
MoE gating
📅 2026-02
这篇论文做什么: 发现很多 web agent 有 cyclic reasoning loops 和 unproductive branches。把 agent 搜索过程建模为状态图,用 Minimum-Necessary DAG Mining 把轨迹优化为最小必要有向无环图。保留 essential reasoning 同时消除冗余步骤。在修剪后的轨迹上继续训练,agent 学会更高效的搜索模式。
📊 工具调用轮次 ⬇️ ~20%,同时准确率提升
DAG mining
state graph
cyclic reasoning
web agent
---
🏗️ 方向12 · System Co-Design
做什么方向: 算法和系统需要协同设计才能高效服务 agent 工作负载。单独优化某一块(调度/caching/compression/speculative)不够,需要整体考虑 inference + system 的 co-design。
📅 2026-02
这篇论文做什么: 四层协同优化:① 认知引导(cognitive guidance)② 预测性 token 推测(predictive token speculation)③ 动态调度(dynamic scheduling)④ 自适应压缩(adaptive compression)。相比传统只优化 isolated kernel 或 quantization 的方法,这个框架专门为 agentic workload 设计层次化优化。
📊 四组件协同,AgentSAM 开启后 2.52× 加速,各优化互补
algorithm-system co-design
cognitive guidance
predictive speculation
adaptive compression
📅 2026-03
这篇论文做什么: 消费级 GPU(单卡)上的并发 tool-augmented SLM agent serving 系统。调度 + 系统级资源控制协同优化。核心挑战:多个 agent 并发时,工具执行的低延迟稳定性 + token 发射稳定性 + 吞吐量之间的平衡。
📊 单 GPU 并发 tool-augmented SLM agent serving
consumer GPU
concurrent agents
scheduling co-optimization
resource management
📅 2026-04
这篇论文做什么: 发现 agent 的复杂度大部分在 harness(包裹模型的代码:context compaction、tool caching、semantic memory、trajectory reuse、speculative tool prediction 等)而不是模型本身。Harbor 把 harness design 做成 first-class ML problem,用 constrained noisy Bayesian optimization 自动搜索最优配置(替代手动 stacking)。
📊 automated harness config search,取代手动 stacking,flag-gated harness
Bayesian optimization
automated config
harness design
noisy BO
---