IdleSpec: Exploiting Idle Time via Speculative lanning for LLM Agents
·
Research/Paper Skimming
(Arixv, 2026)문제 : 에이전트 시스템에서 tool call 후 관찰 대기하는 idle time 이 dominate하다. 이는 자주 발생하지만 많이 연구되지 않았다.해결법 : idle-time에 planning을 하여 추가적 시간 없이 에이전트 성능을 개선한다. 관찰 결과가 예상과 동일할 때와, 다를 때를 나눠서 전략을 생성한다. 관련 연구 :Interactive speculative planning : Long-horizon에서 observation 대기하지 않고 미래 계획 생성하는 Speculative planning 선행연구Sleep-Time Compute : LLM-user interaction에서 미래 query 제공 이전까지 컨텍스트 기반 추론을 미리 생성하는 Idle-time com..
AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs
·
Research/Paper Skimming
(EMNLP, 2026)문제 : Agentic LLM에서 컨텍스트 길이가 latency 병목이 됨. 압축 방법론은 downstream task 성능을 떨어트리는 문제가 있음. 기존 Speculative Decoding은 drafter/verifier가 동일한 컨텍스트를 입력받으므로 이 문제를 개선하지 못함. 해결책 : Drafter가 full-context 기반으로 후보를 생성하고, Verifier가 compressed-context 기반으로 검증하는 방법론 제안. 성능은 일부 감소할 수 있지만 latency/computation-efficient 한 방법론. 관련 연구 :SCD(Speculative Contrastive Decoding) : drafter/verifier logits 차이를 ‘model..
AORCHESTRA: Automating Sub-Agent Creation for Agentic Orchestration
·
Research/Paper Skimming
(ICML, 2026)문제 : 현존 MAS는 서브 에이전트 사용에서 유연함이 부족하다. 서브 에이전트는 작업 컨텍스트 나누기를 위해 사용하거나, 고정된 역할만 하게 한다.해결법 : 오케스트레이터가 서브에이전트(지시/컨텍스트/툴/모델)을 생성하여 런타임에 온디맨드로 생성해서 사용한다. 또한 오케스트레이터를 SFT 기반으로 학습하여 성능을 높이며, ICL로 학습 없이도 성능/효율을 개선한다. AOrchestra오케스트레이터는 위임, 종료(정답 확정) 중 하나의 행동을 한다. 위임 시 다음 테스크를 기반으로 로 서브 에이전트를 생성한다. 서브에이전트는 결정된 model을 사용하고, tools에 결정된 툴셋을 사용하며, (Instruction, context) 조건을 기반으로 추론한다.서브에이전트 출력 : ..
OWL: Optimized Workforce Learning for GeneralMulti-Agent Assistance in Real-World Task Automation
·
Research/Paper Skimming
(NeurIPS, 2025) 문제 : 새로운 도메인에 MAS를 적용할 때 redesign(토폴로지 변경) / retrain(각 에이전트 학습) 필요함.해결법 : Workforce라는 domain-agnostic planner, coordinator, worker(domain specific agent)로 구성되는 계층적 MAS 프레임워크 제안. OWL이라는 planner 학습법 제안하며, 범용적인 서브테스크 분해 능력을 학습함. 이에 따라 도메인의 변경에 따라 domain specific agent를 plug-and-play 가능함. Workforce (방법론)범용 플래닝 에이전트 + 도메인 특화 워커 에이전트planner : 서브 테스크 분할coordinator : 서브 테스크 할당 / 중간 결과 관리..
FlowSearch: Advancing Deep Research with Dynamic Structured Knowledge Flow
·
Research/Paper Skimming
(ACL, 2026) 문제 : Deep Research에서는 탐색 너비 / 추론 깊이의 트레이드오프가 존재한다. 또한 선형적 MAS 구조에서 초기 실패로 인한 오류가 크다.해결책 : DAG 그래프 기반 워크플로로, Planner/Collector/Refiner를 통해 동적으로 에이전트 활용 토폴로지를 개선하는 방법론 제안. 방법론 (FlowSearch)쿼리를 멀티 에이전트 선형 시퀀스로 나누는 기존 방법은 문제 해결의 비선형적인 특징을 다루지 못한다. 예를 들어 A,B 문제를 해결해야 C 문제를 해결할 수 있는 특성을 미 고려한다. 또한 C 문제 입장에서 어떤 입력이 필요한지 모르므로 모든 컨텍스트를 입력받게 된다.본 방법론은 DAG 그래프를 사용하며, 노드는 서브 테스크이고 엣지는 테스크 간 의존 관계..
Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents 리뷰
·
Research/MHQA (자연어 기반)
(ACL, 2026)Abstract LLM 에이전트는 컨텍스트 윈도우 제한으로 long-horizon 추론에 근본적인 한계가 있으며, 따라서 메모리 관리가 중요하다. 현존 방법론은 주로 long-term memory(LTM)과 short-term memory(STM)을 따로 다루며, 휴리스틱이나 보조적 컨트롤러에 의존하는데, 이는 adaptive하지 않고 end-to-end 최적화에 한계가 있다. 이 논문에서는 LTM과 STM 관리를 에이전트의 정책에 직접 통합하는 Agentic Memory 프레임워크를 제안한다. AgeMem은 메모리 동작을 tool 기반 행동으로 노출하고, LLM 에이전트가 자율적으로 어떤 것을 언제 저장, 업데이트, 요약, 제거할지 판단한다. 통합된 행동을 학습하기 위해, 3가지 단..
Learning to Share: Selective Memory for Efficient Parallel Agentic Systems 리뷰
·
Research/MHQA (자연어 기반)
(ICML, 2026)각 에이전트 팀으로 구성된 병렬 에이전트 시스템에서 학습된 경량 LLM으로 공유 메모리에 추가할지 결정하여, 각 팀에서 공유 메모리에 접근하여 작업의 효율성과 성능을 개선함Abstract 에이전트 시스템은 여러 에이전트를 조정하며 반복 추론하거나 tool을 호출하거나, 중간 결과를 교환하는 등 방법을 사용하여 복잡한 문제를 해결한다. 견고함과 성능을 높이기 위해, 최근 방법들은 여러 에이전트 팀을 도입해서 병렬로 다양한 추론 경로를 탐색한다. 하지만 이는 상당한 비용 문제를 유발하며, 서로 다른 팀들이 독립적으로 비슷한 하위 문제를 추론하는 등 반복 연산이 존재한다. 이러한 한계를 해결하기 위해 본 논문은 Learning to Share(LTS)를 제안하며, 이는 병렬적인 에이전트 ..
SWE-Pruner: Self-Adaptive Context Pruning for Coding Agents 리뷰
·
Research/SWE (코딩 에이전트)
https://arxiv.org/pdf/2601.16746코드를 검색할 때 line-level 압축을 통해 목적과 일치하는 코드를 agent에 입력하는 방법론Abstract SWE 분야에서 LLM agent는 긴 상호작용 컨텍스트로 인한 비용과 시간 문제가 존재했다. 컨텍스트 압축 방법론에서 사용하는 평가지표는 코드 이해에 특화되지 않아서 적절하지 않았으며, 중요한 구현 디테일을 자주 망쳤다. 본 논문에서는 코딩 에이전트를 위한 self-adaptive 컨텍스트 압축 프레임워크 SWE-Pruner를 제안한다. 개발자가 선별적으로 소스코드를 훑는 것에 대해 영감을 받아, SWE-Pruner는 task-aware adaptive 압축을 진행한다. 현재의 작업에서 에이전트는 목적을 정하고 이를 기반으로 프루닝..
Latent Collaboration in Multi-Agent Systems 리뷰
·
Research/MHQA (자연어 기반)
https://arxiv.org/pdf/2511.20639(2026, ICML Spotlight)에이전트의 생각과 소통에 hidden representation KV cache를 사용하는 MAS 방법론“에이전트 생각” 시 이전 step에서 출력된 latent representation을 projector를 거쳐서 다음 step의 입력으로 사용함“에이전트 소통” 시 이전 에이전트의 KV cache를 concat하여 다음 에이전트가 사용함 Abstract Multi-agent system(MAS)는 LLM을 단일 모델의 추론에서 협력 시스템 레벨의 지능으로 확대한다. 현존 LLM agent는 자연어 기반으로 추론 및 소통을 하지만, 본 방법론은 모델이 continuous latent space에서 직접 협력..
DeepRAG: Thinking to Retrieve Step by Step for Large Language Models 리뷰
·
Research/MHQA (자연어 기반)
https://arxiv.org/pdf/2502.01142LLM 지식 경계를 기반으로 더 검색할지말지 결정하는 adaptive RAG학습 목적 함수 : NTP(분할할지 정답 생성할지) + DPO(검색해서 답할지 내부 지식으로 답할지) Abstract비효율적인 질문 분할과 중복된 검색은 RAG 퀄리티를 감소시킨다. 이 논문에서 제안하는 DeepRAG는 Markov Decision Process(MDP) 모델링을 통해 합리적인 adpative retrieval이 가능하다. 각 스텝에서 반복적으로 질문을 하위 질문으로 나누고 외부 지식을 검색할지 LLM 내부 추론에 맡길지 판단하는 방식이다. IntroductionRAG에서 복잡한 질문을 여러 스텝의 하위 질문으로 분할하는 방식은 널리 사용된다. 하지만 LLM..