Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents 리뷰
·
Research/MHQA (자연어 기반)
(ACL, 2026)Abstract LLM 에이전트는 컨텍스트 윈도우 제한으로 long-horizon 추론에 근본적인 한계가 있으며, 따라서 메모리 관리가 중요하다. 현존 방법론은 주로 long-term memory(LTM)과 short-term memory(STM)을 따로 다루며, 휴리스틱이나 보조적 컨트롤러에 의존하는데, 이는 adaptive하지 않고 end-to-end 최적화에 한계가 있다. 이 논문에서는 LTM과 STM 관리를 에이전트의 정책에 직접 통합하는 Agentic Memory 프레임워크를 제안한다. AgeMem은 메모리 동작을 tool 기반 행동으로 노출하고, LLM 에이전트가 자율적으로 어떤 것을 언제 저장, 업데이트, 요약, 제거할지 판단한다. 통합된 행동을 학습하기 위해, 3가지 단..
Learning to Share: Selective Memory for Efficient Parallel Agentic Systems 리뷰
·
Research/MHQA (자연어 기반)
(ICML, 2026)각 에이전트 팀으로 구성된 병렬 에이전트 시스템에서 학습된 경량 LLM으로 공유 메모리에 추가할지 결정하여, 각 팀에서 공유 메모리에 접근하여 작업의 효율성과 성능을 개선함Abstract 에이전트 시스템은 여러 에이전트를 조정하며 반복 추론하거나 tool을 호출하거나, 중간 결과를 교환하는 등 방법을 사용하여 복잡한 문제를 해결한다. 견고함과 성능을 높이기 위해, 최근 방법들은 여러 에이전트 팀을 도입해서 병렬로 다양한 추론 경로를 탐색한다. 하지만 이는 상당한 비용 문제를 유발하며, 서로 다른 팀들이 독립적으로 비슷한 하위 문제를 추론하는 등 반복 연산이 존재한다. 이러한 한계를 해결하기 위해 본 논문은 Learning to Share(LTS)를 제안하며, 이는 병렬적인 에이전트 ..
SWE-Pruner: Self-Adaptive Context Pruning for Coding Agents 리뷰
·
Research/SWE (코딩 에이전트)
https://arxiv.org/pdf/2601.16746코드를 검색할 때 line-level 압축을 통해 목적과 일치하는 코드를 agent에 입력하는 방법론Abstract SWE 분야에서 LLM agent는 긴 상호작용 컨텍스트로 인한 비용과 시간 문제가 존재했다. 컨텍스트 압축 방법론에서 사용하는 평가지표는 코드 이해에 특화되지 않아서 적절하지 않았으며, 중요한 구현 디테일을 자주 망쳤다. 본 논문에서는 코딩 에이전트를 위한 self-adaptive 컨텍스트 압축 프레임워크 SWE-Pruner를 제안한다. 개발자가 선별적으로 소스코드를 훑는 것에 대해 영감을 받아, SWE-Pruner는 task-aware adaptive 압축을 진행한다. 현재의 작업에서 에이전트는 목적을 정하고 이를 기반으로 프루닝..
Latent Collaboration in Multi-Agent Systems 리뷰
·
Research/MHQA (자연어 기반)
https://arxiv.org/pdf/2511.20639(2026, ICML Spotlight)에이전트의 생각과 소통에 hidden representation KV cache를 사용하는 MAS 방법론“에이전트 생각” 시 이전 step에서 출력된 latent representation을 projector를 거쳐서 다음 step의 입력으로 사용함“에이전트 소통” 시 이전 에이전트의 KV cache를 concat하여 다음 에이전트가 사용함 Abstract Multi-agent system(MAS)는 LLM을 단일 모델의 추론에서 협력 시스템 레벨의 지능으로 확대한다. 현존 LLM agent는 자연어 기반으로 추론 및 소통을 하지만, 본 방법론은 모델이 continuous latent space에서 직접 협력..
DeepRAG: Thinking to Retrieve Step by Step for Large Language Models 리뷰
·
Research/MHQA (자연어 기반)
https://arxiv.org/pdf/2502.01142LLM 지식 경계를 기반으로 더 검색할지말지 결정하는 adaptive RAG학습 목적 함수 : NTP(분할할지 정답 생성할지) + DPO(검색해서 답할지 내부 지식으로 답할지) Abstract비효율적인 질문 분할과 중복된 검색은 RAG 퀄리티를 감소시킨다. 이 논문에서 제안하는 DeepRAG는 Markov Decision Process(MDP) 모델링을 통해 합리적인 adpative retrieval이 가능하다. 각 스텝에서 반복적으로 질문을 하위 질문으로 나누고 외부 지식을 검색할지 LLM 내부 추론에 맡길지 판단하는 방식이다. IntroductionRAG에서 복잡한 질문을 여러 스텝의 하위 질문으로 분할하는 방식은 널리 사용된다. 하지만 LLM..
LongLLMLingua: Accelerating and Enhancing LLMs in Long ContextScenarios via Prompt Compression 리뷰
·
Research/MHQA (자연어 기반)
Jiang, Huiqiang, et al. "Longllmlingua: Accelerating and enhancing llms in long context scenarios via prompt compression." Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2024.https://arxiv.org/pdf/2310.06839Abstract컨텍스트가 많은 상황에서 LLM을 사용한 작업은 컴퓨팅 자원이 많이 소모되며, 입력에 노이즈가 많고 lost in middle의 위치 편향 문제를 겪는다. 프롬프트 압축은 이런 문제를 일부 개선하는데, 본 논문..
Compressing Context to Enhance Inference Efficiency of Large Language Models 리뷰
·
Research/MHQA (자연어 기반)
Li, Yucheng, et al. "Compressing Context to Enhance Inference Efficiency of Large Language Models." Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP). 2023. https://aclanthology.org/2023.emnlp-main.391.pdfAbstractLLM은 메모리와 추론 시간의 제한으로 사용가능한 컨텍스트가 제한된다. 본 논문에서 제시하는 Selective Context는 입력에서 중복을 제거하면서 추론 효율을 높인다. 실험으로는 긴 컨텍스트를 처리하기 위해 arXiv 논문, 뉴스 기사, 긴 대..
DAC: A Dynamic Attention-aware Approach for Task-Agnostic Prompt Compression 리뷰
·
Research/MHQA (자연어 기반)
Zhao, Yi, et al. "DAC: A dynamic attention-aware approach for task-agnostic prompt compression." Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2025.https://arxiv.org/abs/2507.11942Abstract기존 프롬프트 압축법은 정보 엔트로피에 의존하는데, 이는 ‘(1) 토큰의 어텐션 정보를 간과함 (2) 압축 시 정보 엔트로피의 분포가 이동됨’의 두가지 사실을 간과한다. 본 논문에서는 이를 해결하기 위해 Dynamic Attention-Aware appro..
Cooperative Retrieval-Augmented Generation for Question Answering: Mutual Information Exchange and Ranking by Contrasting Layers 리뷰
·
Research/MHQA (자연어 기반)
Ko, Youmin, Sung Jong Seo, and Hyunjoon Kim. "Cooperative Retrieval-Augmented Generation for Question Answering: Mutual Information Exchange and Ranking by Contrasting Layers." The Thirty-ninth Annual Conference on Neural Information Processing Systems. https://arxiv.org/abs/2512.10422AbstractRAG 기반의 QA는 여전히 부정확한 검색 및 환각이 존재한다. 이 문제를 다루기 위해 본 논문에서 제안하는 CoopRAG는, retriever와 LLM이 협력해서 정보를 교환하며, re..
MAGNET: Augmenting Generative Decoders with Representation Learningand Infilling Capabilities 리뷰
·
Research/MHQA (자연어 기반)
Khosla, Savya, et al. "Magnet: Augmenting generative decoders with representation learning and infilling capabilities." Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2025. https://arxiv.org/pdf/2501.08648AbstractLLM은 단방향 어텐션을 사용하는 생성 모델로 디자인되었지만, 양방향 어텐션도 활용할 수 있게 하는 접근법이 점점 많아지고 있다. 보통 단방향, 양방향 모델은 각기 다른 목적을 가지므로 따로 학습된다. 이러한 구분..