PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop QA

Memory & RAG arxiv arXiv:2601.05465 PDF ↗

stagehopoptimizationarchitecturedomainguidedqaprismapolicy

Proposes a decoupled multi-agent RAG framework for multi-hop QA with a Plan-Retrieve-Inspect-Solve-Memoize architecture and two-stage GRPO optimization to address retrieval collapse over large corpora.

Status

5~10분. 제목→초록→인트로→섹션헤더→그림→결론만.
판단: 어떤 문제를 풀고 / 핵심 아이디어 / 내 작업과 관련 있나?

~1시간. 그림·표를 꼼꼼히. 증명·수식 디테일은 건너뜀.
산출물: "이들이 뭘 했고 왜 그게 통하는가" 한 문단.

재현하듯 읽기. 가정을 의심. 직접 인용/반박할 논문만.
렌즈: "내 플릿에서 측정하면 저자가 못 한 무엇을 보여줄 수 있나?"

View in Knowledge Graph →

PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop QA

Related Papers (10)