Agentic RAG 파이프라인 — 멀티스텝 검색의 프로덕션 적용
Plan-Retrieve-Evaluate-Synthesize 풀 파이프라인 구현. Vector + Web + SQL을 Tool로 통합하고, 환각 탐지와 소스 그라운딩으로 신뢰도를 확보합니다.

title: "Agentic RAG 파이프라인 — 멀티스텝 검색의 프로덕션 적용"
date: "2026-03-09"
series: "agentic-rag"
part: 3
tags: ["rag", "agent", "langgraph", "production", "grounding"]
Agentic RAG 파이프라인 — 멀티스텝 검색의 프로덕션 적용
Part 1에서 "어디서 검색할지", Part 2에서 "검색 결과가 좋은지" 해결했습니다. 하지만 현실의 질문은 한 번의 검색으로 끝나지 않습니다. "지난 분기 매출과 경쟁사 동향을 비교해서 전략을 제안해줘" 같은 복합 질문에는 계획 → 멀티스텝 검색 → 평가 → 합성이 모두 필요합니다. Part 3에서는 이 모든 것을 합쳐서 Plan-Retrieve-Evaluate-Synthesize 풀 파이프라인을 만듭니다.
시리즈: Part 1: Query Routing | Part 2: Self-RAG과 CRAG | Part 3 (이 글)
아키텍처 개요
Query → Plan → [Retrieve → Evaluate → (retry?)] × N → Synthesize → Ground → Answer관련 포스트

TurboQuant vLLM, A100 한 장에서 실측 — 8B 모델에서 프리셋 4개의 용량·속도·정확도
vLLM 0.28, Qwen3-8B bf16, A100 80GB: bf16·fp8·TurboQuant 프리셋 4개의 KV 용량, 배치 처리량, 32K 디코드, needle-in-haystack, GSM8K를 직접 쟀습니다. vLLM 연구가 다루지 않은 8B 크기입니다.

TurboQuant를 실제 KV 텐서 위에서 밑바닥부터 — 3비트의 진짜 비용, 그리고 포크가 논문 레이아웃을 이기는 이유
PolarQuant를 PyTorch 60줄로 구현해 Llama-3.2-1B·Qwen3-8B의 실제 KV에 적용. 3비트는 +10%, k8v4는 +0.2%, QJL은 저비트에서만 유효, 블록-32 레이아웃이 포크 우위의 절반을 설명합니다.

TurboQuant llama.cpp CUDA 포크, A100에서 실측 — turbo4는 q4_0급, turbo3는 긴 컨텍스트에서 무너진다
Qwen3-8B Q4_K_M, A100 한 장, KV 타입 6종: perplexity·프리필·깊이별 디코드·VRAM 실측. turbo4는 q4_0과 품질 동급에 깊은 컨텍스트에선 q8_0보다 2.5배 빠르고, turbo3는 32K에서 PPL이 세 배로 뜁니다.