RAG Evaluation: Precision/Recall을 넘어서
"RAG가 잘 동작하는지 어떻게 알죠?" — Precision/Recall만으로는 부족합니다. Faithfulness, Relevance, Context Recall까지 측정해야 진짜 품질이 보입니다.

RAG Evaluation: Precision/Recall을 넘어서
"RAG가 잘 동작하는지 어떻게 알죠?" — Precision/Recall만으로는 부족합니다. Faithfulness, Relevance, Context Recall까지 측정해야 진짜 품질이 보입니다.
왜 기존 메트릭으로 부족한가?
전통적인 IR(Information Retrieval) 메트릭:
| 메트릭 | 측정 대상 | RAG에서의 한계 |
|---|---|---|
| Precision@K | 상위 K개 중 관련 문서 비율 | 답변 품질과 무관할 수 있음 |
| Recall@K | 전체 관련 문서 중 검색된 비율 | Ground truth 필요, 현실적으로 힘듦 |
| MRR | 첫 관련 문서 순위 | 여러 문서 필요한 경우 무의미 |
관련 포스트

AI 연구
Reversal Curse를 깨는 Identity Bridge — ICML 2026, 이래도 되는데 되는 fix
언어 모델은 "Alice의 남편은 Bob"을 학습해도 "Bob의 아내는?"을 못 맞힙니다 — 유명한 reversal curse. ICML 2026 논문 하나가 학습 데이터에 이상한 자기참조 예제를 섞는 것만으로 이 문제를 해결합니다. 순진한 버전은 안 되고, 정교한 버전은 됩니다.

AI Tools & Agents
스스로 진화하는 AI 에이전트 — 2026년의 새로운 패러다임
GenericAgent, Evolver, Open Agents — 스스로 스킬을 만들고, 실행 경로를 기억하고, 실패에서 배우는 자가 진화 에이전트 3종 비교.

AI Tools & Agents
나만의 LLM Knowledge Base 구축하기 — Karpathy 스타일 지식 시스템
Obsidian + Claude Code로 영구적인 개인 지식 체계를 만드는 완전 가이드. 위키 + 메모리 두 축의 지식 시스템.