RAG 평가 실무 가이드: 검색 품질과 답변 품질을 분리하는 법
RAG 평가를 검색, 컨텍스트, 답변으로 분리해 Recall@K·MRR·nDCG·근거성·정확성을 측정하고 회귀 테스트로 운영하는 방법을 정리했다.
RAG 평가를 검색, 컨텍스트, 답변으로 분리해 Recall@K·MRR·nDCG·근거성·정확성을 측정하고 회귀 테스트로 운영하는 방법을 정리했다.
AI 에이전트의 토큰·캐시·도구 호출·재시도 비용을 실행 단위로 계산하고 팀·프로젝트별로 배부하는 방법을 정리했다.
Cloudflare AI Gateway와 LiteLLM Proxy를 2026년 8월 공식 문서 기준으로 비교했다. 관리형·자체 운영, 라우팅, 예산, 장애 대응, 보안과 도입 순서를 정리했다.
AI 에이전트 운영에서는 서버 로그만으로 부족하다. LLM 호출, 도구 실행, 비용, 승인, 실패 원인을 하나의 trace로 연결해 추적하는 관측성 설계 방법을 정리한다.