#RAG
10 notes
"우리 데이터를 AI-ready로 만들어 달라"는 청소 작업이 아니라 발굴 질문이다. Gartner조차 데이터는 사전에 일반적으로 AI-ready가 될 수 없고 용도가 정해져야 정의된다고 못 박는다. 데모 위의 마법 아래에는 빙산 같은 기반이 있고(Sculley), 업스트림 데이터 준비와 다운스트림 컨텍스트 엔지니어링은 같은 문제의 양 끝이며, 이미 만든 LLM Wiki와 ADR이 곧 그 조직의 AI-ready 데이터 프로덕트다
Karpathy의 LLM Wiki 패턴에 ADR(Architecture Decision Records)을 결합해 개인 블로그를 누적 지식베이스로 발전시키는 방법. 패턴의 원전, 실제 사례 3종, 2026 연구 결과, 실패 모드와 스케일 한계까지 정리한다
280개 한국어+영어 블로그 포스트를 테스트베드로 활용하여 다양한 검색 방법론을 실험하는 시리즈의 첫 번째 글. 키워드 검색부터 벡터 검색, 하이브리드 검색까지 각 방법의 원리를 정리하고, 실험 설계와 평가 기준을 수립한다.
개인 블로그를 지식 베이스로 삼아 Modular RAG 아키텍처를 구축하고, 다양한 검색 모듈 조합을 실험하는 프로젝트.
블로그를 RAG 지식 베이스로 쓰기로 결정한 이유, 그리고 검색 모듈을 조합 가능하게 만들어야 하는 이유.
PostgreSQL에서 벡터 검색을 가능하게 하는 pgvector 익스텐션의 개념, 작동 원리, 인덱스 알고리즘(HNSW), 그리고 다른 벡터 데이터베이스와의 비교를 다룬다.
2025년 최신 버전을 기준으로 pgvector (PostgreSQL 18), Qdrant 1.15, Milvus 2.6의 실제 성능, 기능, 비용을 상세 비교한다. 데이터 삽입, 검색 속도, 필터링, 확장성, 실전 시나리오별 권장사항을 다룬다.
학술 논문을 위한 전문 문서 파싱 및 RAG 시스템 구축 프로젝트 분석. Upstage Document Parse와 LLM을 활용한 고품질 멀티모달 콘텐츠 추출, 벡터 데이터베이스 구축, 그리고 Multi-Query + Reranker 기반 하이브리드 검색 시스템 구현까지 포괄적으로 다룬다.
멀티모달 RAG를 활용한 PDF 문서 내 시각 자료와 텍스트 추출 및 활용 기법
멀티모달 RAG를 통한 문서 내 텍스트와 이미지 추출 및 활용 연구