GuíaBásico
Guía de Fundamentos de Bases de Datos Vectoriales
Aprende cómo funcionan las vector databases por dentro, por qué las necesitas para sistemas RAG y cómo elegir la correcta para tu proyecto. Esta guía te lleva desde los fundamentos (arquitectura, algoritmos de indexing, features esenciales) hasta implementación hands-on con ChromaDB y un proyecto integrador de RAG con 1,000+ documentos y API FastAPI. Al terminar, sabrás implementar storage y retrieval de vectores para producción — y tendrás criterio para decidir entre ChromaDB, Pinecone, Weaviate y Qdrant según tus requisitos reales.
- 67
- lecciones
- 8
- módulos
- Inglés · Español
- disponible en
- Sí
- certificado
- Gratis
- acceso
Resultados
Lo que vas a poder hacer
- Entender por qué los sistemas RAG necesitan vector databases (y cuándo SQL, NoSQL o numpy son suficientes)
- Explicar cómo funcionan las vector databases por dentro: arquitectura, algoritmos HNSW, IVF y PQ
- Identificar features esenciales para RAG en producción: metadata filtering, hybrid search, multi-tenancy, batch operations
- Implementar ChromaDB desde setup hasta similarity search optimizado con metadata filtering
- Construir un sistema RAG completo: ingestion de documentos, indexing, retrieval y generation con FastAPI
- Comparar Pinecone, Weaviate, Qdrant y Milvus — features, pricing y trade-offs de arquitectura
- Aplicar un framework de decisión para elegir la vector database correcta según el proyecto
- Diseñar estrategias de producción: scaling, monitoring, backups, migraciones y optimización de costos
Antes de empezar
Qué necesitas traer
Es para ti si...
- AI Engineers construyendo sistemas RAG que necesitan almacenar y buscar embeddings a escala
- Desarrolladores que completaron la guía Embeddings Deep Dive y quieren implementar vector storage para producción
- Ingenieros backend evaluando opciones de vector databases (ChromaDB vs Pinecone vs Weaviate) para sus proyectos de AI
- Estudiantes que se preparan para las semanas 7-9 del AI Engineering Bootcamp (módulos de implementación RAG)
Requisitos y materiales
- Guía Embeddings Deep Dive completada (Guía #6): cómo generar embeddings, distance metrics, semantic search con numpy
- Guía AI Semantics completada (Guía #5): qué son los vectores, similaridad coseno, keyword vs semantic search
- Python intermedio: funciones, clases, async/await, paquetes pip
- Familiaridad básica con REST APIs (requests, endpoints, JSON)
Contenido
El temario, módulo por módulo
Abre cualquiera para ver sus lecciones.
- Módulo 1: Por qué Vector Databases para AI Engineers
- Cápsula 02: El problema de fondo — RAG necesita encontrar 5 docs entre millones en milisegundos
- Por qué SQL/NoSQL no sirven para semantic search
- Por qué numpy/pandas no escalan a producción
- Cuándo SÍ necesitas vector database
- Cuándo NO necesitas vector database
- Trade-offs: Simplicidad vs Performance vs Costo
- Resumen del Módulo 1 y Transición
- Módulo 2: Cómo funcionan Vector Databases (Conceptual)
- Cápsula 02: Arquitectura de Vector Databases (3 Capas)
- Cápsula 03: Indexing Algorithms - Overview
- Cápsula 04: HNSW - Hierarchical Navigable Small World
- Cápsula 05: IVF - Inverted File Index
- Cápsula 06: PQ - Product Quantization
- Cápsula 07: Comparación HNSW vs IVF vs PQ - Decision Framework
- Cápsula 08: Por qué esto importa para RAG - Resumen del Módulo
- Módulo 3: Features Esenciales para RAG
- Cápsula 02: Metadata Filtering (Where Clauses)
- Cápsula 03: Hybrid Search (Keyword + Semantic)
- Cápsula 04: Multi-tenancy (Aislamiento de datos)
- Cápsula 05: Batch Operations — el costo oculto del ingestion ingenuo
- Cápsula 06: Distance Metrics — la decisión geométrica que casi nadie justifica
- Cápsula 07: Observability — qué medir cuando ya nadie debugea con prints
- Cápsula 08: Features Comparison y Resumen del Módulo
- Módulo 4: ChromaDB Setup y Configuración
- Cápsula 02: ChromaDB Installation y Setup
- Cápsula 03: Collection Configuration — los tres parámetros que casi nadie justifica
- Cápsula 04: Metadata Filtering Implementation — del concepto al código en ChromaDB
- Cápsula 05: Batch Ingestion en ChromaDB — del concepto al pipeline operable
- Cápsula 06: Query Optimization — donde se gana o se pierde la latencia real
- Cápsula 07: Persistence y Durability — qué pasa cuando algo se rompe
- Cápsula 08: Mini-Proyecto - Document Search System
- Cápsula 09: Embeddings con OpenAI — Cuándo cambiar del default
- Cápsula 10: Chunking de documentos — el problema del documento entero
- Cápsula 11: Pipeline RAG end-to-end con ChromaDB
- Módulo 5: Landscape de Vector Databases para AI Engineers
- Cápsula 02: Panorama de Proveedores de Vector DB
- Cápsula 03: Managed vs Self-Hosted
- Cápsula 04: Comparación de Features para RAG
- Cápsula 05: Costos y Trade-offs de Selección
- Cápsula 06: Cuándo Elegir Cada Opción
- Cápsula 07: Anti-patrones al Elegir Vector DB
- Cápsula 08: Proyecto - Decision Tree para Elegir Vector DB
- Módulo 6: Decision Matrix para AI Engineers
- Cápsula 02: Requisitos y Criterios de Decisión
- Cápsula 03: Pesos, Scoring y Metodología de la Matriz
- Cápsula 04: Matriz de Decisión Práctica
- Cápsula 05: Análisis de Costos y ROI
- Cápsula 06: Recomendación por Escenarios
- Cápsula 07: Casos de Elección Real
- Cápsula 08: Proyecto - Cuestionario de Decisión
- Módulo 7: Production Considerations para RAG
- Cápsula 02: Estrategias de Escalado
- Cápsula 03: Monitoring y Observabilidad para Sistemas RAG
- Cápsula 04: Backup y Disaster Recovery
- Cápsula 05: Seguridad para Sistemas RAG
- Cápsula 06: Optimización de Costos y Rendimiento para RAG
- Cápsula 07: Migración sin Downtime (ChromaDB → Pinecone)
- Cápsula 08: Proyecto - Production Readiness Checklist
- Módulo 8: Proyecto Integrador RAG con ChromaDB
- Cápsula 02: Arquitectura del Proyecto
- Cápsula 03: Pipeline de Ingestion para 1,000+ documentos
- Cápsula 04: Retrieval, Generation y API
- Cápsula 05: Testing y Evaluación
- Cápsula 06: Observabilidad y Deployment
- Cápsula 07: Hardening Final
- Cápsula 08: Proyecto - RAG Production-Ready
Dónde encaja
Esta guía es parte de algo más grande
Se estudia dentro de estos programas, con acompañamiento y fechas.
Dudas frecuentes
Lo que suele preguntarse
Sin límite. Es una guía gratuita: entras cuando quieras, las veces que quieras.
No. Los módulos están ordenados de menos a más, pero puedes saltar al que necesites. Tu progreso se guarda por lección.
Lo que haga falta está en «Qué necesitas traer», arriba. Si no aparece nada ahí, puedes empezar desde cero.
En el grupo de WhatsApp del Club, y cada quince días hay un live con un instructor donde se resuelven dudas en vivo.
Sí. Al terminar todas las lecciones se emite automáticamente, con un código verificable que puedes compartir en LinkedIn.
No. Esta guía es autoguiada y sin fechas. El bootcamp es en vivo, por cohorte, con entregas que alguien revisa.
Empieza cuando quieras
Lo que dicen los estudiantes
Estas reseñas son de estudiantes inscritos que completaron al menos el 50% del curso. Moderamos las reseñas solo por motivos de contenido (spam, lenguaje ofensivo, datos personales), nunca por ser críticas o negativas.
Aún no hay reseñas aprobadas.
¡Sé el primero en compartir tu experiencia!