Descripción del episodio
¿Sabías que puedes convertir cualquier texto en coordenadas de 1024 dimensiones y hacer búsquedas inteligentes, clasificación automática o detección de duplicados sin depender de servicios en la nube? En este episodio te enseño a utilizar los embeddings con Ollama para potenciar tus documentos, correos y apuntes desde tu propio equipo Linux.Los embeddings son una de las tecnologías más fascinantes de la inteligencia artificial actual. Básicamente, convierten palabras, frases o párrafos enteros en vectores numéricos que capturan su significado. Esto permite que un ordenador entienda que "gato" está más cerca de "felino" que de "nevera", y mucho más: desde búsqueda semántica hasta clasificación sin entrenamiento, pasando por deduplicación de documentos y sistemas de recomendación.Lo mejor de todo es que no necesitas una GPU potente ni una cuenta en ningún servicio externo. Con Ollama ejecutándose en local y el modelo BGE-M3 (multilenguaje, con soporte para español), puedes generar embeddings desde la terminal con una simple llamada curl o con unas pocas líneas de Python. Y si necesitas escalar, ChromaDB te ofrece una base de datos vectorial completa con persistencia en disco y filtros por metadatos.Capítulos del episodio:0:00 - Introducción y concepto de embeddings2:42 - ¿Qué son los embeddings exactamente?5:13 - Modelos de embeddings: BGE-M3, all-MiniLM-L6-v27:25 - Cómo generar embeddings con Ollama y curl8:01 - Búsqueda semántica: más allá de grep11:57 - Búsqueda semántica con Python y NumPy14:29 - Bases de datos vectoriales para escalar14:53 - Clasificación sin entrenar el modelo18:20 - Clasificación de sentimientos y categorías20:02 - Deduplicación de documentos con embeddings24:50 - Sistema de recomendaciones con similitud semántica27:15 - ChromaDB: base de datos vectorial persistente29:02 -