Fundamentos · Lectura de 7 min

Qué son los embeddings: convertir palabras en coordenadas

Para una máquina, 'rey' y 'reina' no son letras: son puntos en un mapa. Aquí ves cómo se dibuja ese mapa.

Dale a una máquina la palabra "rey" y no verá una R, una E, una Y. Verá un punto suspendido en un mapa de cientos de dimensiones, con una coordenada exacta. Dale "reina" y aterrizará en otro punto, cerca del primero. "Trono", "corona", "monarca" caerán en el mismo barrio. "Zanahoria" quedará al otro lado del mundo. Ese mapa tiene nombre: se llama embedding, y es la forma en que las máquinas modernas guardan el sentido de las cosas. Su regla es hermosa: cerca significa parecido. Este artículo trata de cómo se dibuja ese mapa.

Un buscador clásico compara letras: si escribes "auto" no encuentra "coche", porque no comparten caracteres. Pero un mapa de embeddings pondría "auto" y "coche" casi encima. La diferencia entre esas dos formas de buscar es la diferencia entre deletrear y entender. Y todo empieza por convertir una palabra en un lugar.

01 · la coordenadaQué son los embeddings: una palabra convertida en lugar

Un embedding es una lista de números que representa el significado de algo (una palabra, una frase, una imagen) como un punto en el espacio. Donde tú lees "gato", la máquina guarda algo parecido a [0.24, −0.81, 0.05, …]: cientos de números, cada uno una coordenada en un eje distinto. Un punto en un mapa de papel necesita dos coordenadas (latitud y longitud); un punto en una habitación necesita tres; una palabra en este universo necesita cientos (típicamente 384, 768, 1536 o más, según el modelo). No podemos dibujar 768 ejes, pero la intuición aguanta: cada palabra es un punto, y su posición no es un capricho.

Ese número, cuántas coordenadas tiene cada punto, se llama dimensión del embedding, y lo fija el modelo que lo produce. Más dimensiones dan más lugar para separar matices; menos dimensiones ocupan menos memoria y se comparan más rápido. Es la primera decisión de ingeniería de cualquier mapa semántico: cuánto detalle cabe en cada punto.

Un embedding es el sentido de una palabra escrito como una dirección postal en un mapa de cientos de dimensiones.

02 · el trazadoCómo se dibuja el mapa: por las compañías que una palabra mantiene

Nadie coloca los puntos a mano. Nadie decide "pondré 'rey' en la coordenada 0,24". El mapa lo aprende un modelo leyendo cantidades enormes de texto, guiado por una vieja sospecha lingüística que el británico J. R. Firth resumió en 1957: una palabra se conoce por la compañía que mantiene [1]. Es la hipótesis distribucional, y es el motor de todo lo que sigue.

La mecánica, sin fórmulas, es esta. El modelo desliza una ventana por millones de frases y se hace una y otra vez la misma pregunta: dada esta palabra, ¿qué palabras suelen rodearla? "Perro" aparece cerca de "ladra", "correa", "hueso"; "gato" cerca de "ronronea", "araña", "tejado". Como ambos comparten muchos vecinos ("mascota", "veterinario", "acariciar"), el modelo los va empujando a coordenadas cercanas. Palabra por palabra, ajuste por ajuste, el mapa se ordena solo: lo que se usa parecido termina cerca. La geometría es un residuo del uso.

Figura 1 · el mapa terminado se ordena en barrios
perro gato mascota animales río lago corriente agua ira furia cólera emociones
Nadie dibujó estos barrios: emergen del uso. Las palabras que aparecen en contextos parecidos quedan juntas, y los grupos ajenos se alejan. Esquema ilustrativo; un mapa real vive en cientos de dimensiones, no en dos.
Figura 2 · el mismo texto, dos formas de guardarlo
Buscador de letras a-u-t-o c-o-c-h-e no comparten letras → para el buscador, ajenas Mapa de embeddings auto coche zanahoria cerca = parecido de sentido
A la izquierda, "auto" y "coche" son cadenas de letras distintas y por tanto ajenas. A la derecha, el embedding las coloca casi encima porque se usan igual; "zanahoria" queda lejos. Ilustración propia del contraste léxico vs. semántico.

03 · la medidaCerca cuánto: la distancia se lee como un ángulo

Si el sentido es posición, la similitud es cercanía. Dos ideas parecidas son dos puntos vecinos; dos ideas ajenas, dos puntos lejanos. Pero conviene precisar qué significa "cerca" aquí, porque no se suele medir en línea recta. Se mide el ángulo entre los dos vectores que van del origen a cada punto: la similitud coseno. Si dos flechas apuntan casi en la misma dirección, el ángulo es pequeño y su coseno se acerca a 1 (significan casi lo mismo). Si son perpendiculares, el coseno es 0 (sin relación). Lo elegante de medir el ángulo y no el largo es que a la máquina le importa hacia dónde apunta un significado, no cuánto mide su flecha.

Ese número entre −1 y 1 es, al final, lo que hace útil a todo el mapa: convierte "¿se parecen?" en una cuenta que una computadora resuelve en microsegundos. La tabla siguiente traduce el coseno a intuición.

Tabla 1 · Cómo leer la similitud coseno entre dos embeddings
CosenoÁnguloQué significaEjemplo
≈ 1casi 0°Casi el mismo sentido"coche" y "auto"
≈ 0,5~60°Relacionados, no iguales"coche" y "carretera"
≈ 090°Sin relación"coche" y "zanahoria"
≈ −1180°Direcciones opuestascasos raros en texto real

Fuente: elaboración propia sobre la definición de similitud coseno; los ejemplos son ilustrativos. La escala −1 a 1 es la de la función coseno.

Preguntar "¿se parecen estas dos ideas?" se vuelve medir un ángulo. El sentido se hizo aritmética.

04 · el alcanceNo solo palabras: frases, documentos e imágenes en el mismo mapa

El primer mapa famoso fue de palabras sueltas (word2vec, del equipo de Tomáš Mikolov en Google, en 2013 [2]) y con él llegó el prodigio de que "rey − hombre + mujer" aterrizaba cerca de "reina": las relaciones se habían vuelto direcciones. Pero el poder real llegó cuando el mapa dejó de ser de palabras y pasó a ser de frases y documentos enteros. Modelos como Sentence-BERT, presentado por Nils Reimers e Iryna Gurevych en 2019, aprendieron a colocar una oración completa en un solo punto [3], de modo que "¿cómo cancelo mi suscripción?" y "quiero dar de baja mi cuenta" caen vecinos aunque no compartan casi ninguna palabra.

Y el mapa ni siquiera se limita al lenguaje. Los modelos multimodales colocan una foto de un gato y la frase "un gato atigrado" en el mismo espacio, cerca uno del otro: por eso hoy puedes buscar imágenes escribiendo lo que quieres ver. Distintas puertas (texto, imagen, sonido) que dan al mismo firmamento de coordenadas.

Para qué sirve, en concreto

Si el sentido es cercanía, buscar por significado es buscar por vecindad. Conviertes tu pregunta en un punto, y recuperas los puntos vecinos: los textos que significan algo parecido, aunque no compartan ni una palabra. Esa es la búsqueda semántica, y es el corazón del RAG (generación aumentada por recuperación). Antes de responder, un sistema como Qirava convierte tu consulta en un embedding, busca en el mapa de sus documentos los puntos más próximos y se los entrega al modelo para que responda con fundamento y no de memoria. Guardar y comparar millones de esos puntos con eficiencia es, a su vez, el trabajo de una base de datos vectorial.

Conviene una nota de honestidad: estos mapas heredan lo que leen. Si el texto que entrena al modelo carga prejuicios, la geometría los absorbe como direcciones también, y esa es una constelación que conviene mirar con ojo crítico. Pero incluso ahí la lección se sostiene. Un embedding es un espejo del lenguaje humano, con su luz y sus sombras, traducido a coordenadas. La próxima vez que un buscador entienda lo que quisiste decir y no solo lo que escribiste, recuerda el mapa invisible: alguien convirtió tus palabras en lugares, y midió cuánto distan de lo que buscabas.

Fuentes

  1. Firth, J. R. (1957). A Synopsis of Linguistic Theory, 1930-1955. En Studies in Linguistic Analysis, pp. 1-32. Oxford: Blackwell. (Origen de la frase "You shall know a word by the company it keeps", base de la hipótesis distribucional.)
  2. Mikolov, T., Chen, K., Corrado, G., & Dean, J. (2013). Efficient Estimation of Word Representations in Vector Space. arXiv:1301.3781. (Introduce word2vec y la aritmética de analogías entre embeddings de palabras.)
  3. Reimers, N., & Gurevych, I. (2019). Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. Proceedings of EMNLP-IJCNLP 2019, pp. 3982-3992. ACL Anthology: aclanthology.org/D19-1410.

Aprende más sobre IA

Ver todo Aprende IA