Blog
Ideas y guías de pin
La falla de RAG que debería preocuparle no es una respuesta faltante. Es una respuesta fluida armada con los cinco párrafos equivocados.
Cómo funciona de verdad la generación aumentada por recuperación — segmentación, embeddings, recuperación híbrida, re-ranking, ensamblado de contexto — y los cinco mecanismos distintos por los que produce una respuesta equivocada y plausible en vez de un honesto 'no encontrado'. Fundamentado en la literatura publicada, no en el diagrama de un vendedor.
Cuando un modelo explica su razonamiento, no está reportando lo que pasó adentro. Está generando más texto.
Cómo funciona mecánicamente la inferencia en un LLM moderno — el forward pass, la caché KV, el muestreo, la cuantización y lo que cada uno cuesta de verdad — y qué puede y qué no puede decirle hoy la investigación en interpretabilidad sobre por qué un modelo produjo una salida. Parte 2 de nuestra serie de profundidad técnica.
La falla de OCR que debería preocuparle no se ve como texto corrupto. Se ve como 98% de confianza y un párrafo faltante.
Construimos nuestro pipeline de OCR como una cascada enrutada por confianza, lo comparamos contra tres herramientas más nuevas de comprensión de documentos, y después le tiramos encima escaneos genuinamente sucios y vimos a la red de seguridad no atajar cuatro bugs reales. Lo que encontramos, y lo que la literatura actual realmente respalda.