Discusión sobre este post

Avatar de User
Avatar de Javier Villanueva

Gran artículo, me he visto muy reflejado en la parte de RAG y agentic search.

Llevo meses construyendo una capa de orquestación de memoria sobre mi propio corpus y midiendo justo esto: la misma batería de preguntas multi-hop, resueltas a lo bruto (un agente con grep + leer notas enteras, o agentes más profesionales tipo Claude Code), se come cientos de miles de tokens de entrada... sirviendo solo el contexto justo, baja a un par de miles. Y lo peor: escala muy mal, cuanto mayor es el corpus, mayor el consumo de tokens.

Por eso lo que más me resonó fue tu cierre: también creo que la clave no es qué esquiva, sino qué combinación. La capa que estoy montando va justo de eso: clasificar la intención de la consulta y decidir qué estrategia de recuperación aplicar en cada caso, en lugar de usar siempre la misma. Por ahora veo una gran mejora, pero queda mucho por aprender y probar :)

Gracias por ponerle la matemática debajo, da gusto leer el porqué estructural y no el enésimo "usa RAG".

Sin posts

Por supuesto, sigue adelante.