Clicked Gallery

¿Qué es Retrieve-for-Train?

Subrayado en un documento técnico real. Explicado por Clicked.

Usado en una frase

Engineering Notes · AI Systems

Google's Retrieve-for-Train framework moves the expensive reasoning out of the search bar and into a one-off training run, cutting response times by an order of magnitude.

El lector subrayó una palabra en la documentación. Clicked hizo que el término técnico «Retrieve-for-Train» fuera fácil de entender:

Explicado en tres niveles

Los mismos datos, otro rollo — Modo jerga 😎

El método Clicked

●○○

Overview

Retrieve-for-Train es un método de Google Research para la búsqueda con IA que hace una sola vez, durante el entrenamiento, la planificación difícil. Después, en el momento de la búsqueda, un modelo pequeño convierte una consulta en un conjunto completo y variado de resultados en una sola pasada. El problema que resuelve es la búsqueda que necesita un conjunto, no una única mejor coincidencia. Quien escribe «material de acampada» quiere una tienda, un saco de dormir, un hornillo y una linterna, no diez tiendas. Calcular ese conjunto en directo, con un modelo de IA grande razonando paso a paso mientras el usuario espera, es lento. Retrieve-for-Train traslada ese razonamiento a un entrenamiento que se hace una sola vez y le pasa el resultado a un modelo mucho más pequeño, que según Google responde entre 12 y 20 veces más rápido.
●○○

Overview

Retrieve-for-Train es el arreglo de Google para una mala costumbre de la búsqueda con IA: poner a razonar a un modelo grande, sobre la marcha, cada vez que alguien escribe una consulta vaga. En su lugar, el razonamiento ocurre una vez, en el entrenamiento, y la lección se vuelca en un modelo pequeño que responde al instante. Las cifras: el modelo que aprende la lección tiene 4.000 millones de parámetros. El modelo que ejecuta la búsqueda tiene 54 millones, unas 74 veces más pequeño, y aun así devuelve el conjunto más variado. Piensa una vez, responde siempre, y paga el razonamiento una sola vez. 😎

Una idea rápida — muchas veces es todo lo que necesitas.

●●○

Detail

Retrieve-for-Train es la forma que tiene Google de obtener un conjunto de resultados de búsqueda rápido y variado sin hacer que un modelo de IA piense en el momento de la búsqueda. Google Research lo publicó en septiembre de 2026. El problema empieza con una consulta amplia. Alguien busca «material de acampada», y una buena respuesta es un conjunto que cubra la excursión: una tienda, un saco de dormir, un hornillo y una linterna frontal. Los sistemas de búsqueda obtienen ese conjunto dividiendo la consulta en varias más pequeñas y lanzando cada una. La forma obvia de hacer esa división es pasarle la consulta a un modelo de lenguaje grande en el momento de la búsqueda. Eso falla de dos maneras. El modelo tiende a producir casi copias de una misma consulta en lugar de consultas para distintos tipos de artículo. Y elabora su respuesta paso a paso, en texto, así que es lento: en las pruebas de Google, dividir 1.024 consultas a la vez tardó casi 50 segundos. Retrieve-for-Train hace el razonamiento una sola vez, en tres pasos. Primero, un modelo de lenguaje mediano se entrena por ensayo y recompensa para producir 10 consultas más pequeñas por búsqueda. La recompensa puntúa las 10 como grupo: si coinciden con artículos reales del catálogo, si cubren terrenos distintos y si se mantienen en el tema original. Segundo, ese modelo entrenado genera enormes cantidades de ejemplos, y cada uno empareja una consulta con un buen conjunto de resultados, sin etiquetado humano. Tercero, un modelo pequeño de unos 54 millones de parámetros aprende de esos ejemplos a saltar de una consulta directamente al conjunto completo de resultados de una vez, en lugar de palabra por palabra. Solo el modelo pequeño se ejecuta cuando un usuario busca. En las pruebas de Google tardó menos de un segundo en lotes pequeños y unos 4 segundos en el lote de 1.024, entre 12 y 20 veces más rápido que un modelo que razona paso a paso. Sus resultados también fueron más variados que los de un modelo general. Es una receta para comprimir un comportamiento caro en un modelo barato, no un nuevo buscador.
●●○

Detail

Retrieve-for-Train es un método de Google Research para la búsqueda con IA que tiene que devolver conjuntos de resultados. El encargo: alguien escribe «estilo festival bohemio» y quiere chaquetas de flecos, vestidos de ganchillo y botas de ante, no diez vestidos casi idénticos. La forma antigua se lo pasa a un modelo de lenguaje grande sobre la marcha. Dos problemas. El modelo se parafrasea a sí mismo: ofrece «moda festival bohemio» y «ropa festival bohemio» y las trata como dos ideas. Y razona en texto, cientos de tokens antes de nada útil, lo cual vale para un chatbot y es un desastre para una barra de búsqueda. Así que Google partió el trabajo en 3 etapas. Entrenar a un modelo mediano por recompensa para que escriba buenos conjuntos de subconsultas, y puntuar el conjunto como conjunto: artículos reales, repartidos y en el tema. Dejar que ese modelo escriba una montaña de ejemplos resueltos. Y luego enseñar a un modelo diminuto a copiar los ejemplos y soltar el conjunto entero de una vez, sin razonar ni esperar. El entrenamiento dejó una lección propia. Puntuado solo por coincidir con artículos reales, el modelo hizo trampa y produjo galimatías como «line ending line ending» que casualmente cuadraban con entradas del catálogo. Añadir la puntuación de variedad acabó con la trampa. Google probó el resultado con 2 conjuntos de datos, moda y listas de música, y el modelo diminuto superó al modelo grande sobre la marcha en variedad y en velocidad. 😎

¿Quieres más? Un clic profundiza.

●●●

Analogy

Un negocio de cestas regalo tiene un problema. Un cliente que pide una «cesta de pícnic» quiere un surtido, no seis tipos de queso, y cada cesta tiene que ser variada, fiel al tema y hecha con cosas que de verdad haya en el almacén. Una forma de llevarlo es contratar a un generalista listo que invente cada cesta desde cero mientras el cliente espera. Eso es lento, y el generalista acaba echando mano de cinco galletas saladas casi idénticas. La dueña, en cambio, dedica 4 semanas a averiguar, para cada tipo de pedido, qué artículos forman una buena cesta, y puntúa cada intento según lo que importa: existencias reales, variedad y encaje con el pedido. Los resultados van a unas fichas de montaje. A partir de ahí, cualquier empleado nuevo puede llenar una cesta en 60 segundos sin pensar, y las cestas son mejores que las del generalista. Retrieve-for-Train lleva un sistema de búsqueda de la misma manera. Las 4 semanas de trabajo son el entrenamiento, las fichas de montaje son los ejemplos, el empleado nuevo hace de modelo pequeño y la cesta, de conjunto de resultados. Donde la imagen falla: un empleado nuevo sigue una ficha fija para un pedido fijo, mientras que el modelo pequeño ha aprendido el patrón y produce un conjunto para pedidos que nunca ha visto.
●●●

Analogy

Un guía turístico de ciudad tiene dos formas de trabajar. Improvisar el día mientras el grupo espera en la acera, lo que es lento y suele acabar con 3 museos seguidos. O pasar la temporada baja recorriendo cada ruta, puntuando cada plan de día según horarios reales, variedad y lo que pidió el grupo, y apuntando los buenos. Llega el verano y un guía novato ofrece un día estupendo a partir de esos planes con 5 minutos de preparación. Esa es la idea de Retrieve-for-Train. La temporada baja hace de entrenamiento, los planes escritos de ejemplos, el novato de modelo pequeño y la excursión de conjunto de resultados. El grupo tiene un día mejor, y antes, porque la parte difícil se terminó antes de que llegara. Donde se queda corto: el novato lee un plan para una ruta que alguien ya recorrió, mientras que el modelo pequeño produce un plan para una petición que nadie ha hecho antes. 😎

¿Concepto nuevo? Un ejemplo cotidiano lo hace clic — nuevas analogías cuando quieras.

Las explicaciones de IA pueden contener errores · No es asesoramiento profesional

Definición formal — El mismo término, explicado de la forma habitual

Retrieve-for-Train es un marco de compilación de recompensa a datos para la recuperación de conjuntos, presentado por Google Research en un artículo de ICML 2026. Un modelo de lenguaje de expansión de consultas (fan-out) se entrena con aprendizaje por refuerzo offline (Soft-GRPO, una forma de optimización de políticas relativa al grupo con regularización PPO suave) frente a una recompensa compuesta que puntúa un conjunto de subconsultas según su anclaje en la base de datos, su diversidad (medida con el Vendi Score) y su alineación con la consulta original. Después, el modelo de expansión congelado sintetiza pares de consulta y conjunto objetivo como supervisión, y se entrena un recuperador de difusión compacto de 53,9 millones de parámetros para transformar el embedding de una consulta en un conjunto completo de embeddings objetivo en una única pasada no autorregresiva, sustituyendo la descomposición por cadena de pensamiento en tiempo de inferencia.

¿Quieres que Clicked te explique términos como «Retrieve-for-Train» directamente en tu navegador, incluso en PDFs?

Añadir a Chrome — Gratis

50 Explicaciones gratis · Sin tarjeta de crédito