términos del glosario
Inferencia por lotes
- Categoría
- Training, Adaptation & Inference
- Dificultad
- Intermedio
Definición
La inferencia por lotes es el proceso de ejecutar un modelo de aprendizaje automático en una gran colección de puntos de datos simultáneamente, en lugar de procesar solicitudes individuales en tiempo real.
Cómo funciona y contexto
La inferencia por lotes es una estrategia de despliegue en la que un modelo procesa un conjunto de entradas pre-recopiladas como un único trabajo. A diferencia de la inferencia en tiempo real (u online), que requiere respuestas de baja latencia para las interacciones individuales de los usuarios, la inferencia por lotes prioriza el rendimiento y la eficiencia de los recursos. Este enfoque es ideal para escenarios donde los resultados no se necesitan de inmediato, como la generación de informes diarios, el procesamiento de datos históricos o la realización de etiquetado de datos a gran escala. Al agrupar los datos, los sistemas pueden maximizar la utilización del hardware, como el procesamiento por lotes en GPU, lo que reduce significativamente el coste por predicción. Sin embargo, la limitación principal es la latencia; debido a que el sistema espera un volumen suficiente de datos o una ventana programada para activar el proceso, no puede soportar aplicaciones interactivas. La elección entre la inferencia por lotes y la de tiempo real depende totalmente de los requisitos de latencia específicos y la frecuencia de los datos entrantes.
Por qué es importante
Al desacoplar la predicción de la experiencia inmediata del usuario, los desarrolladores pueden optimizar el uso de la infraestructura, manejar conjuntos de datos masivos que abrumarían a los sistemas en tiempo real y realizar análisis complejos durante las horas de menor actividad.
Ejemplo real
Una empresa minorista utiliza la inferencia por lotes para generar recomendaciones de productos personalizadas para toda su base de clientes cada noche. En lugar de calcular estas recomendaciones cuando un usuario inicia sesión, el sistema procesa el historial de navegación del día anterior de millones de usuarios en un único trabajo por lotes. Esto garantiza que cuando los usuarios visitan el sitio a la mañana siguiente, su feed personalizado ya esté preparado, ahorrando costes de computación significativos durante las horas de mayor tráfico.
Errores frecuentes
- Asumir que la inferencia por lotes puede reemplazar a la inferencia en tiempo real para funciones interactivas del usuario.
- No tener en cuenta la brecha de latencia entre la recopilación de datos y la disponibilidad de la predicción.
- Sobreaprovisionar la infraestructura tratando los trabajos por lotes como si requirieran el mismo hardware de baja latencia que los servicios en tiempo real.
- Descuidar la implementación de un manejo de errores robusto para fallos parciales en los lotes.
Preguntas frecuentes
¿En qué se diferencia la inferencia por lotes de la inferencia en tiempo real?
La inferencia en tiempo real proporciona respuestas inmediatas a solicitudes individuales, mientras que la inferencia por lotes procesa grupos de datos en intervalos programados, priorizando la eficiencia sobre la velocidad.
¿Cuándo debería elegir la inferencia por lotes en lugar del streaming?
Elija la inferencia por lotes cuando su caso de uso no requiera resultados inmediatos, cuando necesite procesar conjuntos de datos masivos o cuando desee minimizar los costes de infraestructura utilizando recursos informáticos fuera de las horas punta.
¿Se puede utilizar la inferencia por lotes para modelos de IA generativa?
Sí, la inferencia por lotes se utiliza con frecuencia para modelos generativos al crear grandes volúmenes de contenido, como la generación de miles de imágenes de marketing o el resumen de archivos de documentos largos, donde no se requiere una salida inmediata.