Los 400ms que te cuesta tu clasificador de modalidad ya no compran nada
Hace dos años, implementamos despachadores de modalidad en cada agente capaz de visión que construimos. El patrón era simple: antes de enviar una solicitud al modelo, enrutarla a través de un clasificador ligero—basado en CLIP o GPT-4o con tokens mínimos—para responder una única pregunta: ¿es esto imagen o texto? Si es imagen, enviar a un modelo de visión. Si es texto, enviar a una variante solo de texto más barata. Este salto añadía 200–500ms y una llamada de inferencia separada, pero el compromiso tenía sentido cuando tu modelo base podía hacer lenguaje o visión, pero no ambos al mismo tiempo.
Qwen 3.8 Max cambia la ecuación. Acepta imagen, texto y video intercalados en un único prompt y mantiene paridad visión-lenguaje en todos ellos. El clasificador que solía compensar una limitación del modelo ahora está resolviendo un problema que el modelo ya ha resuelto. Estás pagando 400ms de latencia de reloj de pared y una superficie de fallo adicional para una decisión que ya no importa.
El costo no es solo latencia. Tus conjuntos de evaluación se construyeron por modalidad. Tus paneles de monitoreo rastrean la confianza del clasificador. Tu lista de verificación de implementación incluye "verificar que la caché de incrustación CLIP esté caliente." Todo eso se convierte en deuda técnica en el momento en que puedes enviar todo a un modelo y eliminar el despachador por completo. Antes de tu próximo sprint, pregunta: en los últimos 30 días de trazas de producción, ¿cuántas veces el clasificador enrutó una solicitud al modelo incorrecto? Si la respuesta es cero, tienes tu respuesta.
Lo que 1M tokens realmente mata: tu código de fragmentación y costura entre modalidades
La ventana de contexto de 1M es el ancla que mata patrones específicos, no todos los patrones. Cuando el contexto era 128k—e incluso con sumarización agresiva, la ventana útil era más cercana a 64k—construiste pipelines de PDF y captura de pantalla de múltiples documentos que pre-sumarizaban visión a texto. Etiquetaste imágenes, incrustaste las etiquetas, las recuperaste por separado, y esperaste que las incrustaciones de texto se alinearan con lo que la imagen realmente contenía. Cosiste referencias entre modalidades manualmente: "el gráfico en la página 4" requería un módulo de costura que mapeara referencias de texto a coordenadas visuales.
Con 1M tokens y paridad visión-lenguaje genuina, ese código se convierte en andamiaje. El modelo puede mantener el PDF completo, la cuadrícula de captura de pantalla, la línea de tiempo de video todo a la vez. Sin sumarización. Sin la danza de captura-y-recuperación. Sin costura de coordenadas. El cosedor es peso muerto a menos que golpees uno de los modos de fallo que hemos raspado de producción.
Pero 1M tokens no es gratis. Con los precios de Anthropic, 1M tokens de entrada en Claude Opus cuestan ~$15. Eso es un cambio de costo, no una eliminación de costo. Eliminas código pero tu gasto por solicitud en los casos pesados sube. Necesitas medir este compromiso de extremo a extremo antes de arrancar la lógica de fragmentación. Ejecuta una prueba en la sombra en 48 horas de tráfico de producción: para cada caso que actualmente se pre-sumariza, también ejecuta la versión de contexto completo y compara la calidad de salida y el costo. Si el contexto completo es 8x más barato porque estás golpeando menos llamadas de modelo aguas abajo (porque el modelo obtuvo la respuesta correcta la primera vez), elimina el fragmentador. Si es 2x más caro y la calidad de salida es la misma, mantén el fragmentador y usa Qwen 3.8 Max para los casos que genuinamente necesitan el contexto completo.
Lógica de enrutamiento que sigue siendo rentable
No todo enrutamiento muere. El enrutamiento de costo sobrevive porque depende de la economía de solicitud, no de lo que el modelo puede hacer. Si estás enviando un producto B2B donde el 80% de las consultas de usuario son texto directo (preguntas de facturación, estado de cuenta), un enrutador de costo que envíe esos a un modelo más barato y reserve Qwen 3.8 Max para tareas de razonamiento visual sigue ahorrando dinero. La decisión de enrutamiento no es "¿es esto imagen o texto?"—es "¿tiene esta solicitud suficiente margen para permitirse el modelo pesado?" Eso es ortogonal a la paridad de modalidad.
El enrutamiento de conmutación por error entre proveedores sobrevive por la misma razón. El patrón de enrutamiento de Vercel AI Gateway no le importa si estás enrutando basado en modalidad—le importa la disponibilidad y los límites de velocidad del proveedor. Si Qwen alcanza límites de velocidad o se cae, necesitas una conmutación por error a OpenAI o Anthropic. Eso sigue siendo lógica de enrutamiento real.
El enrutamiento de nivel de latencia también se gana su lugar. Si tus solicitudes interactivas tienen un presupuesto de 200ms y tus trabajos por lotes no, enrutarlos diferentemente. Envía usuarios interactivos a un proveedor rápido o a un endpoint en caché. Envía lotes a cualquier modelo que dé la mejor salida. Los filtros de seguridad por decisión no colapsan en el modelo tampoco. Tus filtros NSFW, verificaciones de toxicidad, y barandillas específicas del dominio deben ser ortogonales al modelo de razonamiento. La decisión de enrutamiento debe ser "¿viola esta salida una restricción de seguridad?" no "¿qué modelo debe manejar esta modalidad?"
La regla general que usamos ahora: si la decisión de ruta depende de la economía de solicitud, confiabilidad, o seguridad, mantenla. Si depende de modalidad, elimínala y re-evalúa la latencia de extremo a extremo.
La auditoría que ahora ejecutamos antes de tocar un agente multimodal
Antes de arrancar tu despachador de modalidad, ejecuta esta auditoría. Paso uno: extrae 30 días de registros del despachador y agrupa cada decisión de enrutamiento por modelo aguas abajo. ¿Cuántas solicitudes fueron a GPT-4o vision? ¿Cuántas a Anthropic Claude con visión? ¿Cuántas a un modelo solo de texto? Paso dos: para cada ruta, pregunta "¿qué falla si envío todo a Qwen 3.8 Max en su lugar?" Anota los modos de fallo, no en teoría—en producción. Si no puedes nombrar uno, esa ruta es peso muerto.
Paso tres: ejecución en la sombra durante 48 horas. Envía una muestra de cada cubo de enrutamiento a Qwen 3.8 Max en paralelo con tu enrutamiento actual, y difiere salidas en un conjunto de evaluación dorado. Rastrea no solo corrección sino latencia y conteo de tokens. Paso cuatro: mide el tiempo de reloj de pared de extremo a extremo con y sin el salto del despachador. Incluye latencia del clasificador, tiempo de ida y vuelta de red, y espera en cola. Si eliminar el despachador te ahorra 300ms en latencia p50, eso es real. Paso cinco: comprométete a mantener el enrutador solo si sobrevive una puerta de costo o confiabilidad, no una puerta de modalidad. Si el enrutador está ahí porque "las consultas de visión son diferentes," elimínalo. Si está ahí porque "las consultas de visión son 8x más caras y suceden el 5% del tiempo," mantenlo e instrumentalo.
Observa estos modos de fallo específicos en Qwen 3.8 Max durante tu auditoría: recuperación en referencias de imagen pasadas ~600k tokens en una única solicitud (el medio de una ventana de contexto largo aún tiene problemas), calidad de visión en escritura a mano densa y escaneos de bajo contraste (gráficos y capturas de pantalla son fuertes, documentos médicos son más débiles), y aumento de costo silencioso si tu bucle de agente reenvía bytes de imagen cada turno en lugar de cachear tokens de visión.
Modos de fallo que ya hemos golpeado en producción
Ya hemos escalado suficientes agentes multimodales en Qwen 3.8 Max para golpear los puntos de dolor reales. Primero: 1M contexto no es lo mismo que 1M contexto útil. La recuperación de visión cae notablemente en referencias de imagen pasadas la marca de 600k tokens. Si estás construyendo un agente de contexto largo que procesa un PDF de 100 páginas con capturas de pantalla dispersas a lo largo, las imágenes tempranas permanecen nítidas, pero en la página 80, el modelo comienza a perder precisión en referencias visuales en prompts. Esto no es un bloqueador—aún puedes eliminar tu código de sumarización—pero necesitas medirlo en tus documentos específicos antes de reclamar paridad de características.
Segundo: la paridad de visión es fuerte en gráficos, capturas de pantalla, y diagramas. Es más débil en escritura a mano densa, escaneos de bajo contraste, e imágenes médicas. Si tu pipeline de agente incluye documentos pesados en OCR, pruébalos. Tercero: cachea tus tokens de visión. Si tu agente es conversador y sigue reenviando bytes de imagen con cada turno, tu costo por turno se dispara. Los tokens son baratos; el procesamiento de tokens de visión es caro. Qwen volverá a codificar la misma imagen si no usas caché de prompt. Cuarto: los límites de velocidad del proveedor golpean diferentemente cuando todo se canaliza a través de un modelo. Cuando estabas dividiendo visión y texto entre dos proveedores diferentes, tenías dos presupuestos de límite de velocidad separados. Ahora tienes uno. Si Qwen se cae, pierdes todo. Asegúrate de que tu conmutación por error esté probada.
Quinto: si tenías conjuntos de evaluación construidos por modalidad (conjunto de evaluación de visión, conjunto de evaluación de texto), reconstruye el conjunto dorado para incluir prompts intercalados. Las regresiones se ocultan cuando tus evaluaciones no reflejan cómo el modelo se usa realmente. El impuesto de visión en agentes es real, pero se aplica diferentemente cuando texto y visión se procesan en el mismo pase hacia adelante.
La pregunta de ingeniería para los próximos seis meses
Multimodal de modelo único es ahora la suposición predeterminada, no la aspiración. El esfuerzo de ingeniería se desplaza lejos de la lógica de despacho y hacia observabilidad, evaluaciones, y controles de costo. Antes de que enviaras, estabas construyendo infraestructura para enrutar alrededor de limitaciones del modelo. Ahora necesitas construir infraestructura para entender qué está haciendo realmente el modelo unificado, atrapar regresiones rápido, y mantener costos predecibles mientras las ventanas de contexto crecen.
Pregúntate: ¿qué partes de tu pila de agente eran IP y cuáles eran andamiaje alrededor de limitaciones del modelo? El despachador de modalidad era andamiaje. Tu marco de evaluación podría ser IP. Tus definiciones de herramientas, índices de recuperación, y patrones de recuperación de fallo son IP. La pregunta para los próximos seis meses es si mantienes modelos de visión especializados en absoluto. Imágenes médicas, detección de cuadro delimitador preciso, inferencia en dispositivo—esos casos aún podrían necesitar un codificador de visión ligero. Pero para la mayoría de flujos de trabajo de agente, la respuesta es ahora "un modelo, todo en él."
Si estás enviando agentes de razonamiento visual hoy y quieres un segundo par de ojos sobre qué lógica de enrutamiento mantener y cuál eliminar, podemos ayudarte a ejecutar esta auditoría. Antes de tu próximo sprint, git grep tu base de código para "route_to_vision" y "modality_classifier"—si no puedes nombrar un modo de fallo que cada uno previene en los últimos 30 días de trazas, elimínalo y re-evalúa la latencia de extremo a extremo.