WeatherNext omitió la física. Esa es toda la historia.
WeatherNext de DeepMind hace algo contraintuitivo: predice trayectorias de ciclones aprendiendo patrones en datos de reanálisis en lugar de resolver ecuaciones de Navier-Stokes en supercomputadoras. Cincuenta años de predicción numérica del tiempo construidos sobre la suposición de que debes modelar la física para modelar el mundo. WeatherNext se entrenó en reanálisis ERA5 y predice el siguiente estado atmosférico directamente. El error de trayectoria de ciclones disminuyó significativamente en comparación con HRES de ECMWF, un modelo basado en física que cuesta órdenes de magnitud más para ejecutar.
La ingeniería de características específicas del dominio—gradientes de presión, campos de vorticidad, temperatura potencial—se convirtieron en representaciones aprendidas. Este es el mismo cambio que AlphaFold hizo a Rosetta. Una red profunda absorbió décadas de conocimiento de dominio sin que nadie escribiera una sola ecuación de física. Y está llegando a cada flujo multivariado que posees: microestructura de mercado, telemetría de sensores, enrutamiento de flotas, pronóstico de carga.
Para equipos que construyen agentes que tocan datos continuos, esto no es una historia de modelo. Es una historia de arquitectura.
Por qué tu agente es malo en series temporales (y no lo sabe)
Los agentes LLM a los que se les pide razonar sobre flujos numéricos chocan contra una pared en el momento en que intentas hacerlos predecir realmente. Los tokenizadores destrozan flotantes. Una lectura de temperatura como 1273.44 se convierte en 4-6 tokens sin significado ordinal. Tu modelo no tiene concepto nativo de que 1273 está cerca de 1274. Es un truco que aprendió del texto de entrenamiento, no una comprensión estructural de magnitud.
Las ventanas de contexto colapsan rápidamente. Diez mil lecturas de sensores a 1 Hz—tres horas de datos—alcanzan límites de tokens antes de que hayas formulado la pregunta. Así que resumes. Alimentas al agente con texto: "la serie promedió 67.3, alcanzó un pico de 89.2, tendencia al alza." Ahora el agente está razonando sobre resúmenes, no sobre el flujo real. Inventa patrones que pasan a simple vista pero fallan en backtests.
La recuperación no lo arregla. Puedes recuperar contexto histórico con RAG, gráficos de ticks, noticias. Aún estás recuperando texto sobre la serie, no la serie misma. La señal: tu conjunto de evaluación mide "¿suena bien la respuesta?" no "¿predice el siguiente valor?" El razonamiento de cadena de pensamiento sobre secuencias numéricas alucina con confianza.
El patrón de delegación: agente como enrutador, modelo de secuencia como herramienta
La solución es arquitectónica, no un juego de escala de modelo. El LLM decide qué preguntar y cómo actuar. Un modelo de secuencia especializado produce el pronóstico. Conéctalo como una herramienta.
Firma de herramienta: forecast(series_id, horizon, quantiles) -> {p10, p50, p90, confidence}. Tienes opciones: TimesFM (Google), Chronos (Amazon), Moirai (Salesforce), Lag-Llama—todos preentrenados, decentes de cero disparos en dominios donde han visto estructura. Ajusta solo cuando tu dominio tiene cambios de régimen estructural que el modelo preentrenado perdió.
Matemáticas de latencia: una inferencia de Chronos-small se ejecuta en 200–500ms por llamada de pronóstico versus 3–8 segundos de "razonamiento" de LLM que es peor. Matemáticas de costo: una llamada de Chronos-small cuesta fracciones de centavo. Un modelo de clase GPT-4 procesando 8k tokens de CSV cuesta 20–100x más y es menos preciso. Cuando tu agente necesita pronosticar cada 15 minutos en 500 sensores, la diferencia de costo cambia de "optimización" a "modelo de negocio."
Aquí es donde hemos construido nuestra lógica de enrutamiento para modelos de razonamiento de agentes—el razonamiento costoso y capaz se mantiene para decisiones, no para transcripción de patrones que los datos ya contienen.
Cuándo deferir, cuándo razonar: una regla de decisión que realmente usamos
Continuo, multivariado, más de 100 puntos, necesita una respuesta numérica: modelo de secuencia, siempre. Eventos dispersos con contexto de texto rico—incidentes, tickets, noticias, correos electrónicos de clientes—el razonamiento de LLM gana. Cuando necesitas tanto pronóstico como narrativa, el modelo de secuencia produce el número y banda de confianza; el LLM produce la historia. La detección de anomalías es el caso ambiguo: deja que el modelo de secuencia calcule residuales de pronóstico, luego el LLM clasifica picos de alta varianza en "anomalía real" o "falla del sensor."
El fracaso a evitar: hacer que el LLM "verifique la cordura" del modelo de secuencia y lo anule. Acabas de re-añadir la alucinación. El agente cuestiona su herramienta porque el número "parece demasiado alto." Un agente que no confía en sus herramientas es un agente que está haciendo el trabajo dos veces.
El verdadero compromiso en el que pensamos: el trabajo útil por dólar no es la primera pregunta—¿tu problema necesita un bucle de agente en absoluto, o un flujo de trabajo? Si estás pronosticando un flujo y el pronóstico es la decisión, no necesitas un agente. Canaliza el pronóstico directamente a tu infraestructura. Los agentes brillan cuando el siguiente paso depende del razonamiento sobre el pronóstico más contexto externo.
Plomería de producción: esquemas, reintentos y el contrato de confianza
La disciplina de ingeniería importa. Devuelve cuantiles, no estimaciones puntuales. El agente necesita incertidumbre para decidir si actuar o escalar. Un pronóstico de "73 con p10=71, p90=75" le dice al agente si despertar a alguien. Una estimación puntual de "73" no le dice nada.
Versiona el modelo detrás de la herramienta. Registra entradas, salidas y métricas de deriva por llamada. Aplica la misma disciplina de observabilidad que usarías para registros de caché-razón en tu observabilidad de agentes: si la confianza del pronóstico cae por debajo de tu umbral, el agente debería ampliar la ventana de consulta o escalar, no re-solicitarse a sí mismo.
Ejecuta evaluación de relleno semanalmente. Reproduce los últimos 90 días de series de producción contra tu modelo de secuencia. Alerta sobre regresiones de MAPE. La trampa que hemos encontrado: los modelos de secuencia preentrenados se desvían silenciosamente en flujos no estacionarios. Programa re-evaluación trimestral—no solo evalúes en el despliegue. Si tu dominio era estacionario hace seis meses y ahora no lo es, tu modelo de secuencia no lo sabe.
Lo que esto significa para los próximos 12 meses de diseño de agentes
WeatherNext es una señal, no un caso aislado. Espera modelos de fundación especializados para pronóstico de carga, microestructura de libro de órdenes, telemetría de flotas. Tu marco de agentes necesita tratar "llamar a un modelo especializado" como una primitiva de primera clase, no como una herramienta añadida. El ventaja competitiva cambia de "cuál LLM" a "a qué herramientas sabe llegar tu agente."
Los equipos que aún intentan solicitar a modelos de clase GPT para pronosticar perderán contra equipos que envían la arquitectura aburrida. La lectura incómoda: para muchos problemas de alto valor, el LLM es la parte menos interesante de la pila. Es enrutamiento y orquestación y saber cuándo deferir.
Si estás construyendo un agente que toca un flujo numérico, audita un flujo de trabajo esta semana. Mide qué está haciendo realmente tu LLM con los números. Luego compáralo con una llamada de cero disparos de TimesFM o Chronos. Estamos felices de ayudarte a ejecutar esa comparación en /contact.