Skip to Field Notes content
Nota de campo 00417 min de lectura

Una ola de modelos es un evento de recotización.

Cinco modelos y un cambio de acceso aparecieron entre el 16 y el 24 de julio de 2026. Esto no es un resumen de novedades. Es una nota de ruteo: qué carriles se recotizaron, qué frontera de acceso se movió, qué no publicaron en forma verificable tres de los cuatro proveedores, y la política que aplicamos por eso.

01 / El error de categoría

Una ola de lanzamientos es un evento de recotización, no una lista de compras.

Entre el 16 y el 24 de julio de 2026 salieron cinco modelos y se movió una frontera de acceso. Moonshot AI lanzó Kimi K3 a mediados de mes, Alibaba mostró en preview Qwen3.8-Max el 19 de julio y anunció Qwen-Image-3.0 por esos mismos días, Google sacó Gemini 3.6 Flash el 21 de julio, y Anthropic lanzó Claude Opus 5 el 24 de julio. El sexto evento es de otra naturaleza y aun así pertenece a la lista: el 20 de julio, Anthropic cambió qué suscripciones de Claude incluyen Claude Fable 5. No es un modelo. Mueve la misma variable de ruteo que mueven los modelos, que es justamente el punto de esta nota.

El reflejo es preguntar cuál modelo es mejor. Esa pregunta no tiene respuesta operativa, porque nadie opera un modelo. Se opera un conjunto de rutas. Un equipo con agentes en producción ya decidió que cierto trabajo va a un carril rápido y barato, otro a un carril intermedio, y otro a lo más fuerte disponible. Cada una de esas decisiones se tomó bajo precios, límites de contexto, topes de salida, perfiles de latencia, términos de retención y reglas de acceso específicos. Una ola mueve varios de esos insumos a la vez, en direcciones distintas, para proveedores distintos. Lo que invalida no es tu elección de modelo. Es la aritmética debajo de esa elección.

La pregunta que sí produce trabajo es más angosta: para cada clase de trabajo que ya corres, qué cambió esta semana en el costo de ese carril, en el riesgo de ese carril, y en el costo de dejarlo. A veces la respuesta es nada, y nada es un hallazgo legítimo que merece una línea fechada en una tabla.

Figure 03

Nine days, six releases

  1. 16–17 JulKimi K3sources conflict

    Moonshot's blog and Forbes say 17 July; OpenRouter and Simon Willison say 16 July. Shown as a range because the sources genuinely conflict.

  2. 16–21 JulQwen-Image-3.0sources conflict

    Blog metadata says 16 July, the API doc was last updated 20 July, press converges on 21 July. No primary source states a date in body text.

  3. 19 JulQwen3.8-Max-Previewconfirmed

    Previewed at WAIC Shanghai. Token Plan only, Beijing region only.

  4. 20 JulFable 5 subscription inclusionconfirmed

    Max, premium Team and premium seat-based Enterprise, capped at 50% of weekly limits. A commercial change, not a capability one.

  5. 21 JulGemini 3.6 Flashconfirmed

    Generally available. The only release in the wave with a benchmark table that could be extracted as text.

  6. 24 JulClaude Opus 5confirmed

    $5 / $25 per million — the same price as Opus 4.8, and half of Fable 5. Benchmarks published as charts only.

  7. 25 JulThis notetoday

    Publication date. Everything above is stamped to it.

  8. 27 JulKimi K3 weights, promisedpromised

    Moonshot committed to full weights by this date. Not published as of 25 July. A commitment, not an accomplishment.

  9. Qwen3.8-Max weights, promisedpromised

    Announced as coming “soon”. No date and no named licence.

Disputed dates are drawn as ranges rather than points, and forward-dated commitments are drawn as hollow markers. Both are findings about the releases, not gaps in the reporting.

  • Una ola puede cambiar el precio unitario, el tope de salida, el límite de contexto, la latencia, los términos de acceso, los términos de retención o la región. Cada uno es un insumo de ruteo distinto.
  • Un modelo mejor en todos los ejes pero no disponible en tu región no te cambió nada.
  • La unidad de una decisión de ruteo es una clase de trabajo, no el nombre de un producto.
  • La recotización la dispara un insumo que se mueve, no un lanzamiento que ocurre.
  • 'Sin cambio' es un resultado válido, fechado y registrable.

02 / El recibo de esta nota

Sólo un modelo de esta ola publicó una cifra de benchmark que pudimos comprobar.

Publicamos el método junto con la conclusión. Cada cifra de abajo viene de la documentación propia de un proveedor, de un anuncio propio del proveedor, o de una página de medición independiente, cada una consultada directamente el 25 de julio de 2026. Cuando no pudimos consultar una página o un número no estaba publicado, lo decimos y no estimamos.

El hallazgo más útil es uno negativo. De los cinco modelos, exactamente uno publicó resultados numéricos de benchmark que pudimos extraer como texto: Gemini 3.6 Flash, en su model card de DeepMind. El anuncio de Opus 5 de Anthropic presenta todos sus resultados como gráficas, y no pudimos sacar un solo score numérico de ahí. El post de Kimi K3 de Moonshot trae una sección encabezada como tabla completa de benchmarks cuyos números se renderizan del lado del cliente y no aparecieron en ninguna de nuestras consultas. Alibaba no publicó ningún benchmark, para ninguno de sus dos lanzamientos de Qwen. Cuatro de los cinco modelos de esta ola salieron sin ninguna cifra de benchmark que pudiéramos extraer de una página consultada. Cualquier score que imprimiéramos para esos cuatro sería una transcripción de gráfica o la copia de un agregador, y no imprimimos ninguna de las dos cosas.

Segundo hallazgo: las fechas se contradicen. Kimi K3 aparece fechado el 17 de julio de 2026 por el propio blog de Moonshot y por Forbes, y el 16 de julio de 2026 por OpenRouter y por Simon Willison. La explicación más probable es un anuncio en UTC+8 que cruza el límite de un día. No arbitramos; escribimos 'mediados de julio'. Qwen-Image-3.0 es más enredado todavía: la prensa converge en el 21 de julio, los metadatos del blog oficial traen el 16 de julio, y la referencia de API en inglés de Alibaba Cloud reporta una última actualización del 20 de julio. Ninguna fuente primaria declara una fecha de lanzamiento en el cuerpo del texto.

Tercer hallazgo: dos de los cinco se anunciaron con intención de pesos abiertos, y ninguno tenía pesos públicos al momento de revisar. La licencia de Kimi K3 no aparece en ninguna página que pudimos consultar, y sin pesos públicos tampoco hay archivo de licencia público que leer. El system card de Opus 5 de Anthropic superó nuestro límite de tamaño de descarga, así que nada de ahí está verificado en esta nota, incluyendo el nivel de seguridad que reportan medios secundarios. Todo en esta pieza está fechado el 25 de julio de 2026, y parte de esto quedará obsoleto en cuestión de días.

Figure 01

What each vendor actually published

Verification quality of six model releases across five checkable attributes
ReleaseNumeric benchmarks extractablePrice publishedContext / output limitsLicence publishedDate unambiguous
Gemini 3.6 FlashYesYesYesn/a — closedYes
Claude Opus 5Charts onlyYesYesn/a — closedYes
Claude Fable 5Charts onlyYesYesn/a — closedYes
Kimi K3Table is JS-renderedYesYesNo16 vs 17 July
Qwen3.8-Max-PreviewNone publishedCredits onlyNoNoYes
Qwen-Image-3.0None publishedFree, limited timePixel bounds onlyNo16 vs 20 vs 21 July

Checked 25 July 2026. “n/a — closed” means no weights are distributed, so no model licence applies; terms of service still govern use. The column that matters is the first one: for five of six releases, no benchmark number could be extracted from a primary source at all.

  • Benchmarks numéricos que pudimos extraer: sólo Gemini 3.6 Flash.
  • Gráficas sin números extraíbles: Claude Opus 5.
  • Tabla de benchmarks presente pero renderizada del lado del cliente, no extraíble: Kimi K3.
  • Sin ningún benchmark publicado: Qwen3.8-Max-Preview, Qwen-Image-3.0.
  • Licencia no publicada: Kimi K3, Qwen3.8-Max-Preview, Qwen-Image-3.0.
  • Fecha de anuncio en conflicto entre fuentes: Kimi K3, Qwen-Image-3.0.

Línea rápida

Extracción · formato · verificaciones deterministas

Línea balanceada

Implementación por defecto · investigación rutinaria

Línea frontera

Arquitectura · ambigüedad · seguridad · síntesis

Compuerta humana

Acción consecuente · aprobación · aceptación

03 / Cuatro carriles

Define una clase de trabajo por cómo se ve su falla, no por qué tan difícil se siente.

El carril de extracción cubre clasificación, extracción, normalización, formato y conformidad con esquemas. Su modo de falla es silencioso y bien formado: un campo equivocado, una fila que se pierde, una categoría plausible sobre una entrada implausible. La salida se ve correcta, así que leerla es la verificación equivocada. Las aserciones, los fixtures y el muestreo son la verificación correcta, y por eso este carril tolera un modelo más barato de lo que la intuición sugiere. La red de seguridad no es el modelo. Es la verificación.

El carril de implementación cubre código rutinario, pruebas, migraciones de un tipo que ya hiciste antes, documentación y revisión de diffs pequeños. Su modo de falla es ruidoso: rompe el CI o lo atrapa la revisión. Cotizamos este carril en minutos de revisión, no en tokens, lo que significa que un modelo que produce código ligeramente peor pero diffs mucho más cortos puede ganar de forma contundente.

El carril de frontera cubre arquitectura, depuración ambigua, migraciones desconocidas, síntesis sensible a seguridad, y cualquier decisión donde equivocarse cuesta más que todos los tokens que gastarás en ella en toda su vida. Su modo de falla es el peligroso: una respuesta segura, coherente, internamente consistente, que está mal de una forma que el revisor no tiene el contexto para detectar. Este carril se cotiza por consecuencia. El costo en tokens no es la cantidad que decide.

El carril multimodal en realidad son dos carriles. Comprensión toma imágenes, audio, video o documentos como entrada y regresa texto. Generación regresa un artefacto. Tienen proveedores distintos, modos de falla distintos, estructuras de costo distintas y, este mes, una claridad de licenciamiento muy distinta. Tratarlos como un solo carril es un error de ruteo, y esta ola hace la separación fácil de ver.

  • Extracción: falla estructural silenciosa. Carril barato más aserciones duras.
  • Implementación: falla ruidosa que atrapan CI y la revisión. Se cotiza en minutos de revisión.
  • Frontera: respuestas seguras y equivocadas. Se cotiza por consecuencia, no por tokens.
  • Comprensión multimodal: rutea como extracción con una cuenta más grande.
  • Generación multimodal: rutea como una decisión de cadena de suministro, porque la licencia y la retención dominan.

04 / El carril barato, recotizado

Gemini 3.6 Flash recotizó el carril barato. El tope de salida decide quién puede usarlo.

Google anunció Gemini 3.6 Flash el 21 de julio de 2026; su documentación dice que está disponible de forma general y lista para producción, bajo el ID de modelo de API gemini-3.6-flash. El precio estándar es $1.50 por millón de tokens de entrada y $7.50 por millón de tokens de salida, con la salida incluyendo tokens de pensamiento. El lote (batch) es $0.75 y $3.75, flex es idéntico al lote, y prioridad es $2.70 y $13.50. El cacheo de contexto cuesta $0.15 por millón de tokens de entrada más $1.00 por millón de tokens por hora de almacenamiento, así que el término de almacenamiento, no la tasa de lectura, es el número que hay que modelar. La ventana de contexto es de 1M de entrada con un límite de 64K de salida. El corte de conocimiento es marzo de 2026, con el model card señalando que algunos dominios están limitados a enero de 2025. Las entradas pueden ser texto, imágenes, audio o video, con PDFs listados en la página de Flash de DeepMind. La salida es sólo texto.

Los cuatro niveles de precio son el producto real: el trabajo que puede esperar no debería pagar la tarifa síncrona, y el lote cuesta la mitad del estándar. Google también afirma que 3.6 Flash reduce el uso de tokens de salida en 17% contra 3.5 Flash, según el Artificial Analysis Index. Lee eso con cuidado, porque es el número con más probabilidad de citarse mal este mes: es una reducción en tokens consumidos, no un recorte de precio. Para trabajo cobrado por salida es, si acaso, el número más interesante, porque el consumo es el término que no puedes negociar. Reportes secundarios también describen un recorte al precio de salida, pero no pudimos verificar la cifra anterior en ninguna fuente primaria de Google, así que ni la imprimimos ni nos apoyamos en ella. Google además cita a Datacurve reportando hasta 65% de reducción de tokens de salida en el benchmark DeepSWE, y cifras de socios de Harvey (12% más rápido en completar tareas) y JetBrains (ganancias de 10 a 20% en desempeño de codificación).

El tope de 64K de salida es la especificación que decide si una tarea pertenece a este carril. Para extracción casi nunca es una restricción real. Para cualquier tarea cuyo artefacto exceda 64K tokens es un muro duro, y ninguna cantidad de inteligencia lo compensa. Como contraste: Claude Opus 5 emite hasta 128k tokens de forma síncrona y hasta 300k en la Message Batches API detrás de un beta header, y Kimi K3 por defecto usa 131,072 tokens de salida y se puede configurar hasta 1,048,576. Tres modelos con contexto de 1M cuyos techos de salida difieren por un factor de dieciséis. La ventana de contexto es el número que todos citan. El tope de salida es el número que rutea el trabajo.

Dos mediciones independientes de Artificial Analysis apuntan en direcciones opuestas y ambas importan. Midió 237.1 tokens de salida por segundo, en el primer lugar de 190 modelos, y un tiempo al primer token de 14.73 segundos, que describe como algo más alto que el promedio. Una persona viendo un cursor experimenta el primer token; una cola que va drenando salida experimenta la tasa. El mismo modelo queda primero en una medición y por debajo del promedio en la otra. Artificial Analysis le da 50 en su Intelligence Index v4.1, en el lugar 26 de 190 contra una mediana de 32.

  • SWE-Bench Pro: 58.7%, contra Gemini 3.5 Flash con 55.1%.
  • DeepSWE v1.1: 49%, contra 3.5 Flash con 37%.
  • Terminal-bench 2.1: 78.0%.
  • MLE-Bench: 63.9%, contra 3.5 Flash con 49.7%.
  • OSWorld-Verified: 83.0%, contra 3.5 Flash con 78.4%.
  • GDM-MRCR v2 de contexto largo: 91.8% a 128k, y 54.0% a 1M puntual. Una ventana que recupera al 54% no es una ventana de 1M para trabajo donde la exactitud es crítica.

05 / El carril de frontera, recotizado

Opus 5 no es un recorte de precio en la línea Opus. Es una afirmación sobre el carril de frontera que un canario puede comprobar.

Anthropic anunció Claude Opus 5 el 24 de julio de 2026 a $5 por millón de tokens de entrada y $25 por millón de tokens de salida. Es exactamente lo que costaba Claude Opus 4.8, y exactamente la mitad de Claude Fable 5 a $10 y $50. El planteamiento de Anthropic es que Opus 5 se acerca a la inteligencia de frontera de Fable 5 a la mitad del precio, y que entrega un desempeño muy mejorado por el mismo costo que su predecesor. Ambas afirmaciones describen la misma lista de precios. Si tu carril de frontera corre sobre Fable 5, el proveedor está diciendo ahora que el carril cuesta la mitad. Si eso se cumple en tu carga de trabajo es justo para lo que sirve un canario, porque una hoja de especificaciones no trae tasas de acierto, carga de reintentos ni minutos de revisión.

No hay scores numéricos de benchmark que comprobar. El anuncio presenta todo como gráficas, y las evaluaciones nombradas son Frontier-Bench v0.1, CursorBench 3.2, el AA Coding Agent Index, ARC-AGI 3, GDPval-AA v2, OSWorld 2.0, HLE, Zapier AutomationBench y DeepSearchQA. Lo que sí pudimos verificar es el propio texto de Anthropic sobre posición relativa, sin números absolutos detrás: en Frontier-Bench v0.1 supera a todos los demás modelos y más que duplica el desempeño de Opus 4.8 a un menor costo por tarea; en CursorBench 3.2 con esfuerzo máximo queda a 0.5% del mejor score de Fable 5 a la mitad del costo; en ARC-AGI 3 su score es el triple del siguiente mejor modelo; en Zapier AutomationBench su tasa de acierto es alrededor de 1.5 veces la del siguiente mejor modelo por el mismo costo; en OSWorld 2.0 supera el mejor resultado de Fable 5 por poco más de un tercio del costo. Cuatro de esas cinco afirmaciones están normalizadas por costo. El proveedor está argumentando sobre el mismo eje que argumenta esta nota, lo cual es interesante, y es infalsificable desde afuera sin los números, que es el problema.

El parámetro de esfuerzo (effort) es el verdadero dial de ruteo, y eso significa que la lista de precios no es el precio. Opus 5 soporta cinco niveles: low, medium, high, xhigh y max, con high como default de API tanto en la Claude API como en Claude Code, configurado mediante output_config en el request de Messages. El thinking no se puede desactivar en xhigh ni en max; un request que lo intenta regresa un 400. Anthropic también señala que en Opus 5, cambiar el esfuerzo no acorta de forma confiable la respuesta visible, y que en su lugar hay que pedir la longitud en el prompt. El esfuerzo mueve el consumo de tokens, y el consumo de tokens es lo que te cobran. Un modelo de costo que trata $5 y $25 como constantes está modelando la lista, no la factura.

Dos partidas del resto de la superficie mueven la factura por múltiplos; las demás son constantes pequeñas que vale la pena conocer. Primero el cacheo: los hits y refrescos de caché cuestan $0.50 por MTok contra $5.00 en fresco, y una escritura de caché de cinco minutos cuesta $6.25, una prima que una sola reutilización dentro de la ventana ya recupera de sobra. La escritura de una hora cuesta $10.00 y necesita al menos dos lecturas contra el mismo prefijo para salir ganando. El esfuerzo es la segunda, ya cubierta arriba. Las constantes pequeñas: lote a $2.50 y $12.50; modo rápido a $10 y $50 por cerca de 2.5 veces la velocidad default, en research preview, sólo en la Claude API de primera parte, no disponible en Claude Platform en AWS, nubes socias, ni en la Batch API; la ventana completa de 1M cobrada a tarifas estándar sin sobrecargo por contexto largo en Claude 4.6 y posteriores; el uso de herramientas agregando 286 tokens de entrada de overhead de system prompt para tool_choice auto o none y 406 para any o tool, con la herramienta Bash agregando 325 más; y Claude Managed Agents a $0.08 por hora-sesión encima de los tokens. Nada de esto es emocionante. Todo aparece en la factura.

  • Opus 5: $5 / $25 por MTok, contexto de 1M, 128k de salida máxima síncrona, 300k en Batches detrás de un beta header, corte de entrenamiento mayo 2026.
  • Fable 5: $10 / $50 por MTok, contexto de 1M, 128k de salida máxima, corte enero 2026.
  • Mismo precio que Opus 4.8. Mitad del precio de Fable 5. No es un recorte de precio en la línea Opus.
  • El esfuerzo default es high; el thinking no se puede desactivar en xhigh ni en max.
  • Modo rápido: 2x el precio por cerca de 2.5x la velocidad, research preview, sólo API de primera parte.
  • Según Anthropic, Opus 5 se queda atrás de Claude Mythos 5 en tareas de ciberseguridad e investigación biológica.

06 / El acceso es un insumo de ruteo

El cambio de Fable 5 no es un cambio de capacidad. Es la frontera de acceso que se mueve.

A partir del 20 de julio de 2026, Claude Fable 5 está incluido sin costo extra en Max, en asientos Team premium, y en asientos Enterprise premium por asiento, con un tope de 50% de los límites de uso semanales. Ese tope no es aditivo: otros modelos consumen del mismo fondo semanal, y el total sigue siendo el límite semanal. Los asientos Pro y Team Standard no están incluidos y pagan mediante créditos de uso después de un crédito único inicial. El centro de ayuda de Anthropic sólo dice que existe un crédito único; la cuenta @claudeai, según cita Simon Willison, da la cifra de $100. La promoción anterior de acceso gratuito terminó el 19 de julio de 2026 a las 11:59:59 PM PT. Aquí importa una palabra: el artículo del centro de ayuda nunca usa la palabra permanente. Declara un cambio vigente desde el 20 de julio sin fecha de fin, y el 'permanente' de los titulares es palabra de los periodistas, no una cita. Una fecha de fin ausente no es un compromiso, y la diferencia entre esas dos lecturas es toda la pregunta de si puedes construir sobre esto.

La inestabilidad misma es el dato. Anthropic revisó el acceso de Fable 5 por plan al menos cuatro veces entre el 9 de junio y el 20 de julio de 2026, y su propia razón declarada es que la demanda resultó difícil de predecir, así que el acceso se fue extendiendo por etapas conforme se aseguraba capacidad. Por separado, Fable 5 se quedó fuera de línea el 12 de junio de 2026 por una directiva de control de exportaciones de Estados Unidos y volvió el 1 de julio. Reportes independientes describen el efecto práctico del cambio de julio como 50% de unos límites que ya venían reducidos, después de un recorte de aproximadamente un tercio al uso regular cuando terminó la fase de bono. Nada de eso dice algo sobre la capacidad del modelo, y todo eso es un insumo de ruteo. Un carril cuyos términos comerciales se movieron cuatro veces en seis semanas, y al que una directiva gubernamental dejó fuera de línea una vez, no debería ser el único carril que un equipo puede correr.

Dos restricciones de este lanzamiento le ganan a la capacidad sin discusión. Fable 5 está designado Covered Model con retención de datos de 30 días y no está disponible bajo un acuerdo de retención cero. Para una carga de trabajo regulada eso es determinante, y ningún benchmark puede discutir contra eso. La segunda es más silenciosa y le cuesta dinero real a los equipos: Fable 5 usa el tokenizador introducido con Claude Opus 4.7, y el mismo texto produce aproximadamente 30% más tokens que en modelos lanzados antes de 4.7. Dólares por millón de tokens, entonces, no es una unidad comparable entre proveedores, ni siquiera entre generaciones de un mismo proveedor. Cotiza tus carriles sobre tu propio corpus, en tokens que tú mismo contaste, o estás comparando con dos reglas distintas.

  • Incluido: Max, asientos Team premium, asientos Enterprise premium por asiento, hasta 50% del fondo semanal.
  • No incluido: Pro, Team Standard. Créditos de uso después de un crédito único.
  • El artículo del centro de ayuda no llama permanente al cambio. Declara una fecha de inicio y ninguna fecha de fin.
  • Fable 5 es un Covered Model: retención de 30 días, sin opción de retención cero.
  • El tokenizador de Fable 5 produce aproximadamente 30% más tokens para el mismo texto que los modelos anteriores a 4.7.
  • Precios de lista por plan, como se publican: Pro $17/mes anual o $20/mes mensual; Max desde $100/mes; Team Standard $20/asiento anual o $25/asiento mensual; Team Premium $100/asiento anual o $125/asiento mensual; Enterprise $20/asiento.

07 / Pesos abiertos como postura

Dos compromisos de pesos abiertos, cero pesos públicos.

Kimi K3 es real, está hospedado, y técnicamente es lo más interesante de la ola. El blog de Moonshot describe un modelo de 2.8 billones de parámetros que usa una mezcla de expertos dispersa que activa 16 de 896 expertos por token, un diseño de atención llamado Kimi Delta Attention con residuales de atención, y entrenamiento consciente de cuantización con pesos MXFP4 y activaciones MXFP8. El write-up de preview de vLLM corrobora la configuración de expertos y los pesos MXFP4, y describe la atención como lineal dominada por KDA con capas periódicas de atención completa. Las entradas son texto, imágenes y archivos de video según la documentación de API. El contexto es de 1,048,576 tokens. El precio es $3.00 por millón de tokens de entrada en cache miss, $0.30 en cache hit, y $15.00 por millón de salida, plano, sin niveles por longitud de contexto. El razonamiento está siempre activo, con niveles de esfuerzo low, high y max, con max por default. El acceso a la API se desbloquea después de una recarga mínima de $1. Moonshot lo posiciona para codificación de horizonte largo y trabajo de conocimiento de punta a punta.

Lo que falta es la parte que importa para la resiliencia. Al 25 de julio de 2026, la organización moonshotai en Hugging Face no lista ningún repositorio de K3; las entradas más nuevas son K2.7-Code y anteriores. El blog de Moonshot se compromete a liberar los pesos completos antes del 27 de julio de 2026, y vLLM repitió el 22 de julio que eso seguía pendiente. Existen repositorios de terceros con el mismo nombre y no son de Moonshot. Ninguna página que consultamos declara una licencia, y sin pesos públicos tampoco hay archivo de licencia público que leer. El soporte de vLLM está en etapa de preview y requiere paralelismo de expertos a gran escala. Nada de esto le impide a un equipo llamar la API hospedada hoy mismo; el ID del modelo, los precios y los límites están publicados y el carril es usable. Lo que sí impide es aquello para lo que sirven los pesos abiertos: correrlo, fijarlo, y ya no depender de lo que haga el proveedor después. Esa parte es una fecha en el calendario, dos días después de que se publica esta nota.

Qwen3.8-Max-Preview está todavía más flaco de información. La documentación de Qoder de Alibaba declara 2.4 billones de parámetros. Se mostró en preview el 19 de julio de 2026 en la World Artificial Intelligence Conference de Shanghái. El acceso corre a través de la suscripción Token Plan de Alibaba, Qoder y QoderWork, y Token Plan sólo está disponible en la región China (Beijing). No hay precio por token publicado; el cobro es por créditos, con el preview descontando el coeficiente de facturación de 0.5x a 0.05x, y a 0.01x entre las 22:00 y las 08:00 UTC+8. Alibaba no publicó model card, ni tabla de benchmarks, ni conteo de parámetros activados, ni licencia, y confirmamos la ausencia directamente: las tablas de especificación de Model Studio no traen ninguna fila para este modelo. La única afirmación de desempeño que hizo Alibaba es un solo post del equipo de Qwen describiéndolo como segundo sólo detrás de Fable 5, sin nada publicado detrás de eso. Los pesos se prometen pronto, sin fecha y sin licencia nombrada. Vale la pena marcar una trampa: circula ampliamente una cifra de ventana de contexto para este modelo que no aparece en ninguna página de Alibaba que consultamos; la cifra de 1M en esas tablas pertenece a Qwen3.7-Max, un modelo distinto. No damos una ventana de contexto para Qwen3.8-Max-Preview, porque no tenemos una.

Dos proveedores anunciaron modelos muy grandes con intención de pesos abiertos dentro de una misma semana, y ninguno ha liberado pesos públicos. La resiliencia de proveedor no es una segunda API key, y desde luego no es una promesa de liberar pesos. Son tres cosas concretas: un contrato de herramientas portable entre proveedores, un conjunto de casos fijado que define el éxito independientemente de cualquier modelo, y un segundo carril que de verdad hayas corrido bajo carga de producción al menos una vez. Construye las tres como si el segundo carril fuera a necesitarse. Y trata cada liberación de pesos anunciada como una entrada de diario por verificar, no como una capacidad que ya posees.

  • Kimi K3: 2.8T de parámetros totales, 16 de 896 expertos activos, contexto de 1,048,576 tokens.
  • Precio de Kimi K3: $3.00 entrada en cache miss, $0.30 en cache hit, $15.00 de salida, por millón de tokens, plano.
  • Pesos de Kimi K3: prometidos para el 27 de julio de 2026, no públicos al 25 de julio de 2026. Licencia no declarada.
  • Kimi K3 se puede llamar hoy como carril hospedado. No se puede fijar, y esa es la diferencia.
  • Qwen3.8-Max-Preview: 2.4T de parámetros según lo declarado, sólo preview, sólo Token Plan, sólo región Beijing.
  • Qwen3.8-Max-Preview: sin benchmark, sin licencia, sin precio por token, sin ventana de contexto verificada.
  • La resiliencia es un contrato de herramientas portable, un conjunto de casos fijado, y un segundo carril que de verdad hayas corrido.

08 / Multimodal son dos carriles

Comprensión se hizo más amplia. Generación se quedó con un problema de licencia.

Del lado de comprensión, esta ola fue generosa. Gemini 3.6 Flash acepta texto, imágenes, audio y video, con PDFs listados en la página de Flash de DeepMind, y regresa sólo texto. Kimi K3 acepta texto, imágenes y archivos de video, con imágenes entregadas en base64 o con un identificador de archivo ms://; su documentación declara las entradas y no dice nada sobre la modalidad de salida más allá de que las respuestas de texto son el default. Se reporta que Qwen3.8-Max-Preview maneja comprensión de texto, imágenes, video y documentos, pero eso viene sólo de cobertura secundaria y no lo pudimos confirmar en ninguna página propia de Alibaba. Comprensión rutea como el carril de extracción con una cuenta más grande: emite un objeto estructurado, verifica ese objeto con aserciones, y nunca dejes que la impresión de un revisor sobre la prosa sustituya a una verificación.

Generación es una disciplina distinta. Qwen-Image-3.0 se expone en Alibaba Cloud Model Studio como qwen-image-3.0-pro, manejando texto-a-imagen e imagen-a-imagen en un solo modelo, con imagen-a-imagen tomando de una a tres imágenes de referencia más una sola instrucción. Está en preview limitado y requiere una solicitud aprobada a través del Model Gallery. Sirve desde dos regiones, China (Beijing) y Singapur, con llaves y endpoints separados que no se pueden usar de forma intercambiable. Restricciones de API verificadas: píxeles totales de salida entre 512x512 y 2048x2048, salida en PNG, n entre 1 y 6 imágenes con default de 1, prompt_extend con default true, watermark con default false, seed en el rango 0 a 2147483647. Las imágenes de entrada pueden ser JPG, JPEG, PNG, BMP, TIFF, WEBP o GIF, recomendadas entre 384 y 2048 píxeles por lado, hasta 10MB. Los requests son de un solo turno, con exactamente un mensaje de usuario.

Las afirmaciones del proveedor son la parte interesante y ninguna es comprobable. El blog de Qwen declara soporte para prompts de entrada de hasta 4.5k tokens, renderizado preciso de texto tan pequeño como 10px, renderizado nativo de 12 idiomas, y más de 100 estilos artísticos; ofrece un ejemplo de una cuadrícula de tres por tres de infografías generadas en una sola pasada a partir de un prompt de 3.7k tokens, en lugar de ensambladas. No hay tabla de benchmarks, ni conteo de parámetros, ni descripción de arquitectura, ni reporte técnico, ni declaración de licencia en el blog ni en la referencia de API. El precio aparece listado como gratis por tiempo limitado en ambas tablas de tarifas regionales, lo cual no es un precio. Para dar escala, esas mismas tablas ponen a la generación anterior, qwen-image-2.0-pro, en ¥0.5 por imagen en Beijing.

Dos de esos hechos son de diseño de pipeline, no trivia. Las URLs de imágenes generadas expiran a las 24 horas, así que cualquier sistema que conserve imágenes debe persistirlas al recibirlas; un pipeline que guarda la URL trae una falla de 24 horas incorporada que no va a aparecer hasta que alguien abra un registro viejo. Y no hay licencia publicada para el modelo ni para el uso comercial de sus salidas. Nuestra política es tajante en esto: no ruteamos entregables de cliente por un carril de generación cuyos términos de uso no podamos presentar por escrito, y nada de lo publicado para Qwen-Image-3.0 todavía cumple esa barra. Los últimos pesos abiertos de la línea de imagen de Qwen fueron Qwen-Image-2512, Apache 2.0, fechados el 31 de diciembre de 2025. La versión 3.0 está cerrada, con acceso por invitación, y sin licencia pública. Eso es una decisión de cadena de suministro antes de ser una decisión estética.

  • Entrada de comprensión: Gemini 3.6 Flash (texto, imagen, audio, video, PDF), Kimi K3 (texto, imagen, video).
  • Salida de comprensión: sólo texto para Gemini 3.6 Flash y los modelos Claude. Kimi K3 y Qwen3.8-Max-Preview no publican declaración de modalidad de salida.
  • Generación: Qwen-Image-3.0 vía qwen-image-3.0-pro, preview limitado, requiere solicitud.
  • Techo de salida 2048x2048 píxeles totales, PNG. No esperes 4K nativo.
  • Las URLs generadas expiran a las 24 horas. Persiste al recibir.
  • No hay licencia publicada para Qwen-Image-3.0 ni para sus salidas. Bajo nuestra política eso lo deja fuera del trabajo de cliente, sin importar su calidad.

09 / La política

Una política de ruteo que puedes adoptar esta semana y medir el mes que entra.

Escribe la política como una tabla de clases de trabajo, no de nombres de modelo. Para cada clase, registra seis campos: el carril default, el disparador de escalamiento, el carril de escalamiento, las restricciones duras (retención, región, tope de salida, licencia), el conjunto de fixtures que prueba que el carril funciona, y la fecha en que se recotizó el carril por última vez. Una política que lista nombres de modelo sin clases de trabajo es una preferencia. Una política que lista clases de trabajo sin fechas es un recuerdo. Las fechas son lo que te permite responder, seis semanas después, si una decisión se tomó bajo condiciones que todavía se sostienen.

Ahora aplica la ola. Extracción y formato van por default a un carril barato, y si ese carril es Gemini 3.6 Flash, rutea el volumen asíncrono a lote a $0.75 y $3.75 en lugar de estándar a $1.50 y $7.50, y verifica que ninguna tarea de la clase necesite más de 64K de salida. La implementación rutinaria se queda donde tu costo por minuto de revisión sea más bajo; nada de lo verificado en esta ola obliga a moverse, y un carril que produce diffs más cortos le gana a un carril que puntúa mejor. El trabajo de frontera se rutea al carril más fuerte que puedas costear por tarea, y si ese carril era Fable 5, corre un canario en Opus 5 a $5 y $25 con esfuerzo en xhigh antes de tratar el precio de lista a la mitad como un costo a la mitad. La comprensión multimodal se une al carril de extracción con aserciones más duras. La generación multimodal se queda fuera del trabajo de cliente hasta que existan términos de uso por escrito.

Mide cinco cosas. Costo por tarea aceptada, no costo por millón de tokens, porque los niveles de esfuerzo y los tokenizadores hacen que las comparaciones por token no signifiquen nada entre proveedores. Tasa de escalamiento. Tasa de acierto del escalamiento, es decir, qué tan seguido el carril de frontera de verdad cambió la respuesta. Minutos de revisión por tarea aceptada. Y la fecha de tu último simulacro de failover. Si la tasa de escalamiento es alta y la tasa de acierto es baja, el carril está bien y el disparador está mal calibrado; arregla el disparador, no el carril. Lo que esta nota no te puede entregar son los umbrales. Esos salen de tu propia telemetría, y cualquier consultor que te dé uno sin haber visto tu telemetría está adivinando.

La regla permanente es que recotizas cuando se mueve un insumo, no cuando se lanza un modelo. Precio, límite de contexto, tope de salida, términos de acceso, términos de retención, región: cualquiera de esos moviéndose abre la tabla. La regla necesita una enmienda honesta: una afirmación de capacidad a precio de lista sin cambios no es un disparador de re-ruteo, pero sí es un disparador de canario, porque el costo por tarea aceptada puede bajar mientras la lista de precios se mantiene quieta, por menos reintentos y revisiones más cortas. El re-ruteo sigue esperando los números del canario, y la aritmética del canario tiene que incluir el costo del cambio mismo: trabajo de integración, portabilidad del prompt, pérdida de caché, y revisores aprendiendo un perfil de falla nuevo. Según nuestra lectura de esta semana: un lanzamiento recotizó el carril barato, uno recotizó el carril de frontera pendiente de canario, uno movió una frontera de acceso sin tocar ningún modelo, uno agregó un carril hospedado cuyos pesos y licencia son promesas con fecha puesta, y dos sobre los que no podemos actuar en absoluto, uno restringido a una región y suscripción que no tenemos y otro con acceso por invitación y sin licencia. La primera de esas promesas vence el 27 de julio. Anota qué se movió, qué hiciste al respecto, y qué no pudiste verificar, y fecha las tres cosas.

  • Rutea extracción al carril barato con aserciones duras. Usa precio de lote para el volumen asíncrono.
  • Revisa el tope de salida antes que la ventana de contexto. 64K, 128K, 300K y 1,048,576 conviven en esta ola.
  • Rutea implementación por minutos de revisión, no por posición en benchmarks.
  • Rutea el trabajo de frontera por consecuencia. Corre un canario en un carril de frontera más barato antes de adoptarlo.
  • Una afirmación de capacidad a precio constante es un disparador de canario, no de re-ruteo.
  • Mantén generación fuera de los entregables de cliente hasta que se publiquen términos de uso.
  • Recotiza cuando se mueva un insumo. Registra 'sin cambio' con fecha cuando nada se movió.
  • Ensaya el failover al segundo carril con un calendario, y registra la fecha en que salió bien la última vez.

10 / Misiones de producción

Prompts que especifican una misión completa.

No son puntos de partida. Cada uno es un contrato operativo para GPT-5.6 o Fable 5: resultado, límites, arquitectura, política de modelos, fases, pruebas de aceptación, evidencia, release y condiciones de parada.

Mission 01 · Ruteo de modelos

Auditoría de recotización tras una ola de lanzamientos

Una tabla de ruteo fechada que indica qué carriles cambió de verdad una ola de lanzamientos, cuáles no, y qué no se pudo verificar.

Claude Opus 5 · effort high · snapshot fijado

Full operating contract

MISIÓN: RECOTIZAR CADA DECISIÓN DE RUTEO DESPUÉS DE UNA OLA DE LANZAMIENTOS DE MODELOS

Actúa como el dueño del ruteo de un equipo que corre agentes en producción. Acaba de aterrizar un conjunto de lanzamientos de modelos. Tu trabajo no es resumirlos. Tu trabajo es determinar, para cada clase de trabajo que ya corremos, si se movió algún insumo de ruteo, y dejar un registro fechado que un ingeniero futuro pueda auditar.

INSUMOS QUE VOY A DAR
- Nuestra tabla de ruteo actual: clases de trabajo, carril default, disparador de escalamiento, carril de escalamiento, restricciones duras.
- 30 a 90 días de telemetría de producción: tokens de entrada y salida por clase, niveles de esfuerzo usados, tasa de acierto de caché, percentiles de latencia, eventos de escalamiento, salidas rechazadas.
- Los lanzamientos en alcance, con las URLs de documentación del proveedor.
- Nuestras restricciones de cumplimiento: retención de datos, región, requisitos de licencia, proveedores aprobados.

CONTRATO DE OPERACIÓN
1. Trata los anuncios de proveedores como afirmaciones. Registra la URL y la fecha de consulta de cada número que uses.
2. Si un número no está publicado, escribe SIN VERIFICAR y di qué página revisaste. Nunca estimes un precio, un límite de contexto, un tope de salida, ni un score de benchmark.
3. Distingue el precio de lista del costo realizado. Los parámetros de esfuerzo, los tokens de pensamiento, el overhead de definición de herramientas, las primas de escritura de caché y las diferencias de tokenizador mueven el costo realizado.
4. Nunca compares dólares por millón de tokens entre proveedores sin re-tokenizar una muestra de nuestro propio corpus. Declara la razón de tokens que mediste.
5. Una afirmación de capacidad sin cambio de precio, límites, acceso o riesgo no es, por sí sola, un disparador de re-ruteo. Es un disparador de canario, porque el costo por tarea aceptada puede moverse a precio de lista constante. El re-ruteo espera los números del canario.

PRODUCE, POR CLASE DE TRABAJO
- Los seis insumos de ruteo y si cada uno se movió: precio unitario, límite de contexto, tope de salida, perfil de latencia, términos de acceso, retención y región.
- Costo realizado por tarea aceptada bajo el carril actual, calculado a partir de nuestra telemetría y no de la lista de precios.
- Costo realizado proyectado bajo cada carril candidato, con los supuestos declarados como una lista.
- Una verificación de restricciones duras que pueda vetar de tajo un carril más barato: términos de retención, disponibilidad por región, tope de salida, licencia publicada o términos de uso.
- Un veredicto de entre: sin cambio, canario recomendado, migrar, o bloqueado pendiente de verificación.
- La fecha, y el hecho específico que forzaría una nueva revisión.

PASADA ADVERSARIAL
- Identifica cada lugar donde un carril más barato fallaría en silencio en lugar de ruidosamente, y di qué aserción lo atraparía.
- Identifica cada carril donde hoy no tenemos alternativa probada, y nombra el riesgo en una sola oración.
- Lista cualquier afirmación del material del proveedor que esté normalizada por costo pero sea infalsificable sin números absolutos.

ENTREGABLE
Una sola tabla de ruteo fechada más un apéndice de SIN VERIFICAR que liste cada número que quisimos y no conseguimos, con la página que revisaste. No recomiendes una migración para ninguna clase donde el apéndice contenga un número del que dependa esa decisión de migración.

Mission 02 · Ingeniería de costos

Canario de migración a carril barato

Un movimiento medido de una clase de trabajo a un carril más barato, con un disparador de escalamiento que se paga solo con evidencia o revierte.

Carril barato candidato bajo prueba · carril más fuerte como árbitro

Full operating contract

MISIÓN: MOVER UNA CLASE DE TRABAJO A UN CARRIL MÁS BARATO SIN PERDER EL HILO

Actúa como el ingeniero responsable de una sola clase de trabajo. Creemos que un carril más barato la puede cargar. Compruébalo o refútalo con evidencia, y deja un disparador que rutee hacia arriba los casos residuales.

INSUMOS QUE VOY A DAR
- La definición de la clase de trabajo, su carril actual, y sus criterios de aceptación.
- 100 a 300 casos históricos con resultados conocidos como correctos, incluyendo casos límite, entradas contradictorias, datos faltantes, y al menos diez intentos adversariales o de prompt injection.
- Costo realizado actual, percentiles de latencia, y minutos de revisión por tarea aceptada.
- El precio publicado del carril candidato, su límite de contexto, tope de salida, y restricciones.

CONTRATO DE OPERACIÓN
1. Fija los identificadores de modelo en ambos carriles. Nunca compares un alias rodante contra una línea base congelada.
2. Revisa el tope de salida contra el artefacto más grande del conjunto de fixtures antes de correr nada. Si algún caso lo excede, la migración está muerta y debes decirlo en el primer párrafo.
3. El éxito lo define el conjunto de fixtures, no el modelo. No cambies los criterios de aceptación para que le quepan al carril más barato.
4. Mide el costo por tarea aceptada, incluyendo reintentos, escalamientos, y los minutos de revisión que gasta un humano. No tokens.
5. Corre la porción asíncrona con precio de lote donde el proveedor lo ofrezca, y reporta la división.
6. Incluye el costo del cambio mismo en la aritmética: trabajo de integración, portabilidad del prompt, pérdida de caché, y reentrenamiento de revisores.

CONSTRUYE
- Un harness de corridas en paralelo que mande cada fixture a ambos carriles y registre salida, tokens, latencia al primer token, latencia a la finalización, y costo.
- Un comparador determinista que clasifique cada desacuerdo como: carril barato equivocado, carril fuerte equivocado, ambos aceptables, o ambiguo y requiere arbitraje humano.
- Un disparador de escalamiento expresado como regla sobre señales observables, no sobre la confianza del modelo. Señales candidatas: violación de esquema, baja cobertura de campos, contradicción entre campos extraídos, longitud o estructura de entrada fuera de la distribución de los fixtures, conteo de reintentos.
- Un despliegue en modo sombra que rutee tráfico de producción al carril barato, escale con el disparador, y registre ambos resultados sin cambiar el comportamiento visible para el usuario.

ACEPTACIÓN
- Se reportan tanto la tasa de escalamiento como la tasa de acierto del escalamiento. Una tasa de escalamiento alta con una tasa de acierto baja significa que el disparador está mal, no el carril.
- Ningún fixture adversarial produce una salida aceptada en ninguno de los dos carriles.
- El costo realizado por tarea aceptada es menor en la configuración nueva, incluyendo escalamientos y costo de cambio, o la migración se rechaza.
- Un solo cambio de configuración revierte al carril anterior, y ese revert ya se ejecutó una vez en staging.

ENTREGABLE
La tabla de resultados de la corrida en paralelo, la regla del disparador, los logs del modo sombra, el procedimiento de revert con su fecha de ensayo, y una recomendación explícita. Si la recomendación es quedarse, dilo claramente y declara qué cambiaría la respuesta.

Mission 03 · Resiliencia de proveedor

Simulacro de failover a segundo carril

Evidencia de que un segundo carril nombrado puede cargar una clase de trabajo hoy, en lugar de una segunda API key que nadie ha probado nunca.

Carril primario y carril de respaldo declarado, ambos fijados

Full operating contract

MISIÓN: COMPROBAR QUE EL SEGUNDO CARRIL FUNCIONA ANTES DE NECESITARLO

Actúa como el dueño de confiabilidad de un sistema que depende de modelos. Tenemos un proveedor de respaldo declarado. Determina si es real. Una entrada de configuración no es un respaldo; un carril que ya ha cargado tráfico de producción bajo carga sí lo es.

CONTEXTO QUE MOTIVA ESTO
Los términos de acceso son un insumo de ruteo y se mueven independientemente de la capacidad. En una ventana de seis semanas a mediados de 2026, a un modelo de frontera le revisaron los términos de suscripción al menos cuatro veces y, por separado, lo dejaron fuera de línea por semanas una directiva de control de exportaciones. En el mismo mes, dos proveedores anunciaron modelos de pesos abiertos y no habían liberado pesos públicos al momento de revisar. Planea para que la frontera de acceso se mueva, no para que el modelo empeore.

INSUMOS QUE VOY A DAR
- Las clases de trabajo en alcance y sus carriles primarios actuales.
- El respaldo declarado para cada una, y el contrato de herramientas por el que se llama a cada carril.
- El conjunto de casos fijado que define el éxito para cada clase.
- Restricciones de cumplimiento: retención, región, licencia, proveedores aprobados.

CONTRATO DE OPERACIÓN
1. Nunca trates una liberación de pesos abiertos prometida como un respaldo disponible. Sólo cuenta un carril que puedas llamar hoy.
2. Revisa primero el respaldo contra las restricciones duras: términos de retención, disponibilidad por región, tope de salida, licencia publicada o términos de uso. Un respaldo que falla una verificación de cumplimiento no es un respaldo.
3. El contrato de herramientas debe ser idéntico entre carriles. Si el respaldo requiere un esquema de herramientas distinto, esa diferencia es el verdadero pendiente de trabajo.
4. Registra el costo realizado en el carril de respaldo. Un respaldo que no puedes costear por una semana es un respaldo que no vas a usar.

CORRE EL SIMULACRO
- Fuerza un failover duro de una clase de trabajo al carril de respaldo por una ventana acotada sobre tráfico real.
- Mide la tasa de acierto contra el conjunto de casos fijado, el costo realizado por tarea aceptada, la latencia al primer token y a la finalización, y los minutos de revisión.
- Inyecta los modos de falla que de verdad ocurren: 429s del proveedor, latencia elevada, un stop reason tipo rechazo devuelto con un código de estado de éxito, una región que se vuelve no disponible, y un cambio de acceso a nivel de cuenta o de plan.
- Regresa al carril primario (fail back), y verifica que el trabajo en curso se haya completado o se haya reintentado limpiamente sin efectos secundarios externos duplicados.

ENTREGABLE
Un registro de una página del simulacro: fecha, clase de trabajo, carril de respaldo, delta de tasa de acierto, delta de costo, delta de latencia, fallas observadas, defectos reportados, y la fecha del siguiente simulacro programado. Declara con claridad qué clases de trabajo no tienen hoy un segundo carril viable y qué haría falta para crear uno. No reportes éxito para ninguna clase donde el simulacro no se haya corrido de verdad.

11 / Rastro de fuentes

Primarias, frescas, inspeccionables.

Los detalles de producto cambian rápido. Estas fuentes se verificaron para esta edición el 25 de julio de 2026. Vuelve a verificar antes de cambiar una política de producción.

  1. 01Kimi K3Moonshot AIPost de lanzamiento primario. Fuente de los 2.8T de parámetros, la activación de 16 de 896 expertos, el entrenamiento MXFP4/MXFP8, la visión nativa, el precio, y el compromiso de publicar los pesos completos antes del 27 de julio de 2026. Su tabla de benchmarks se renderiza en JavaScript y no se pudo extraer.
  2. 02Kimi K3 quickstartMoonshot AIReferencia de API primaria. Fuente del ID de modelo kimi-k3, el razonamiento siempre activo con esfuerzo low/high/max, las modalidades de entrada aceptadas, los defaults y el techo de tokens de salida, la estructura de precio plano, y la recarga mínima de $1.
  3. 03Kimi K3 pricingMoonshot AIFuente primaria de la ventana de contexto de 1,048,576 tokens y de las tarifas de cache-miss, cache-hit y salida.
  4. 04moonshotai on Hugging FaceHugging FaceRevisado el 25 de julio de 2026. No hay repositorio de Kimi K3 presente; las entradas más nuevas son K2.7-Code y anteriores. Esta es la evidencia de que los pesos seguían sin publicarse.
  5. 05Kimi K3 preview supportvLLMFechado el 22 de julio de 2026. Corrobora la configuración de expertos y los pesos MXFP4, describe que servirlo requiere paralelismo de expertos a gran escala, y repite que la liberación de pesos seguía pendiente.
  6. 06Kimi K3Simon WillisonReseña independiente fechada el 16 de julio de 2026, una de las dos fuentes que contradicen la fecha del 17 de julio que da el proveedor.
  7. 07Gemini 3.6 Flash model cardGoogle DeepMindLa única tabla de benchmarks numérica totalmente extraíble de esta ola. Fuente de los límites de contexto y salida, el corte de conocimiento, las modalidades, y cada cifra de benchmark citada aquí.
  8. 08Gemini API pricingGoogleFuente primaria de las tarifas estándar, de lote, flex y prioridad, los costos de cacheo de contexto, el nivel gratuito, y el precio de grounding.
  9. 09Gemini 3.6 Flash, 3.5 Flash-Lite and 3.5 Flash CyberGoogleAnuncio primario, 21 de julio de 2026. Fuente de la afirmación de 17% de reducción de tokens de salida y de la cifra de Datacurve.
  10. 10Gemini 3.6 FlashArtificial AnalysisMedición independiente. Fuente del score y ranking del Intelligence Index v4.1, los 237.1 tokens de salida por segundo, y los 14.73 segundos de tiempo al primer token.
  11. 11Introducing Claude Opus 5AnthropicAnuncio primario, 24 de julio de 2026. Fuente del precio, el posicionamiento frente a Fable 5, el modo rápido, y el texto sobre posición relativa en benchmarks. Todos los resultados de benchmark se presentan como gráficas; no se pudo extraer ningún score numérico.
  12. 12Model overviewAnthropicFuente primaria de las ventanas de contexto, los topes de salida, los cortes de entrenamiento, los IDs de modelo, la nota sobre el tokenizador de Opus 4.7, y el estatus legacy de Opus 4.8.
  13. 13PricingAnthropicFuente primaria de las tarifas de escritura y hit de caché, las tarifas de lote, el precio y los límites de disponibilidad del modo rápido, el overhead de tokens por definición de herramientas, y la facturación por hora-sesión de Managed Agents.
  14. 14EffortAnthropicFuente primaria de los cinco niveles de esfuerzo, el default high, el error 400 al desactivar el thinking en xhigh o max, y la nota de que el esfuerzo no acorta de forma confiable la longitud de la salida visible.
  15. 15Claude Fable 5 on your planAnthropicFuente primaria de los términos de inclusión del 20 de julio de 2026, el tope no aditivo de 50%, la exclusión de Pro y Team Standard, y el fin de la promoción gratuita. El artículo mismo nunca usa la palabra 'permanente'.
  16. 16Introducing Claude Fable 5 and Claude Mythos 5AnthropicFuente primaria del precio de Fable 5, la fecha de disponibilidad del 9 de junio de 2026, el thinking adaptativo siempre activo, el stop reason de rechazo, y la designación de Covered Model con retención de 30 días.
  17. 17Redeploying Fable 5AnthropicRegistro primario del cierre por control de exportaciones del 12 de junio de 2026 y del regreso al servicio el 1 de julio de 2026.
  18. 18The @claudeai statement on Fable 5 plan inclusionSimon WillisonFuente secundaria que reproduce textual el comunicado de @claudeai, incluyendo la cifra de $100 de crédito único que el propio centro de ayuda de Anthropic omite. El post original devolvió HTTP 402 y no se pudo consultar directamente. El encuadre de 'permanente' en esta reseña es del autor, no una palabra citada de Anthropic.
  19. 19Anthropic slashes Claude Fable 5 limits in Max and Team PremiumThe DecoderRelato independiente del efecto práctico: Fable 5 topado al 50% de unos límites que ya habían sido recortados en aproximadamente un tercio cuando terminó la fase de bono.
  20. 20Qwen3.8-Max-Preview campaignQoder (Alibaba)La única página propia de Alibaba que declara 2.4 billones de parámetros. Fuente de la fecha de inicio del 19 de julio de 2026, la elegibilidad, y los coeficientes de facturación de 0.5x a 0.05x y 0.01x.
  21. 21Token Plan overviewAlibaba Cloud Model StudioConfirmación primaria del ID de modelo qwen3.8-max-preview, su estatus de preview, la restricción a la región China (Beijing), y los niveles de suscripción de Token Plan.
  22. 22Text generation modelsAlibaba Cloud Model StudioRevisada directamente. No contiene ninguna fila de especificación para qwen3.8-max-preview, por lo que esta nota no declara ventana de contexto para ese modelo. La cifra de 1M en estas tablas pertenece a Qwen3.7-Max.
  23. 23Qwen-Image-3.0: Rich Content, Authentic Details, Deep KnowledgeQwenAnuncio primario. Fuente de la afirmación de prompts de 4.5k tokens, el renderizado de texto a 10px, los 12 idiomas, y la cuadrícula de infografías en una sola pasada. No contiene tabla de benchmarks, conteo de parámetros, detalle de arquitectura, ni declaración de licencia.
  24. 24Qwen image generation and editing API referenceAlibaba Cloud Model StudioReferencia de API primaria para qwen-image-3.0-pro. Fuente de la restricción de preview limitado, los dos endpoints regionales no intercambiables, los límites de píxeles, y la forma del request de un solo turno.
  25. 25Model Studio billingAlibaba CloudFuente primaria de que qwen-image-3.0-pro aparece listado como gratis por tiempo limitado en ambas regiones, y del punto de referencia de ¥0.5 por imagen de la generación anterior.
  26. 26Qwen-Image on GitHubQwenLMRevisado el 25 de julio de 2026. No hay entrada de 3.0; las liberaciones de pesos abiertos se detienen en Qwen-Image-2512 bajo Apache 2.0, fechada el 31 de diciembre de 2025.
  27. 27Google releases three new Gemini models, but no 3.5 ProTechCrunchCobertura independiente del lanzamiento del 21 de julio de 2026, la ausencia de una actualización de Gemini 3.5 Pro, y el estatus de piloto limitado de Gemini 3.5 Flash Cyber.
  28. 28Anthropic launches Opus 5TechCrunchConfirmación independiente de la fecha de lanzamiento del 24 de julio de 2026 y de su brecha de aproximadamente dos meses después de Opus 4.8.
  29. 29Claude Opus 5 System CardAnthropicPublicado el 24 de julio de 2026. Se lista por completitud y explícitamente NO se usa como apoyo: el PDF superó nuestro límite de tamaño de descarga, así que nada de ahí está verificado en esta nota, incluyendo el nivel de seguridad que le atribuyen medios secundarios.
  30. 30Moonshot unveils Kimi K3ForbesCobertura independiente fechada el 17 de julio de 2026, que coincide con el propio blog de Moonshot y difiere de OpenRouter y Simon Willison, quienes fechan el lanzamiento el 16 de julio.
  31. 31Alibaba previews Qwen3.8-MaxMarkTechPostCobertura independiente. Fuente del conteo de parámetros activados no revelado y de la ausencia de model card, y de las capacidades multimodales reportadas que ninguna página de Alibaba confirma.

Weekly signal · biweekly email

Field-tested ideas. No content treadmill.

One substantial note when we have something worth showing: systems, receipts, prompts, and what failed. Confirm by email. Unsubscribe whenever you like.

Signup opens when the production Turnstile site key is configured.