Community managers
Turbo devuelve imágenes lo suficientemente rápido para hacer lluvia de ideas en vivo, y la apariencia consistente mantiene una semana de publicaciones bajo una misma identidad visual.

Z-Image Turbo es el modelo de imagen destilado en 8 pasos de Alibaba: fotogramas fotorrealistas y texto nítido en inglés o chino en pocos segundos, a un precio fijo de 5 créditos por imagen. Ejecútalo en tu navegador, sin necesidad de GPU. Las cuentas nuevas obtienen 20 créditos gratis.



GALERÍA






Función 01
El modelo no solo pinta las palabras de tu prompt; completa lo que esas palabras implican. El modelo posee mucho conocimiento del mundo, y el canal propio de Tongyi-MAI añade un Potenciador de Prompts, de modo que un prompt que mencione la Gran Pagoda del Ganso Salvaje en Xi'an, un estilo de bordado Hanfu o una terraza de cafetería parisina en primavera obtiene la arquitectura correcta, el detalle del vestuario y la luz sin necesidad de un párrafo de descripción. El efecto es menos repeticiones: un prompt corto ya se acerca a la imagen que tienes en mente. El modelo también mantiene la lógica correcta del mundo real, como reflejos que coinciden con su fuente y sombras que caen alejadas de la lámpara.

Función 02
El aprendizaje por refuerzo empuja a Turbo hacia una respuesta pulida por prompt. La tabla de modelos propia de Tongyi-MAI califica la calidad visual de Turbo como Muy Alta y su diversidad como Baja, lo que suena como una debilidad hasta que necesitas un conjunto: ejecuta el mismo prompt diez veces y la iluminación, la paleta y el estilo se mantienen fieles a la marca en lugar de vagar. Eso convierte a Turbo en el modelo ideal cuando una campaña necesita veinte imágenes con el mismo aspecto, o cuando una descripción de personaje debe volver reconociblemente igual cada vez. Cuando quieras variedad, cambia el prompt, no la semilla.

Función 03
La representación precisa de texto bilingüe es una de las tres habilidades principales que Tongyi-MAI destaca para este modelo, junto con el fotorrealismo y el seguimiento de instrucciones. Pon las palabras entre comillas y el modelo las coloca en letreros, carteles, empaques y pantallas, en inglés, en chino, o ambos en una misma imagen. Los caracteres chinos complejos son donde muchos modelos de imagen distorsionan los trazos; este los mantiene legibles. Esto es útil para tiendas que venden en China y para cualquiera que haga un menú bilingüe, un cartel de festival de linternas o una etiqueta de producto con ambos alfabetos. Los prompts mismos pueden escribirse en cualquiera de los dos idiomas.

Característica 04
Los modelos rápidos suelen pagar la velocidad con obediencia. Turbo cierra esa brecha con DMDR, el método de Tongyi-MAI que combina destilación de distribución con aprendizaje por refuerzo después del entrenamiento, orientado a una mejor alineación semántica y detalles más ricos en generación de pocos pasos. En la práctica, Turbo maneja prompts de múltiples partes: la mujer con vestido Hanfu rojo, el tocado de fénix, el abanico plegable, la lámpara de neón sobre su palma y la pagoda detrás de ella aparecen exactamente donde pediste. En el ranking de preferencia humana de Alibaba AI Arena, Tongyi-MAI reporta a Turbo como el estado del arte entre los modelos de código abierto.

Característica 05
El fotorrealismo es la primera capacidad que Tongyi-MAI muestra para el modelo: textura de la piel, tejido de tela y luz natural que pasan por una foto real. En Ricebowl eliges uno de los cinco formatos antes de generar: 1:1 para feeds y marketplaces, 16:9 para banners y miniaturas, 9:16 para stories, y 4:3 o 3:4 para páginas de producto. Cada imagen cuesta los mismos 5 créditos, por lo que elegir el formato correcto nunca cambia el precio. Para trabajos de impresión que necesiten 4K, cambia a Seedream 5.0 Lite en el mismo selector de modelos.

EJEMPLOS DE PROMPTS
Prompt
Calle de mercado nocturno en Taipéi, un puesto de comida con un cartel pintado a mano que dice "阿明豆花 Ming's Tofu Pudding", vapor saliendo de las ollas, bombillas de tungsteno cálidas, profundidad de campo reducida, filmado en película de 35 mm.
Referencia

Resultado

Prompt
Anuncio minimalista de cuidado de la piel, una botella de vidrio esmerilado sobre arena pálida, sombra suave de la mañana, titular "HYDRATE" en sans-serif delgado en la parte superior, espacio negativo limpio para el texto.
Referencia

Resultado

CASOS DE USO
Turbo devuelve imágenes lo suficientemente rápido para hacer lluvia de ideas en vivo, y la apariencia consistente mantiene una semana de publicaciones bajo una misma identidad visual.
La representación de texto bilingüe coloca inglés y chino en el mismo banner o etiqueta, de modo que una imagen de listado funciona en dos marketplaces.
Borradores baratos y rápidos por 5 créditos lo convierten en un motor de mood boards. Itera en la composición aquí, luego termina la idea elegida en un modelo más lento.
Las personas que leen que Turbo cabe en 16 GB de VRAM pero tienen una laptop usan Ricebowl para obtener el mismo modelo sin instalación.
El modelo es Apache 2.0. Los equipos prueban prompts en Ricebowl primero, luego deciden si vale la pena una implementación local.
LO QUE DICEN LOS USUARIOS
01
Ocho pasos en lugar de docenas es lo primero que la gente menciona. Los borradores llegan antes de que termines de leer el prompt.
02
Con 6B parámetros, Turbo es una fracción del checkpoint FLUX.2 [dev] de 32B, pero los retratos y las tomas de producto se sostienen lado a lado.
03
Los usuarios que hacen señalética bilingüe destacan que los caracteres chinos salen correctos, no como glifos aproximados.
04
La otra cara de la consistencia: regenerar el mismo prompt da imágenes similares. Reescribe el prompt cuando quieras algo nuevo.
CUÁL
Tongyi-MAI distribuye el modelo en dos formas principales. Turbo es la versión destilada, diseñada para velocidad; la Z-Image base es el checkpoint sin destilar del que se destiló Turbo. Ricebowl ejecuta Turbo.
Destilación de 8 pasos sin guía libre de clasificador, ajustada con aprendizaje por refuerzo para una calidad visual muy alta. Rápida, consistente, y la versión que se ejecuta en Ricebowl a 5 créditos por imagen.
Alrededor de 50 pasos, más lento, con más variedad por prompt y soporte para prompts negativos. Es el checkpoint pensado para fine-tuning. La edición reside en la variante separada Z-Image-Edit.
LO QUE LO DIFERENCIA
01
No necesitas ComfyUI ni una tarjeta gráfica para usarlo. Localmente, el modelo requiere una GPU con 16GB VRAM y una configuración de diffusers; en Ricebowl se ejecuta en una pestaña del navegador en cualquier portátil o teléfono, y el resultado está en tu feed segundos después.
02
Elige Turbo por velocidad y FLUX.2 por detalle y edición. Es un modelo de 6B que termina en 8 pasos; el checkpoint abierto FLUX.2 [dev] es de 32B. FLUX.2 Pro en Ricebowl agrega hasta 8 imágenes de referencia y edición de fotos, que Turbo no ofrece aquí.
03
Tongyi-MAI publica Turbo bajo la licencia Apache 2.0, una de las licencias más permisivas en IA de código abierto. Los pesos son públicos en Hugging Face y ModelScope, así que todo lo que aprendas aquí se traslada a tu propia implementación.
NUESTRA OPINIÓN
Borradores fotorrealistas rápidos y texto bilingüe. Úsalo para retratos, tomas de producto y señalética en inglés y chino; esas son las tres habilidades con las que sus creadores lideran. No lo uses para ediciones de fotos en Ricebowl, donde es solo de texto a imagen.
Z-Image Turbo. Ejecuta 8 evaluaciones de función, y Tongyi-MAI reporta latencia de menos de un segundo en GPUs H800. FLUX.2 [dev] es más de cinco veces más grande con 32B parámetros, y los propios ejemplos de FLUX.2 Flex usan de 6 a 50 pasos.
En línea, a menos que ya tengas una GPU de 16GB y generes miles de imágenes. A 5 créditos por imagen en Ricebowl, el costo de una tarjeta gráfica adecuada compra una cantidad muy grande de imágenes, sin controladores ni actualizaciones que administrar.
COMPARACIÓN
| Característica | Z-Image Turbo | FLUX.2 Pro | Qwen Image 3.0 |
|---|---|---|---|
| Creador | Alibaba Tongyi-MAI | Black Forest Labs | Alibaba Qwen team |
| Créditos en Ricebowl | 5 por imagen | 5 a 1K, 7 a 2K | 5 por imagen |
| Pasos de muestreo | 8 | Establecido por el proveedor | Establecido por el proveedor |
| Imágenes de referencia en Ricebowl | Ninguna, solo texto a imagen | Hasta 8 | Hasta 3 |
| Edición de fotos en Ricebowl | No | Sí | Sí |
| Potencia de renderizado de texto | Inglés y chino | Tipografía compleja | Texto complejo, especialmente chino |
| Pesos abiertos | Sí, Apache 2.0 (6B) | La familia tiene FLUX.2 [dev], 32B | Qwen-Image es Apache 2.0 |
| Ideal para | Borradores fotorrealistas rápidos | Detalle y ediciones con múltiples referencias | Diseños con mucho texto y ediciones |
Nuestra recomendación: empieza con Z-Image Turbo cuando necesites una imagen limpia rápidamente solo a partir de texto. Cambia a FLUX.2 Pro cuando el trabajo requiera fotos de referencia, y a Qwen Image cuando el texto denso en chino o las ediciones de texto dentro de la imagen sean lo más importante.
Prueba Z-Image Turbo gratis01
El generador en la parte superior de esta página ya ejecuta Z-Image Turbo. Crea una cuenta gratuita: incluye 20 créditos, y cada imagen cuesta 5.
02
Describe el sujeto, el entorno, la iluminación y la cámara. Pon entre comillas, en inglés o chino, cualquier palabra que deba aparecer en la imagen.
03
Selecciona 1:1, 16:9, 9:16, 4:3 o 3:4 y presiona generar. Tu imagen Z-Image Turbo aparece en el feed y se descarga con un solo clic.
RESEÑAS
Lo que dicen las personas que ejecutan Z-Image Turbo en Ricebowl.
Un banner, título en inglés y chino, ambos escritos correctamente. Antes solía corregir el chino a mano cada vez.
Vendedor transfronterizo
Hago una lluvia de ideas para una semana de publicaciones en una sola sesión. Con 5 créditos por imagen, dejo de preocuparme por los reintentos.
Community manager
Z-Image Turbo es mi máquina de paneles de inspiración. Rápido, realista y el aspecto se mantiene consistente en todo un conjunto.
Director de arte de videojuegos independientes
Mi portátil no tiene una GPU de verdad. Aquí obtengo el modelo del que todo el mundo habla en Reddit sin instalar nada.
Ilustradora con portátil
Probamos nuestro conjunto de prompts en Ricebowl antes de decidir autoalojarlo. Nos ahorró una semana de configuración.
Ingeniero de ML
Un solo saldo, todos los modelos. Los créditos sirven para los 20 modelos de vídeo: sin marca de agua, sin modelos bloqueados por plan y con uso comercial en cada plan de pago.
Paga anualmente y ahorra 30%
Paga anualmente y ahorra más.
El precio más bajo para empezar. Todos los modelos, un presupuesto mensual para probar.
7,99 US$/mes
Se renueva mensualmente, cancela en cualquier momento.
200 créditos
≈ 0–10 vídeos, según el modelo
≈ 14–66 imágenes, según el modelo
4.00¢ / crédito
La forma más económica de empezar. Todos los modelos, un presupuesto mensual reducido.
12,99 US$/mes
Se renueva mensualmente, cancela en cualquier momento.
400 créditos
≈ 1–20 vídeos, según el modelo
≈ 28–133 imágenes, según el modelo
3.25¢ / crédito
Créditos suficientes para probar todos los modelos y terminar algunos clips al mes.
29,9 US$/mes
Se renueva mensualmente, cancela en cualquier momento.
1000 créditos
≈ 3–50 vídeos, según el modelo
≈ 71–333 imágenes, según el modelo
2.99¢ / crédito
2 tareas en paralelo
Producción constante para creadores en solitario que van en serio: todos los modelos y un presupuesto holgado.
49,9 US$/mes
Se renueva mensualmente, cancela en cualquier momento.
2000 créditos
≈ 6–100 vídeos, según el modelo
≈ 142–666 imágenes, según el modelo
2.50¢ / crédito
3 tareas en paralelo
Producción de alto volumen para creadores prolíficos y equipos pequeños.
89,9 US$/mes
Se renueva mensualmente, cancela en cualquier momento.
5000 créditos
≈ 15–250 vídeos, según el modelo
≈ 357–1666 imágenes, según el modelo
1.80¢ / crédito
5 tareas en paralelo
Suscripción mensual flexible.
Créditos suficientes para probar todos los modelos y terminar algunos clips al mes.
19,9 US$/mes29,9 US$
Facturado anualmente a $238.8. Se renueva anualmente, cancela en cualquier momento.
Ahorra $120/año vs mensual
12.000 créditos
≈ 38–600 vídeos, según el modelo
≈ 857–4000 imágenes, según el modelo
1.99¢ / crédito
2 tareas en paralelo
Producción constante para creadores en solitario que van en serio: todos los modelos y un presupuesto holgado.
34,9 US$/mes49,9 US$
Facturado anualmente a $418.8. Se renueva anualmente, cancela en cualquier momento.
Ahorra $180/año vs mensual
24.000 créditos
≈ 76–1200 vídeos, según el modelo
≈ 1714–8000 imágenes, según el modelo
1.75¢ / crédito
3 tareas en paralelo
Producción de alto volumen para creadores prolíficos y equipos pequeños.
62,9 US$/mes89,9 US$
Facturado anualmente a $754.8. Se renueva anualmente, cancela en cualquier momento.
Ahorra $324/año vs mensual
60.000 créditos
≈ 190–3000 vídeos, según el modelo
≈ 4285–20000 imágenes, según el modelo
1.26¢ / crédito
5 tareas en paralelo
Recarga créditos válidos por 12 meses.
Recarga única para necesidades ocasionales.
49,9 US$
Compra única, válida por 12 meses.
1000 créditos
≈ 3–50 vídeos, según el modelo
≈ 71–333 imágenes, según el modelo
4.99¢ / crédito
Recarga única más grande con mejor precio por unidad.
198 US$
Compra única, válida por 12 meses.
4800 créditos
≈ 15–240 vídeos, según el modelo
≈ 342–1600 imágenes, según el modelo
4.13¢ / crédito
5 tareas en paralelo
Qué es Z-Image Turbo, cuánto cuesta y qué puede y no puede hacer.
Prueba Z-Image Turbo gratisSí. Regístrate en Ricebowl y obtienes 20 créditos gratis, suficientes para cuatro imágenes, sin necesidad de tarjeta. Después cada imagen cuesta 5 créditos fijos. Los pesos abiertos también se pueden descargar gratis bajo Apache 2.0 si tienes tu propia GPU de 16 GB.
Z-Image Turbo es un modelo texto a imagen de 6 mil millones de parámetros que genera en 8 pasos. Es una versión destilada de Z-Image construida sobre un transformador de difusión de un solo flujo, y se enfoca en el fotorrealismo, el texto bilingüe en inglés y chino, y el seguimiento de instrucciones.
Tongyi-MAI, un laboratorio dentro del grupo Tongyi de Alibaba. El nombre del proyecto en chino es 造相. El equipo Qwen de la misma empresa crea Qwen Image, que también está en Ricebowl.
Sí. Tongyi-MAI publica los pesos de 6B bajo la licencia Apache 2.0 en Hugging Face y ModelScope, por lo que puedes ejecutarlo localmente con diffusers o ComfyUI si tienes una GPU con aproximadamente 16 GB de VRAM. En Ricebowl se ejecuta en el navegador, sin instalación y sin tarjeta gráfica.
Ninguna en Ricebowl. Z-Image Turbo se ejecuta aquí solo como texto a imagen, por lo que cada imagen comienza desde tu indicación. Para trabajos guiados por referencia, cambia a FLUX.2 Pro (hasta 8 imágenes) o Seedream 5.0 Lite (hasta 14) en el selector de modelos.
No en Ricebowl. Tongyi-MAI enumera la edición bajo puntos de control separados Z-Image-Edit y Z-Image-Omni-Base, no bajo Turbo. Para editar una foto aquí, usa FLUX.2, Seedream o Qwen Image.
Cinco en Ricebowl: 1:1, 16:9, 9:16, 4:3 y 3:4. Todas cuestan las mismas 5 créditos.
Turbo. Es un modelo de 6B que ejecuta 8 pasos, mientras que el punto de control abierto FLUX.2 [dev] es de 32B. FLUX.2 gana en edición basada en referencias; Z-Image Turbo gana en tiempo hasta la primera imagen.
Para borradores, paneles de inspiración (mood boards) y gráficos para redes sociales, sí: el texto es legible y el realismo es alto. Para diseños de impresión finales que requieren 4K o ediciones precisas, termina en Seedream o FLUX.2.
Aquí mismo en Ricebowl. El generador en la parte superior de esta página ejecuta Z-Image Turbo en tu navegador sin ComfyUI, sin GPU y sin clave API, y puedes compararlo con FLUX.2, Qwen Image y Seedream con la misma indicación.
RELACIONADO
MÁS MODELOS
Ocho pasos, resultados fotorrealistas, texto en inglés y chino, y sin necesidad de comprar GPU.
Prueba Z-Image Turbo Gratis20 CRÉDITOS GRATIS AL REGISTRARSE · 5 CRÉDITOS POR IMAGEN · GENERACIÓN EN 8 PASOS · TEXTO BILINGÜE
Comienza a Usar el Modelo de Imagen AI Z-Image Turbo
Prueba Z-Image Turbo gratis