Saltar al contenido

Gemini 2.0 revoluciona la generación y edición de imágenes de IA con su nueva función nativa

Durante más de un año, el término nativamente multimodal ha resonado en el mundo de la inteligencia artificial, pero pocos han logrado aprovechar al máximo estas capacidades.

Por

Actualizada el 3 min de lectura

Gemini 2.0 revoluciona la generación y edición de imágenes de IA con su nueva función nativa

IAs de esta guía

Durante más de un año, el término nativamente multimodal ha resonado en el mundo de la inteligencia artificial, pero pocos han logrado aprovechar al máximo estas capacidades. Ahora, Google ha hecho su jugada con el lanzamiento de su modelo más reciente, Gemini 2.0 Flash Experimental, que permite no solo generar imágenes, sino también editarlas de forma nativa. Vamos, que le ha dado un pellizco a Photoshop 🤏🏼…

¿Por qué es tan importante la generación de imágenes? Aunque la generación de imágenes por IA ha estado disponible a través de chatbots como ChatGPT, estos suelen depender de modelos especializados como Dall-E 3 o Imagen 3, que son extensiones del modelo principal y no parte integral de él. Por el contrario, los modelos como Gemini son nativamente multimodales, lo que significa que pueden entender y crear tanto texto como imágenes de manera intrínseca.

Generación de Imágenes Nativa con Gemini 2.0 Flash Experimental

Actualmente, esta función de generación de imágenes nativa no está disponible para todos los usuarios. El modelo Gemini 2.0 Flash Experimental se puede probar de manera gratuita en el AI Studio de Google y estará disponible para un público más amplio pronto. Después de experimentar con este modelo, puedo decir que la experiencia fue realmente sorprendente.

Comencé pidiendo a Gemini que creara una guía visual sobre cómo hacer unos macarrones a la boloñesa. Los resultados fueron sorprendentes, mostrando una consistencia notable entre las imágenes generadas, desde la sartén hasta los ingredientes. Cada imagen mantiene la misma resolución de 1024 x 680, lo que facilita la creación de guías visuales de cualquier tema.

Google AI Studio con Gemini 2.0 Flash generando una guía visual de macarrones a la boloñesa: los ingredientes, el sofrito de cebolla y la zanahoria con apio
Google AI Studio con Gemini 2.0 Flash generando una guía visual de macarrones a la boloñesa: los ingredientes, el sofrito de cebolla y la zanahoria con apio

Luego, solicité a Gemini que generara una habitación vacía, y le fui pidiendo modificaciones sobre la decoración y utilidad de la habitación. La continuidad que mantuvo fue asombrosa.

Conversación con Gemini generando una habitación vacía y amueblándola paso a paso para un niño de cinco años, manteniendo la misma escena en las tres imágenes
Conversación con Gemini generando una habitación vacía y amueblándola paso a paso para un niño de cinco años, manteniendo la misma escena en las tres imágenes

Edición de Imágenes Nativa con Gemini 2.0 Flash Experimental

Para demostrar la función de edición de imágenes, subí una foto de mi garaje y le pedí que cambiara mi coche por un Tesla blanco, y el resultado fue impresionante. Finalmente, le pedí que agregara unas mesas con ordenadores, y así me demostró el potencial de la edición de imágenes gracias a la capacidad multimodal nativa de Gemini. No fueron perfectas, pero sí muy buenas. Además, pedí a Gemini que colorizara una foto antigua en blanco y negro, y el resultado superó mis expectativas, con una calidad visual óptima y sin errores visibles.

Las posibilidades con Gemini son vastas y emocionantes. Google ha hecho un trabajo admirable al integrar la generación y edición de imágenes de manera nativa. Con el reciente lanzamiento de Veo 2 para generación de video y Imagen 3 para generación de imágenes especializadas, parece que Google ha superado a OpenAI en varios aspectos, no solo en generación de texto. Será interesante ver cómo responde OpenAI a este avance con su ChatGPT.

Informático desde 2002: sistemas, ingeniería, desarrollo web y SEO. Hago negocio con IA desde febrero de 2023, cuando se pudo contratar ChatGPT en España.

Más sobre mí Cómo pruebo las herramientas

Guías relacionadas

¿Te ha quedado alguna duda? Pregúntame

Te respondo yo, Miguel Ángel, aquí mismo. Y si ves algo que ya no es así, dímelo y lo corrijo.

Escribir mi pregunta

Lo que quieras preguntar o contarme. Sin enlaces.

El que quieras que salga publicado. No te pido el email.

Qué guardo: tu nombre visible, tu texto y la fecha, para publicarlos si pasan la revisión. No te pido el email. Contra el spam, Cloudflare Turnstile comprueba que eres una persona y guardo durante 30 días una huella de tu conexión hecha con una clave, que no se puede revertir (nunca la IP en claro). Lo que no se publica se borra 30 días después de revisarlo; lo publicado sigue mientras exista la página o hasta que me pidas quitarlo. Base legal: tu consentimiento, que puedes retirar cuando quieras. Política de privacidad.

Los leo todos antes de publicarlos. No publico enlaces ni insultos.