Saltar al contenido

Meta lanza la Llama API con velocidades de inferencia récord para desarrolladores

En un giro emocionante de los acontecimientos en el mundo de la inteligencia artificial, Meta ha desvelado la Llama API en el primer LlamaCon, prometiendo revolucionar la forma en que los desarrolladores interactúan con sus modelos de IA.

Por

Actualizada el 2 min de lectura

Cartela del debrief de LlamaCon 2025 sobre fondo azul con caracteres de código

En un giro emocionante de los acontecimientos en el mundo de la inteligencia artificial, Meta ha desvelado la Llama API en el primer LlamaCon, prometiendo revolucionar la forma en que los desarrolladores interactúan con sus modelos de IA. Este nuevo servicio, que se encuentra en una fase de prueba gratuita limitada, permite a los desarrolladores acceder a diferentes modelos de la familia Llama, incluyendo los recién lanzados Llama 4 Scout y Llama 4 Maverick.

La Llama API se destaca por su facilidad de uso, ofreciendo creación de claves API con un solo clic y SDKs ligeros en TypeScript y Python. Lo mejor de todo es su compatibilidad con el SDK de OpenAI, lo que facilita a los desarrolladores portar sus aplicaciones basadas en OpenAI hacia esta nueva plataforma.

Velocidades de inferencia sin precedentes

Pero eso no es todo, ya que Meta ha asociado fuerzas con Cerebras y Groq, prometiendo velocidades de inferencia récord. Cerebras afirma que su modelo Llama 4 Cerebras puede generar tokens hasta 18 veces más rápido que las soluciones tradicionales basadas en GPU de NVIDIA y otras. De acuerdo con el sitio de benchmarks Artificial Analysis, el modelo Cerebras superó los 2,600 tokens/s para Llama 4 Scout, en comparación con solo 130 tokens/s de ChatGPT y 25 tokens/s de DeepSeek.

Andrew Feldman, CEO y cofundador de Cerebras, expresó su entusiasmo: “Cerebras se enorgullece de hacer de la Llama API la API de inferencia más rápida del mundo. Los desarrolladores que construyen aplicaciones en tiempo real necesitan velocidad. Con Cerebras en la Llama API, pueden crear sistemas de IA que son fundamentalmente inalcanzables para las nubes de inferencia líderes basadas en GPU”.

Los desarrolladores interesados pueden acceder a esta increíble velocidad de inferencia al seleccionar Cerebras desde las opciones del modelo dentro de la Llama API. Además, Llama 4 Scout también está disponible a través de Groq, aunque actualmente opera a más de 460 tokens/s, lo que es aproximadamente 6 veces más lento que la solución de Cerebras, pero aún 4 veces más rápido que otras soluciones basadas en GPU.

Informático desde 2002: sistemas, ingeniería, desarrollo web y SEO. Hago negocio con IA desde febrero de 2023, cuando se pudo contratar ChatGPT en España.

Más sobre mí Cómo pruebo las herramientas

¿Te ha quedado alguna duda? Pregúntame

Te respondo yo, Miguel Ángel, aquí mismo. Y si ves algo que ya no es así, dímelo y lo corrijo.

Escribir mi pregunta

Lo que quieras preguntar o contarme. Sin enlaces.

El que quieras que salga publicado. No te pido el email.

Qué guardo: tu nombre visible, tu texto y la fecha, para publicarlos si pasan la revisión. No te pido el email. Contra el spam, Cloudflare Turnstile comprueba que eres una persona y guardo durante 30 días una huella de tu conexión hecha con una clave, que no se puede revertir (nunca la IP en claro). Lo que no se publica se borra 30 días después de revisarlo; lo publicado sigue mientras exista la página o hasta que me pidas quitarlo. Base legal: tu consentimiento, que puedes retirar cuando quieras. Política de privacidad.

Los leo todos antes de publicarlos. No publico enlaces ni insultos.