META AI lanza Llama 3.2. Comprende imágenes y edita fotos si está integrado en WhatsApp o Instagram

La inteligencia artificial de META evoluciona hacia lo multimodal. Así, su nuevo modelo de código abierto Llama 3.2, frente a su predecesor, puede entender, leer y razonar con imágenes, además de poder editarlas desde FACEBOOK o WhatsApp. ¿Es mejor que ChatGPT 4o? Veamos.

Meta lanzar Llama 3.2
Anuncios
META lanza Llama 3.2. ¿Es mejor que GPT-4O?

META lanza su nuevo modelo de código abierto Llama 3.2, que evoluciona su versión 3.1 anterior hacia las capacidades multimodales, más allá de interactuar sólo con texto, y ahora también con imágenes.

La versión multimodal de Llama 3.2 presentada en Meta Connect

En su evento META Connect 2024, la tecnológica informó de que Llama 3.2 se destaca por ser el primer modelo de META capaz de procesar tanto imágenes como texto. Esto le permite:

  • Comprender tablas y gráficos
  • Generar subtítulos para imágenes
  • Localizar objetos en fotos
  • Extraer detalles de imágenes y escribir descripciones

Esta capacidad multimodal permite nuevas aplicaciones, como enviar fotos al asistente Meta AI para obtener información o recetas basadas en imágenes de platillos.

Rendimiento y eficiencia del nuevo modelo de Meta AI

Llama 3.2 se presenta en dos versiones principales:

Anuncios
  • Un modelo de 90 mil millones de parámetros
  • Un modelo más ligero de 11 mil millones de parámetros

Además, incluye versiones optimizadas para dispositivos ARM, permitiendo su ejecución en procesadores Qualcomm y MediaTek.

En comparación, GPT-4 opera con aproximadamente 1.7 billones de parámetros, lo que le confiere mayor capacidad de procesamiento para tareas complejas.

Benchmarks y comparación de Llama 3.2 con otras IA

Según META, Llama 3.2 es competitivo frente a otros modelos comerciales:

  • En algunos casos, supera a Claude 3 Haiku y GPT-4o mini
  • Destaca en pruebas de reconocimiento de imágenes y comprensión visual

En pruebas específicas:

  • Llama 3 obtuvo un 82% en la prueba MMLU de 5 disparos, cerca del 86.4% de GPT-4
  • En tareas de razonamiento avanzado, Llama 3 logró un 35.7% en benchmarks de nivel posgrado, comparado con el 39.5% de GPT-4
  • En codificación, GPT-4 mantiene una ventaja clara con un 85.9% en la prueba HumanEval, frente al 81.7% de Llama 3

Ventajas de Llama 3.2

  1. Código abierto: A diferencia de GPT-4, Llama 3.2 es de código abierto, lo que permite mayor accesibilidad y adaptabilidad.
  2. Eficiencia: Es más eficiente en el procesamiento de ventanas de contexto cortas, ideal para respuestas rápidas y precisas.
  3. Adaptabilidad: Permite ajustes para mejorar la seguridad y alineación con expectativas humanas.
  4. Costo: Al ser de código abierto, ofrece una ventaja considerable en términos de costo.

Llama 3.2 frente a Llama 3.1 y comparado con GPT-4o

Llama 3.2 muestra un aumento de rendimiento decente sobre su predecesor Llama 3.1 para algunas métricas, pero en comparación con GPT-4o, se queda algo atrás.

Tal vez una comparación con GPT-4o mini sea más adecuada. Esta comparativa te muestra los casos de uso y las capacidades de Llama 3.2 vs 3.1 y GPT-4o:

CaracterísticaLlama 3.2Llama 3.1GPT-4o
Fecha de lanzamientoSeptiembre de 2024Julio 2024Marzo de 2024
Parámetros1B, 3B, 11B y 90B405 mil millonesNo se indica explícitamente; estimado en más de 200 mil millones
Longitud del contextoHasta 128.000 tokensHasta 128.000 tokensHasta 128.000 tokens
Capacidades multimodalesSí (texto + visión)Solo textoSí (texto + audio + imagen + vídeo)
Interacción de vozNo
Opciones de implementaciónDispositivos de borde (1B y 3B), nubePrincipalmente basado en la nubePrincipalmente basado en la nube
Puntos de referencia de rendimientoCompetitivo con Claude y GPT-4o-mini en varias tareasFuerte en el procesamiento de textoFuerte en la generación de texto; sobresale en interacciones en tiempo real
Datos de entrenamientoMejorado con datos multimodalesAmplios datos de formación multilingüeAmplia capacitación en diversos conjuntos de datos
Características de seguridadLlama Guard mejorada para tareas multimodalesLlama Guard 3, Prompt GuardFunciones de seguridad integradas para la moderación de contenido
Casos de usoComputación de borde, reconocimiento de imágenes, aplicaciones de vozInvestigación, aplicaciones comercialesServicio al cliente, creación de contenido, traducciones en tiempo real
AccesibilidadFuente abiertaFuente abiertaPropietario; acceso limitado para algunas características
Velocidad de respuestaBaja latencia en dispositivos de bordeAltoAproximadamente 232-320 milisegundos
Innovaciones claveFuncionalidad multimodal e integración de vozLongitud extendida del contextoCapacidades de omni-entrada (texto, audio, imagen)

Aunque Llama 3.2 representa un avance significativo y compite con GPT-4 en varios aspectos, es difícil determinar un claro ganador. La elección entre ambos dependerá del caso de uso específico:

  • Llama 3.2 es preferible para respuestas rápidas y precisas, ideal en entornos que requieren velocidad y eficiencia (WhatsApp, Facebook, por ejemplo).
  • GPT-4 sigue siendo superior en tareas que demandan una comprensión profunda y detallada de información compleja


Síguenos en Google como fuente preferente
Suscríbete a nuestro canal de WhatsApp
Hazte Premium y apoya este proyecto periodístico
Únete a mi canal de YouTube

Anuncios

Más Noticias Relacionadas