Llama 3.1 405B

Sin cargo

El modelo de lenguaje abierto más grande de Meta con 405 mil millones de parámetros, disponible para uso comercial y ajuste independiente.

Examen

Llama 3.1 405B

Descripción de la red neuronal Llama 3.1 405B

Llama 3.1 405B es el modelo de lenguaje de código abierto más grande lanzado por Meta en julio de 2024. Contiene 405 milliardes de parámetros y se capacita en un conjunto de datos de más de 15 billones de fichas utilizando la etapa RLHF (Aprendizaje de Reacción Humana). En cuanto al desempeño de tareas, el modelo es comparable a los modelos insignia cerrados (GPT-4 y Claude 3 Opus), mientras que sus pesos modelo están totalmente abiertos, lo que le permite ser utilizado como base para el ajuste de tareas especializadas.

El modelo funciona con texto y código y es compatible con una ventana de contexto token de 128K, suficiente para analizar documentos largos, diálogos extensos y un razonamiento complejo de varios pasos. Llama 3.1 405B está disponible tanto para uso comercial a través de plataformas en la nube como para auto hospedar en sus propios servidores si tiene suficiente poder de cálculo.

Llama 3.1 405B especificaciones

CaracterísticasValor
DesarrolladorMeta
Fecha de lanzamiento23 de julio, 2024
Número de parámetros405 mil millones
Context windowTokens 128K
TipoModelo de lenguaje de código abierto (fuente abierto)
Modalidades disponiblesTexto, Código
LicenciaMeta Llama 3.1 Licencia comunitaria (uso comercial para hasta 700 millones de usuarios)

¿Quién es la red neuronal Llama 3.1 405B adecuada para?

Investigadores y empresas especializadas

Llama 3.1 405B es una opción ideal para grupos de investigación y empresas que necesitan un modelo base para seguir perfeccionando en dominios específicos. La apertura de los pesos hace posible adaptar el modelo para tareas en medicina, derecho, finanzas y otras industrias donde se requiere especialización profunda en lugar de respuestas genéricas.

Desarrolladores usando modelos de código abierto

Los desarrolladores que quieran trabajar con un modelo de nivel GPT-4 pero prefieren soluciones de código abierto sin el bloqueo del proveedor obtienen el control completo sobre el modelo con Llama 3.1 405B: desde la configuración y ajuste fino hasta el despliegue en su propia infraestructura o a través de un proveedor de nube elegido.

¿Cómo utilizar la red neuronal Llama 3.1 405B?

A través de plataformas de nubes

La forma más fácil de empezar es acceder al modelo a través de uno de los proveedores de la nube: AWS Bedrock, Azure Machine Learning, GCP Vertex AI, Together.ai, Fireworks AI o Replicar. El registro se realiza a través del servicio seleccionado, después de lo cual el modelo está disponible a través de API sin la necesidad de implementar la infraestructura usted mismo.

Self-hosting

Llama 3.1 405B localmente requiere por lo menos 8 GPU A100 con 80 GB de memoria cada uno al utilizar la precisión FP8. Este es un requisito importante que hace que el despliegue local sea accesible sólo a las organizaciones con su propia capacidad de servidor o acceso a grupos de alto rendimiento.

Pruebas gratuitas

El acceso libre limitado al modelo es proporcionado por Together.ai. También puede probar el modelo en modo demo en HuggingFace Spaces. Esto es suficiente para evaluar la calidad del modelo, pero el uso regular requerirá una suscripción pagada.

Características clave de Llama 3.1 405B

Número récord de parámetros

405 mil millones de parámetros hacen de Llama 3.1 405B el mayor modelo de lenguaje de código abierto en el momento de la liberación. El gran tamaño afecta directamente a la capacidad del modelo para manejar tareas complejas y de varios pasos que requieren una comprensión contextual profunda y una larga cadena de razonamiento.

Ventana de contexto token 128K

El modelo se procesa a 128 mil fichas en una sola solicitud. Esto permite trabajar con grandes documentos, analizar largos diálogos y procesar libros enteros, bases de código y contratos legales sin perder contexto.

Altas puntuaciones de referencia

Llama 3.1 405B alcanza el 88,6% en el parámetro MMLU (valoración de conocimiento en varios dominios) y el 89,0% en HumanEval (trabajos de programación). Estos resultados lo ponen a la par con los mejores modelos comerciales cerrados.

Pesos totalmente abiertos

A diferencia de muchos competidores, Meta publica no sólo la API sino también el modelo de pesos mismos. Esto hace posible fingir Llama 3.1 405B para tareas especializadas, crear versiones personalizadas y controlar completamente el proceso de inferencia.

Ventajas de Llama 3.1 405B

  • Calidad GPT-4 con plena apertura — el modelo es comparable a las principales alternativas cerradas, mientras que permanece disponible para estudio independiente, modificación y ajuste fino.
  • El modelo de lenguaje de código abierto más grande — 405 mil millones de parámetros proporcionan la mayor profundidad de análisis entre todas las soluciones de código abierto.
  • 128K token context — permite procesar documentos largos y diálogos inaccesibles a modelos con ventanas de contexto más pequeñas.
  • Uso comercial bajo la licencia Meta — el modelo puede ser utilizado en productos comerciales por empresas con una audiencia de arriba a 700 millones de usuarios.
  • Disponibilidad a través de proveedores de cloud — AWS Bedrock, Azure y otros servicios ofrecen el modelo sin necesidad de desplegar una infraestructura pesada.

Desventajas de Llama 3.1 405B

  • Ingentes requisitos de computación — el despliegue local requiere por lo menos 8 GPU A100 con 80 GB cada una, haciendo inaccesible el alojamiento a la mayoría de los usuarios y pequeñas empresas.
  • Costo de alta API — el costo de las llamadas modelo es significativamente mayor que el de las versiones más pequeñas de Llama 3.1 70B, por lo que no es rentable para tareas simples y rutinarias.
  • Inferencia lenta — debido al gran tamaño del modelo, el tiempo de respuesta es notablemente mayor en comparación con las alternativas compactas.
  • Alucinaciones sobre acontecimientos recientes — los datos de entrenamiento del modelo se cortan a principios de 2024, por lo que la información sobre eventos más recientes puede ser inexacta o fabricada.

¿Qué tareas resuelve Llama 3.1 405B?

Complejo razonamiento de varios pasos

El modelo es particularmente fuerte en tareas que requieren una larga cadena lógica: pruebas matemáticas, planificación, informes analíticos, análisis legal. La ventana de contexto grande y la instrucción de alta calidad que sigue le permiten mantener la lógica compleja durante toda la respuesta.

Programación y trabajo con código

Llama 3.1 405B alcanza el 89,0% en el referente HumanEval, que corresponde al nivel de los principales modelos comerciales. Maneja el código de escritura, refactoring, explicando algoritmos y depurando.

Análisis de documentos largos

Gracias al contexto de token 128K, el modelo puede procesar libros enteros, artículos científicos, contratos legales o bases de código, extrayendo información clave y respondiendo preguntas sobre todo el contenido.

Crear modelos de base para el ajuste fino

La apertura de los pesos hace de Llama 3.1 405B la plataforma principal para crear modelos especializados en campos como medicina, derecho y finanzas. Los investigadores pueden ajustar el modelo en sus propios conjuntos de datos, obteniendo herramientas precisamente adaptadas a una industria específica.

Llama 3.1 405B precios

Acceso gratuito

Acceso gratuito limitado a través de Together.ai. También está disponible una versión demo en HuggingFace Spaces. Esto es suficiente para familiarizarse con las capacidades del modelo y probarlo en pequeñas cantidades de datos.

Planes de pago

El costo de uso a través de Together.ai comienza en $3 por 1 millón de fichas de entrada. Además, el modelo está disponible por suscripción a través de proveedores de nube: Together.ai, Fireworks AI, Replicate, AWS Bedrock y Azure. Las tarifas específicas dependen del proveedor elegido y los volúmenes de uso.

Términos de uso para Llama 3.1 405B

Para trabajar con el modelo, se requiere registro a través de un proveedor de nube elegido. El uso comercial se rige por la Licencia Comunitaria Meta Llama 3.1, que permite el uso del modelo por empresas con una audiencia de arriba a 700 millones de usuarios. Las organizaciones que superen este umbral deben solicitar una licencia separada de Meta.

Disponibilidad de Llama 3.1 405B

El modelo está disponible a través de las principales plataformas de nube: Together.ai, Fireworks AI, Replicar, AWS Bedrock, Azure Machine Learning, y GCP Vertex AI. La instalación local requiere al menos 8 GPUs A100 80GB. Dado que el modelo está completamente abierto, no hay restricciones de lenguaje o regionales, el acceso sólo se determina por la capacidad de conectarse al servicio de nube elegido o la disponibilidad de su propio hardware.

Cómo Llama 3.1 405B difiere de alternativas

Apertura con calidad GPT-4

La principal diferencia entre Llama 3.1 405B y alternativas comerciales (GPT-4, Claude 3 Opus) es la total apertura de los pesos con calidad comparable. Los modelos cerrados no permiten realizar tareas específicas, estudiar la arquitectura interna o desplegarse en su propia infraestructura. Llama 3.1 405B proporciona todas estas capacidades.

Comparación con modelos de código abierto más pequeños

Comparado con Llama 3.1 70B, la versión con 405 milliardes de parámetros supera significativamente el modelo más pequeño en tareas complejas: matemáticas, programación y razonamiento multi-paso. Sin embargo, para la mayoría de las tareas cotidianas, la diferencia de calidad es insignificante, mientras que Llama 3.1 70B gana notablemente en la velocidad de respuesta y el costo de uso.

Conclusión

Llama 3.1 405B es un modelo de código abierto históricamente significativo de Meta que ha llegado muy cerca de la calidad de los modelos insignia cerrados GPT-4 y Claude 3 Opus. Es un nuevo bar para los modelos de lenguaje de código abierto y es especialmente valioso como un modelo base para realizar tareas especializadas gracias a sus pesos totalmente abiertos. A pesar de los altos recursos y costos, Llama 3.1 405B se ha convertido en un hito importante en el camino para democratizar el acceso a modelos de lenguaje poderoso.

Generación y análisis de textos
Escribir y refactorizar código
Building AI Assistants and chatbots
Investigación científica y ajuste modelo

Aranceles

ArancelPrecioOportunidadesLimitaciones
Acceso gratuitoGratisAcceso a través de Together.ai, modo demo en HuggingFace SpacesLimited

Preguntas frecuentes

Vea también

Llama 3.1 405B — panorama de la red neuronal abierta de Meta