
Llama 3.1 405B
O maior modelo de linguagem aberta da Meta com 405 bilhões de parâmetros, disponível para uso comercial e ajuste fino independente.
Visão geral
Llama 3.1 405B
Descrição da rede neural Llama 3.1 405B
Llama 3.1 405B é o maior modelo de linguagem de código aberto lançado pela Meta em julho de 2024. Ele contém 405 bilhões de parâmetros e é treinado em um conjunto de dados de mais de 15 trilhões de fichas usando a fase RLHF (Reinforcement Learning from Human Feedback). Em termos de desempenho de tarefas, o modelo é comparável aos modelos emblemáticos fechados — GPT-4 e Claude 3 Opus — enquanto seus pesos de modelo estão totalmente abertos, permitindo que ele seja usado como uma base para ajuste fino para tarefas especializadas.
O modelo trabalha com texto e código e suporta uma janela de contexto de 128K token — o suficiente para analisar documentos longos, diálogos extensos e raciocínio multi-passo complexo. O Llama 3.1 405B está disponível tanto para uso comercial através de plataformas de nuvem como para hospedagem automática em seus próprios servidores se você tiver poder de computação suficiente.
Especificações Llama 3.1 405B
| Característica | Valor |
|---|---|
| Desenvolvimento | Meta |
| Data de lançamento | 23 de julho de 2024 |
| Número de parâmetros | 405 mil milhões |
| Janela de contexto | 128K tokens |
| Tipo | Modelo de linguagem de código aberto (Open Source) |
| Modalidades disponíveis | Texto, Código |
| Licença | Meta Llama 3.1 Licença Comunitária (uso comercial para até 700 milhões de usuários) |
Para quem é adequada a rede neural Llama 3.1 405B?
Pesquisadores e empresas especializadas
O Llama 3.1 405B é uma escolha ideal para grupos de pesquisa e empresas que necessitam de um modelo de base para melhor ajuste em domínios específicos. A abertura dos pesos permite adaptar o modelo de tarefas em medicina, direito, finanças e outras indústrias onde é necessária uma especialização profunda e não respostas genéricas.
Desenvolvedores usando modelos de código aberto
Desenvolvedores que querem trabalhar com um modelo de nível GPT-4, mas preferem soluções de código aberto sem bloqueio de fornecedores, obtêm controle total sobre o modelo com o Llama 3.1 405B: da configuração e ajuste fino à implantação em sua própria infraestrutura ou através de um provedor de nuvem escolhido.
Como usar a rede neural Llama 3.1 405B?
Através de plataformas de nuvem
A maneira mais fácil de começar é acessar o modelo através de um dos provedores de nuvem: AWS Bedrock, Azure Machine Learning, GCP Vertex AI, Together.ai, Fireworks AI, ou Replicate. O registro é feito através do serviço selecionado, após o qual o modelo está disponível via API sem a necessidade de implantar a infraestrutura você mesmo.
Auto-apresentação
Executar o Llama 3.1 405B localmente requer pelo menos 8 GPUs A100 com 80 GB de memória cada quando usando precisão FP8. Este é um requisito significativo que torna a implantação local acessível apenas para organizações com sua própria capacidade de servidor ou acesso a clusters de alto desempenho.
Testes livres
O acesso gratuito limitado ao modelo é fornecido pela empresa Together.ai. Você também pode testar o modelo no modo de demonstração em HuggingFace Spaces. Isso é suficiente para avaliar a qualidade do modelo, mas o uso regular exigirá uma assinatura paga.
Principais características de Llama 3.1 405B
Número recorde de parâmetros
405 bilhões de parâmetros fazem do Llama 3.1 405B o maior modelo de linguagem de código aberto no momento do lançamento. O tamanho grande afeta diretamente a capacidade do modelo de lidar com tarefas complexas, multi-passos que requerem compreensão contextual profunda e uma longa cadeia de raciocínio.
Janela de contexto do token 128K
O modelo processa-se a 128 mil fichas em um único pedido. Isso permite trabalhar com documentos grandes, analisar diálogos longos e processar livros inteiros, bases de código e contratos legais sem perder o contexto.
Pontuação de referência elevada
O Llama 3.1 405B atinge 88,6% no valor de referência do MMLU (avaliação do conhecimento em vários domínios) e 89,0% no HumanEval (tarefas de programação). Estes resultados colocam-no em par com os melhores modelos comerciais fechados.
Pesos totalmente abertos
Ao contrário de muitos concorrentes, a Meta publica não só a API, mas também o modelo pesa a si mesmo. Isso permite ajustar o Llama 3.1 405B para tarefas especializadas, criar versões personalizadas e controlar totalmente o processo de inferência.
Vantagens do Llama 3.1 405B
- Qualidade de nível GPT-4 com total abertura — o modelo é comparável ao das principais alternativas fechadas, mantendo-se disponível para estudos, modificações e ajustes independentes.
- O maior modelo de linguagem de código aberto — 405 mil milhões de parâmetros fornecem a maior profundidade de análise entre todas as soluções de código aberto.
- Contexto do token 128K — permite processar documentos longos e diálogos inacessíveis a modelos com janelas de contexto menores.
- Uso comercial sob a licença Meta — o modelo pode ser utilizado em produtos comerciais por empresas com 700 milhões de utilizadores.
- Disponibilidade através de provedores de nuvem — AWS Bedrock, Azure e outros serviços oferecem o modelo sem a necessidade de implantar infra-estrutura pesada você mesmo.
Desvantagens de Llama 3.1 405B
- Enormes requisitos de computação — a implantação local requer pelo menos 8 GPUs A100 com 80 GB cada, tornando inacessíveis a maioria dos usuários e pequenas empresas.
- Alto custo da API — o custo das chamadas de modelos é significativamente superior ao das versões mais pequenas do Llama 3.1 70B, tornando-o inútil para tarefas simples e de rotina.
- Inferência lenta — devido ao grande tamanho do modelo, o tempo de resposta é consideravelmente mais elevado do que as alternativas compactas.
- Alucinações em eventos recentes — os dados de formação do modelo são cortados no início de 2024, pelo que as informações sobre acontecimentos mais recentes podem ser imprecisas ou fabricadas.
Que tarefas o Llama 3.1 405B resolve?
Raciocínio multi-passo complexo
O modelo é particularmente forte em tarefas que requerem uma longa cadeia lógica: provas matemáticas, planejamento, relatórios analíticos, análise jurídica. A grande janela de contexto e instruções de alta qualidade a seguir permitem manter uma lógica complexa durante toda a resposta.
Programação e trabalho com código
O Llama 3.1 405B atinge 89,0% no benchmark HumanEval, que corresponde ao nível dos principais modelos comerciais. Ele lida com a escrita de código, refatoração, explicação de algoritmos e depuração.
Análise longa do documento
Graças ao contexto do token 128K, o modelo pode processar livros inteiros, artigos científicos, contratos legais ou bases de código, extraindo informações-chave e respondendo a perguntas sobre todo o conteúdo.
Criando modelos de base para ajuste fino
A abertura dos pesos faz da Llama 3.1 405B a principal plataforma para a criação de modelos especializados em áreas como medicina, direito e finanças. Os pesquisadores podem ajustar o modelo em seus próprios conjuntos de dados, obtendo ferramentas precisamente adaptadas a uma indústria específica.
Preço Llama 3.1 405B
Acesso gratuito
Acesso gratuito limitado é fornecido através de Together.ai. Uma versão demo também está disponível no HuggingFace Spaces. Isso é suficiente para se familiarizar com as capacidades do modelo e testá-lo em pequenas quantidades de dados.
Planos pagos
O custo do uso através de Together.ai começa em $3 por 1 milhão de fichas de entrada. Além disso, o modelo está disponível por assinatura através de provedores de nuvem: Together.ai, Fireworks AI, Replicate, AWS Bedrock e Azure. As taxas específicas dependem do fornecedor escolhido e dos volumes de utilização.
Condições de utilização do Llama 3.1 405B
Para trabalhar com o modelo, é necessário registrar através de um provedor de nuvem escolhido. O uso comercial é regido pela Meta Llama 3.1 Licença Comunitária, que permite o uso do modelo por empresas com audiência de up 700 milhões de utilizadores. Organizações que ultrapassem esse limite devem solicitar uma licença separada da Meta.
Disponibilidade do Llama 3.1 405B
O modelo está disponível através das principais plataformas de nuvem: Together.ai, Fireworks AI, Replicate, AWS Bedrock, Azure Machine Learning e GCP Vertex AI. A instalação local requer pelo menos 8 GPUs A100 80GB. Como o modelo está totalmente aberto, não há restrições de idioma ou regionais — o acesso é determinado apenas pela capacidade de se conectar ao serviço de nuvem escolhido ou pela disponibilidade do seu próprio hardware.
Como o Llama 3.1 405B difere das alternativas
Abertura com qualidade de nível GPT-4
A principal diferença entre Llama 3.1 405B e alternativas comerciais (GPT-4, Claude 3 Opus) é a abertura total dos pesos com qualidade comparável. Modelos fechados não permitem ajustes finos para tarefas específicas, estudar a arquitetura interna ou implantar em sua própria infraestrutura. O Llama 3.1 405B fornece todas essas capacidades.
Comparação com modelos de código aberto menores
Em comparação com o Llama 3.1 70B, a versão com 405 bilhões de parâmetros supera significativamente o modelo menor em tarefas complexas: matemática, programação e raciocínio multi-passo. No entanto, para a maioria das tarefas diárias, a diferença de qualidade é insignificante, enquanto Llama 3.1 70B visivelmente ganha em velocidade de resposta e custo de uso.
Conclusão
Llama 3.1 405B é um modelo de código aberto historicamente significativo da Meta que chegou muito perto em qualidade dos modelos emblemáticos fechados GPT-4 e Claude 3 Opus. Ele define uma nova barra para modelos de linguagem de código aberto e é especialmente valioso como um modelo base para ajuste fino para tarefas especializadas graças aos seus pesos totalmente abertos. Apesar dos elevados requisitos de recursos e custos, o Llama 3.1 405B tornou-se um marco importante no caminho para democratizar o acesso a modelos de linguagem poderosos.
Tarifas
Perguntas mais frequentes
Ferramentas de IA semelhantes
Consulte também

Extensão para Chrome que ajuda a gerenciar abas, histórico e favoritos com um assistente de IA.

Serviço online para criar um clone realista de voz a partir de uma gravação de áudio curta e converter texto em fala.

Assistente de IA para criar e editar rapidamente textos em vários formatos.

Uma plataforma aberta para gerar imagens e outros conteúdos visuais a partir de descrições de texto usando IA.

Plataforma de IA para criação e edição de vídeos, funcionando diretamente no navegador Chrome.

Plataforma online de síntese de fala de IA que permite gerar áudio com vozes de personagens famosos e celebridades.

Catálogo de ferramentas de IA com materiais de aprendizagem e guias para selecionar redes neurais.

Plataforma para automação de desenvolvimento de software com um construtor visual de agentes de IA.
