Resumo espectral por página em vez de um esboço geral: LOCKS e seleção de blocos sem ler as chaves

20 setembro 202618 visualizações

O método LOCKS mantém, para cada página de contexto, uma representação de baixo posto separada das chaves, portanto a avaliação da importância dos blocos baseia-se apenas nesse resumo, e as próprias chaves candidatas não são lidas. Em tarefas longas, essa solução mantém a qualidade próxima à do cache completo ao acessar aproximadamente 2% dos tokens e com redução notável da latência de decodificação.

Resumo espectral por página em vez de um esboço geral: LOCKS e seleção de blocos sem ler as chaves

Por que um esboço global não funciona para páginas

A manutenção de grandes modelos de linguagem em contexto longo esbarra no cache key-value (KV). O cache é lido integralmente a cada passo de decodificação. As attention keys são localmente low-rank, embora globalmente high-rank. Um esboço low-rank fixo, comum a todas as páginas, é comprovadamente cego às direções das páginas.

Com o mesmo tamanho de summary, a base própria da página ranqueia as páginas e preserva os portadores muito melhor. O esboço global não enxerga essas direções. O summary espectral por chave resolve o problema.

Resumo espectral por página

O LOCKS fornece a cada página seu próprio rank-r spectral summary. O resumo é residente: um décimo do cache com r=8 e um vinte e cinco avos com r=2. O método reconstrói os logits intrapágina. Ele estima a massa de atenção de cada página via log-sum-exp. Em seguida, processa apenas as páginas superiores.

Elementos-chave:

  • Nome: Page-Local Compact Key Summaries for Efficient Long-Context Decoding.
  • Resumo: rank-r spectral summary para cada página.
  • Residência: um décimo do cache com r=8, um vinte e cinco avos com r=2.
  • Reconstrução: logits intrapágina.
  • Estimativa: massa de atenção da página via log-sum-exp.
  • Seleção: apenas as páginas superiores.

Conclusão: o resumo ocupa uma fração do cache, mas preserva as características das páginas. A seleção de páginas ocorre com base nos dados espectrais.

Seleção de blocos sem leitura de chaves

A própria seleção não lê as chaves ou valores dos candidatos. A escolha ocorre apenas com base no resumo espectral. O resumo é escaneado integralmente a cada passo. A leitura de KV por passo cai de 10 a 25 vezes no intervalo de ranks indicado.

A latência de decodificação por token é reduzida pela metade. Com 1M de tokens em uma única H200 NVL, o ganho é de 2.0× com r=8. Essa é uma comparação com atenção densa. A seleção não depende da leitura das chaves dos candidatos.

Qualidade em tarefas longas

O LOCKS preserva a qualidade em vários tipos de tarefas. Em long-document QA (LongBench-v1; Llama-3.1-8B), o resultado permanece dentro de um ponto do cache completo. Em retrieval-dense RULER, o método segue o oráculo LSE exato, que lê cada chave, até os menores orçamentos. Em long-form reasoning (AIME26, MATH-500; Qwen3-4B), a qualidade se mantém por mais tempo em regime de orçamentos pequenos. Seletores e compressores de raciocínio baseados em eviction recuam nesse cenário.

Com orçamento de 2048 tokens, o LOCKS iguala a qualidade agregada do FullKV em contexto de 100K+ (GLM-4-9B-Chat-1M). Ao mesmo tempo, o método processa 2% dos tokens.

CondiçãoResultado
Long-document QA (LongBench-v1; Llama-3.1-8B)dentro de um ponto do cache completo
Retrieval-dense RULERsegue o oráculo LSE exato até orçamentos pequenos
Long-form reasoning (AIME26, MATH-500; Qwen3-4B)mantém a qualidade por mais tempo em orçamentos pequenos
Orçamento de 2048 tokens, contexto 100K+ (GLM-4-9B-Chat-1M)iguala o FullKV, processa 2% dos tokens

Conclusão: nas tarefas listadas, a abordagem preserva a qualidade por mais tempo do que seletores e compressores baseados em eviction.

Implantação e critério de escolha

A abordagem é fornecida como plugin drop-in para o vLLM não modificado. A decodificação em lote funciona em CUDA graphs completos. Não é necessária modificação do vLLM.

Critério de escolha: contexto longo, orçamento de tokens limitado, necessidade de reduzir a leitura de KV e a latência de decodificação. Se a tarefa exige seleção de blocos sem leitura das chaves dos candidatos, a abordagem é adequada.

Perguntas mais frequentes

Materiais semelhantes

Todos os materiais
Resumo espectral por página em vez de um esboço geral: LOCKS e seleção de blocos sem ler as chaves