Imagem de fundo

No processo de inferência, o LLaMA utiliza decodificação...

No processo de inferência, o LLaMA utiliza decodificação paralela em vez de decodificação sequencial, gerando todos os tokens simultaneamente, sem depender do contexto anterior, o que elimina a necessidade de otimizações como layer-wise quantization.


C

Certo


E

Errado