Skip to content
AI Compute Radar

Manual de campo

IA local, explicada sem rodeios.

Cada termo que o radar usa, respondido primeiro em uma frase e depois em um minuto de linguagem simples: sem alarde e sem presumir conhecimento prévio. Cada verbete termina onde o conceito faz trabalho de verdade neste site (as ferramentas estão em inglês).

21 termos, e crescendo

Também em:EnglishEspañol

01Amostragem (top-p, top-k)Amostragem é como um modelo escolhe cada próximo token da sua lista de candidatos: a temperatura remodela as chances, top-p e top-k enxugam a lista, e juntos definem quão previsível ou ousada é a saída.02Cache KVO cache KV é a memória de trabalho que o modelo preenche enquanto lê a sua conversa: cresce a cada token e, em contextos longos, pode rivalizar em tamanho com o próprio modelo.03DestilaçãoA destilação treina um modelo pequeno para imitar as respostas de um maior: por isso existem muitos dos melhores modelos pequenos, e por isso herdam os hábitos do grande, bons e maus.04Embedding (vetor de significado)Um embedding é uma lista de números que captura o significado de um texto, de modo que textos sobre a mesma coisa ficam próximos entre si: a engrenagem por trás da busca semântica e do RAG.05Fine-tuning (ajuste fino)O fine-tuning continua o treinamento de um modelo com os seus próprios exemplos para que ele adote um estilo, um formato ou uma especialidade: muda os pesos, enquanto um prompt apenas os instrui.06GGUFGGUF é o formato de arquivo único que os runtimes de IA local carregam: os pesos do modelo, geralmente quantizados, junto com tudo o que é preciso para executá-lo.07InferênciaInferência é um modelo respondendo: usar os pesos já treinados para produzir uma saída. Treinamento é como esses pesos foram aprendidos; inferência é cada uso depois disso.08Janela de contextoA janela de contexto é quanto texto um modelo consegue considerar de uma vez, medido em tokens; e manter esse texto na memória custa VRAM por meio do cache KV.09Memória unificadaMemória unificada é um único bloco de RAM compartilhado pelo processador e pelos núcleos gráficos: por isso Macs com Apple Silicon rodam modelos que em outra máquina exigiriam uma placa de vídeo enorme.10Mistura de especialistas (MoE)Um modelo de mistura de especialistas mantém muitas sub-redes especialistas, mas ativa só algumas por token: conhecimento de modelo grande na velocidade de um modelo pequeno, com a memória de modelo grande ainda necessária.11OffloadingO offloading divide um modelo entre a memória gráfica e a RAM comum quando ele não cabe por inteiro: o modelo roda, só que visivelmente mais devagar.12Parâmetros (7B, 70B)Parâmetros são os pesos aprendidos de um modelo, contados em bilhões: o B de 7B. Mais parâmetros significam mais memória, e só às vezes respostas melhores.13Pontuação de tendênciaA pontuação de tendência é a medida do próprio Hugging Face de com quais modelos a comunidade está interagindo neste momento: um sinal de impulso, não uma nota de qualidade.14QuantizaçãoA quantização armazena os pesos de um modelo com menos precisão (por exemplo, 4 bits em vez de 16), reduzindo a memória a cerca de um quarto com um pequeno custo em qualidade.15RAG (geração aumentada por recuperação)RAG permite que um modelo responda a partir dos seus próprios documentos: primeiro recupera os trechos relevantes e os coloca no prompt. Conhecimento sem retreinar nada.16Runtime localUm runtime local é o aplicativo que realmente roda modelos na sua máquina: carrega um arquivo GGUF, aciona a sua GPU e entrega uma janela de chat ou uma API.17SafetensorsSafetensors é o formato em que os modelos são publicados originalmente: pesos em precisão completa espalhados por muitos arquivos, feitos para GPUs de data center e treinamento, não para notebooks.18System prompt (instrução de sistema)O system prompt é a instrução permanente que um modelo lê antes da sua conversa: quem ele deve ser, o que pode fazer e como responder. Quem define é o aplicativo ou você, não o modelo.19TemperaturaA temperatura é o controle que define quão ousadas são as escolhas de palavras de um modelo: valores baixos o deixam previsível e repetitivo, valores altos criativo e mais propenso a erros.20TokenUm token é a unidade que os modelos de IA realmente leem e escrevem: um fragmento de palavra de poucos caracteres; em 1.000 tokens cabem aproximadamente 750 palavras em inglês.21VRAM vs. RAM do sistemaVRAM é a memória da sua placa de vídeo; a RAM do sistema, a da placa-mãe. Para a IA local a diferença é velocidade, não tamanho: um modelo precisa caber quase inteiro na VRAM para rodar rápido.