Segundo cérebro com IA · Capítulo 4 de 16 · 10 min
Vale a pena ter um computador de IA no escritório?
Separe o que roda dentro da pousada do que fica na nuvem pela memória da máquina.
Este capítulo faz parte do curso gratuito Segundo cérebro com IA. Para marcar como concluído e salvar o progresso, abra este capítulo na página do curso.
Nesta aula você decide quais tarefas saem da nuvem, calcula a memória que o modelo de cada uma pede e escolhe a máquina por essa conta, e não pelo preço da etiqueta. Com a agenda ligada ao assistente, as fichas dos clientes ainda saem pela internet a cada pergunta; um computador de IA no escritório vale a pena quando você quer que elas fiquem dentro de casa.
Hoje toda pergunta vai para a nuvem (computador de outra empresa, que você usa pela internet). Com isso, três coisas ficam nas mãos da outra empresa: a demora da resposta, o caminho da ficha e o dia em que o serviço cai. A divisão que funciona é simples. O que é repetitivo e traz dado pessoal roda na máquina do escritório; o que pede modelo grande continua na nuvem.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
O desenho das quatro peças volta com uma só em destaque. Um computador assim é um servidor local, isto é, uma máquina ligada no escritório que atende os outros aparelhos. O trabalho dele é a inferência (o momento em que o modelo pensa e escreve a resposta).
Quanta memória a máquina precisa ter?
A memória precisa guardar o modelo inteiro e ainda sobrar espaço para a conversa, e a conta cabe numa linha. O tamanho de um modelo se mede em parâmetros (os números que ele aprendeu; mais parâmetros pedem mais memória), contados em bilhões. A quantização compacta cada parâmetro para caber na máquina, como uma foto salva em qualidade menor.
Pela regra publicada pela Hugging Face, site onde os modelos abertos são distribuídos, os pesos ocupam perto de parâmetros vezes bits dividido por oito, em bytes. Um modelo de 8 bilhões ocupa cerca de 16 GB em 16 bits, 8 GB em 8 bits e 4 GB em 4 bits. Para rodar, some até 20%, pela estimativa do grupo de pesquisa EleutherAI que a Hugging Face cita, mais o espaço da conversa, que cresce com o tamanho do texto.
Se a figura ultrapassar a área visível, deslize para os lados. Pelo teclado, foque a figura e use as setas.
Compactar tem um preço que a nota final esconde. Na maior comparação publicada, da Red Hat com o Instituto de Ciência e Tecnologia da Áustria, apresentada na ACL 2025 e revista em maio de 2026, 8 bits em ponto flutuante não perdeu acerto em nenhum tamanho da família Llama 3.1, e 4 bits só nos pesos ficou perto de 8 bits. Os autores distribuem modelos compactados, e o teste mede resposta, não uso de ferramenta.
O uso de ferramenta é onde o dano aparece. Pesquisadores da VAIV Company, da Universidade Nacional de Seul e da Universidade da Coreia, em julho de 2026, rodaram agentes de atendimento em 16, 8 e 4 bits: o placar empatou, mas em 4 bits a chamada a uma ferramenta que não existe cresceu até 2,5 vezes. Por isso a tarefa que consulta planilha ou preenche ficha se testa pelo registro das chamadas antes de fechar a compra.
O teto de 64 GB pesa na escolha: modelos de 30 a 35 bilhões compactados em 4 bits são o caso típico dessa memória, e o de 70 bilhões fica no limite. À venda desde 22 de setembro de 2026, o Mac mini vem com chip M6, até 32 GB, ou M5 Pro, até 64 GB; 128 GB ou mais só no Mac Studio, que chega a 512 GB. A Apple anuncia o M5 Pro para servir agentes dia e noite; quem decide a compra é a memória.
O Mac mini com M5 Pro em quatro números da Apple
64 GB
memória máxima
só no M5 Pro; o M6 vai até 32 GB
307 GB/s
vazão da memória
quanto mais vazão, mais rápida a resposta
6 W
em repouso
com 64 GB de memória
145 W
no máximo
mesma configuração
Os dois últimos números fazem a conta de luz de uma máquina ligada dia e noite: multiplique os watts pelas horas do mês e pela tarifa da sua distribuidora. Num teste de agosto de 2026 com um computador da Apple de chip M4 Pro, a máquina inteira gastou de 8 a 12 W respondendo com modelos de 3 a 9 bilhões de parâmetros; só um medidor na tomada diz o número da sua.
No Mac, vale a memória unificada (uma só memória para todas as partes do chip, como a bancada comum de uma cozinha), e o limite passa a ser a largura de banda de memória (a velocidade com que o chip lê essa memória, como a vazão de um cano). No PC, a placa de vídeo tem memória própria, mais rápida e menor: a GeForce RTX 5090, da NVIDIA, tem 32 GB e consome até 575 W, e quando o modelo não cabe nela a velocidade cai.
Como dimensionar a memória pela tarefa e pela compactação
Antes de pedir cotação, tenha a lista das duas ou três tarefas que vão sair da nuvem e o modelo candidato de cada uma. O número de parâmetros aparece na página do modelo no Ollama (programa que baixa e roda modelos no seu computador).
Dimensionar a memória antes de pedir cotação
Passo 1: Liste as tarefas que saem da nuvem e o modelo de cada uma
Deu certo quando: Cada tarefa tem um modelo com o número de parâmetros ao lado.
Passo 2: Calcule o peso de cada modelo em 8 e em 4 bits
Parâmetros vezes bits, dividido por oito: 30 bilhões dão 30 GB em 8 bits e 15 GB em 4 bits.
Passo 3: Some até 20% e a folga da conversa a cada peso
Erro comum: O erro mais comum é comparar só o tamanho do arquivo com a memória; sem a folga, a máquina fica lenta.
Passo 4: Prefira 8 bits sempre que a soma couber
Passo 5: Peça ao técnico três perguntas que usam ferramenta se só couber em 4 bits
Consultar a planilha, preencher uma ficha, buscar uma reserva.
Deu certo quando: O registro das chamadas não mostra nenhuma ferramenta inexistente nem campo errado.
Erro comum: Olhar só a resposta final. O conserto é pedir o registro das chamadas ao lado da resposta.
Passo 6: Escolha a máquina pela maior das somas, com sobra
Deu certo quando: A maior soma cabe na memória e ainda sobra espaço.
No fim você tem: Uma tabela com tarefa, modelo, bits, memória somada e máquina, com a linha de ferramentas testada.
Três decisões saem da conta. Se a tarefa é conversa sem ferramenta, 4 bits basta. Se a tarefa chama ferramenta, prefira 8 bits ou um modelo menor em 8 bits. Se nem assim cabe, a tarefa fica na nuvem. Na pousada de exemplo, as tarefas se dividiram assim.
O que roda dentro da pousada e o que fica na nuvem
| Tarefa | Onde roda | Por quê |
|---|---|---|
| Ler fichas dos hóspedes | No Mac | A ficha não vai à internet |
| Resumo diário de reservas | No Mac | Tarefa pequena |
| Resposta em inglês a grupo | Na nuvem | Pede modelo maior |
Divisão de exemplo para a pousada da Marta.
Com duas tarefas dentro de casa, um modelo de 30 a 35 bilhões compactado cabia em 64 GB, e o Mac mini com M5 Pro bastava; o Mac Studio ficou para o dia em que a pousada quiser modelos maiores. Tirar a tarefa da nuvem impede que a ficha viaje pela internet; o que o programa grava no próprio Mac se confere na escolha do programa, na próxima aula.
Para comparar as opções pelo custo de cada tarefa, o curso "Software e IA para executivos" tem o capítulo como escolher entre buscar, treinar ou rotear antes de pagar a conta. Ele mostra quando vale mandar cada pedido a um modelo diferente.
Decidir a compra na sua semana
A decisão tem três caminhos, e esperar também é um deles, com custo por mês.
Três caminhos para a pousada e o que cada um custa
| Caminho | O que custa | Risco principal |
|---|---|---|
| Manter as assinaturas | A conta de todo mês | A ficha sai do escritório |
| Comprar o computador | A máquina e uma tarde do técnico | Escolher memória de menos |
| Esperar um ano | As assinaturas do ano inteiro | Decidir com pressa depois |
Caminhos de exemplo; o valor de cada um sai da sua conta de assinaturas e da cotação da máquina.
Esperar parece de graça, mas cada mês sem decidir é mais um mês de fichas saindo do escritório e de assinaturas pagas. Some o que você paga hoje por mês nos assistentes: esse é o seu ponto de partida para comparar com a cotação.
A escolha está pronta quando a tabela do guia tem cada tarefa com modelo, bits e memória somada, a maior soma cabe na máquina com sobra e a tarefa que chama ferramenta passou no teste do registro das chamadas. Para a conta completa de construir contra comprar, com energia, técnico e tempo, o curso "LLM FinOps" traz o capítulo modelo aberto não é modelo grátis. Com a máquina escolhida, abra "Qual programa escolher para rodar a IA no Mac" e decida com o técnico o que instalar primeiro.
Seu caderno neste capítulo
Abrir o caderno completoSelecione um trecho do capítulo para destacar ou anotar. Nos vídeos e áudios, use Anotar este momento. No teclado, selecione com Shift e as setas e use Alt+Shift+D para destacar ou Alt+Shift+N para anotar.
Salvo neste navegador. Entre na sua conta para levar o caderno a outros aparelhos.
Entre na sua conta para compartilhar o que aprendeu e convidar alguém para estudar com você.
Conexões deste capítulo
Explore os conceitos e compare abordagens em outros cursos. As conexões indicam assuntos relacionados; a sequência de estudo continua no índice do curso.
Conceitos deste capítulo
O mesmo assunto em outros cursos
- IA Local na PráticaRoda no meu equipamento? Do notebook simples ao PC parrudoExaminar conexões de Roda no meu equipamento? Do notebook simples ao PC parrudo
- Prompt Engineering para ExecutivosEscolher a técnica para fluxos que rodam por horasExaminar conexões de Escolher a técnica para fluxos que rodam por horas
- Frontends com VibecodingSupervisionar o modelo que opera o computadorExaminar conexões de Supervisionar o modelo que opera o computador
Voltar ao capítulo anterior: Como ligar o assistente à agenda de reservas sem perder o controle
Capítulos vizinhos em Segundo cérebro com IA
- 02Escrever um arquivo que todo assistente de IA entende
- 03Como ligar o assistente à agenda de reservas sem perder o controle
- 04Vale a pena ter um computador de IA no escritório?
- 05Qual programa escolher para rodar a IA no Mac
- 06O agente pode perceber que o Wi-Fi caiu antes do hóspede?