Melhor LLM para suporte técnico em empresas de serviços de TI (ESN)
Implementar uma IA local de suporte técnico atende a uma restrição prática das empresas de serviços de TI (ESNs): os tickets, os logs e os runbooks contêm dados de clientes sujeitos a cláusulas de confidencialidade. Com uma IA local de suporte técnico, esses elementos permanecem em uma máquina que você controla e cada resposta pode ser vinculada a uma fonte.
Esta página trata apenas do suporte interno de TI: triagem de tickets técnicos, leitura de logs com informações sensíveis removidas, busca nos runbooks, rastreabilidade e encaminhamento para níveis superiores de suporte. O comércio, os reembolsos e a tradução no atendimento ao cliente são abordados no guia atendimento multilíngue ao cliente com um LLM local.
O plano: critérios de escolha, seleção de modelos, memória por quantização, taxa de processamento e benchmarks, licenças e, por fim, o fluxo de implantação.
O que o suporte de TI de uma ESN exige de um modelo
O suporte interno não exige as mesmas qualidades de um assistente generalista. Quatro critérios importam:
- Janela de contexto : um trecho de logs, um runbook e o histórico de um ticket ultrapassam rapidamente 30.000 tokens. Modelos limitados a 4.096 tokens (Snowflake Arctic Instruct) ou 8.192 tokens (Grok-1 (base)) são excluídos para esse uso.
- Saída estruturada : o modelo deve produzir um JSON estável (categoria, gravidade, equipe alvo) que o sistema de tickets possa consumir.
- Fidelidade às fontes : a resposta deve citar o runbook ou a linha de log utilizada, caso contrário, a rastreabilidade é perdida.
- Licença : o modelo costuma rodar em um serviço pago, ou seja, em uso comercial.
A seleção: sete modelos entre 68 e 85 GB em Q4
Os modelos abaixo são os mais leves do catálogo de referência desta página. Todos exigem um servidor ou uma estação com grande quantidade de memória, não um computador de técnico.
- Mistral Small 4 : 119B, Apache 2.0, ~72 GB em Q4, contexto de 256 000. Primeira escolha por padrão graças à sua licença permissiva e ao seu amplo contexto. Pesos na página da Mistral no Hugging Face.
- Qwen 3.5 122B-A10B : 122B, Apache 2.0, ~73 GB em Q4, contexto 262 000. O sufixo A10B indica aproximadamente 10 bilhões de parâmetros ativos por token, o que favorece a taxa de processamento. Consulte Alibaba no Hugging Face.
- Nemotron 3 Super 120B : 120B, NVIDIA Open Model License, ~72 GB em Q4, contexto 128 000. Pertinente em uma infraestrutura já equipada com hardware NVIDIA (NVIDIA no Hugging Face).
- Laguna S 2.1 : 118B, OpenMDW 1.1, ~68 GB em Q4, contexto 262 144. O mais leve da seleção, voltado para código, útil para tickets relacionados a scripts e pipelines.
- Qwen3.8 Flash Next 125B-A6B : 125B, licença « Outra (pesos abertos) », ~72 GB em Q4, contexto 256.000. Ler a licença antes de qualquer uso no ambiente de um cliente.
- Mistral Medium 3.5 128B : 128B, Modified MIT, ~74 GB em Q4, contexto 256 000.
- Mixtral 8x22B Instruct : 141B, Apache 2.0, ~82 GB em Q4, contexto de 64 000. Contexto mais curto, suficiente para um ticket e um runbook, mas no limite para longos trechos de logs.
Dois modelos são limitados por seu contexto de 32.768 tokens: dots.llm1 Instruct (142B, MIT, ~85 GB) e DBRX Instruct (132B, Databricks Open Model License, ~76 GB). Eles são adequados para triagem de tickets, menos para análise de logs.
Para uma equipe com mais memória, Step 3.5 Flash (196B, Apache 2.0, ~118 GB) e MiniMax-M2.7 (229B, Apache 2.0, ~138 GB) constituem o próximo nível.
Memória por quantização e hardware
Apenas os valores Q4 vêm do catálogo. Os demais níveis são ordens de grandeza estimadas por uma regra de proporcionalidade, a confirmar em cada ficha.
Para a classe 118B-128B:
- Q4 : 68 a 74 GB (catálogo)
- Q5 : ~82 a 90 GB (estimado)
- Q8 : ~120 a 135 GB (estimado)
- FP16 : ~236 a 256 GB (estimado)
Para Mixtral 8x22B Instruct (141B) :
- Q4 : ~82 GB (catálogo)
- Q5 : ~97 GB (estimado)
- Q8 : ~150 GB (estimado)
- FP16 : ~282 GB (estimado)
Esses números não incluem o contexto: carregar 100.000 tokens de logs adiciona vários GB de cache. Reserve uma margem de pelo menos 15 a 20% (estimativa).
No hardware, um Q4 de 72 GB cabe em uma máquina com memória unificada de 96 GB com pouca margem, e de forma mais confortável em 128 GB. As páginas Mac 96 GB et Mac 128 GB detalham essas configurações. No PC, é necessário combinar várias placas gráficas: veja o guia escolher uma GPU para um LLM local.
Taxa de geração e benchmarks: o que ainda precisa ser confirmado
Nenhuma taxa de geração medida é publicada aqui para esses sete modelos: os tokens por segundo precisam ser confirmados no seu hardware. Dois pontos de referência qualitativos:
- Arquitetura MoE : com o mesmo tamanho, um modelo com poucos parâmetros ativos (A6B, A10B) lê menos dados por token e gera mais rápido que um modelo denso.
- Concorrência : uma equipe de suporte envia várias requisições simultâneas. Um servidor como vLLM processa as requisições em lotes e aumenta a vazão total, enquanto llama.cpp continua sendo o mais simples para um único fluxo em GGUF.
Para os scores MMLU ou HumanEval, consulte oOpen LLM Leaderboard e as fichas do catálogo. Esses scores devem ser confirmados modelo por modelo e medem mal o trabalho de suporte.
Um conjunto interno de testes é mais confiável: 50 tickets encerrados e anonimizados, com a categoria, a gravidade e a resolução reais. Meça a taxa de categorização correta, a taxa de citações exatas do runbook e o número de escalonamentos indevidos. A página benchmark local descreve o método de medição da taxa de transferência.
Licenças: verificar antes de instalar para um cliente
- Apache 2.0 (Mistral Small 4, Qwen 3.5 122B-A10B, Mixtral 8x22B Instruct): uso comercial permitido, desde que os avisos de licença sejam mantidos.
- MIT (dots.llm1 Instruct) : uso comercial permitido, restrições mínimas.
- MIT modificada (Mistral Medium 3.5 128B): as cláusulas adicionadas devem ser lidas e as condições confirmadas.
- NVIDIA Licença de Modelo Aberto, OpenMDW 1.1, Licença de Modelo Aberto do Databricks : licenças específicas dos fornecedores, a serem revisadas antes da implantação na prestação de serviços.
- Outro (pesos abertos) (Qwen3.8 Flash Next 125B-A6B) : condições a confirmar caso a caso.
O guia LLM local em empresas e RGPD complementa esse ponto no que diz respeito aos dados pessoais presentes nos tickets.
Cadeia de implantação: tickets, logs sanitizados, runbooks, escalonamento
Uma cadeia de suporte local é composta por cinco etapas:
- Expurgação determinística : um script substitui endereços IP, nomes de host, tokens e endereços de e-mail por identificadores neutros antes de qualquer envio ao modelo. A tabela de correspondência permanece fora do modelo.
- Pesquisa nos runbooks : os procedimentos são divididos e indexados, depois o modelo recebe apenas os trechos relevantes com suas referências.
- Classificação : o modelo retorna um JSON com categoria, gravidade, hipótese de causa e fontes citadas.
- Regra de escalonamento : toda resposta sem fonte, todo incidente de gravidade alta e toda ação que modifique a produção são encaminhados para um técnico.
- Registro : cada interação é registrada com a versão do modelo, a quantização, o prompt e os trechos utilizados.
Para a interface de equipe, Open WebUI se conecta a um servidor local. O guia implantar um chatbot de equipe na intranet detalha a instalação e arquitetura de um agente local abrange chamadas a ferramentas.
FAQ
P: Esses modelos rodam no computador de um técnico?
Não. O mais leve da seleção, Laguna S 2.1, exige cerca de 68 GB em Q4, sem contar a memória necessária para o contexto. O cenário realista é um servidor compartilhado ou uma estação com 96 a 128 GB de memória, acessado pela equipe via rede interna. Para máquinas mais simples, o configurador do site sugere modelos adaptados à memória disponível.
P: É necessário fazer o ajuste fino do modelo com nossos tickets?
Não como primeira opção. A busca nos runbooks, com citações, já fornece o vocabulário e os procedimentos da ESN sem novo treinamento. O ajuste fino se torna útil se o formato de saída continuar instável ou se a categorização estagnar no seu conjunto de teste. Ele exige dados anonimizados e uma verificação da licença do modelo.
P: O próprio modelo consegue remover informações sensíveis dos logs?
Não é recomendado. Um modelo pode deixar passar um endereço IP ou um token em um trecho longo. A remoção de dados sensíveis deve ser feita por um script determinístico, testado e versionado, colocado antes do modelo. O modelo trabalha então com identificadores neutros, e a correspondência com os valores reais permanece em um sistema separado.
P: O modelo consegue fechar um ticket sozinho?
É melhor evitar isso no início. O modelo propõe uma classificação e uma possível solução, e depois um técnico as valida. Após algumas semanas de medição, algumas categorias de baixo risco podem ser automatizadas, por exemplo, solicitações de documentos. Os incidentes de produção e as ações que exigem privilégios continuam sujeitos à validação humana.
P: Qual deve ser o tamanho mínimo da janela de contexto para análise de logs?
Busque pelo menos 64.000 tokens, capacidade oferecida pelo Mixtral 8x22B Instruct, e de preferência 128.000 ou mais para correlacionar vários arquivos. Os modelos com 32.768 tokens exigem dividir os trechos em partes bem menores. Um contexto grande consome mais memória e torna a geração mais lenta: filtre os logs antes de enviá-los.
P: Essa seleção inclui o atendimento ao cliente?
Não. Ela se destina ao suporte interno de TI de uma empresa de serviços digitais (ESN): incidentes, logs, runbooks e escalonamento. As interações comerciais, os reembolsos e a tradução das conversas com clientes finais seguem outros critérios, especialmente a qualidade multilíngue. Esses temas são abordados no guia dedicado ao suporte multilíngue ao cliente com um LLM local.
Conclusão
Para uma IA de suporte técnico local em ESN, Mistral Small 4 e Qwen 3.5 122B-A10B são o ponto de partida mais seguro: licença Apache 2.0, contexto de aproximadamente 256.000 tokens, 72 a 73 GB em Q4. As taxas de geração e as pontuações ainda precisam ser confirmadas com seu hardware e seus próprios tickets. Indique a memória disponível no configurador para verificar a compatibilidade, ou visite o catálogo para comparar licenças e necessidades de VRAM.
O hardware para rodar um LLM localmente
Para executar esses modelos localmente com conforto, uma RTX 5070 Ti oferece uma excelente relação preço/desempenho. Compare os preços:
Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.