Melhor LLM para suporte técnico em empresas de serviços de TI (ESN)

Implementar uma IA local de suporte técnico atende a uma restrição prática das empresas de serviços de TI (ESNs): os tickets, os logs e os runbooks contêm dados de clientes sujeitos a cláusulas de confidencialidade. Com uma IA local de suporte técnico, esses elementos permanecem em uma máquina que você controla e cada resposta pode ser vinculada a uma fonte.

Esta página trata apenas do suporte interno de TI: triagem de tickets técnicos, leitura de logs com informações sensíveis removidas, busca nos runbooks, rastreabilidade e encaminhamento para níveis superiores de suporte. O comércio, os reembolsos e a tradução no atendimento ao cliente são abordados no guia atendimento multilíngue ao cliente com um LLM local.

O plano: critérios de escolha, seleção de modelos, memória por quantização, taxa de processamento e benchmarks, licenças e, por fim, o fluxo de implantação.

O que o suporte de TI de uma ESN exige de um modelo

O suporte interno não exige as mesmas qualidades de um assistente generalista. Quatro critérios importam:

A seleção: sete modelos entre 68 e 85 GB em Q4

Os modelos abaixo são os mais leves do catálogo de referência desta página. Todos exigem um servidor ou uma estação com grande quantidade de memória, não um computador de técnico.

Dois modelos são limitados por seu contexto de 32.768 tokens: dots.llm1 Instruct (142B, MIT, ~85 GB) e DBRX Instruct (132B, Databricks Open Model License, ~76 GB). Eles são adequados para triagem de tickets, menos para análise de logs.

Para uma equipe com mais memória, Step 3.5 Flash (196B, Apache 2.0, ~118 GB) e MiniMax-M2.7 (229B, Apache 2.0, ~138 GB) constituem o próximo nível.

Memória por quantização e hardware

Apenas os valores Q4 vêm do catálogo. Os demais níveis são ordens de grandeza estimadas por uma regra de proporcionalidade, a confirmar em cada ficha.

Para a classe 118B-128B:

Para Mixtral 8x22B Instruct (141B) :

Esses números não incluem o contexto: carregar 100.000 tokens de logs adiciona vários GB de cache. Reserve uma margem de pelo menos 15 a 20% (estimativa).

No hardware, um Q4 de 72 GB cabe em uma máquina com memória unificada de 96 GB com pouca margem, e de forma mais confortável em 128 GB. As páginas Mac 96 GB et Mac 128 GB detalham essas configurações. No PC, é necessário combinar várias placas gráficas: veja o guia escolher uma GPU para um LLM local.

Taxa de geração e benchmarks: o que ainda precisa ser confirmado

Nenhuma taxa de geração medida é publicada aqui para esses sete modelos: os tokens por segundo precisam ser confirmados no seu hardware. Dois pontos de referência qualitativos:

Para os scores MMLU ou HumanEval, consulte oOpen LLM Leaderboard e as fichas do catálogo. Esses scores devem ser confirmados modelo por modelo e medem mal o trabalho de suporte.

Um conjunto interno de testes é mais confiável: 50 tickets encerrados e anonimizados, com a categoria, a gravidade e a resolução reais. Meça a taxa de categorização correta, a taxa de citações exatas do runbook e o número de escalonamentos indevidos. A página benchmark local descreve o método de medição da taxa de transferência.

Licenças: verificar antes de instalar para um cliente

O guia LLM local em empresas e RGPD complementa esse ponto no que diz respeito aos dados pessoais presentes nos tickets.

Cadeia de implantação: tickets, logs sanitizados, runbooks, escalonamento

Uma cadeia de suporte local é composta por cinco etapas:

  1. Expurgação determinística : um script substitui endereços IP, nomes de host, tokens e endereços de e-mail por identificadores neutros antes de qualquer envio ao modelo. A tabela de correspondência permanece fora do modelo.
  2. Pesquisa nos runbooks : os procedimentos são divididos e indexados, depois o modelo recebe apenas os trechos relevantes com suas referências.
  3. Classificação : o modelo retorna um JSON com categoria, gravidade, hipótese de causa e fontes citadas.
  4. Regra de escalonamento : toda resposta sem fonte, todo incidente de gravidade alta e toda ação que modifique a produção são encaminhados para um técnico.
  5. Registro : cada interação é registrada com a versão do modelo, a quantização, o prompt e os trechos utilizados.

Para a interface de equipe, Open WebUI se conecta a um servidor local. O guia implantar um chatbot de equipe na intranet detalha a instalação e arquitetura de um agente local abrange chamadas a ferramentas.

FAQ

P: Esses modelos rodam no computador de um técnico?

Não. O mais leve da seleção, Laguna S 2.1, exige cerca de 68 GB em Q4, sem contar a memória necessária para o contexto. O cenário realista é um servidor compartilhado ou uma estação com 96 a 128 GB de memória, acessado pela equipe via rede interna. Para máquinas mais simples, o configurador do site sugere modelos adaptados à memória disponível.

P: É necessário fazer o ajuste fino do modelo com nossos tickets?

Não como primeira opção. A busca nos runbooks, com citações, já fornece o vocabulário e os procedimentos da ESN sem novo treinamento. O ajuste fino se torna útil se o formato de saída continuar instável ou se a categorização estagnar no seu conjunto de teste. Ele exige dados anonimizados e uma verificação da licença do modelo.

P: O próprio modelo consegue remover informações sensíveis dos logs?

Não é recomendado. Um modelo pode deixar passar um endereço IP ou um token em um trecho longo. A remoção de dados sensíveis deve ser feita por um script determinístico, testado e versionado, colocado antes do modelo. O modelo trabalha então com identificadores neutros, e a correspondência com os valores reais permanece em um sistema separado.

P: O modelo consegue fechar um ticket sozinho?

É melhor evitar isso no início. O modelo propõe uma classificação e uma possível solução, e depois um técnico as valida. Após algumas semanas de medição, algumas categorias de baixo risco podem ser automatizadas, por exemplo, solicitações de documentos. Os incidentes de produção e as ações que exigem privilégios continuam sujeitos à validação humana.

P: Qual deve ser o tamanho mínimo da janela de contexto para análise de logs?

Busque pelo menos 64.000 tokens, capacidade oferecida pelo Mixtral 8x22B Instruct, e de preferência 128.000 ou mais para correlacionar vários arquivos. Os modelos com 32.768 tokens exigem dividir os trechos em partes bem menores. Um contexto grande consome mais memória e torna a geração mais lenta: filtre os logs antes de enviá-los.

P: Essa seleção inclui o atendimento ao cliente?

Não. Ela se destina ao suporte interno de TI de uma empresa de serviços digitais (ESN): incidentes, logs, runbooks e escalonamento. As interações comerciais, os reembolsos e a tradução das conversas com clientes finais seguem outros critérios, especialmente a qualidade multilíngue. Esses temas são abordados no guia dedicado ao suporte multilíngue ao cliente com um LLM local.

Conclusão

Para uma IA de suporte técnico local em ESN, Mistral Small 4 e Qwen 3.5 122B-A10B são o ponto de partida mais seguro: licença Apache 2.0, contexto de aproximadamente 256.000 tokens, 72 a 73 GB em Q4. As taxas de geração e as pontuações ainda precisam ser confirmadas com seu hardware e seus próprios tickets. Indique a memória disponível no configurador para verificar a compatibilidade, ou visite o catálogo para comparar licenças e necessidades de VRAM.

O hardware para rodar um LLM localmente

Para executar esses modelos localmente com conforto, uma RTX 5070 Ti oferece uma excelente relação preço/desempenho. Compare os preços:

Amazon RTX 5070 Ti →

Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

Artigo publicado e atualizado em por Mohamed Meguedmi · Fonte de dados: /api/models.json · Licença de conteúdo: CC BY 4.0.

Algum erro ou alguma atualização para informar? Contribuir.