Melhor LLM para atendimento ao cliente em varejo e e-commerce
Implementar uma IA local para atendimento ao cliente no comércio significa rodar um LLM em suas próprias máquinas para responder aos clientes de uma loja online sem enviar catálogo, pedidos nem endereços postais a um serviço de terceiros. O modelo certo para essa IA local voltada ao comércio não é o maior nem o mais bem classificado em um benchmark generalista: é aquele que lê corretamente uma ficha de produto, informa o status correto do pedido, aplica a política de devolução à risca e transfere o atendimento para um humano quando não sabe responder. Este artigo detalha as quatro tarefas a cobrir, propõe uma seleção por nível de hardware no catálogo QualLLM, descreve um protocolo de avaliação da fundamentação nas informações fornecidas e, em seguida, examina licenças e implantação antes de uma seção de perguntas frequentes.
As quatro tarefas de um LLM de atendimento a clientes em comércio eletrônico
O escopo é intencionalmente limitado. O suporte multilíngue é abordado no guia dedicado ao suporte multilíngue ao cliente com execução local e o suporte interno de TI não é abordado aqui. Restam quatro funções que definem a especificação de requisitos:
- Pesquisa no catálogo de produtos : o modelo recebe um trecho do catálogo (fichas, estoque, variantes, preços) por meio de um sistema de busca e deve responder apenas com base nesse trecho. Um tamanho de roupa inventado ou uma compatibilidade de acessório presumida gera uma devolução.
- Status do pedido : o modelo chama uma ferramenta (função) que consulta sua base de pedidos e reformula o resultado. Ele nunca deve gerar um número de rastreamento ou uma data de entrega que não venha dessa chamada.
- Política de devolução e reembolso : o texto da política é fornecido no contexto. O modelo deve citar os prazos e condições exatos, incluindo as exclusões, e não arredondar "14 dias" para "cerca de duas semanas".
- Encaminhamento para atendimento humano : assim que uma solicitação sair do escopo (litígio, concessão comercial, dado ausente), o modelo deve gerar uma resposta de transferência e um resumo estruturado para o agente humano.
A capacidade que diferencia os modelos é, portanto, aancrage : responder com base nas informações fornecidas e recusar adequadamente quando a informação estiver ausente. A arquitetura recomendada (pesquisa documental, chamadas de ferramentas, regras de recusa) é descrita no guia de arquitetura de agente local.
Seleção para Mac 128 GB e estação com duas GPUs (Q4 entre 68 e 75 GB)
Este nível corresponde a um Mac Studio com 128 GB de memória unificada ou a uma estação com uma placa profissional de 96 GB. Os modelos abaixo são arquiteturas com especialistas (MoE): poucos parâmetros ativos por token, portanto, uma taxa de processamento compatível com uma conversa em tempo real, apesar do tamanho dos pesos. Todas as taxas de processamento são estimativas derivadas do número de parâmetros ativos e da largura de banda de memória, a serem confirmadas em sua máquina.
Qwen 3.5 122B-A10B (Alibaba, Apache 2.0) - Parâmetros : 122B ao total, aproximadamente 10B ativos por token - VRAM Q4 : ~73 GB; Q5 ~88 GB (estimado); Q8 ~130 GB (estimado); FP16 ~245 GB (estimado) - Contexto : 262.000 tokens, mais do que suficiente para uma política de devolução completa, um histórico de conversa e cerca de dez fichas de produto - Taxa de processamento : 30 a 45 tokens/s estimados em um Mac Studio M4 Max com 128 GB em Q4; 80 tokens/s ou mais estimados em uma placa de 96 GB com vLLM - Por que usar no e-commerce : a família Qwen segue bem as instruções de formato e as chamadas de ferramentas, o que é importante para os status dos pedidos. Pesos publicados por Alibaba no Hugging Face.
Mistral Small 4 (Mistral, Apache 2.0) - Parâmetros : 119B - VRAM Q4 : ~72 GB; Q8 ~127 GB (estimado); FP16 ~240 GB (estimado) - Contexto : 256 000 tokens - Taxa de processamento : a confirmar de acordo com o número de parâmetros ativos da arquitetura; considere uma ordem de grandeza semelhante ao anterior se o modelo for MoE - Por que usar no e-commerce : qualidade do francês na redação de textos para clientes, licença Apache 2.0 sem cláusula comercial. Pesos publicados por Mistral no Hugging Face.
Qwen3.8 Flash Next 125B-A6B (Qwen, licença de pesos abertos, termos a verificar antes do uso comercial) - Parâmetros : 125B no total, aproximadamente 6B ativos - VRAM Q4 : ~72 GB ; Q8 ~133 GB (estimado) - Contexto : 256 000 tokens - Taxa de processamento : o mais rápido do nível, 50 a 70 tokens/s estimados em Mac Studio 128 GB - Por que usar no e-commerce : latência baixa para um chat com alto tráfego. Em contrapartida: menos parâmetros ativos, portanto é preciso testar com cuidado em perguntas ambíguas.
Mistral Medium 3.5 128B (Mistral, Modified MIT) - VRAM Q4 : ~74 GB; Q8 ~136 GB (estimado) - Contexto : 256 000 tokens - Por que usar no e-commerce : alternativa ao Mistral Small 4 quando você quer um nível adicional de raciocínio em casos de litígio, ao custo de uma taxa de geração mais baixa (a confirmar).
Para escolher a máquina, a página dedicada aos Macs com 128 GB lista os modelos que realmente cabem na memória com o contexto.
Nível de servidor: 140 GB ou mais
Se você tiver um servidor com várias placas ou uma máquina com 192 GB ou mais, três modelos oferecem uma vantagem de qualidade nos casos complexos (reclamações em várias etapas, pedidos parcialmente enviados).
- Qwen 3 235B-A22B (Alibaba, Apache 2.0): ~142 GB em Q4, ~250 GB em Q8 (estimado), 131.072 tokens de contexto, cerca de 22B ativos. Uma escolha confiável para chamadas de ferramentas em sequência.
- MiniMax-M2.7 (MiniMax, Apache 2.0) : ~138 GB em Q4, 205.000 tokens de contexto. Orientado a agentes, útil quando o atendimento ao cliente realiza pesquisa no catálogo seguida por atualização de ticket.
- DeepSeek V4 Flash 284B (DeepSeek, MIT): ~170 GB em Q4, contexto de 1.000.000 tokens. O contexto muito longo permite carregar um catálogo inteiro de vários milhares de referências sem pesquisa prévia, mas a latência de pré-preenchimento aumenta proporcionalmente. Pesos publicados por DeepSeek no Hugging Face. A escolha entre Flash e Pro é detalhada no comparativo DeepSeek V4 Pro vs Flash.
- GLM 5.3 Flash 320B-A18B (Zhipu, MIT): ~186 GB em Q4, 128.000 tokens, 18B ativos. Pesos publicados por Zhipu no Hugging Face.
Os modelos do catálogo acima de 400 GB (DeepSeek V4 Pro, Kimi K3, GLM 5.2) estão fora do alcance de uma implantação em loja e não trazem ganho mensurável em tarefas tão bem delimitadas.
Avaliar a fundamentação e a recusa: o protocolo que importa
Os benchmarks públicos (MMLU, HumanEval, AIME) medem conhecimentos gerais, programação ou matemática. Nenhum mede «o modelo inventou um prazo de devolução?». O Open LLM Leaderboard serve para descartar um modelo fraco, não para escolher um modelo para esse caso de uso. Crie seu próprio conjunto de testes; meio dia é suficiente:
- 50 perguntas em três categorias : 20 cuja resposta está nos dados fornecidos, 20 cuja resposta está ausente, 10 ambíguas (produto existente em duas variantes, pedido com dois pacotes).
- Contexto igual para todos os modelos : mesmas fichas de produto, mesma política de devolução, mesma saída simulada da ferramenta de pedidos.
- Três métricas : precisão nas perguntas presentes; taxa de recusa correta nas perguntas ausentes (“não tenho essa informação, encaminho para um consultor”); taxa de invenção, ou seja, uma resposta confiante sem apoio no contexto.
- Limite de aceitação : uma taxa de invenção superior a 2 % em questões ausentes desclassifica o modelo, independentemente de sua qualidade em outros aspectos. Um cliente que recebe uma data de entrega falsa gera um ticket, uma reclamação, às vezes um comentário negativo.
- Teste do prompt de sistema : adicione a instrução explícita « se a informação não estiver no contexto, responda que não sabe e proponha uma transferência ». Compare antes e depois. Os modelos listados acima geralmente reagem bem a essa instrução, mas a diferença entre eles aparece sobretudo nas perguntas ambíguas.
Para a camada de pesquisa documental, o guia Firecrawl e RAG local mostra como montar o índice do catálogo; o guia GraphRAG trata o caso dos catálogos com muitas relações entre produtos.
Licenças e dados dos clientes
Um serviço de atendimento ao cliente trata dados pessoais: nome, endereço, histórico de compras. A implantação local elimina a transferência para um subcontratado, mas dois pontos ainda precisam ser definidos.
- Licença do modelo : Apache 2.0 (Qwen 3.5, Mistral Small 4, Qwen 3 235B, MiniMax-M2.7) e MIT (DeepSeek V4 Flash, GLM 5.3 Flash) permitem uso comercial sem restrição de volume. A licença Modified MIT do Mistral Medium 3.5 e a licença “outra” do Qwen3.8 Flash Next exigem a leitura do texto antes da entrada em produção. A NVIDIA Open Model License de Nemotron 3 Super 120B possui suas próprias cláusulas.
- Registro : mantenha as conversas para avaliação, mas com um prazo de retenção definido e pseudonimização dos identificadores de pedido. O guia de LLM local em empresas e RGPD detalha o registro de processamento.
Implantação: motor, interface, latência-alvo
- Motor de inferência : llama.cpp para um Mac Studio ou uma estação de trabalho de um único usuário em GGUF; vLLM assim que vários clientes conversarem em paralelo, pois o processamento em lotes multiplica a taxa total de processamento em uma mesma placa.
- Interface e ferramentas : Open WebUI fornece uma interface de teste e gerenciamento de ferramentas (funções) para integrar sua API de pedidos. Em produção, a integração é feita geralmente no seu widget de chat existente via a API compatível com OpenAI exposta pelo motor.
- Contexto a reservar : considere 8.000 a 16.000 tokens por conversa (política de devolução, 5 a 10 fichas de produto, histórico). Em um Mac de 128 GB com um modelo Q4 de 73 GB, há margem para várias sessões simultâneas.
- Latência alvo : primeiro token em menos de 2 segundos, resposta completa em menos de 10 segundos. Os modelos MoE do nível de 72 GB atingem esse objetivo; os modelos densos de tamanho semelhante, não.
Le guia de implantação de um chatbot de equipe na intranet abrange o processo de implantação passo a passo.
FAQ
P: Qual modelo escolher para começar com um Mac Studio 128 GB?
Qwen 3.5 122B-A10B em Q4 (~73 GB) é o ponto de partida mais equilibrado: licença Apache 2.0, boas chamadas de ferramentas, taxa estimada de 30 a 45 tokens/s. Se a latência tiver prioridade sobre o refinamento das respostas, Qwen3.8 Flash Next 125B-A6B é mais rápido, mas precisa ser mais testado com perguntas ambíguas. Execute o protocolo de 50 perguntas com os dois antes de decidir.
P: Um modelo menor que um 100B seria suficiente para esse uso?
Muitas vezes sim para buscas no catálogo e consultas ao status dos pedidos, em que o modelo reformula principalmente os dados fornecidos. O ganho dos modelos desse nível aparece nos casos ambíguos e nas recusas. O catálogo filtra por VRAM para comparar com modelos mais leves; o protocolo de avaliação permanece o mesmo.
P: Como impedir o modelo de inventar um prazo de entrega?
Três camadas: o status vem sempre de uma chamada de ferramenta, nunca da memória do modelo; o prompt de sistema impõe "nenhuma data sem resultado de ferramenta"; uma regra aplicativa bloqueia qualquer resposta contendo data se nenhuma chamada tiver ocorrido. Meça em seguida a taxa de invenção em suas 20 perguntas sem resposta: ela deve permanecer abaixo de 2%.
P: É necessário um contexto de 1.000.000 tokens para carregar todo o catálogo?
Raramente. Carregar um catálogo inteiro em cada mensagem multiplica a latência de pré-preenchimento e o custo de memória do cache. Uma pesquisa que traz 5 a 10 fichas relevantes em um contexto de 8.000 a 16.000 tokens dá melhores resultados e uma resposta mais rápida. O contexto muito longo do DeepSeek V4 Flash serve mais para análises pontuais.
P: Qual é a diferença em relação ao guia sobre suporte multilíngue?
Este comparativo se limita às tarefas transacionais em francês: catálogo, pedidos, devoluções, escalonamento. O guia de suporte multilíngue ao cliente aborda a detecção de idioma, a tradução e os conjuntos de teste por idioma. Os dois se combinam: escolha o modelo aqui e adicione a camada multilíngue depois, se sua loja fizer entregas fora das regiões francófonas.
P: Como medir a taxa real de processamento na minha máquina?
Carregue o modelo em Q4 com llama.cpp ou vLLM, envie dez vezes a mesma conversa típica com 8.000 tokens de contexto e registre a taxa de geração em tokens/s e o tempo até o primeiro token. Os números deste artigo são estimativas; os seus dependem da largura de banda da memória, da quantização e do número de sessões simultâneas. A página de benchmark local descreve um método reprodutível.
Conclusão
Uma IA local para o comércio, voltada ao atendimento ao cliente, é avaliada pela fundamentação das respostas e pela capacidade de recusa, não por uma pontuação MMLU. Em um Mac com 128 GB ou uma estação de trabalho com 96 GB, Qwen 3.5 122B-A10B e Mistral Small 4 cobrem catálogo, pedidos, devoluções e encaminhamento a um nível superior de atendimento com uma licença Apache 2.0. Acima de 140 GB, Qwen 3 235B-A22B e MiniMax-M2.7 oferecem mais margem para casos complexos. Verifique a compatibilidade com seu hardware no configurador, depois valide o modelo escolhido com suas próprias 50 perguntas.
O hardware para rodar um LLM localmente
Para executar esses modelos localmente com conforto, uma RTX 5070 Ti oferece uma excelente relação preço/desempenho. Compare os preços:
Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.