Melhor LLM para atendimento ao cliente em varejo e e-commerce

Implementar uma IA local para atendimento ao cliente no comércio significa rodar um LLM em suas próprias máquinas para responder aos clientes de uma loja online sem enviar catálogo, pedidos nem endereços postais a um serviço de terceiros. O modelo certo para essa IA local voltada ao comércio não é o maior nem o mais bem classificado em um benchmark generalista: é aquele que lê corretamente uma ficha de produto, informa o status correto do pedido, aplica a política de devolução à risca e transfere o atendimento para um humano quando não sabe responder. Este artigo detalha as quatro tarefas a cobrir, propõe uma seleção por nível de hardware no catálogo QualLLM, descreve um protocolo de avaliação da fundamentação nas informações fornecidas e, em seguida, examina licenças e implantação antes de uma seção de perguntas frequentes.

As quatro tarefas de um LLM de atendimento a clientes em comércio eletrônico

O escopo é intencionalmente limitado. O suporte multilíngue é abordado no guia dedicado ao suporte multilíngue ao cliente com execução local e o suporte interno de TI não é abordado aqui. Restam quatro funções que definem a especificação de requisitos:

A capacidade que diferencia os modelos é, portanto, aancrage : responder com base nas informações fornecidas e recusar adequadamente quando a informação estiver ausente. A arquitetura recomendada (pesquisa documental, chamadas de ferramentas, regras de recusa) é descrita no guia de arquitetura de agente local.

Seleção para Mac 128 GB e estação com duas GPUs (Q4 entre 68 e 75 GB)

Este nível corresponde a um Mac Studio com 128 GB de memória unificada ou a uma estação com uma placa profissional de 96 GB. Os modelos abaixo são arquiteturas com especialistas (MoE): poucos parâmetros ativos por token, portanto, uma taxa de processamento compatível com uma conversa em tempo real, apesar do tamanho dos pesos. Todas as taxas de processamento são estimativas derivadas do número de parâmetros ativos e da largura de banda de memória, a serem confirmadas em sua máquina.

Qwen 3.5 122B-A10B (Alibaba, Apache 2.0) - Parâmetros : 122B ao total, aproximadamente 10B ativos por token - VRAM Q4 : ~73 GB; Q5 ~88 GB (estimado); Q8 ~130 GB (estimado); FP16 ~245 GB (estimado) - Contexto : 262.000 tokens, mais do que suficiente para uma política de devolução completa, um histórico de conversa e cerca de dez fichas de produto - Taxa de processamento : 30 a 45 tokens/s estimados em um Mac Studio M4 Max com 128 GB em Q4; 80 tokens/s ou mais estimados em uma placa de 96 GB com vLLM - Por que usar no e-commerce : a família Qwen segue bem as instruções de formato e as chamadas de ferramentas, o que é importante para os status dos pedidos. Pesos publicados por Alibaba no Hugging Face.

Mistral Small 4 (Mistral, Apache 2.0) - Parâmetros : 119B - VRAM Q4 : ~72 GB; Q8 ~127 GB (estimado); FP16 ~240 GB (estimado) - Contexto : 256 000 tokens - Taxa de processamento : a confirmar de acordo com o número de parâmetros ativos da arquitetura; considere uma ordem de grandeza semelhante ao anterior se o modelo for MoE - Por que usar no e-commerce : qualidade do francês na redação de textos para clientes, licença Apache 2.0 sem cláusula comercial. Pesos publicados por Mistral no Hugging Face.

Qwen3.8 Flash Next 125B-A6B (Qwen, licença de pesos abertos, termos a verificar antes do uso comercial) - Parâmetros : 125B no total, aproximadamente 6B ativos - VRAM Q4 : ~72 GB ; Q8 ~133 GB (estimado) - Contexto : 256 000 tokens - Taxa de processamento : o mais rápido do nível, 50 a 70 tokens/s estimados em Mac Studio 128 GB - Por que usar no e-commerce : latência baixa para um chat com alto tráfego. Em contrapartida: menos parâmetros ativos, portanto é preciso testar com cuidado em perguntas ambíguas.

Mistral Medium 3.5 128B (Mistral, Modified MIT) - VRAM Q4 : ~74 GB; Q8 ~136 GB (estimado) - Contexto : 256 000 tokens - Por que usar no e-commerce : alternativa ao Mistral Small 4 quando você quer um nível adicional de raciocínio em casos de litígio, ao custo de uma taxa de geração mais baixa (a confirmar).

Para escolher a máquina, a página dedicada aos Macs com 128 GB lista os modelos que realmente cabem na memória com o contexto.

Nível de servidor: 140 GB ou mais

Se você tiver um servidor com várias placas ou uma máquina com 192 GB ou mais, três modelos oferecem uma vantagem de qualidade nos casos complexos (reclamações em várias etapas, pedidos parcialmente enviados).

Os modelos do catálogo acima de 400 GB (DeepSeek V4 Pro, Kimi K3, GLM 5.2) estão fora do alcance de uma implantação em loja e não trazem ganho mensurável em tarefas tão bem delimitadas.

Avaliar a fundamentação e a recusa: o protocolo que importa

Os benchmarks públicos (MMLU, HumanEval, AIME) medem conhecimentos gerais, programação ou matemática. Nenhum mede «o modelo inventou um prazo de devolução?». O Open LLM Leaderboard serve para descartar um modelo fraco, não para escolher um modelo para esse caso de uso. Crie seu próprio conjunto de testes; meio dia é suficiente:

Para a camada de pesquisa documental, o guia Firecrawl e RAG local mostra como montar o índice do catálogo; o guia GraphRAG trata o caso dos catálogos com muitas relações entre produtos.

Licenças e dados dos clientes

Um serviço de atendimento ao cliente trata dados pessoais: nome, endereço, histórico de compras. A implantação local elimina a transferência para um subcontratado, mas dois pontos ainda precisam ser definidos.

Implantação: motor, interface, latência-alvo

Le guia de implantação de um chatbot de equipe na intranet abrange o processo de implantação passo a passo.

FAQ

P: Qual modelo escolher para começar com um Mac Studio 128 GB?

Qwen 3.5 122B-A10B em Q4 (~73 GB) é o ponto de partida mais equilibrado: licença Apache 2.0, boas chamadas de ferramentas, taxa estimada de 30 a 45 tokens/s. Se a latência tiver prioridade sobre o refinamento das respostas, Qwen3.8 Flash Next 125B-A6B é mais rápido, mas precisa ser mais testado com perguntas ambíguas. Execute o protocolo de 50 perguntas com os dois antes de decidir.

P: Um modelo menor que um 100B seria suficiente para esse uso?

Muitas vezes sim para buscas no catálogo e consultas ao status dos pedidos, em que o modelo reformula principalmente os dados fornecidos. O ganho dos modelos desse nível aparece nos casos ambíguos e nas recusas. O catálogo filtra por VRAM para comparar com modelos mais leves; o protocolo de avaliação permanece o mesmo.

P: Como impedir o modelo de inventar um prazo de entrega?

Três camadas: o status vem sempre de uma chamada de ferramenta, nunca da memória do modelo; o prompt de sistema impõe "nenhuma data sem resultado de ferramenta"; uma regra aplicativa bloqueia qualquer resposta contendo data se nenhuma chamada tiver ocorrido. Meça em seguida a taxa de invenção em suas 20 perguntas sem resposta: ela deve permanecer abaixo de 2%.

P: É necessário um contexto de 1.000.000 tokens para carregar todo o catálogo?

Raramente. Carregar um catálogo inteiro em cada mensagem multiplica a latência de pré-preenchimento e o custo de memória do cache. Uma pesquisa que traz 5 a 10 fichas relevantes em um contexto de 8.000 a 16.000 tokens dá melhores resultados e uma resposta mais rápida. O contexto muito longo do DeepSeek V4 Flash serve mais para análises pontuais.

P: Qual é a diferença em relação ao guia sobre suporte multilíngue?

Este comparativo se limita às tarefas transacionais em francês: catálogo, pedidos, devoluções, escalonamento. O guia de suporte multilíngue ao cliente aborda a detecção de idioma, a tradução e os conjuntos de teste por idioma. Os dois se combinam: escolha o modelo aqui e adicione a camada multilíngue depois, se sua loja fizer entregas fora das regiões francófonas.

P: Como medir a taxa real de processamento na minha máquina?

Carregue o modelo em Q4 com llama.cpp ou vLLM, envie dez vezes a mesma conversa típica com 8.000 tokens de contexto e registre a taxa de geração em tokens/s e o tempo até o primeiro token. Os números deste artigo são estimativas; os seus dependem da largura de banda da memória, da quantização e do número de sessões simultâneas. A página de benchmark local descreve um método reprodutível.

Conclusão

Uma IA local para o comércio, voltada ao atendimento ao cliente, é avaliada pela fundamentação das respostas e pela capacidade de recusa, não por uma pontuação MMLU. Em um Mac com 128 GB ou uma estação de trabalho com 96 GB, Qwen 3.5 122B-A10B e Mistral Small 4 cobrem catálogo, pedidos, devoluções e encaminhamento a um nível superior de atendimento com uma licença Apache 2.0. Acima de 140 GB, Qwen 3 235B-A22B e MiniMax-M2.7 oferecem mais margem para casos complexos. Verifique a compatibilidade com seu hardware no configurador, depois valide o modelo escolhido com suas próprias 50 perguntas.

O hardware para rodar um LLM localmente

Para executar esses modelos localmente com conforto, uma RTX 5070 Ti oferece uma excelente relação preço/desempenho. Compare os preços:

Amazon RTX 5070 Ti →

Links afiliados — QualLLM pode receber uma comissão sobre as compras, sem custo adicional para você. Como Parceiro Amazon, QualLLM obtém lucro com compras que atendem às condições exigidas.

Artigo publicado e atualizado em por Mohamed Meguedmi · Fonte de dados: /api/models.json · Licença de conteúdo: CC BY 4.0.

Algum erro ou alguma atualização para informar? Contribuir.