Avançado 11 minAgentes

AutoGen local: o que funciona e o que casse

Resposta direta

AutoGen funciona localmente através de um ponto de acesso compatível com a OpenAI (Ollama, vLLM), mas a Microsoft colocou o projeto em modo de manutenção em 2 de outubro de 2025: sem novas funcionalidades, e a Microsoft recomenda a migração para o Microsoft Agent Framework. AG2, o fork com licença Apache-2.0 dos criadores originais, é hoje a versão ativamente desenvolvida a ser considerada para um novo projeto.

O AutoGen constrói sistemas a partir de agentes que se comunicam entre si. Conectado a um modelo local, ele funciona — até um ponto que depende quase totalmente do tamanho do modelo e de quanto você deixa a conversa se prolongar. Localmente, cada turno de conversa é uma geração na sua própria placa gráfica: a disciplina não está no prompt, está nos limites. Outra coisa mudou desde o final de 2025, e poucos tutoriais ainda mencionam isso: o nome «AutoGen» não indica mais um único projeto ativo, mas três trajetórias distintas que devem ser diferenciadas antes de decidir onde investir tempo.

Por Mohamed Meguedmi·Atualização 2026-09-28·Testado no Windows, macOS e Linux

#O modelo de conversa

Enquanto um framework de cadeias exige definir etapas, o AutoGen exige definir participantes. Um agente assistente propõe; um agente que atua em seu nome representa você, pode executar código e retorna o resultado; uma discussão em grupo envolve vários especialistas sob a coordenação de um gerenciador que decide quem fala. O comportamento emerge dessas trocas.

Isso é realmente poderoso para tarefas abertas — depurar, refinar uma análise em várias iterações — e é exatamente isso que torna o custo imprevisível. Uma cadeia fixa faz N chamadas ao modelo. Uma conversa faz tantas chamadas quantas forem necessárias, e essa quantidade é decidida justamente pelo modelo do qual você desconfia.

Esse design tem uma consequência direta sobre a escolha dos papéis: quanto mais agentes distintos houver na conversa, mais turnos serão possíveis antes que uma resposta final surja e maior será o risco de desvio. Dois agentes que se respondem em loop sem nunca chegar a uma conclusão são o sintoma mais comum na execução local, exatamente porque nenhum limite foi definido antes do primeiro teste. O número de agentes, portanto, não é apenas uma escolha de arquitetura: é um multiplicador direto do tempo de cálculo consumido na sua própria placa gráfica.

#AutoGen em modo manutenção: o que mudou

O kit Agentes Locais

Agentes que agem na sua máquina: Cline agêntico, MCP, n8n + Ollama, automações locais.

  • Espaço online vitalício
  • PDF + arquivos
  • Atualizações vitalícias

Esse é o ponto que a maioria dos tutoriais ainda disponíveis online omite. O próprio repositório oficial microsoft/autogen declara isso explicitamente desde 2 de outubro de 2025: o projeto está em modo de manutenção, não receberá novas funcionalidades e será gerido pela comunidade. A Microsoft recomenda que novos projetos comecem diretamente com o Microsoft Agent Framework (MAF), o sucessor que reúne os componentes do AutoGen e do Semantic Kernel em um único kit de desenvolvimento, disponibilizado para uso geral no início de abril de 2026.

Os criadores originais do AutoGen, Chi Wang e Qingyun Wu, saíram da Microsoft no final de 2024 e continuaram o desenvolvimento sob o nome AG2, um fork sob licença Apache 2.0, hospedado pela organização ag2ai. O AG2 se apresenta como a continuação ativa do projeto, e não como uma ruptura: a base histórica continua acessível sob o nome AG2 Classic para quem não quer mudar nada no código, enquanto o AG2 1.0 evolui a arquitetura para um protocolo mais explícito entre agentes. Para um projeto que começa hoje, o AG2 é a escolha mais coerente se você quer manter-se próximo da API original do AutoGen; o Microsoft Agent Framework é a opção a considerar se você já está no ecossistema da Microsoft e a fusão com as ferramentas do Semantic Kernel diz respeito diretamente a você.

!
O que muda concretamente para você
O código histórico do AutoGen continua funcionando: recebe correções de segurança, mas não novas funcionalidades. Nada do que vem a seguir neste guia (configuração do Ollama, confinamento da execução de código, tamanhos de modelo) muda com o AG2, cuja API permanece muito semelhante. Mas adotar hoje o “AutoGen” sem saber que o nome agora abrange três projetos distintos — o repositório da Microsoft congelado, o fork AG2 ativo e o Microsoft Agent Framework — é o tipo de erro na escolha de uma ferramenta que custa caro seis meses depois, quando chega a hora de evoluir o código.

#Conectá-lo a um modelo local

  1. 01
    Servir o modelo
    Em um endpoint compatível com a API da OpenAI. Para vários agentes conversando ao mesmo tempo, um servidor projetado para lidar com solicitações simultâneas funciona muito melhor do que um servidor pensado para uma única estação de trabalho.
  2. 02
    Configurar o cliente
    URL base (por exemplo http://localhost:11434/v1 para Ollama), nome do modelo exatamente como foi baixado localmente, chave fictícia. Servidores locais ignoram a chave; a biblioteca do cliente exige frequentemente que ela exista.
  3. 03
    Declarar honestamente as capacidades
    Os frameworks perguntam se o modelo suporta chamadas de função ou o modo JSON. Afirmar uma capacidade inexistente gera erros incompreensíveis mais adiante, em vez de uma falha clara.
  4. 04
    Aumentar a janela de contexto
    O histórico cresce a cada rodada. Um contexto padrão trunca silenciosamente o início, e os agentes então repetem um trabalho já feito.
!
Defina um número máximo de rodadas antes do primeiro teste
Não depois. A primeira experiência típica com uma conversa de múltiplos agentes em execução local consiste em descobrir, vinte minutos depois, que dois agentes estão se parabenizando desde a terceira mensagem enquanto a placa de vídeo funciona a plena carga.

#Execução de código: deve ser isolada

O fluxo que torna o AutoGen atraente — um agente escreve código, um agente intermediário o executa, o erro retorna, o agente corrige — é também o que executa código escrito por um modelo na sua máquina. Esse código deve ser executado em um contêiner, sem credenciais, sem acesso à rede se a tarefa não o exigir e nunca tendo sua pasta pessoal como alvo. E todo conteúdo obtido de fontes externas — um ticket, uma página web, um arquivo de documentação — deve ser considerado potencialmente hostil.

A observabilidade conta tanto quanto o isolamento. Em uma conversa com três ou quatro agentes, um incidente é diagnosticado relendo o prompt exato recebido por cada agente em cada turno, e não um resumo feito depois. Sem um registro completo, nunca se sabe se um agente interpretou mal uma instrução ou simplesmente recebeu um contexto truncado por falta de memória. Registrar cada troca, incluindo as chamadas de ferramentas e seus argumentos exatos, custa pouco e evita ter que adivinhar o que aconteceu depois que a placa gráfica volta a ficar silenciosa.

#O tamanho do modelo, de novo

O que realmente acontece em uma conversa
Classe de modeloComportamento
3 a 8 bilhõesMensagens fluidas, chamadas de ferramentas pouco confiáveis, sem disciplina de parada. Loop.
12 a 14 bilhõesAs trocas entre dois agentes com papéis definidos funcionam; as discussões em grupo saem do assunto.
24 a 32 bilhõesO mínimo viável para discussões em grupo e loops de execução de código.
70 bilhões ou maisComportamento mais próximo do cloud, lento o suficiente para que as conversas longas se tornem processamento em lote.

Prefira modelos treinados para chamadas de ferramentas e saídas estruturadas. É o mesmo limite que todos os frameworks de agentes locais enfrentam: produzir texto é fácil, mas seguir formatos rígidos não é. O papel de gerenciador, em uma discussão em grupo, geralmente merece o modelo mais capaz de que você dispõe: é ele quem decide quem fala a seguir, e cada decisão errada de roteamento custa um turno inteiro, um custo que se repete enquanto a conversa continua sem convergir.

#AutoGen, AG2 ou CrewAI

Dois modelos mentais diferentes
Você querEscolha
Papéis definidos, transferências de responsabilidade ordenadas, um custo previsívelCrewAI
Uma conversa aberta, iteração, ciclos de corrigir e tentar novamenteAG2 (o fork ativo do que era AutoGen)
Um grafo explícito com um estado que você controlaUm framework orientado a grafos
Um único agente que modifica um repositórioUm agente de código dedicado
Projeto já construído no ecossistema da MicrosoftMicrosoft Agent Framework

No código já escrito com a API histórica do AutoGen, a migração para o AG2 geralmente exige poucas alterações: o namespace autogen.* original continua disponível em uma branch dedicada (AG2 Classic), dando tempo para você fazer a transição no seu ritmo. Começar do zero hoje é outra decisão: vale mais a pena escolher diretamente o AG2 ou avaliar o Microsoft Agent Framework do que aprender uma base de código que seu próprio fornecedor descreve como mantida pela comunidade.

#Quanto realmente custa uma conversa

Em uma API paga, uma conversa com três agentes que se estende por vinte rodadas aparece na fatura. Localmente, ela aparece no ventilador do gabinete e no relógio de parede. Cada rodada é uma geração completa: se uma rodada dura em média cinco segundos na sua placa, vinte rodadas sem condição de parada representam pelo menos um minuto e quarenta segundos de processamento contínuo, muitas vezes bem mais quando o contexto aumenta e cada geração relê um histórico mais longo do que o da geração anterior. Nada alerta você enquanto isso acontece — nenhum contador, nenhum limite, apenas uma GPU que continua quente.

É por isso que o limite de rodadas não é um detalhe de configuração entre outros: é o único mecanismo que transforma um custo potencialmente ilimitado em um custo limitado e previsível, exatamente como faria um orçamento de tokens em uma API comercial. Definir esse limite antes do primeiro teste, em vez de descobri-lo depois, é a diferença entre um teste de cinco minutos e uma placa de vídeo monopolizada durante uma noite inteira por uma conversa que não levava a nada desde a décima mensagem. Em uma máquina compartilhada com outros usos — uma estação de trabalho, não um servidor dedicado —, essa monopolização também tem um custo de oportunidade concreto: é impossível executar qualquer outra tarefa que exija muitos recursos da GPU enquanto uma conversa entre múltiplos agentes roda sem limite em segundo plano.

#FAQ

O AutoGen ainda é desenvolvido pela Microsoft?+
Não, não mais ativamente. A Microsoft colocou o repositório microsoft/autogen em modo de manutenção em 2 de outubro de 2025: apenas correções de segurança, nenhuma nova funcionalidade, gestão comunitária para o restante. A Microsoft recomenda explicitamente que novos projetos usem o Microsoft Agent Framework, seu sucessor oficial lançado em disponibilidade geral no início de abril de 2026, com um guia de migração dedicado.
O que é o AG2 e você deve usá-lo no lugar?+
AG2 é o fork sob licença Apache 2.0 criado por Chi Wang e Qingyun Wu, os autores originais do AutoGen, após sua saída da Microsoft no fim de 2024. É hoje a versão ativamente desenvolvida mais próxima da API histórica do AutoGen: uma escolha razoável para um novo projeto que deseja manter esse espírito sem depender do ecossistema da Microsoft.
O AutoGen funciona com o Ollama?+
Sim, pelo endpoint do Ollama compatível com OpenAI, disponível em http://localhost:11434/v1: endereço base, nome do modelo exatamente como obtido localmente e chave fictícia, pois o Ollama não a verifica. Para vários agentes simultâneos, um servidor projetado para execução concorrente funciona muito melhor que o Ollama sozinho em uma estação de trabalho comum.
Por que meus agentes falam sem parar?+
Nenhuma condição de parada eficaz foi definida, e muitas vezes o modelo é muito pequeno para reconhecê-la mesmo quando ela existe no prompt. Defina um número máximo de rodadas antes do primeiro teste, estabeleça uma frase de parada explícita e testada e atribua um modelo maior ao papel de gestor, que decide quem fala em seguida.
É prudente deixar um agente executar código?+
Apenas em um contêiner, sem credenciais e com acesso à rede restrito ao estritamente necessário. O executor roda código escrito por um modelo que pode ter lido texto controlado por terceiros ao longo da conversa, o que faz dele uma porta de entrada clássica para a injeção indireta de prompt em uma instalação local.
Qual o menor modelo utilizável?+
Aproximadamente 12 a 14 bilhões de parâmetros para trocas simples entre dois agentes com papéis bem definidos, e 24 a 32 bilhões para discussões em grupo ou loops de execução de código. Abaixo desse limite, as mensagens parecem fluidas, mas a disciplina de encerramento e as chamadas de ferramentas tornam-se pouco confiáveis.
AutoGen (AG2) ou CrewAI?+
CrewAI é mais adequado para papéis definidos de antemão e transferências previsíveis de tarefas de um agente para outro; AG2, para conversas abertas e resolução iterativa em que o caminho não é conhecido no início. Ambos continuam igualmente sensíveis à qualidade do modelo quando passam a ser executados localmente.
Este guia ajudou você?

Um comentário, um erro ou uma observação? Avise-nos; isso ajuda a melhorar o guia para todos.