Agent Argo

Agent Argo

Descreve o teu objetivo em linguagem natural. Uma IA CEO planeia, delega a uma equipa de agentes especializados e faz com que o resultado seja verificado de forma independente antes de contar como concluído.

Equipa de IA CEOUma equipa de agentes especializados contesta-se mutuamente antes de algo ser escrito — não um único agente de chat.
Neutro quanto ao fornecedor (BYOK)As tuas próprias chaves de API, misturando livremente modelos cloud e locais — sem dependência de um fornecedor.
Verificação independenteUm agente verificador à parte — não o autor do código — revê cada resultado com testes e análise, acionando automaticamente uma reparação em caso de falha.
Rastreabilidade totalCada decisão, contexto, modelo e custo fica registado — rastreável mesmo meses depois.
Telemetria

Medido, não afirmado

A Argo mede o custo por resultado aceite — não os tokens. Estes valores provêm de telemetria opt-in anonimizada de instalações reais: apenas números agregados, nunca conteúdo dos projetos.

Ainda não há dados de utilização anonimizados suficientes para apresentação — os valores aparecem assim que for atingida a amostra mínima.

Benchmarks SWE

Valores estimados — os testes reais seguem-se

Os valores são deliberadamente estimados de forma pessimista — preferimos ficar aquém do que prometer algo que o Argo ainda não cumpre de forma fiável. Cada percentagem é a taxa de resolução: a proporção de tarefas do benchmark resolvidas de forma totalmente correta — sem comparação de tempo com outros modelos e sem pontuação parcial por soluções meio certas. São estimativas fundamentadas, não resultados medidos: definidas com base nos modelos subjacentes, na orquestração e na camada de verificação do Argo — não em execuções de benchmark efetivamente realizadas. Os testes reais estão, por agora, adiados devido ao custo potencialmente elevado de API (muitas chamadas ao modelo por tarefa) e seguir-se-ão mais tarde.

SWE-bench Verified
SWE-bench Lite
LiveCodeBench
Terminal-Bench

Valores estimados, não medições — as execuções reais de benchmark estão adiadas por motivos de custo e serão adicionadas assim que estiverem disponíveis.

Blog

Blog: acompanhe o desenvolvimento ao vivo

O que estamos a construir agora, as novas técnicas implementadas e o que mudou na última atualização.

Ver o blog
Posicionamento

Não é um chatbot. É uma equipa de software artificial

Um único agente entrega rapidamente uma solução plausível. Mas plausibilidade não é fiabilidade. A Argo trata o planeamento, a implementação, a revisão e a aprovação como responsabilidades distintas — como uma boa equipa.

Orquestração

Uma equipa, não um único raciocínio isolado

A Argo decompõe a tarefa, distribui-a por funções especializadas e deixa que estas se contraponham antes de qualquer coisa ser escrita. Isto revela fragilidades que um único agente não detetaria.

Controlo

Autonomia com barreiras de segurança

As alterações surgem primeiro como um patch num ambiente isolado e só são aplicadas após revisão. Tu decides o que a Argo pode fazer automaticamente — as ações críticas permanecem sempre especialmente protegidas.

Rastreabilidade

Cada decisão deixa um rasto

Cada execução regista o que aconteceu: qual o contexto, qual o modelo, quais os custos, quais as verificações. Mesmo meses depois, é possível compreender porque foi tomada uma decisão.

Modo de funcionamento

Do requisito ao resultado verificado

Descreves um objetivo em linguagem natural. A Argo transforma-o num plano, orquestra os agentes adequados e entrega um resultado que não parece apenas concluído — foi efetivamente verificado.

  • Um scheduler e um replanner decidem quais os agentes e modelos realmente necessários
  • Verificadores independentes analisam os resultados, em vez de se limitarem a resumi-los
  • Pacotes de contexto entregam, de forma precisa, as partes relevantes de grandes bases de código
  • Modo Git: commits, branches e descrições de PR gerados a partir do trabalho realizado
CEO-IA
Compreender a tarefa, criar um plano e um grafo de tarefas
Equipa de agentes
Arquitetura, desenvolvimento, QA, documentação — com deliberação estruturada
Verificação
Testes, revisões, instâncias de verificação independentes, execuções de reparação
Resultado
Patches verificados, justificações e um rasto de auditoria completo
Rentabilidade

A métrica certa: custo por resultado aceite

A Argo consome muitas vezes mais tokens por tarefa do que uma única conversa — e ainda assim sai mais barata. O trabalho de rotina corre em modelos económicos ou locais; os modelos de topo, mais caros, só são usados onde o seu valor acrescentado justifica o custo adicional.

  • Encaminhamento inteligente de modelos entre diferentes níveis de preço, com escolha de modelo explicável
  • Orçamentos, limites de custo flexíveis e rígidos, simulação antes do início
  • Menos tentativas, menos retrabalho, menos tempo de revisão — o trabalho humano é o recurso mais caro
Rotina
Pesquisa de contexto, documentação, verificações simples → modelos económicos ou locais
Exigente
Arquitetura, implementação complexa, análise de causas de erro → modelos avançados
Salvaguarda
Verificação e escalonamento apenas onde trazem valor mensurável
Próximo passo

Melhores resultados, com menos supervisão

Menos retrabalho, menos tempo de revisão, mais confiança no resultado — é essa a diferença entre um agente e uma equipa.

Ver preços