Agent Argo

Agent Argo

Beschrijf je doel in natuurlijke taal. Een CEO-AI plant, delegeert aan een team van gespecialiseerde agenten en laat het resultaat onafhankelijk verifiëren voordat het als afgerond telt.

CEO-AI-teamEen team van gespecialiseerde agenten daagt elkaar uit voordat er iets geschreven wordt — geen enkele chatagent.
Leveranciersonafhankelijk (BYOK)Je eigen API-sleutels, vrije mix van cloud- en lokale modellen — geen vendor lock-in.
Onafhankelijke verificatieEen aparte verificatie-agent — niet de auteur van de code — controleert elk resultaat met tests en review en start bij een fout automatisch een reparatie.
Volledige traceerbaarheidElke beslissing, context, model en kostenpost wordt gelogd — ook maanden later na te gaan.
Telemetrie

Gemeten, niet beweerd

Argo meet de kosten per geaccepteerd resultaat — niet tokens. Deze cijfers komen uit geanonimiseerde opt-in-telemetrie van echte installaties: alleen geaggregeerde getallen, nooit projectinhoud.

Nog niet genoeg geanonimiseerde gebruiksgegevens om cijfers te tonen — ze verschijnen zodra de minimale steekproefomvang is bereikt.

SWE-benchmarks

Geschatte cijfers — echte testruns volgen nog

De cijfers zijn bewust pessimistisch geschat — we onderschatten liever dan iets te beloven wat Argo (nog) niet betrouwbaar levert. Elk percentage is het oplossingspercentage: het aandeel benchmarktaken dat volledig correct is opgelost — geen tijdsvergelijking met andere modellen en geen deelpunten voor half juiste oplossingen. Het zijn onderbouwde schattingen, geen gemeten resultaten: afgeleid van de onderliggende modellen, de orkestratie en de verificatielaag van Argo — niet van daadwerkelijk uitgevoerde benchmarkruns. Echte testruns zijn voorlopig uitgesteld vanwege de mogelijk hoge API-kosten (veel modelaanroepen per taak) en volgen later.

SWE-bench Verified
SWE-bench Lite
LiveCodeBench
Terminal-Bench

Geschatte cijfers, geen metingen — echte benchmarkruns zijn om kostenredenen uitgesteld en worden toegevoegd zodra ze beschikbaar zijn.

Blog

Blog: volg de ontwikkeling live

Waar we nu aan werken, welke nieuwe technieken we uitrollen en wat er in de laatste update is veranderd.

Naar de blog
Positionering

Geen chatbot. Een kunstmatig softwareteam

Eén enkele agent levert snel een plausibele oplossing. Maar plausibiliteit is geen betrouwbaarheid. Argo behandelt planning, uitvoering, controle en vrijgave als afzonderlijke verantwoordelijkheden — zoals een goed team.

Orkestratie

Een team in plaats van één denkspoor

Argo splitst de taak op, verdeelt deze over gespecialiseerde rollen en laat ze elkaar tegenspreken voordat er iets wordt geschreven. Dat legt zwakke plekken bloot die een enkele agent over het hoofd ziet.

Controle

Autonomie met vangrails

Wijzigingen ontstaan eerst als patch in een geïsoleerde omgeving en worden pas na controle overgenomen. Jij bepaalt wat Argo automatisch mag — kritieke acties blijven altijd apart beschermd.

Traceerbaarheid

Elke beslissing laat een spoor na

Elke run legt vast wat er is gebeurd: welke context, welk model, welke kosten, welke controle. Ook maanden later is nog te herleiden waarom een beslissing is genomen.

Werkwijze

Van vereiste naar geverifieerd resultaat

Je beschrijft een doel in natuurlijke taal. Argo maakt daar een plan van, orkestreert de juiste agenten en levert een resultaat dat niet alleen af lijkt, maar ook geverifieerd is.

  • Scheduler en replanner bepalen welke agenten en modellen echt nodig zijn
  • Onafhankelijke verifiers controleren resultaten in plaats van ze alleen samen te vatten
  • Contextpakketten leveren gericht de relevante delen van grote codebases
  • Git-modus: commits, branches en PR-beschrijvingen op basis van het verrichte werk
CEO-AI
Taak begrijpen, plan en task graph opstellen
Agententeam
Architectuur, ontwikkeling, QA, documentatie — met gestructureerde deliberatie
Verificatie
Tests, reviews, onafhankelijke controle-instanties, herstelruns
Resultaat
Geverifieerde patches, onderbouwingen en een volledig auditspoor
Rentabiliteit

De juiste maatstaf: kosten per geaccepteerd resultaat

Argo verbruikt voor een opdracht vaak meer tokens dan een enkele chat — en is toch goedkoper. Routinewerk draait op goedkope of lokale modellen, dure topmodellen worden alleen ingezet waar hun meerwaarde de meerkosten rechtvaardigt.

  • Intelligente modelroutering over prijsklassen heen, met verklaarbare modelkeuze
  • Budgetten, zachte en harde kostenlimieten, simulatie vóór de start
  • Minder pogingen, minder nawerk, minder reviewtijd — de duurste resource is menselijke arbeid
Routine
Contextzoeken, documentatie, eenvoudige controles → goedkope of lokale modellen
Veeleisend
Architectuur, complexe implementatie, foutanalyse → sterke modellen
Borging
Verificatie en escalatie alleen waar het meetbaar nut oplevert
Volgende stap

Betere resultaten met minder toezicht

Minder nawerk, minder reviewtijd, meer vertrouwen in het resultaat — dat is het verschil tussen een agent en een team.

Prijzen bekijken