Een team in plaats van één denkspoor
Argo splitst de taak op, verdeelt deze over gespecialiseerde rollen en laat ze elkaar tegenspreken voordat er iets wordt geschreven. Dat legt zwakke plekken bloot die een enkele agent over het hoofd ziet.
Beschrijf je doel in natuurlijke taal. Een CEO-AI plant, delegeert aan een team van gespecialiseerde agenten en laat het resultaat onafhankelijk verifiëren voordat het als afgerond telt.
Argo meet de kosten per geaccepteerd resultaat — niet tokens. Deze cijfers komen uit geanonimiseerde opt-in-telemetrie van echte installaties: alleen geaggregeerde getallen, nooit projectinhoud.
Nog niet genoeg geanonimiseerde gebruiksgegevens om cijfers te tonen — ze verschijnen zodra de minimale steekproefomvang is bereikt.
De cijfers zijn bewust pessimistisch geschat — we onderschatten liever dan iets te beloven wat Argo (nog) niet betrouwbaar levert. Elk percentage is het oplossingspercentage: het aandeel benchmarktaken dat volledig correct is opgelost — geen tijdsvergelijking met andere modellen en geen deelpunten voor half juiste oplossingen. Het zijn onderbouwde schattingen, geen gemeten resultaten: afgeleid van de onderliggende modellen, de orkestratie en de verificatielaag van Argo — niet van daadwerkelijk uitgevoerde benchmarkruns. Echte testruns zijn voorlopig uitgesteld vanwege de mogelijk hoge API-kosten (veel modelaanroepen per taak) en volgen later.
Ultracode is nog volop in ontwikkeling — deze cijfers zijn voorlopige schattingen.
Geschatte cijfers, geen metingen — echte benchmarkruns zijn om kostenredenen uitgesteld en worden toegevoegd zodra ze beschikbaar zijn.
Waar we nu aan werken, welke nieuwe technieken we uitrollen en wat er in de laatste update is veranderd.
Eén enkele agent levert snel een plausibele oplossing. Maar plausibiliteit is geen betrouwbaarheid. Argo behandelt planning, uitvoering, controle en vrijgave als afzonderlijke verantwoordelijkheden — zoals een goed team.
Argo splitst de taak op, verdeelt deze over gespecialiseerde rollen en laat ze elkaar tegenspreken voordat er iets wordt geschreven. Dat legt zwakke plekken bloot die een enkele agent over het hoofd ziet.
Wijzigingen ontstaan eerst als patch in een geïsoleerde omgeving en worden pas na controle overgenomen. Jij bepaalt wat Argo automatisch mag — kritieke acties blijven altijd apart beschermd.
Elke run legt vast wat er is gebeurd: welke context, welk model, welke kosten, welke controle. Ook maanden later is nog te herleiden waarom een beslissing is genomen.
Je beschrijft een doel in natuurlijke taal. Argo maakt daar een plan van, orkestreert de juiste agenten en levert een resultaat dat niet alleen af lijkt, maar ook geverifieerd is.
Argo verbruikt voor een opdracht vaak meer tokens dan een enkele chat — en is toch goedkoper. Routinewerk draait op goedkope of lokale modellen, dure topmodellen worden alleen ingezet waar hun meerwaarde de meerkosten rechtvaardigt.
Minder nawerk, minder reviewtijd, meer vertrouwen in het resultaat — dat is het verschil tussen een agent en een team.