Un team, non un unico filo di pensiero
Argo scompone l'attività, la distribuisce a ruoli specializzati e li lascia contraddirsi a vicenda prima che venga scritto qualcosa. Questo fa emergere debolezze che un singolo agente non noterebbe.
Descrivi il tuo obiettivo in linguaggio naturale. Un'IA CEO pianifica, delega a un team di agenti specializzati e fa verificare il risultato in modo indipendente prima che conti come completato.
Argo misura il costo per risultato accettato — non i token. Questi valori provengono da telemetria opt-in anonimizzata di installazioni reali: solo numeri aggregati, mai contenuti dei progetti.
Non ci sono ancora abbastanza dati di utilizzo anonimizzati per una visualizzazione — i valori compariranno al raggiungimento della dimensione minima del campione.
I valori sono deliberatamente stimati in modo pessimistico — preferiamo sottostimare piuttosto che promettere qualcosa che Argo non offre (ancora) in modo affidabile. Ogni percentuale è il tasso di risoluzione: la quota di attività del benchmark risolte in modo completamente corretto — nessun confronto di tempo con altri modelli e nessun punteggio parziale per soluzioni a metà. Sono stime motivate, non risultati misurati: ricavate dai modelli sottostanti, dall'orchestrazione e dal livello di verifica di Argo — non da esecuzioni di benchmark effettivamente svolte. I test reali sono per ora rinviati per via del costo potenzialmente elevato delle API (molte chiamate al modello per attività) e seguiranno più avanti.
Ultracode è ancora in sviluppo attivo — questi valori sono stime preliminari.
Valori stimati, non misurazioni — le esecuzioni reali dei benchmark sono rinviate per motivi di costo e verranno aggiunte non appena disponibili.
Cosa stiamo costruendo in questo momento, le nuove tecniche implementate e cosa è cambiato nell'ultimo aggiornamento.
Un singolo agente offre rapidamente una soluzione plausibile. Ma plausibilità non significa affidabilità. Argo tratta pianificazione, implementazione, verifica e approvazione come responsabilità separate — come un buon team.
Argo scompone l'attività, la distribuisce a ruoli specializzati e li lascia contraddirsi a vicenda prima che venga scritto qualcosa. Questo fa emergere debolezze che un singolo agente non noterebbe.
Le modifiche nascono prima come patch in un ambiente isolato e vengono applicate solo dopo la verifica. Decidi tu cosa Argo può fare automaticamente — le azioni critiche restano sempre protette a parte.
Ogni run registra cosa è successo: quale contesto, quale modello, quali costi, quale verifica. Anche mesi dopo è possibile ricostruire perché è stata presa una decisione.
Descrivi un obiettivo in linguaggio naturale. Argo lo trasforma in un piano, orchestra gli agenti giusti e fornisce un risultato che non sembra soltanto finito, ma è stato verificato.
Per un incarico, Argo spesso consuma più token di una singola chat — e nonostante ciò risulta più economico. Il lavoro di routine viene eseguito su modelli economici o locali, i modelli di punta costosi vengono impiegati solo dove il loro valore aggiunto giustifica il costo maggiore.
Meno rilavorazioni, meno tempo di revisione, più fiducia nel risultato — questa è la differenza tra un agente e un team.