Tek bir düşünce akışı değil, bir ekip
Argo görevi parçalara ayırır, uzmanlaşmış rollere dağıtır ve herhangi bir şey yazılmadan önce birbirlerine meydan okumalarına izin verir. Bu, tek bir ajanın gözden kaçıracağı zayıflıkları gün yüzüne çıkarır.
Hedefini doğal dilde tanımla. CEO-AI planlar, uzman ajanlardan oluşan bir ekibe görev devreder ve sonucu tamamlandı sayılmadan önce bağımsız olarak doğrulatır.
Argo, token yerine kabul edilen sonuç başına maliyeti ölçer. Bu rakamlar, gerçek kurulumların anonimleştirilmiş, açık onaya dayalı telemetrisinden gelir: yalnızca toplulaştırılmış sayılar, asla proje içeriği değil.
Rakamları görüntülemek için henüz yeterli anonimleştirilmiş kullanım verisi yok — asgari örneklem büyüklüğüne ulaşıldığında görünecekler.
Değerler bilinçli olarak kötümser şekilde tahmin edilmiştir — Argo'nun (henüz) güvenilir biçimde sunmadığı bir şeyi vaat etmektense daha düşük göstermeyi tercih ediyoruz. Her yüzde, çözüm oranını gösterir: karşılaştırma görevlerinin tamamen doğru şekilde çözülen payı — diğer modellerle süre karşılaştırması yoktur ve yarı doğru çözümler için kısmi puan verilmez. Bunlar ölçülen sonuçlar değil, gerekçeli tahminlerdir: Argo'nun temel modellerine, orkestrasyonuna ve doğrulama katmanına dayanarak belirlenmiştir — gerçekten çalıştırılmış karşılaştırma koşularına dayanmaz. Gerçek test koşuları, olası yüksek API maliyeti nedeniyle (görev başına çok sayıda model çağrısı) şimdilik ertelenmiştir ve daha sonra eklenecektir.
Ultracode hâlâ aktif geliştirme aşamasındadır — bu değerler ön tahminlerdir.
Tahmini değerlerdir, ölçüm değildir — gerçek karşılaştırma koşuları maliyet nedeniyle ertelenmiştir ve kullanılabilir olduklarında eklenecektir.
Şu anda üzerinde çalıştığımız konular, hayata geçirdiğimiz yeni teknikler ve son güncellemede neyin değiştiği.
Tek bir ajan hızla makul görünen bir çözüm sunar. Ama makul görünmek güvenilir olmak demek değildir. Argo; planlamayı, uygulamayı, incelemeyi ve onayı — tıpkı iyi bir ekip gibi — ayrı sorumluluklar olarak ele alır.
Argo görevi parçalara ayırır, uzmanlaşmış rollere dağıtır ve herhangi bir şey yazılmadan önce birbirlerine meydan okumalarına izin verir. Bu, tek bir ajanın gözden kaçıracağı zayıflıkları gün yüzüne çıkarır.
Değişiklikler izole bir ortamda bir yama (patch) olarak başlar ve yalnızca inceleme sonrasında uygulanır. Argo'nun otomatik olarak neler yapabileceğine siz karar verirsiniz — kritik eylemler her zaman özel olarak korunmuş kalır.
Her çalışma (run) neler olduğunu kaydeder: hangi bağlam, hangi model, hangi maliyetler, hangi kontroller. Aylar sonra bile, bir kararın neden verildiğini izleyebilirsiniz.
Bir hedefi doğal dilde tanımlarsınız. Argo bunu bir plana dönüştürür, doğru ajanları orkestre eder ve yalnızca bitmiş görünen değil, doğrulanmış bir sonuç sunar.
Argo genellikle görev başına tek bir sohbetten daha fazla token tüketir — ve yine de daha ucuza mal olur. Rutin işler ucuz veya yerel modellerde çalışır; pahalı öncü (frontier) modeller yalnızca kattıkları değerin ek maliyeti haklı çıkardığı yerlerde kullanılır.
Daha az yeniden çalışma, daha az inceleme süresi, sonuca daha fazla güven — bir ajan ile bir ekip arasındaki fark budur.