Agent Argo

Agent Argo

Hedefini doğal dilde tanımla. CEO-AI planlar, uzman ajanlardan oluşan bir ekibe görev devreder ve sonucu tamamlandı sayılmadan önce bağımsız olarak doğrulatır.

CEO-AI ekibiUzman ajanlardan oluşan bir ekip, bir şey yazılmadan önce birbirini sorgular — tek bir sohbet ajanı değil.
Sağlayıcıdan bağımsız (BYOK)Kendi API anahtarların, bulut ve yerel modelleri özgürce karıştırarak — sağlayıcıya bağımlılık yok.
Bağımsız doğrulamaKodun yazarı değil, ayrı bir doğrulayıcı ajan her sonucu testler ve incelemeyle kontrol eder ve hata durumunda otomatik olarak onarım başlatır.
Tam izlenebilirlikHer karar, bağlam, model ve maliyet kaydedilir — aylar sonra bile izlenebilir.
Telemetri

Ölçülür, iddia edilmez

Argo, token yerine kabul edilen sonuç başına maliyeti ölçer. Bu rakamlar, gerçek kurulumların anonimleştirilmiş, açık onaya dayalı telemetrisinden gelir: yalnızca toplulaştırılmış sayılar, asla proje içeriği değil.

Rakamları görüntülemek için henüz yeterli anonimleştirilmiş kullanım verisi yok — asgari örneklem büyüklüğüne ulaşıldığında görünecekler.

SWE karşılaştırmaları

Tahmini değerler — gerçek test koşuları sonra gelecek

Değerler bilinçli olarak kötümser şekilde tahmin edilmiştir — Argo'nun (henüz) güvenilir biçimde sunmadığı bir şeyi vaat etmektense daha düşük göstermeyi tercih ediyoruz. Her yüzde, çözüm oranını gösterir: karşılaştırma görevlerinin tamamen doğru şekilde çözülen payı — diğer modellerle süre karşılaştırması yoktur ve yarı doğru çözümler için kısmi puan verilmez. Bunlar ölçülen sonuçlar değil, gerekçeli tahminlerdir: Argo'nun temel modellerine, orkestrasyonuna ve doğrulama katmanına dayanarak belirlenmiştir — gerçekten çalıştırılmış karşılaştırma koşularına dayanmaz. Gerçek test koşuları, olası yüksek API maliyeti nedeniyle (görev başına çok sayıda model çağrısı) şimdilik ertelenmiştir ve daha sonra eklenecektir.

SWE-bench Verified
SWE-bench Lite
LiveCodeBench
Terminal-Bench

Tahmini değerlerdir, ölçüm değildir — gerçek karşılaştırma koşuları maliyet nedeniyle ertelenmiştir ve kullanılabilir olduklarında eklenecektir.

Blog

Blog: geliştirmeyi canlı takip edin

Şu anda üzerinde çalıştığımız konular, hayata geçirdiğimiz yeni teknikler ve son güncellemede neyin değiştiği.

Bloga git
Konumlandırma

Bir sohbet botu değil. Yapay bir yazılım ekibi

Tek bir ajan hızla makul görünen bir çözüm sunar. Ama makul görünmek güvenilir olmak demek değildir. Argo; planlamayı, uygulamayı, incelemeyi ve onayı — tıpkı iyi bir ekip gibi — ayrı sorumluluklar olarak ele alır.

Orkestrasyon

Tek bir düşünce akışı değil, bir ekip

Argo görevi parçalara ayırır, uzmanlaşmış rollere dağıtır ve herhangi bir şey yazılmadan önce birbirlerine meydan okumalarına izin verir. Bu, tek bir ajanın gözden kaçıracağı zayıflıkları gün yüzüne çıkarır.

Kontrol

Korkuluklarla özerklik

Değişiklikler izole bir ortamda bir yama (patch) olarak başlar ve yalnızca inceleme sonrasında uygulanır. Argo'nun otomatik olarak neler yapabileceğine siz karar verirsiniz — kritik eylemler her zaman özel olarak korunmuş kalır.

İzlenebilirlik

Her karar bir iz bırakır

Her çalışma (run) neler olduğunu kaydeder: hangi bağlam, hangi model, hangi maliyetler, hangi kontroller. Aylar sonra bile, bir kararın neden verildiğini izleyebilirsiniz.

Nasıl çalışır

Gereksinimden doğrulanmış sonuca

Bir hedefi doğal dilde tanımlarsınız. Argo bunu bir plana dönüştürür, doğru ajanları orkestre eder ve yalnızca bitmiş görünen değil, doğrulanmış bir sonuç sunar.

  • Bir zamanlayıcı ve yeniden planlayıcı, hangi ajanların ve modellerin gerçekten gerektiğine karar verir
  • Bağımsız doğrulayıcılar sonuçları yalnızca özetlemek yerine kontrol eder
  • Bağlam paketleri, büyük kod tabanlarının ilgili kısımlarını hassas biçimde hedeflenmiş olarak sunar
  • Git modu: yapılan işten türetilen commit'ler, dallar ve PR açıklamaları
CEO yapay zekâsı
Görevi anla, bir plan ve görev grafiği oluştur
Ajan ekibi
Mimari, geliştirme, kalite güvence, dokümantasyon — yapılandırılmış müzakereyle
Doğrulama
Testler, incelemeler, bağımsız doğrulayıcılar, onarım çalışmaları
Sonuç
Doğrulanmış yamalar, gerekçe ve eksiksiz bir denetim izi
Ekonomi

Doğru ölçüt: kabul edilen sonuç başına maliyet

Argo genellikle görev başına tek bir sohbetten daha fazla token tüketir — ve yine de daha ucuza mal olur. Rutin işler ucuz veya yerel modellerde çalışır; pahalı öncü (frontier) modeller yalnızca kattıkları değerin ek maliyeti haklı çıkardığı yerlerde kullanılır.

  • Fiyat katmanları arasında akıllı model yönlendirmesi, açıklanabilir model seçimiyle
  • Bir çalışma başlamadan önce simüle edilen yumuşak ve sert bütçe sınırları
  • Daha az yeniden deneme, daha az yeniden çalışma, daha az inceleme süresi — insan emeği çok daha pahalı bir kaynaktır
Rutin
Bağlam sorgulama, dokümantasyon, basit kontroller → ucuz veya yerel modeller
Zorlu
Mimari, karmaşık uygulama, kök neden analizi → güçlü modeller
Güvenceler
Doğrulama ve yükseltme yalnızca ölçülebilir değer kattığı yerlerde
Sonraki adım

Daha az gözetimle daha iyi sonuçlar

Daha az yeniden çalışma, daha az inceleme süresi, sonuca daha fazla güven — bir ajan ile bir ekip arasındaki fark budur.