一支團隊,而非單一思路
Argo 將任務拆解,分配給專業化角色,並讓它們於動手之前相互質疑與挑戰。此舉能揭露單一代理人容易忽略之弱點。
用自然語言描述你的目標。CEO AI 進行規劃,委派給一組專業智能體組成的團隊,並在結果被視為完成之前進行獨立驗證。
Argo 衡量的是每個被採納結果之成本——而非token數量。這些數字來自真實安裝實例之匿名化選擇加入(opt-in)遙測資料:僅包含彙總數字,絕不涉及專案內容。
目前匿名化使用資料尚不足以呈現——一旦達到最小樣本量,相關指標即會顯示。
這些數值是刻意偏保守估算的——我們寧願估低,也不願承諾 Argo(目前)尚無法可靠達成的水準。每個百分比代表解決率:即完全正確解決的基準測試任務佔比——不涉及與其他模型的時間比較,也不為部分正確的答案給予分數。這些是有依據的估算,而非實測結果:根據 Argo 所用的底層模型、協調方式及驗證層推算得出——並非來自實際執行的基準測試運行。由於每個任務可能產生較高的 API 呼叫成本,真實測試運行暫時延後,稍後將陸續公布。
Ultracode 仍在積極開發中——這些數值為初步估算。
這些是估算數值,並非實測結果——出於成本考量,真實基準測試運行已延後,一旦有結果將補充公布。
我們正在開發的內容、部署的新技術,以及最新更新的變化。
單一代理人能很快提出一個看似可行之方案。但看似可行不等於真正可靠。Argo 將規劃、實作、評審與驗收視為彼此獨立之職責——就如同一支優秀之團隊。
Argo 將任務拆解,分配給專業化角色,並讓它們於動手之前相互質疑與挑戰。此舉能揭露單一代理人容易忽略之弱點。
變更最初以修補(patch)形式產生於隔離環境中,唯有經過評審後才會被套用。由您決定 Argo 可自動執行哪些操作——關鍵操作始終受到特別保護。
每次執行皆會記錄所發生之一切:使用了何種上下文、何種模型、產生了何種成本、經過了何種檢查。即使數月之後,您依然能夠追溯某個決策之由來。
您以自然語言描述一個目標。Argo 將其轉化為計畫,編排合適之代理人,並交付一個不僅看似完成、而是真正經過驗證之結果。
對於同一項任務,Argo 消耗之token往往比單次對話更多——卻依然更加經濟。常規工作於低成本或本機模型上運行;唯有當昂貴之前沿模型帶來之附加價值足以證明其成本合理時,才會被使用。