एक टीम, न कि तर्क की एक अकेली धारा
Argo कार्य को तोड़ता है, इसे विशेषीकृत भूमिकाओं में वितरित करता है, और कुछ भी लिखे जाने से पहले उन्हें एक-दूसरे को चुनौती देने देता है। इससे वे कमज़ोरियाँ सामने आती हैं जिन्हें एक अकेला एजेंट चूक जाता।
अपना लक्ष्य प्राकृतिक भाषा में बताएं। एक CEO-AI योजना बनाता है, विशेषज्ञ एजेंटों की एक टीम को कार्य सौंपता है और परिणाम को पूर्ण मानने से पहले उसका स्वतंत्र सत्यापन करवाता है।
Argo स्वीकृत परिणाम की लागत मापता है — टोकन नहीं। ये आँकड़े वास्तविक इंस्टॉलेशन के अनाम, ऑप्ट-इन टेलीमेट्री से आते हैं: केवल समग्रीकृत संख्याएँ, कभी प्रोजेक्ट सामग्री नहीं।
आँकड़े दिखाने के लिए अभी तक पर्याप्त अनाम उपयोग डेटा नहीं है — न्यूनतम नमूना आकार पहुँचने पर ये दिखाई देंगे।
ये आंकड़े जान-बूझकर निराशावादी रूप से अनुमानित हैं — हम कुछ ऐसा वादा करने के बजाय कम आंकना पसंद करते हैं जो Argo (अभी तक) भरोसेमंद ढंग से नहीं देता। हर प्रतिशत समाधान दर दर्शाता है: बेंचमार्क कार्यों का वह हिस्सा जो पूरी तरह सही ढंग से हल हुआ — न किसी अन्य मॉडल से समय की तुलना, न आधे-सही समाधानों के लिए आंशिक अंक। ये तर्कसंगत अनुमान हैं, मापे गए परिणाम नहीं: इन्हें अंतर्निहित मॉडलों, ऑर्केस्ट्रेशन और Argo की सत्यापन परत के आधार पर तय किया गया है — न कि वास्तव में चलाए गए बेंचमार्क रन से। असली टेस्ट रन फिलहाल संभावित रूप से ऊंची API लागत (प्रति कार्य कई मॉडल कॉल) के कारण टाल दिए गए हैं और बाद में आएंगे।
Ultracode अभी भी सक्रिय विकास में है — ये आंकड़े अस्थायी अनुमान हैं।
अनुमानित आंकड़े हैं, माप नहीं — असली बेंचमार्क रन लागत कारणों से टाल दिए गए हैं और उपलब्ध होते ही जोड़ दिए जाएंगे।
हम अभी क्या बना रहे हैं, कौन-सी नई तकनीकें लागू कर रहे हैं, और नवीनतम अपडेट में क्या बदला।
एक अकेला एजेंट जल्दी से एक प्रशंसनीय समाधान देता है। लेकिन प्रशंसनीयता विश्वसनीयता नहीं है। Argo योजना, कार्यान्वयन, समीक्षा, और अनुमोदन को अलग-अलग ज़िम्मेदारियों के रूप में मानता है — एक अच्छी टीम की तरह।
Argo कार्य को तोड़ता है, इसे विशेषीकृत भूमिकाओं में वितरित करता है, और कुछ भी लिखे जाने से पहले उन्हें एक-दूसरे को चुनौती देने देता है। इससे वे कमज़ोरियाँ सामने आती हैं जिन्हें एक अकेला एजेंट चूक जाता।
परिवर्तन एक अलग वातावरण में एक पैच के रूप में शुरू होते हैं और समीक्षा के बाद ही लागू किए जाते हैं। आप तय करते हैं कि Argo स्वचालित रूप से क्या कर सकता है — महत्वपूर्ण कार्य हमेशा विशेष रूप से संरक्षित रहते हैं।
हर रन यह लॉग करता है कि क्या हुआ: कौन-सा संदर्भ, कौन-सा मॉडल, कौन-सी लागत, कौन-सी जाँच। महीनों बाद भी, आप यह पता लगा सकते हैं कि कोई निर्णय क्यों लिया गया था।
आप प्राकृतिक भाषा में एक लक्ष्य बताते हैं। Argo इसे एक योजना में बदलता है, सही एजेंटों को ऑर्केस्ट्रेट करता है, और एक ऐसा परिणाम देता है जो सिर्फ पूर्ण दिखता ही नहीं — इसे सत्यापित किया गया है।
Argo अक्सर एक अकेले चैट की तुलना में प्रति कार्य अधिक टोकन खर्च करता है — और फिर भी सस्ता पड़ता है। नियमित काम सस्ते या स्थानीय मॉडलों पर चलता है; महंगे फ़्रंटियर मॉडलों का उपयोग केवल वहीं किया जाता है जहाँ उनका अतिरिक्त मूल्य अतिरिक्त लागत को उचित ठहराता है।
कम पुनः कार्य, कम समीक्षा समय, परिणाम में अधिक भरोसा — यही एक एजेंट और एक टीम के बीच का अंतर है।