一支团队,而非一条单一的思维链
Argo 将任务拆解,分配给专业化角色,并让它们在动手之前互相质疑与挑战。这能暴露出单个智能体容易忽略的弱点。
用自然语言描述你的目标。CEO AI 进行规划,委派给一组专业智能体组成的团队,并在结果被视为完成之前进行独立验证。
Argo 衡量的是每个被采纳结果的成本——而不是token数量。这些数字来自真实安装实例的匿名化选择加入(opt-in)遥测数据:仅包含汇总数字,绝不涉及项目内容。
目前匿名化使用数据尚不足以展示——一旦达到最小样本量,相关指标即会显示。
这些数值是刻意偏保守估算的——我们宁愿估低,也不愿承诺 Argo(目前)尚无法可靠达成的水平。每个百分比代表解决率:即完全正确解决的基准测试任务占比——不涉及与其他模型的时间对比,也不为部分正确的答案给予分数。这些是有依据的估算,而非实测结果:根据 Argo 所用的底层模型、编排方式及验证层推算得出——并非来自实际执行的基准测试运行。由于每个任务可能产生较高的 API 调用成本,真实测试运行暂时推迟,稍后将陆续公布。
Ultracode 仍在积极开发中——这些数值为初步估算。
这些是估算数值,并非实测结果——出于成本考虑,真实基准测试运行已推迟,一旦有结果将补充公布。
我们正在开发的内容、部署的新技术,以及最新更新的变化。
单个智能体能很快给出一个看似可行的方案。但看似可行不等于真正可靠。Argo 将规划、实现、评审与验收视为彼此独立的职责——就像一支优秀的团队一样。
Argo 将任务拆解,分配给专业化角色,并让它们在动手之前互相质疑与挑战。这能暴露出单个智能体容易忽略的弱点。
变更最初以补丁的形式产生于隔离环境中,只有经过评审后才会被应用。由您决定 Argo 可以自动执行哪些操作——关键操作始终受到特别保护。
每次运行都会记录所发生的一切:使用了何种上下文、何种模型、产生了何种成本、经过了何种检查。即使数月之后,您依然能够追溯某个决策的由来。
您用自然语言描述一个目标。Argo 将其转化为计划,编排合适的智能体,并交付一个不只是看起来完成、而是真正经过验证的结果。
对于同一项任务,Argo 消耗的token往往比单次对话更多——却依然更加经济。常规工作运行在廉价或本地模型上;只有当昂贵的前沿模型带来的附加价值能够证明其成本合理时,才会被使用。