Agent Argo

Agent Argo

用自然语言描述你的目标。CEO AI 进行规划,委派给一组专业智能体组成的团队,并在结果被视为完成之前进行独立验证。

CEO AI 团队在写下任何内容之前,一组专业智能体会相互质疑——而不是单一的聊天智能体。
供应商中立(BYOK)使用你自己的 API 密钥,自由混合云端与本地模型——不被单一供应商锁定。
独立验证一个独立的验证智能体——而非代码的编写者——通过测试和审查检查每个结果,并在失败时自动启动修复。
完整可追溯性每个决策、上下文、模型和成本都会被记录——即使数月后也可追溯。
遥测数据

用数据说话,而非空口承诺

Argo 衡量的是每个被采纳结果的成本——而不是token数量。这些数字来自真实安装实例的匿名化选择加入(opt-in)遥测数据:仅包含汇总数字,绝不涉及项目内容。

目前匿名化使用数据尚不足以展示——一旦达到最小样本量,相关指标即会显示。

SWE 基准测试

预估数值——真实测试稍后进行

这些数值是刻意偏保守估算的——我们宁愿估低,也不愿承诺 Argo(目前)尚无法可靠达成的水平。每个百分比代表解决率:即完全正确解决的基准测试任务占比——不涉及与其他模型的时间对比,也不为部分正确的答案给予分数。这些是有依据的估算,而非实测结果:根据 Argo 所用的底层模型、编排方式及验证层推算得出——并非来自实际执行的基准测试运行。由于每个任务可能产生较高的 API 调用成本,真实测试运行暂时推迟,稍后将陆续公布。

SWE-bench Verified
SWE-bench Lite
LiveCodeBench
Terminal-Bench

这些是估算数值,并非实测结果——出于成本考虑,真实基准测试运行已推迟,一旦有结果将补充公布。

博客

博客:实时了解开发进展

我们正在开发的内容、部署的新技术,以及最新更新的变化。

前往博客
定位

不是聊天机器人,而是一支人工软件团队

单个智能体能很快给出一个看似可行的方案。但看似可行不等于真正可靠。Argo 将规划、实现、评审与验收视为彼此独立的职责——就像一支优秀的团队一样。

编排

一支团队,而非一条单一的思维链

Argo 将任务拆解,分配给专业化角色,并让它们在动手之前互相质疑与挑战。这能暴露出单个智能体容易忽略的弱点。

控制

有护栏的自主性

变更最初以补丁的形式产生于隔离环境中,只有经过评审后才会被应用。由您决定 Argo 可以自动执行哪些操作——关键操作始终受到特别保护。

可追溯性

每一个决策都留有记录

每次运行都会记录所发生的一切:使用了何种上下文、何种模型、产生了何种成本、经过了何种检查。即使数月之后,您依然能够追溯某个决策的由来。

运作方式

从需求到经过验证的结果

您用自然语言描述一个目标。Argo 将其转化为计划,编排合适的智能体,并交付一个不只是看起来完成、而是真正经过验证的结果。

  • 调度器与重规划器决定实际需要哪些智能体和模型
  • 独立的验证器会检查结果,而不仅仅是对其进行总结
  • 上下文包能精准提取大型代码库中的相关部分
  • Git 模式:依据实际完成的工作生成提交、分支及PR描述
CEO AI
理解任务,构建计划与任务图
智能体团队
架构、开发、质量保证、文档——通过结构化协商进行
验证
测试、评审、独立验证器、修复运行
结果
经过验证的补丁、决策依据及完整的审计轨迹
经济性

正确的衡量指标:每个被采纳结果的成本

对于同一项任务,Argo 消耗的token往往比单次对话更多——却依然更加经济。常规工作运行在廉价或本地模型上;只有当昂贵的前沿模型带来的附加价值能够证明其成本合理时,才会被使用。

  • 跨价格档位的智能模型路由,配合可解释的模型选择依据
  • 软性与硬性预算限制,在运行开始前进行模拟
  • 更少的重试、更少的返工、更少的评审时间——人力才是远比模型调用更昂贵的资源
常规任务
上下文查找、文档、简单检查 → 廉价或本地模型
高要求任务
架构设计、复杂实现、根因分析 → 强力模型
保障机制
验证与升级仅在能带来可衡量价值之处使用
下一步

更好的结果,更少的人工监督

更少的返工、更少的评审时间、对结果更高的信任——这就是一个智能体与一支团队之间的区别。

查看价格