---
url: /codex-harness/introduction.md
description: >-
  Codex Harness 是 OpenAI 开源的 Agent 运行框架，Apache-2.0 协议，放出 codex exec、官方 Codex SDK
  与 app-server 三件套，把智能体循环直接嵌进你自己的产品。
---

# 认识 Codex Harness

先甩一个让我头皮发麻的数据：同一个模型 **GPT-5.6 Sol**，在 ARC-AGI-3 这个硬核基准上，得分从 **13.3% 直接飙到 38.3%**，输出 token 还砍掉了 **六倍**——而模型一行没换，只调了运行框架的两项设置（保留推理、上下文压缩）。

这说明什么？说明「一个厉害的 Agent」这件事，大头根本不在模型，而在模型外面那层包着它的「执行系统」。OpenAI 自己把这个执行系统叫 **Harness**。而 2026 年 8 月，OpenAI 在开发者博客《Codex as a platform》里，把驱动 Codex 的这层 Harness 整个开源了——Apache-2.0，免费可改可商用。

我第一反应是：这不是把发动机白送人吗？后来想明白，它想做的不是又一个聊天框，而是「把智能体循环嵌进你已有的软件里」。

> 一句话：Codex Harness 让大模型不再只能待在聊天窗口里，而是能钻进你的工程工具、运营看板、财务系统——界面你做主，脑子它来出。

## 什么是 Codex Harness

**Codex Harness** 是 OpenAI 开源的 **Agent 运行框架（agent harness）**，仓库在 `github.com/openai/codex`，采用 **Apache-2.0 协议** 完整开源。它正是 Codex App、Codex 命令行、Codex IDE 插件背后那套「同一套底层系统」的公开形态。

如果你把大模型想成「大脑」，那 Agent 就是「会思考、会调工具、会干长活的工作单元」。但让一个 Agent 真正跑起来，模型之外还有一堆脏活：理解任务、跨轮维持上下文、检索信息、调工具、上报进度、处理失败、该请求的权限要请求、最后把结果交回来。这层「包围着模型的执行系统」，就是 Harness。

> 模型评测圈有句新口头禅：模型选型重要，prompt 重要，但「Harness 工程」同样重要。同一个模型，套不同的 Harness，跑分能差出一个身位——ARC-AGI-3 上那 13.3% 到 38.3% 的跃迁，就是活证据。

## Codex Harness 的特点

OpenAI 一口气把三件套扔了出来，外加一个命令行入口：

* **Codex CLI**：轻量级本地 coding agent，直接在终端里跑，登录 ChatGPT 账号或填 API Key 就能用
* **Codex SDK（官方）**：给应用代码用的编程接口，能直接 start / resume / stream（启动、续跑、流式拉取）Codex 任务，不用你自己造一套对话协议
* **Codex app-server**：最耀眼的明星组件。它把 Harness 能力通过一套文档化的客户端协议暴露出来——你的应用能建线程、起任务、收事件、处理审批。当 Agent 是你产品的一部分时，就靠它
* **codex exec**：一条命令搞定脚本、CI、一次性后台任务，返回结构化结果，没有持久会话要管
* **你拥有界面、上下文与边界**：应用保留自己的看板、编辑器、审批流、业务数据和应用自有的 MCP 服务；Harness 只管对话状态、Agent 循环、沙箱与审批策略的执行
* **Apache-2.0 完全开源**：代码可审查、可改造、可商用；模型访问和托管服务则单独分离，不在开源之列

> 老张我自己的判断：它的精髓不是「又一个 AI 助手」，而是「把 Agent 循环当零件卖给你」。你不用逼着团队把活儿搬进通用聊天框，而是给现有软件装个脑子——哪个界面该看什么、能碰哪些文件、哪些动作要人批，全是你说了算。

## 为什么值得关注：三个真实信号

别只当它是又一个玩具，下面三个信号是实打实的。

**信号一：连 OpenAI 自己的 benchmark 都在吃 Harness 的红利。** 前面那组 ARC-AGI-3 数据（13.3% → 38.3%，token 省六倍）就是官方放出来的——而且强调「同一个模型」。这等于公开承认：模型能力之外，运行框架已经是影响结果的关键变量。

**信号二：大厂已经把它嵌进生产了。**

* **Cisco**：在云控制平台里用 Codex SDK 搭了 AppBuilder，客户用自然语言就能生成自定义应用；
* **Thrive Holdings + Crete**：把 Harness 塞进税务准备工作流，试点处理了 **7,000 份申报表**，准备时间砍掉约三分之一；
* **GitHub、JetBrains**：已把 Codex 整合进各自的 IDE 工作流。

**信号三：战场从「拼模型」切到「拼执行层」。** OpenAI 放这个出来，和 DeepSeek 此前开源的 DeepSeek Harness 形成了有趣的对照——一个闭源巨头的开放底座，一个开源新贵的插件化底座，圈内已经有人喊出「iOS vs 安卓」的路线对决。无论谁赢，开发者都是捡便宜的那个。

> 打个比方：DeepSeek Harness 像「一切皆插件的乐高底板」，Codex Harness 像「你家的软件直接住进一个带大脑的租客」。两者都在抢同一件事——定义 Agent 时代的运行标准。

## Codex Harness 初体验

想亲手跑起来？最轻量的就是 Codex CLI，三步就够。

**第 1 步：装 Node.js 并全局安装**

需要较新的 Node 环境，终端里一行搞定：

```bash
npm install -g @openai/codex
```

macOS 用户也可以走 Homebrew：

```bash
brew install --cask codex
```

**第 2 步：登录授权**

首次运行会引导你登录——可以用 **ChatGPT Plus / Pro / Business / Edu / Enterprise** 账号，也可以直接填 **OpenAI API Key**。装完先确认版本：

```bash
codex --version
```

**第 3 步：开聊 / 跑一次性任务**

交互模式直接问：

```bash
codex "解释一下当前目录的项目结构，并指出主要的依赖"
```

只想跑个边界明确的一次性任务（脚本、CI、后台活儿），用 `codex exec` 拿结构化结果：

```bash
codex exec "列出 src 目录下所有超过 200 行的文件"
```

> 真要做产品集成，路线是：`codex exec` 跑一段有头有尾的任务 → 用 **Codex SDK** 在代码里启停/续跑任务 → 当 Agent 成了你产品的常驻一员，上 **Codex app-server** 管线程、收事件、过审批。一层比一层深，按需取用。

## 进阶

Codex Harness 最迷人的地方在于：它把「大模型落地执行」这件本该很吃工程的事，拆成了三档清晰的积木——exec 管一次性任务，SDK 管程序化控制，app-server 管产品级常驻。你不必一上来就啃客户端协议，先把 CLI 跑起来、让它帮你读个仓库、改个 Bug，等真要嵌进自己的系统时再上 SDK 和 app-server，也来得及。

前提是——它是 2026 年 8 月才开源的新鲜框架，模型访问仍依赖 OpenAI 账号或 API Key，别指望离线白嫖模型本身。但那层「执行系统」现在确实已经摊在你面前，随便看、随便改。

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
