AI 再强大,也需要人类经验来补足短板。Ford 因为过度依赖 AI 质检失败,不得不重新聘回 350 名资深工程师,这才让质量重回正轨。
Anthropic Workshop:构建可运行数小时的 Agent
主讲:Ash Prabaker、Andrew Wilson(Anthropic Applied AI Team)
原视频:https://www.youtube.com/watch?v=mR-WAvEPRwE
概括
这场 workshop 讲的是:长时间运行的 Agent 不是只靠更强模型实现的,而是模型能力与外部 harness(脚手架、调度、记忆、评估、工具、权限、状态管理)共同演化的结果。
讲者以 Claude Code / Agent SDK 的演进为主线,解释了为什么 Agent 过去只能稳定工作十几分钟,而现在可以通过更好的模型、上下文管理、子 Agent、检查点、文件状态、评估器和自动化测试,持续完成数小时级复杂任务,例如从一句话 prompt 构建一个完整 Web App。
这场分享要解决的问题
长期运行 Agent 的难点主要集中在三个方面:
1. 上下文问题
Agent 的上下文窗口有限。随着任务变长,会出现:
- 上下文遗忘:新会话像失忆一样,需要重新建立任务状态。
- 上下文腐化:会话越长,模型对早期目标和约束的把握越容易漂移。
- 上下文焦虑:接近上下文窗口末尾时,模型可能急于“收尾”,导致半成品被误判为完成。
2. 规划问题
模型默认并不总是擅长长期规划。它可能...
Codex Remote 工程实践介绍
核心观点
移动端最有价值的能力不是复制桌面,而是让关键决策变得快速、清晰且安全。
Codex Remote 的价值体现在几个方面:
- 控制执行环境:在任务开始前选择主机、仓库、分支、workspace 或独立 worktree,避免后续清理混乱的 Git 状态。
- 明确任务边界:通过 Plan mode、Goal、附件、技能和插件,让 Codex 在正确上下文中工作。
- 区分 Queue 与 Steer:Queue 适合排队后续任务,Steer 适合在当前运行中及时纠偏。
- 用 side chat 分离思考支线:主线程继续推进工程任务,side chat 用来解释错误、讨论架构或生成发布说明。
- 在移动端完成轻量代码审查:查看 changed-file summary、打开 diff、添加 inline comments,并让 Codex 在同一线程中修复。
- 把权限审批纳入工作流:对命令、文件修改、网络访问和连接工具进行细粒度审批,尽量使用最小权限。
- 管理长期上下文:使用 /status
、/compact、/fork等命令保持线程聚焦,避免长期会话变慢或跑偏。
关键功能速览
| 功能 / 命令 | 用途 | | ----------------...