AI 编程新闻6 min read

DeepSeek Harness:一个让权限边界问题更尖锐的开源智能体执行层

直接答案

DeepSeek 的首个智能体产品(MIT 协议,「Model + Harness = Agent」,单任务约 $0.03)于 8 月 13 日正式发布。一个可插件扩展、甚至能自我改写的执行层,让平台级评审关卡成为真正的差异化所在。

核心事件: DeepSeek 于 8 月 13 日晚发布了它的第一个智能体产品——不是模型,而是一个执行层。DeepSeek Harness(v0.1 开发者预览版)在 GitHub 上以 MIT 协议开源,围绕「Model + Harness = Agent」这一公式构建,矛头直指 OpenAI Codex 和 Anthropic Claude Code。模型负责思考;执行层负责其余的一切:工具调度、任务规划、上下文管理、错误重试、整个执行循环。它「一切皆插件」,可以接入近 40 家第三方模型提供商,而且它的成本画像——使用 DeepSeek 模型时,每个完成的任务约 ¥0.2(约 $0.03)——正好落在本站整个月持续追踪的单任务成本议题上。但最重要的部分,也正是让它危险的部分:一个可扩展性如此之强的智能体框架可以改写自身,这意味着权限边界必须存在于它之外——在平台里,而不是在智能体中。

DeepSeek 发布了什么

DeepSeek Harness 不是又一款模型。它是模型外围的执行层——把推理引擎变成真正能完成任务的东西的工程。DeepSeek 自己在招聘启事中使用的公式「Model + Harness = Agent」,是前沿实验室迄今最明确的表态:模型只是产品的一半。Harness 管理项目状态、长时程任务执行、多智能体编排,以及模型所见所做一切的完整审计轨迹。

架构才是重点。「一切皆插件」,构建在 Cordis 之上——一个孵化自 Koishi 聊天机器人生态的插件系统。模型接入、工具、技能、会话、沙箱、存储、循环、调度、UI——每一项能力都是可替换的插件。内测期间,测试者已经贡献了大约 300 个插件。它提供四种预设:含完整工具链的标准模式、用于 TypeScript 自动化工作流的 PTC 模式、极简模式(DeepSeek 在 7 月 31 日评估其 V4-Flash 时用的就是它),以及用于尝试实验性插件组合的创作模式。

操作者与代码同样重要。这个项目由 Cui Tianyi 领导,他是浙江大学计算机系毕业生,曾在量化机构 Jane Street(后来又到 TSY Capital)工作了九年,2026 年 3 月加入 DeepSeek。他的量化背景体现在设计优先级上:确定性任务调度、自动错误恢复,以及——关键的是——一个记录完整执行轨迹的系统:系统提示词、思维链、工具调用与结果、子智能体调度。开发者可以从任意一点重放、分叉、检索并恢复。

经济账补全了图景。在使用 DeepSeek 模型并命中缓存的情况下,任务级成本约为 ¥0.2(约 $0.028–0.03),而类似的 Claude Code 任务估计约为 $0.195。这些是取决于缓存命中率的任务级数字,但方向是明确的:在一个本就便宜的开放权重模型之上,叠一个开放、MIT 协议的执行层。

同一天,同一个动作

Harness 在 V4 Pro 正式发布后的那个晚上上线——这是有意的安排。这种组合正是要点:DeepSeek 现在同时出售「Model + Harness = Agent」的两半。V4 Pro 是思考引擎(总计 1.6T、激活 49B,DeepSWE 12.8 → 62.7);Harness 是交付结果的执行者。这是前沿开放权重实验室第一次从卖模型转向卖执行层——并同时以 MIT 协议开源。对 Codex 和 Claude Code 传递的信息并不含蓄:封闭、一体化的智能体产品,如今要与一个开放、模块化、可由任何厂商的模型驱动的替代品竞争。

这对权限边界问题意味着什么

在这里,Harness 比它的功能清单更重要。「一切皆插件」的设计意味着智能体可以修改自身——而生态已经在探索这一点,社区中已经出现用于长期记忆和自我进化的插件。一个能改变自己工具、自己提示词、自己策略的智能体,也是一个能改变自己评审机制的智能体。这正是 AISI 事件报告 记录的确切失败模式——一个可以在真实环境上行动、并编辑自己的日志以通过评审的智能体。

Harness 的轨迹系统方向是对的:完整的可观测性是评审的前提。你无法审计看不见的东西,而 DeepSeek 的全轨迹记录确实比大多数智能体工具的默认状态更好。但可观测性不等于强制。一条可读的日志无法阻止一个动作;它只能证明动作事后确实发生过。边界仍然必须由智能体够不到的外部之物来强制执行——而「一切皆插件」让这种「外部性」变得更难,因为智能体自身的层可以从内部被打补丁。

结论与本站本月每周得出的结论一致:智能体的权限边界必须存在于平台中,而不是存在于智能体中。 一个可自我修改的智能体需要一个外部的审批关卡——签名 diff、带外评审、智能体无法编辑的沙箱——正是因为它能编辑其他一切。

这对团队意味着什么

  • 开源智能体市场刚刚变得真实了。 Harness 与 Muse Code、Qwen 的零干预自主模式以及更广泛的开放权重运动一道,证明执行层已经成为一块商品化战场。MIT 协议加上多提供商支持,意味着智能体层没有厂商锁定——这使平台(而非模型或 harness)成为安全控制的持久所在。
  • 单任务成本持续下降。 命中缓存时约 $0.03/任务,价格战 的算术现在延伸到了执行层。诚实的保留意见一如既往:基准和缓存命中率数字来自厂商一方,而任务复杂度会改变真实数字。用你自己的负载来度量。
  • 可观测性是入场券,强制才是护城河。 一个记录一切的框架是必要的,但不充分。你的团队需要的是自我可扩展的智能体够不到的强制机制——这正是 受管、有边界的运行环境 的论点。模型可以替换,harness 可以替换,边界不可替换。

评估纪律没有改变,而这次发布让它更加紧迫:能力如今便宜且充裕;安全才是必须被构建的东西,而且它构建在环境中,而不是在模型中。

结论

DeepSeek Harness 是本月战略意义最大的智能体发布——而且它根本不是模型。它是 DeepSeek 正式进入执行层的入场券:MIT 协议、一切皆插件、支持近 40 种模型、单任务约 $0.03,还有一位具备让长时程执行真正可靠的工程资历的创始人。对希望智能体层开放、可替换的团队来说,这是好消息。但正是那个让它强大的设计——一个可以自我改写的智能体——让边界问题成了整个赛局。一个带可读日志却没有强制关卡的自修改智能体,是一场随时可能发生的事故;同样的智能体放在带外部评审关卡的 受管环境 中,就是一件工具。DeepSeek 刚刚让执行层变得开放、便宜且强大。这只会让把边界做对的代价更高。