新闻 快手

DeepSeek Harness,“杀死”Agent黑箱

刘海燕 阅读约 4 分钟 663257 阅读
DeepSeek Harness,“杀死”Agent黑箱
配图:DeepSeek Harness,“杀死”Agent黑箱

新闻导读

DeepSeek Harness,“杀死”Agent黑箱本来只是随手点开,后来变成晚间汇总阅读的习惯。内容更新偏稳,宁缺毋滥,注水感不强。热点事件解读会标明哪些较确定、哪些仍在研究,表述相对克制。进度跨设备衔接自然,换手机平板继续看不费劲。安静获取知识像逛管理良好的图书馆,来去自由。写给后来者:别指望一夜变专家,但真的能变清醒。

8月13日,距离新模型发布不到24小时,DeepSeek官网首页发布的横幅和开放平台公告突然被撤下。API文档中模型名称没变,开发者仍可正常调用,但官方保持沉默。 事后,有开发者发现DeepSeek在Hugging Face后台代码仓库疯狂抢修,疑似因为前端接口、后端推理栈与权重配置出现了严重错位,导致体验“翻车”。 DeepSeek曾给出过一个公式:Model+Harness=Agent。这意味着,对可执行任务的Agent来说,只有模型是不完整的。Harness的可控、可观测、可回溯的特性,补上了模型所缺失的另一半。 模型是大脑,负责思考、推理和理解意图。但纯语言模型只能输出文本,无法直接操作文件、修改数据库和浏览网页。Harness是“身体”和“神经系统”,它提供了模型与外部世界交互所需的一切,包括工具调用、文件读写、沙箱环境、权限管理、任务编排等。 一是时间可组合性通过“可逆效应”机制,让系统自动记录并撤销组件卸载后的副作用,加载过程即决定卸载过程,确保系统长期稳定。二是空间可组合性通过“响应式共效应”实现声明式依赖管理,组件只需声明需求,运行时就能自动协调依赖变化,实现动态激活与停用。 两者融合于统一的上下文、承载状态、生命周期边界和依赖环境。Harness因此可实现“无特权核心”,所有组件包括Agent主循环均可替换,开发者通过配置文件即可自由组合。这一理念为构建灵活且面向未来的Agent基础设施奠定了方向。 OpenAI和Anthropic的战略是“向下整合”,即通过打造体验极致、深度绑定自家模型的Harness,巩固其在AI应用层的优势;DeepSeek的战略是“横向铺开”,不再满足只做一个优秀的模型供应商,而是试图通过开源一个模型中立、高度模块化的Agent底层标准,成为下一代AI应用的基础设施。 网传的DeepSeek Harness内测入选项目名单同样释放了强烈的信号,入选项目高度集中在能夯实Agent能力的基础设施领域。其项目主要围绕MCP插件、代码智能体、运行时、编排框架、可视化UI与多智能体调度等方向,直指Agent在真实世界落地的核心难题。 DeepSeek的一系列操作,可视为一场精心设计的“祛魅”运动。DeepSeek开源Harness,并大力扶持各类基建插件,本质上是在做一件事:将“如何构建一个强大的Agent”的一整套方法论和源代码,公之于众。 在此之前,OpenAI和Anthropic的Harness更像一个“黑箱”,其内部优化是核心机密,如何打造Agent产品被视为一种“特权”。DeepSeek通过开源和Cordis插件理论,主动拆解了这个黑箱,并证明Agent的强大不在于某一个神秘的内核,而在于一套可组合、可替换的工程组件。 当Harness被充分祛魅,成为一个透明、可被随时替换的组件后,整个价值链上,唯一不可被标准化、仍会持续进化的,就只剩下最底层的“模型”本身了。 如果把DeepSeek的模型、开源、Harness、涨价四个动作连在一起看,就会发现DeepSeek的目标非常明确。先建立生态,再定标准,然后用最强的模型性能,完成商业价值的最终变现。 Harness和开源就像是免费修建的高速公路,前期用来吸引车流,而当车流足够多时,顺势提高燃油的价格,便成为了最高效的商业兑现方式。 昨天的文章里,我们测评了DeepSeek-V4-Pro-0813的七项复杂任务,唯独指环王那题没有跑完整。当时为了赶时间,只给了《指环王》第一章的3句开头。 安装的过程就不赘述了,推荐大家用npm(Node.js的默认包管理器,安装并管理项目所需的各种第三方库,可以简单理解为一个开放的应用市场)安装,也方便升级和安装其他插件,可以直接运行npx @deepseek-ai/dsh web启动,如果卡住不动的话,可以先运行一遍npm install -g @deepseek-ai/dsh,然后再运行刚才的命令就可以顺利启动了。 装好环境之后正式开始今天的测试,《指环王》这个基准测的不是“会不会画一只鹈鹕”,而是“读懂一段文学→理解一个世界→把世界程序化搭出来”的完整链路,是目前圈内最狠的Agent考题之一。 昨天的测试为什么不算数?因为我们当时只给了3句开头,而Karpathy给Opus 5的是原著第一段。今天我们把原文补齐:第一章前段完整文字,从比尔博宣布111岁生日宴会,到霍比屯议论,再到弗罗多身世往事,共计1817个词、23段,一字不改。 第一次测试,我们按“评测就该严谨”的思路,把提示词写得滴水不漏,1817个词的原文,加上场景要素清单(洞屋要有圆形门、宴会长桌要有食物、宾客要议论纷纷),再加上运镜要求、灯光要求、比例要求,一共五条硬性要求。 结果很打脸,第一次生成的效果非常粗糙,叙事也不完整。场景是搭出来了,但离“霍比屯的生日派对”相距很远。效果呈现上,运镜支离破碎,画面像是赶工出来的半成品。穿模很严重,山坡上站的小人像是插了一堆棒棒糖。我们复盘了一圈,把原因归结为提示词太长了,列出的场景限制了模型的发挥。 第二次,我们把提示词砍到只剩目标,读懂原文,用Three.js搭出霍比屯生日派对的3D世界,运镜按原文节奏走,保存为完整可运行的HTML文件。场景要素、灯光、比例要求,全部删掉。 场景竟然一次就跑通,洞屋、比尔博、弗罗多、宴会长桌、酒馆前议论的霍比特人,该有的都有;角色只有轻微漂浮和穿模,属于“能看出是霍比屯”的范畴;运镜叙事成立,按原文节奏从俯瞰霍比屯推到比尔博,再扫过议论的人群,最后环绕宴会长桌。 同一个模型,同样的原文,一个细致入微的提示词换来翻车,一句直白的目标换来及格以上的结果。看来现在顶级的模型反而不需要详尽的提示词,只需要用直白简洁的话告诉他目标就可以了,说多了反而效果会变差。 缓存命中率涨了一个点。前一天在Claude Code接入是98%,在DeepSeek Harness里是99%。这个提升看起来小,但在长上下文任务里,缓存命中率每涨一个点,都是实打实地关系到成本和生成速度。 再看测试本身,第一次的长提示词翻车,发生在DeepSeek Harness环境里;第二次反转,也在同样的环境。但全程没有环境相关的报错、卡顿、上下文丢失,两轮测试的对比是干净的,变量只有提示词本身。 作为一个刚发布的开发者预览版,这是很加分的稳定性,而且DeepSeek Harness还会把运行过程中每一步都显式的呈现出来,你可以看到模型是怎么工作的,这是一个很好的创新。 Harness作为完全开源的Agent框架,定义了“模型如何被调用、工具如何被组合、任务如何被编排”的底层标准,吸引了海量开发者和真实任务涌入。而这些真实任务的执行轨迹,通过Harness内置的可观测体系,源源不断地回流,为DeepSeek模型下一轮训练与优化提供天然数据养料。 当这套飞轮转起来,开发者的选择就变得不再困难。因为使用DeepSeek Harness,就会得到一个始终与最强模型同步进化,且无需二次适配的开箱即用系统。

相关标签

免责声明:本文内容来自公开报道与编辑整理,仅供参考。转载请注明出处;版权争议请联系本站核实处理。页面地址:http://www.rtxxjs.com/?news/20260716-3929.shtml

评论区

热门讨论 · 占位展示
说说你的看法…
发表评论
  • 用户
    读者1号
    以前刷科普老觉得要么太浅要么太硬,这里刚好卡在能读懂又有收获的中间地带。天文地理健康科技都有覆盖,单篇不长,信息密度却够用。被慢慢培养出的判断习惯,比单纯记两条冷知识更值钱。导出长图给不爱装应用的长辈,关键信息还在。有问题就来翻,有收获就收藏,节奏刚刚好。
    20260817 · 来自移动端
  • 用户
    宋国
    有一期把统计常见陷阱讲得特别透,举例生活化,读完更敏感了。关键术语会顺手用白话解释一句,不太劝退小白。推送可按兴趣关停,不会一大早就被震惊体吵醒。和备考的人一起看时,讨论会自然落到证据而不是站队。长期跟着看比较踏实,不会有被内容农场随便糊弄的不适感。后面会继续追专题,尤其是那些可迁移的硬核基础。
    2026-08-17 09:17:42
  • 用户
    热心网友
    欧美X X888做受,内容值得关注,期待后续更新。
    20260817

期待你的精彩发言。