菜单
小墨

小墨

从DeepSeek Harness看大厂为何越来越重视AI测试

2026年8月,DeepSeek发布了首款开源Agent产品DeepSeek Harness,仅用42小时便斩获10万颗GitHub星标,目前星标数已突破15万,成为史上涨星最快的项目之一。MIT许可的开源策略固然是推动因素,但更值得关注的是这一现象背后的方向信号——这是DeepSeek首次从“造模型”正式迈入“造Agent产品”的赛道。社区实测显示,DeepSeek Harness的能力覆盖文件操作、命令执行、检索、技能编排、任务管理和会话管理等场景,并提供标准、PTC、极简、创造等多种运行模式。这意味着AI不再只是答疑解惑的对话助手,而是开始动手执行复杂任务的智能代理。

非确定性:传统测试范式的失效与评估体系的崛起

一个根本性的变化在于:聊天机器人答错一句话是体验问题,而Agent做错一步可能酿成真实事故。质量保障的权重因此完全不同。然而,传统软件测试范式在面对AI产品时正遭遇系统性失效——同样的输入在传统软件中永远产生同样的输出,一套用例可以用很多年;但模型产品不具备这种确定性,同一个问题问两次,答案可能完全不同。

成本:质量问题演变为财务问题

设想一个负责生成测试用例的Agent:这次生成的用例覆盖了优惠券叠加规则,下次可能就漏掉了这条业务逻辑。这种变化速度是人工抽检根本无法追及的。“断言精确值”的测试范式不再适用,质量保障的核心从“测试”转向“评估”——通过多次运行观察输出分布,用基线用例集进行对比,依靠通过率和语义打分来判断能力是否达到发布标准。谁掌握了评估能力,谁就握住了AI产品的发布闸门。这要求测试工程师具备设计评估集、设计统计方法、运用语义评估工具的综合能力。

一个Agent跑复杂长任务,API成本会随任务长度放大,一旦失控打转,烧掉的不只是token,还有用户的信任和耐心。这是质量问题,也是真金白银的经营问题。

“行业观察”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

安全合规:行为可控成为硬指标

社区对DeepSeek Harness的实测也暴露了当前Agent产品的典型短板:响应偏慢、API成本随任务长度线性放大、偶发循环打转。循环打转的问题尤为棘手——它不报错、不告警,只是悄悄消耗token,出现在月末账单时才被察觉。这种“静默浪费”是传统测试中完全不存在的场景,却成为AI产品运营的真实痛点。因此,AI质量保障必须建立“token经济账”意识:单任务平均消耗多少token、哪些行为模式预示即将失控、何时应该触发止损机制。成本回归在传统测试里闻所未闻,在AI产品里却是必修课。

当Agent能够执行命令、操作文件时,它的错误带来的不再是虚拟对话,而是真实世界的副作用。这解释了为何DeepSeek Harness将"Revertible Effects"作为核心设计——对上下文的每次修改都记录反向撤销方法,卸载时按相反顺序回滚。这粒“后悔药”确保了Agent行为的安全边界。更重要的是,当Agent走向自进化——在运行中自行编写和安装插件——行为变化的速度只会指数级加快,审计和回滚能力将成为刚需。金融、医疗等强监管场景已将“行为可审计、可回滚、可验证”写入合规要求,而这些能力的可靠性全靠测试来保障。

如有侵权,请联系删除。

#AI测试#大模型评测#质量保障#DeepSeek
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信