从 coder 到 designer:电商团队数据研发的 Harness Engineering 实践

2026年7月16日

47

759

从 coder 到 designer:电商团队数据研发的 Harness Engineering 实践

随着大模型技术的快速发展,AI 在数据研发领域的应用成为企业提升效率的重要方向。然而,许多团队在落地 NL2SQL、ChatBI 等方案时发现,垂直领域的单点突破虽然效果显著,却难以横向拓展为通用解决方案。核心挑战在于两个方面:一是现有平台能力缺少标准化接口,其他业务接入时因业务特性差异,只能发挥约三成的效能;二是 NL2SQL 的准确度强依赖于语义层的数据资产质量,而不同团队各自为政,缺乏统一的语义组织标准。问题的本质归结为:数据研发的知识是碎片化的,流程是非标准化的。

语义层:NL2SQL 的核心基础设施

基于这一认知,我们认为数研工作范式的升级需要双引擎驱动——知识工程解决「AI 凭什么能做对」的问题,将数研专家的经验、业务规则、数据资产转化为 LLM 可理解的结构化知识体系;Harness Engineering 则解决「AI 如何稳定运行」的问题,为 AI 智能体构建系统化的管控框架,确保在长程复杂任务中稳定、安全、可回溯地运行。

Multi-Agent 协同工作流架构

语义层解决的是 NL2SQL 中最关键的一步:从自然语言到精确数据语义的映射。直接让自然语言转 SQL 成功率很难提高,因为自然语言中缺少太多关键信息。因此我们引入「语义层」,走 NL2DSL2SQL 的路线——先将自然语言映射到标准化的指标-维度语义,再从语义生成 SQL。语义层建设面临两大核心挑战:指标命名混乱影响 AI 效能,以及数据资产在使用过程中会持续劣化。针对指标歧义问题,我们采用先治理再录入的原则,由核心数研专家负责核心指标资产的数据建模和注册,后续注册的指标语义资产需经过确认才能录入。同时构建资产防腐双循环机制——上线前由数仓小组拦截语义重复资产,上线后通过定期资产健康度评估,动态清理冗余资产,保证语义资产层的质量。

知识工程确保 AI「做对事」,Harness Engineering 确保 AI「稳定做事」,两者协同构成数据研发 AI 化的完整技术底座。

“技术实践总结”
🦞

JimoClaw — 桌面 AI Agent 工作台

让 AI 处理本地资料、操控浏览器,最终交付可直接使用的文档、表格与 PPT,而不只是一段回答。

下载桌面版

知识工程:构建三层架构

知识工程的核心是将数研专家的「数据研发思路和经验」转化为 LLM 易于理解的结构化知识。我们设计了三层架构:方法论层通过 Spec 指导需求分析、Plan 规范技术方案、Task 定义执行标准,形成「文档即接口」的多 Agent 协同机制;协作机制采用文档状态机驱动八阶段研发流程,结合人工校验形成「需求经验沉淀-能力提升-效率提升」的飞轮效应;关键技术组件包括记录协作规范的 AGENTS.md、执行核心操作的 Skills 引擎、以及沉淀研发经验的 Knowledge 库。知识工程最重要的是「知识是否在持续生长」。我们设计的闭环机制确保每一次研发过程本身就是一次知识生产——每完成一个数据需求,过程中产出的 SPEC、PLAN、SQL、验证报告都自动归档,新增的指标定义自动进入语义资产库,踩过的坑记录到 anti-patterns.md。这样,团队的知识资产随着项目推进自然增长。

Harness Engineering:确保 AI 稳定可控

当模型能力不再是瓶颈,决定 AI 智能体性能上限的,是围绕模型构建的整套外部系统。Harness Engineering 通过以下手段实现管控:分离关注点,将「决策」与「执行」分离,将「知识检索」与「代码生成」分离;施加约束,通过 Gate 机制、规范校验、强制审批限制 AI 的自由度;管理上下文,控制每个 Agent 的信息输入量避免过载;管理熵值,在长程任务中持续「整理」和「矫正」防止行为漂移。稳定性是 Harness Engineering 最核心的设计目标。幻觉是 AI Agent 最危险的问题。我们建立了技能幻觉检测 Hook,在每次技能执行后自动对比 Agent 声称的执行结果与实际的系统状态;所有关键操作必须产出可验证的产物,仅凭 Agent 的文本回复不能作为任务完成的依据。此外,通过独立 Workspace 空间隔离、严格的命名规范、以及配置文件自动化 Git 备份,确保系统稳健运行。

🛡️

积墨 AI 安全隐患巡检系统

任务一键下达 · 隐患 AI 识别 · 整改全程留痕 · 报告一键生成。让安全巡检真正看得见、管得住、能闭环。

了解方案

如有侵权,请联系删除。

Related Articles

联系我们 试用咨询
小墨 AI