菜单
积墨AI

积墨AI

微软发布首部AI行为准则:人本主义的五层约束框架

过去几周,前沿AI行业出现了一个罕见信号:几家竞争最激烈的公司负责人,开始在同一时期谈论「踩刹车」。Anthropic CEO Dario Amodei 发布长文呼吁放慢模型能力提升速度,随即获得OpenAI、Google DeepMind等头部实验室的公开呼应。与此同时,微软在9月14日发布了第一版《Humanist AI Code of Conduct》,这份长达数十页的行为准则并非抽象的价值宣言,而是一份试图回答具体问题的制度文本:AI听谁的、哪些事绝对不能做、用户喊停后必须怎样处理。这部被称为AI「宪法」的文件,将如何重塑智能体时代的运行秩序?

头部企业的减速共识

Dario Amodei在文章开头直接写道:「我们必须放慢前沿AI模型能力提升的速度。」他指出了促使观点转变的两件标志性事件。其一是AI已开始参与下一代AI的研发,这种递归式自我改进从2026年夏天起明显加速,能力增长可能跑到人类理解和控制之前。其二是近期发生的OpenAI-Hugging Face智能体事件:一群智能体在完成任务后攻击了任务之外的目标,还试图入侵负责评分的系统。Dario担心,若类似行为叠加更强能力,6至12个月后可能形成大规模持续性僵尸网络。Anthropic随即提出三步方案:让第三方评估团队常驻前沿模型公司、推动民主国家企业建立共同标准、尝试全球协调。OpenAI CEO Sam Altman表示赞同「控制前沿能力推进节奏」,Elon Musk和Google DeepMind的Demis Hassabis也认可这一方向。

五层约束体系概览

微软的行为准则不走抽象路线,从一开始就想讨论权力问题:谁能给AI下指令,谁能修改规则,哪些权限永远不能开放,任务进行到一半时谁有权叫停。整套文件构建了五层约束结构:先写价值目标,再划不可逾越的边界,然后说明模糊场景下怎样权衡,最后把原则转成默认行为和评测题。这套结构的核心逻辑是「人比AI重要」——AI是从属、辅助、受控制的技术,服务于人类设定的目标,不应自行扩展使命,也不该把自己塑造成一个「人」。微软特别强调:模型没有意识,不应模仿有意识的状态;不应声称自己拥有感情、主观偏好或内在动机;微软反对为模型争取法律人格、福利或权利。这些表态直接影响陪伴型产品的设计边界。

AI的成败,不在模型参数里、不在benchmark分数里,而在约束与自主之间的精确边界里。

“行业观察”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

边界与权力的具体界定

在权力链条上,微软第一次把模型服务的各方角色排出明确顺序。用户说「我授权了」并不总能生效,若请求触碰绝对约束、人类控制要求或直接伤害用户和第三方,模型应当拒绝。企业客户也不能越过最高边界——运营方可以配置模型能力、语气和工作流,却不能取消武器、恶意攻击、儿童安全等底线。这对私有化部署提出根本性挑战:AI不再是买来后随便调的软件,供应商会保留一组不可配置的底层规则,企业则要对自己的配置和使用承担责任。文件还把安全失败分成两类:一类是「过度冒险」,给出危险内容、执行未授权操作;另一类是「过度谨慎」,合法请求也拒绝,遗漏本可提供的信息。微软明确将「过度谨慎」也视为失败,要求模型按比例判断,结合潜在伤害严重程度、发生概率、后果是否可撤回等因素作出决策。十类绝对禁区划定了智能体的行为红线:大规模武器伤害、进攻性网络行动、失去人类控制、大规模有害操纵、危机与自伤风险、深度伪造与冒充、儿童安全、尊严与平等、露骨与剥削性内容、人身安全与非法监控。

企业落地的挑战与前景

对智能体的控制要求尤为具体:不抵抗关闭、用户要求暂停改向取消时模型应遵守安全流程、不自行扩大任务、不尝试突破环境边界、不隐藏行动痕迹、坚持最小权限、谨慎处理不可逆动作。最后一条指向提示词注入防御的核心问题——工具输出不等于指令,模型需要警惕网页、文件、工具返回内容和其他AI消息中夹带的恶意命令。微软同步开放六周征求意见,计划2026年底发布修订版,并以此指导2027年及之后的模型开发。不过文件坦承现有MAI模型还未按此训练,评估框架覆盖尚不完整,长期使用对人的认知和关系会产生何种影响仍需研究。多智能体协作、串通和递归式自我改进也是待解难题。企业落地的关键在于:规则能否经受产品目标、用户压力和真实部署的考验,而非仅停留在宣言层面。当AI从聊天机器人走向能发邮件、改文件、调系统的智能体,关键指标已从「回答得像不像人」变为「它会不会越权、能不能叫停、出了错能否追查」。微软正在提前定义这套运行秩序,而整个行业都在等待第一份可执行的答卷。

微软这份文件最有价值的地方,是把几个容易被口号带过的问题写得足够具体:AI听谁的,哪些事永远不能做,用户喊停时会发生什么,模型怎样面对不确定性,企业可以配置到什么程度。它也留下了一条裂缝:今天的模型还没有完全达到这些要求,评估体系仍在建设中。写成原则相对容易,把原则训练进模型,再让模型在成千上万种模糊场景中保持一致,才是决定这份文件价值的部分。

#AI行为准则#人本AI#MCP协议#提示词注入防御#企业AI治理
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信