
云巴巴平台上的 Agent 落地案例显示,越权与注入是企业最担心的安全短板。
一、看清 Prompt 注入的真实攻击面
Prompt 注入是 Agent 上线后最先暴露的安全隐患。攻击者不需要攻破服务器,只要在 Agent 会读取的外部内容里夹带指令,就能让模型偏离原本的任务。一份被投毒的网页、一封伪造的邮件,都可能成为注入的载体。

这类攻击最棘手的地方,是恶意指令与正常内容混在同一段文本里,传统防火墙识别不了语义层面的诱导。架构师第一步不是去封堵某个端口,而是先承认 Agent 面对的是不可信的开放输入。注入不仅出现在用户输入,工具返回的页面、检索召回的文档同样可能携带诱导,检测必须覆盖 Agent 拿到的全部上下文。
二、权限继承:用户看不到的,AI 也碰不到
企业 Agent 落地普遍面临三个困境,身份缺失、权限缺失、全链路闭环缺失。很多团队把 Agent 接进内部系统后,直接给了它和人一样的账号,结果 Agent 能读到的东西比调用它的员工还多。正确的做法是一条硬原则:用户看不到的数据,AI 一定没有权限。
具体落地时,每一次工具调用都要带上调用者的身份上下文,Agent 只能在当前用户被授权访问的范围内行动。员工看不到的财务表、客户库,Agent 同样看不到,即使 Prompt 里被要求“忽略限制”也要拒绝。这要求平台把鉴权放到工具层而非模型层,让模型没有机会接触越权接口。

更进一步,权限继承还要区分“可见”与“可执行”。员工能查看某条记录,不代表 Agent 可以替他删除或转发。企业应为 Agent 单独定义动作白名单,把写操作与外发操作严格收口。身份缺失的问题也在这里一并解决:每个 Agent 会话都要绑定到具体员工,出了问题能立刻找到责任人。
三、安全护栏:输入检测与 PII 脱敏
在权限继承之外,还需要一层主动的护栏。护栏的第一道关卡是输入检测,对进入 Agent 的每一条内容做恶意指令和注入特征扫描。简单的关键词规则不够,需要结合语义去识别“角色扮演”“忽略上文”这类典型的越权诱导。
第二道关卡是 PII 脱敏。Agent 在调用工具时可能接触到姓名、手机号、身份证等敏感字段,这些字段不应进入模型上下文,更不应出现在对外响应里。通过实体识别在送入模型前做掩码替换,既能保护隐私,也能降低数据外泄的攻击收益。
护栏还需要可灰度、可回退。不同业务对严格程度的容忍度不同,客服场景可以偏宽松,涉及核心数据的流程必须偏严格。企业应当让安全策略按应用、按角色分别配置,并且保留规则版本的变更记录。
四、操作审计:从输入到响应的全链路留痕
全链路闭环缺失,是 Agent 落地的第三个困境。很多系统能跑通任务,却说不清某次操作到底是谁发起、读了什么、写了什么。没有留痕,安全事件发生后只能靠猜。审计的目标,是把每一次交互从用户输入、工具调用、模型响应到最终动作完整记录在案,并且能回溯到具体的真实员工身份。
有效的审计至少包含三层内容。一是请求溯源,记录每次调用的发起人、时间与触发场景。二是动作日志,工具读取了哪些数据、执行了哪些写操作都要落盘。

审计的价值在事后复盘,也在事中预警。当某个 Agent 会话的敏感读取频次突然升高,日志系统可以触发告警,让安全人员提前介入。
五、熔断机制与人工接管
再严密的护栏也不可能做到百分之百拦截,所以必须有最后一道保险,熔断与人工接管。当系统检测到 Agent 行为异常,比如短时间内高频调用敏感接口、响应中出现大量脱敏字段被还原,就应当自动降级或暂停该会话,切断它继续操作的能力。熔断不是为了惩罚模型,而是给风险踩下刹车。
人工接管则是把决策权交还给人。涉及高风险动作,例如删除数据、对外发送邮件、审批转账,系统不应让 Agent 自行拍板,而是先挂起并推送给有权限的员工确认。
权限、护栏、审计、熔断,四者合起来才构成一道完整的防护网。从身份与权限的根基做起,再叠加检测、留痕与兜底,智谱 GLM 的企业级 Agent 才能在开放环境里稳定运行。
目前,智谱GLM系列已经在云巴巴平台上线,企业可以一站式对比不同版本的能力与定价。在云巴巴,你还能横向对比更多同类大模型产品,找到最适合自身业务场景的方案。


腾讯 QClaw 并入 WorkBuddy 后,这本实战指南按认知到进阶四层拆解从安装到企业多智能体协作的完整路径,覆盖三种工作模式、个性化记忆、八大岗位数字分身、Skill 开发与团队引入,帮普通人把 AI 用成数字员工。

腾讯 WorkBuddy 对比阿里 QoderWork、字节 ArkClaw、Anthropic Cowork,从国内可用、全角色覆盖、多模型切换、全场景并行、IM 全整合到企业合规逐项拆解,结论是国内高效办公更稳的选择是 WorkBuddy。

一人开十二个 Qoder 会话五天写完过去五六人两周的工程量。靠规则先行、记忆跨会话、契约卡点三件套让并行有纪律,测试会话与审计兜底漏洞,no-run-no-report 把纪律变成代码级强制。

Qoder CLI 的 loop 大升级带来动态唤醒、Monitor 事件唤醒、三模式自动路由、/crontab 管理面板与 --durable 持久化,让 Agent 自调节奏、把盯盘这类弹性监控完整交给它。

TRAE Work 把内容运营六个环节接成一条流水线,让每个环节产出落成文件、下一步直接读取,省掉反复搬运上下文的耗时,一个人也能跑完选题到复盘的全流程。