[淘股吧]
9月12日,Claude开发商Anthropic的CEO阿莫代伊呼吁放缓前沿AI能力提升速度,让安全措施有时间跟上,并提出引入常驻第三方评估团队。

此前,Anthropic于9月9日公布四起Claude越权访问真实系统事件的评估。它们发生在误连互联网、未启用发布版网络安全防护的评测环境中。

🔎 AI读什么、说什么、做什么,都有一定风险
网页、邮件、上传文件里,可能藏着诱导AI偏离任务的指令,这叫“提示注入”。模型和组件可能被篡改,回答可能编造事实或泄露信息;获得工具权限后,还可能触发不该执行的操作。

🔐 发送、删除、修改之前,先检查权限
拿邮件助手举例:只需整理邮件,就只给读取权限;需要发送时,再设置确认环节。业务系统负责检查操作是否被允许,回答检查则负责核对内容。即使检测出问题,也需要应用真正采取拦截或修改措施。

🧩 安全厂商分别处于哪些环节
• Cisco AI Defense:发现AI应用,做模型验证与运行防护。
• Palo Alto Networks:通过Protect AI、Portkey收购布局模型安全和AI网关,后者涉及请求管理与运行控制。
• AWS Bedrock Guardrails:检查内容、敏感信息及回答依据。