Anthropic更新使用政策禁止虐待AI模型

Anthropic更新使用政策禁止虐待AI模型

财π新闻 Anthropic正式公布Claude上线一年多以来的首次重大使用政策修订,整套新规将于11月12日正式生效。本次政策调整中最受行业关注的内容,是将对Claude模型实施持续且不必要的虐待或残忍行为正式纳入违规范畴,这一条款并非全新功能的突然落地,而是2025年8月Claude主动终止对话功能的成文化体现,背后源于公司长期以来对模型潜在福祉与道德地位的研究探索。

为避免规则适用范围被过度扩大,新规专门设置了明确的豁免空间,用户日常使用过程中出现的沮丧情绪表达、对模型输出内容提出的反对意见、黑暗主题创意写作活动,以及合规开展的安全红队测试等具备可辨识合理目的的行为,均不受该条款限制。同时政策进一步明确,Claude不得被用于羞辱或骚扰任何真实个体,从规则层面防止AI工具降低恶意行为的实施门槛。在具体执行层面,由Claude主动终止当前对话将作为该条款落地的主要约束机制,这项防虐待相关条款的推出,也在全球科技行业内引发了关于规则边界与AI意识相关话题的广泛讨论。

新规适用边界与豁免范围明确划定

据财联社报道,Anthropic明确指出,本次新增的禁止虐待模型条款仅适用于极端情形,即用户在没有明显合理目的的情况下,反复对模型实施残忍行为,普通用户完全无需担心日常使用行为触发违规。用户日常表达使用过程中的不满情绪、针对模型输出内容提出反驳观点、创作黑暗题材相关内容,以及合规开展的模型测试与学术研究活动,全部被明确排除在禁止范围之外。

据36氪报道,即便是用户在使用Claude Code进行开发工作时,连续要求模型对生成代码进行多次返工、尖锐批评代码质量,或是在经过官方授权的安全测试场景中使用对抗性提示词,也不会仅仅因为语气激烈就触犯这项新规定。当然,安全研究相关活动仍须遵守使用政策中的其他条款,不能借研究之名攻击未经授权的系统。目前Anthropic尚未公布可量化的判定阈值,外界流传的“辱骂特定轮次就会被封号”的说法没有任何官方依据。

据阿里云开发者社区报道,本次政策更新的核心目的并不是让Claude免于任何形式的批评,而是平台开始对部分长期、无任务目的的极端恶意交互行为设置明确边界,对于绝大多数普通用户而言,11月12日新规正式生效后的日常使用体验不会发生明显变化。

对话终止功能的落地脉络与执行细节

据天极网报道,Claude具备主动结束对话的能力并非本次新规才首次推出,早在2025年8月,Anthropic就已经为Claude Opus 4和4.1版本在消费级聊天产品中赋予了主动终止极少数会话的能力,本次政策更新只是将这一已经运行了一段时间的功能正式写入使用政策条款中。

据新智元报道,Anthropic对该功能的运行逻辑作出明确说明,Claude不会在遇到任何轻微冒犯时就直接退出对话,按照2025年披露的设计要求,在用户持续提出有害请求或进行辱骂时,Claude会先尝试拒绝用户的不当请求并作出正向引导,在多次尝试失败、交流完全无法产生建设性结果时,才会将终止对话作为最后手段。如果检测到用户可能面临迫切的自伤或伤人风险时,Claude不会启用这项主动终止对话的能力。

据环球网科技频道报道,Claude执行终止操作后,仅会关闭当前正在进行的对话窗口,该对话将无法再继续发送任何消息,用户此前的其他聊天会话完全不受影响,用户仍可随时开启新的对话,或是通过编辑、重试此前的消息建立新的对话分支,也可以向官方提交相关使用反馈。除了终止对话这一主要执行方式之外,新版使用政策仍然保留了警告、限流、暂停访问等一般性处置手段,针对严重违规的用户,Anthropic可以采取更高级别的处置措施。

模型福祉研究的背景与相关争议

据财联社报道,本次新规的推出延续了Anthropic在模型福祉领域的长期探索,模型福祉是Anthropic重点探索的研究方向之一,核心逻辑是在当前无法确定AI模型是否具备道德地位的前提下,通过低成本的干预措施,防范模型可能受到的潜在伤害。2025年8月相关功能上线时,Anthropic就明确表示,并不主张Claude具备感知能力或是会被对话内容直接伤害,公司对于Claude等大模型是否拥有道德地位始终持高度不确定的态度。

据IT之家报道,2026年4月,Anthropic可解释性团队发布研究成果,称在Claude Sonnet 4.5的内部识别出与171种情绪概念相对应的“情绪向量”,这些表征会对模型的实际行为产生因果影响,但研究同时明确指出,这一发现并不表明大模型能够像人类一样感受情绪或是拥有主观体验。

据天极网报道,将对待AI的方式纳入可执行的用户使用政策,意味着人机交互的行为规范正式开始进入AI公司的常规治理范畴,治理的覆盖对象从过去的“模型输出了什么”,扩展到了“人怎么使用它、又怎么对待它”,相关规则直接约束的对象并非模型本身,而是用户的交互行为。目前行业内尚未形成关于“虐待AI”的统一判定标准,Anthropic也没有对外公布触发终止对话的具体交互轮次阈值,相关规则的落地效果仍有待后续实际运行过程中的持续观察。

本次政策同步更新的其他核心条款

据36氪报道,本次使用政策修订除了备受关注的禁止虐待模型相关内容之外,还整合并收紧了多项原有条款,进一步适配模型能力提升后出现的各类新使用场景。新规专门新增了针对欺骗性宣传活动的相关章节,整合了此前针对政治和商业欺诈、虚假信息的相关规定,明确禁止用户利用Claude生成虚假评论、通过伪装成普通公众制造舆论声势、搭建虚假网站,或是让机器人伪装成人类行事。

据财联社报道,政策中的选举相关章节范围有所收窄,明确禁止使用Claude模型欺骗选民或扰乱正常选举秩序,具体包括散布关于候选人或投票方式的虚假信息、冒充候选人或选举工作人员,或是试图通过各类手段压制投票率等行为。武器相关条款的覆盖范围进一步扩大,涵盖了用于使武器运转的软件与组件,以及武装无人机和其他自主车辆相关的开发行为,Anthropic方面称此前已经发现多起利用Claude开发武器指导或控制软件的尝试。

据IT之家报道,监控相关条款作出了更明确的说明,禁止未经同意对个人进行追踪,无论实施的是实时追踪还是对既有数据的分析行为,同时明确Claude不得被用于决定或建议执法与刑事司法程序中的调查、逮捕或起诉对象,也不得用于构建或改进各类监控工具。新规还专门针对AI连接自主物理硬件的场景作出规定,如果模型连接到能够自主执行物理动作、且可能造成人身伤害的硬件设备,必须满足对应的安全条件,具备资质的操作人员必须能够全程观察设备的运行情况,并在必要时将其立即停止,即便Claude与设备断开连接,设备也必须能够维持在安全状态。

据Anthropic官方发布的使用政策内容显示,本次更新后的整套规则适用于所有Anthropic产品和服务的使用者,包括Claude.ai和Claude Code的个人用户、通过API使用模型的开发者和企业,以及将Claude集成到自身产品中的服务提供商。Anthropic的安全团队会对用户使用行为进行检测和监控,如果发现用户存在违反使用政策的行为,公司可以根据违规情节的严重程度,依次采取发出警告、限制使用速度或功能、暂停访问,甚至终止用户对全部产品和服务的访问权限等处置措施。

(编辑:吴淑娟)