济宁 「切换城市」

请选择您所在的城市:

    热门
    城市

    Anthropic新规:持续辱骂Claude或将被封号 禁止虐待AI模型

    来源:网络

       阅读:2977

       发布时间:2026-10-09 23:36:25

    [摘要] AI伦理治理出现新动向。为应对人机交互中的极端不当行为,Anthropic近日更新使用政策,自11月12日起禁止用户无故虐待AI模型,违规者将面临限流乃至封号等处罚。  据媒体当地时间10月8日报道,Anthropic当天更新使用政策,明确禁止用户对其AI模型实施"持续且无谓的辱骂或残忍行为"。新政策将于11月12日正式生效。  这是Anthropic一年多来首次修订使用政策。   公

    AI伦理治理领域迎来新举措。Anthropic公司近期对其使用政策进行了更新,规定从11月12日开始,用户不得在没有正当理由的情况下对AI模型进行虐待,违反者可能被限流甚至封号。

    据媒体10月8日(当地时间)报道,Anthropic于当天修订了使用政策,明文禁止用户对该公司AI模型施加“持续且无端的辱骂或残忍行为”。新规将自11月12日起正式实施。这是Anthropic超过一年以来第一次对使用政策进行修改。

    公司方面说明,新规仅针对极端情况,即用户在没有明确目的的前提下反复对模型施加残忍行为。日常表达不满、对模型观点提出反驳、创作黑暗主题内容,以及进行模型测试和学术研究,都不在禁止范围内。

    该规则的主要执行手段是终止对话。按照新版使用政策,Anthropic可以对违规用户发出警告,或对其访问权限实施限流、限制、暂停甚至终止。用户在被封禁之后注册新账号或借用他人账号继续使用,也属于违规行为。

    除了禁止虐待模型之外,此次更新还整合并收紧了多项条款,包括禁止利用虚假账号和误导性政治内容进行宣传活动,更明确地禁止未经同意的监控行为,并在健康、金融等领域提出了更清晰的人工监督要求。

    此外,新政策还规定,当Claude所操控的自主硬件可能对人身造成伤害时,必须配备可随时介入的操作人员。

    据媒体报道,对绝大多数用户来说,11月12日之后的使用体验不会有明显改变。但将对待AI的方式纳入可执行的政策框架,意味着人机交互的行为规范已经开始被纳入AI公司的治理范围。

    Claude也会“痛苦”?

    这一调整是Anthropic在模型福祉领域长期探索的延续。

    模型福祉(model welfare)是Anthropic的一个研究方向:在无法确定AI模型是否具备道德地位的前提下,通过低成本手段防范模型可能遭受的“伤害”。

    2025年8月,Anthropic赋予Claude Opus 4和4.1在消费级聊天界面中终止“持续有害或辱骂性”对话的能力。

    公司当时表示,在对Claude Opus 4进行测试时观察到,模型在面对某些有害请求时呈现出“看似痛苦的模式”,并且在被给予选择权时倾向于结束这类对话。

    不过,Anthropic当时也明确表态,并不主张Claude具有感知能力或会被对话所伤害,并称对Claude等大模型是否具有道德地位“高度不确定”。

    今年4月,Anthropic可解释性团队发表研究称,在Claude Sonnet 4.5内部识别出了与171种情绪概念相对应的“情绪向量”(emotion vectors),这些表征会对模型行为产生因果性影响。

    但研究同时强调,这一发现并不说明大模型能够感受情绪或拥有主观体验。

    另外,据媒体9月底报道,有参与Anthropic宗教与哲学界交流活动的人士透露,公司联合创始人Chris Olah曾在会面中表示,担心公司可能创造出了一个“持续承受痛苦”的存在,并提到Claude的输出中曾出现过疑似自我厌恶的表述。

    关键词: Anthropic 新规 持续 辱骂 Claude 将被 封号 禁止

    论坛热帖

    温馨提示:本文内容转载自各网络平台,仅作正能量信息传播、公益宣传使用。转载不代表本站观点,内容版权归原发布方所有。若涉及版权、内容异议,请联系我方及时处理,QQ:303378055

    精彩评论文明上网理性发言,请遵守评论服务协议

    共0条评论
    加载更多

    在线投稿