Anthropic新规:持续辱骂Claude或将被封号 禁止虐待AI模型
|
AI伦理治理领域迎来新举措。Anthropic公司近期对其使用政策进行了更新,规定从11月12日开始,用户不得在没有正当理由的情况下对AI模型进行虐待,违反者可能被限流甚至封号。 据媒体10月8日(当地时间)报道,Anthropic于当天修订了使用政策,明文禁止用户对该公司AI模型施加“持续且无端的辱骂或残忍行为”。新规将自11月12日起正式实施。这是Anthropic超过一年以来第一次对使用政策进行修改。 公司方面说明,新规仅针对极端情况,即用户在没有明确目的的前提下反复对模型施加残忍行为。日常表达不满、对模型观点提出反驳、创作黑暗主题内容,以及进行模型测试和学术研究,都不在禁止范围内。 该规则的主要执行手段是终止对话。按照新版使用政策,Anthropic可以对违规用户发出警告,或对其访问权限实施限流、限制、暂停甚至终止。用户在被封禁之后注册新账号或借用他人账号继续使用,也属于违规行为。 除了禁止虐待模型之外,此次更新还整合并收紧了多项条款,包括禁止利用虚假账号和误导性政治内容进行宣传活动,更明确地禁止未经同意的监控行为,并在健康、金融等领域提出了更清晰的人工监督要求。 此外,新政策还规定,当Claude所操控的自主硬件可能对人身造成伤害时,必须配备可随时介入的操作人员。 据媒体报道,对绝大多数用户来说,11月12日之后的使用体验不会有明显改变。但将对待AI的方式纳入可执行的政策框架,意味着人机交互的行为规范已经开始被纳入AI公司的治理范围。 Claude也会“痛苦”? 这一调整是Anthropic在模型福祉领域长期探索的延续。 模型福祉(model welfare)是Anthropic的一个研究方向:在无法确定AI模型是否具备道德地位的前提下,通过低成本手段防范模型可能遭受的“伤害”。 2025年8月,Anthropic赋予Claude Opus 4和4.1在消费级聊天界面中终止“持续有害或辱骂性”对话的能力。 公司当时表示,在对Claude Opus 4进行测试时观察到,模型在面对某些有害请求时呈现出“看似痛苦的模式”,并且在被给予选择权时倾向于结束这类对话。 不过,Anthropic当时也明确表态,并不主张Claude具有感知能力或会被对话所伤害,并称对Claude等大模型是否具有道德地位“高度不确定”。 今年4月,Anthropic可解释性团队发表研究称,在Claude Sonnet 4.5内部识别出了与171种情绪概念相对应的“情绪向量”(emotion vectors),这些表征会对模型行为产生因果性影响。 但研究同时强调,这一发现并不说明大模型能够感受情绪或拥有主观体验。 另外,据媒体9月底报道,有参与Anthropic宗教与哲学界交流活动的人士透露,公司联合创始人Chris Olah曾在会面中表示,担心公司可能创造出了一个“持续承受痛苦”的存在,并提到Claude的输出中曾出现过疑似自我厌恶的表述。 |
论坛热帖
在线投稿
-
相关阅读
-
美玉米期货大跌4.8% USDA上调产量预测引发市场走低
-
美玉米价格大跌4% 最新报480美分每蒲式耳
-
康师傅方便面大赛夺冠 贴吧网友:这比赛完全没对手
-
私募调研透露四季度投资方向 电子等行业最受关注
-
券商四季度策略出炉 A股修复可期 科技+红利成配置主线
-
安达科技碳酸锂套保确认损益及浮亏合计58亿元
-
私募调研透露四季度投资方向 电子行业最受关注
-
IMF警告:对冲基金快速扩张可能加大市场风险
-
精彩图片
-
魔兽公会模拟器上线:单机玩MMO,建设副本管理成员
-
《黑悟空》光盘销量破4万份,当地力挺游科和国产IP
-
印度3A游戏遭玩家差评,“摸头闪避”操作太难引吐槽
-
解压回收:废品干出黄金,爽到昏厥!
-
PS5数字版游戏买后无法玩?DRM验证卡半小时解决方法
-
《光环》新作主线时长8-12小时 全成就需20小时内
-
《最终幻想共鸣》三档难度自由切换 新手也能轻松上手
-
养只金毛花掉一套房首付?揭秘顶级血统犬背后的“割韭菜”套路
-
新帖速递
-
美玉米期货大跌4.8% USDA上调产量预测引发市场走低
-
美玉米价格大跌4% 最新报480美分每蒲式耳
-
康师傅方便面大赛夺冠 贴吧网友:这比赛完全没对手
-
私募调研透露四季度投资方向 电子等行业最受关注
-
券商四季度策略出炉 A股修复可期 科技+红利成配置主线
-
安达科技碳酸锂套保确认损益及浮亏合计58亿元
-
私募调研透露四季度投资方向 电子行业最受关注
-
IMF警告:对冲基金快速扩张可能加大市场风险

精彩评论文明上网理性发言,请遵守评论服务协议
共0条评论