群发资讯网

看懂AI安全更新,别把回退减少写成边界取消Anthropic 8 月 7 日公布

看懂AI安全更新,别把回退减少写成边界取消Anthropic 8 月 7 日公布了一项生物安全机制更新。在它的内部测试中,产品端与生物相关的模型回退减少约 85%。这句话有三个容易混淆的层次。第一,回退不等于拒答。这里的回退,是系统把部分请求转给另一模型处理。它描述的是路由机制,不是所有请求都被直接拒绝。第二,减少回退不等于取消边界。日常健康和教育问题预计会少一些误触发,但涉及专业生物、药物研发的双用途问题,仍可能回退到 Opus 5。第三,安全优化不只是多拦。分类器既要避免漏掉高风险请求,也要减少把良性问题拦错。Anthropic 这次重写分类器规则、更新训练数据,并加入专家反馈,目标是提高判断精度。所以,“约 85%”是 Anthropic 的内部测试结果,不应写成所有用户都会获得同样改善;“精拦”也是我的编辑解释,不是官方术语。更成熟的 AI 安全,不是把更多问题挡在门外,而是更准确地知道什么时候该放行,什么时候必须收紧。你更在意 AI 少误拦,还是高风险场景不漏拦?大模型人工智能生成式AIAI安全