随着9月2日Anthropic推出Fable 5.1,新一轮的大蒸馏时代宣告结束。此次更新彻底修改了API规则,切断了企业通过API获取顶尖模型推理流程、进而训练自己“小模型”的途径。过去,许多公司借助顶尖模型的推理过程来节省资源,但从今天起,这种方法将不再可行。
Fable 5.1以其严格的反蒸馏机制引起关注,关键在于锁住了“思考块”。这个“思考块”指的是AI在得出最终答案之前所进行的推理过程。Claude在进行推理时,会以“思考块”的形式向用户返回这些步骤。而在多轮对话中,开发者需要把这些思考块与系统提示、工具和历史消息一起发送回Claude,以保持上下文的连贯性。这个机制成为了蒸馏者的机会,他们通过篡改上下文陷入Claude的防护,成功提取底层推理逻辑。
为应对这一现象,Anthropic在Fable 5.1中引入了“上下文一致性验证”,具体措施包括:第一,API将严格检查客户端返回的“思考块”,确保与其生成的原始上下文完全一致;第二,任何对上下文的修改将导致API返回错误,拒绝服务。为了保障合法开发者的需求,Anthropic还设立了一种“非严格模式”,但在这种模式下,所有“思考块”都会被删除,模型在缺乏推理过程的情况下进行回答。 龙8头号玩家
这种措施是为了应对近年来不断升级的非法蒸馏现象。Anthropic的安全团队发现,专业的蒸馏黑客们利用自动化脚本,通过大量虚假账户访问API,进行持续的滥用行为。尽管Claude的思考块经过加密,这些黑客依然能够通过上下文注入和对话重写的手法,使Claude在逻辑混乱中揭示其隐秘的推理过程。这使得一些小型模型无需经过大量算力和算法创新,即能获得接近顶尖AI的性能。
更加令人担忧的是,这种漏斗式的核心能力与安全保障的脱节,可能导致整个AI安全界产生严重隐患。大型模型如Claude和GPT-4,在发展过程中融入了严格的道德和安全训练,识别和避免参与危险行为。然而,蒸馏模型通过非法途径获取高智能推理能力,却缺乏相应的安全性,如同获得了爱因斯坦的智商却没有他的道德观。
这次措施的实施主要针对新账户,特意从最易于滥用的新账户开始,确保对合法开发者的影响降到最低。现有的API用户则完全不受此次限制的影响,得以继续正常使用服务。 龙8头号玩家
发表评论