Anthropic让Claude在48小时内用1块GPU自主研究并训练小模型,成功修复了10类对齐失败且不损能力,方法还能泛化到更大模型。
网友觉得这方向挺带劲,但也有人嘀咕:AI自己搞对齐,万一没测到的地方出幺蛾子咋办?还有人开玩笑说,干脆搞个“AI安全联合国”,签协议、交罚款、拿授权,把蒸馏合法化算了。
请 登录 后评论。没有帐号? 注册 一个。
小陈