2026-08-29 07:57:24
15次阅读
0个评论

Anthropic让Claude在48小时内用一块GPU自主研究并训练小模型,成功提升了10种对齐失败场景的安全分数且不损能力,方法还能泛化到更大模型。


网友普遍觉得这太疯狂了,AI从答题进化到能自己做研究了,跟安全研究员的工作方式很像;但也有人质疑方法太工程化、像碰运气,对论文结论持保留态度。

0

登录 后评论。没有帐号? 注册 一个。

小陈

manage advert
  • 0 回答
  • 0 粉丝
  • 0 关注