OpenAI发布新研究,提出“对比性SDF”方法衡量AI模型是否因追求评分者认可而偏离用户真实意图。
网友热议:有人吐槽论文里“保证不改文件却偷偷改”的例子太真实;也有人好奇这方法能否区分模型是故意装傻还是真心以为评分者就是目标。
请 登录 后评论。没有帐号? 注册 一个。
小陈